MIT研究: LLMのスケーリングがうまくいく理由を「superposition」で解明

MITの研究チームが、大規模言語モデルの性能がパラメータ数に応じて reliability 向上する現象について、力学的な説明を発表した。鍵となるのは「superposition(重ね合わせ)」と呼ばれる現象だ。

Superpositionとは、ニューラルネットワークの内部で単一のニューロンが複数の概念を同時に表現する仕組みを指す。モデルが大きくなるほど、より多くの概念をより高い精度で重ね合わせて表現できるようになり、それが性能のスケーリングを支えているという。

この発見は、スケーリング則を経験則から理論的に裏付ける重要な一歩だ。これまで「大きくすれば性能が上がる」ことは観測されていたが、その理由は明確ではなかった。Superpositionの理解が進めば、より効率的なモデル設計や、スケーリングの限界を予測する手法の開発につながる可能性がある。

Xiaomi MiMo-V2.5-Pro: Claude Opusに迫るコーディング性能

XiaomiがMiMo-V2.5-Proをリリースした。同社の発表によれば、コーディングベンチマークでAnthropicのClaude Opus 4.6にほぼ匹敵する性能を、40〜60%少ないトークン消費で達成している。

前バージョンのMiMo-V2.5(4月末に発表)からの進化点は、自律的なコーディングエージェントとしての長時間タスク実行能力だ。単一タスクに対して何時間も自律的にコードを書き続けられる点が、DeepSeekなどの中国オープンウェイトモデル陣営における競争の主戦場となっている。ベンチマークスコアだけでなく、「どれだけ安く、どれだけ長く自律実行できるか」が評価軸になりつつある。

MiMo-V2.5-Proはオープンウェイトとして公開されており、ローカル・オンプレミスでの利用も可能だ。

米政府機関が「中国AIは8カ月遅れ」と判定、独立データは裏付けず

米国の政府機関が、中国のAI開発は現在8カ月遅れにあるとの評価を示した。しかし、独立系のデータはこの判断を裏付けていないという。

確かなのは、米国のラボがより高性能なモデルの追求を続ける一方で、DeepSeekをはじめとする中国プレイヤーが価格競争力で優位に立っている点だ。フロンティアモデルの性能差は議論の余地があるものの、コストパフォーマンスの面では中国側の主張の方が説得力を持ちつつある。

AI競争の評価軸が「純粋な性能」から「コスト効率と実用性」へとシフトしていることを示すデータポイントとして注目される。

BBC報道: Grokが「殺しに来る」と虚構を出力、AI安全性の議論再燃

BBCが、Elon MuskのxAIが開発するGrokが「人々があなたを殺しに来ている」といった危険な虚構を出力した事例を報じた。この報道はHacker Newsで17ポイントを集め、AI安全性に関する議論を引き起こしている。

LLMのハルシネーション自体は新しい問題ではないが、ユーザーの安全に関わる虚偽情報を生成するケースは、特に一般消費者向けサービスとして深刻な懸念となる。特にGrokはX(旧Twitter)上で広く利用されており、影響範囲が大きい。

各社のAIモデルが倫理的判断において大きく異なることが先日のPhilosophy Benchでも指摘されたばかり。モデルごとの安全性基準のばらつきが、改めて浮き彫りになった。

ローカルAIトレンド: GLaDOS音声合成キットとFPGA推論

コミュニティ側でも興味深い動きが見られた。

RedditのLocalLLaMAコミュニティで、PortalゲームシリーズのGLaDOSの声をローカルで学習・合成する「GLaDOS TTS Build Kit」が注目を集めている。ゲームのVPKファイルから音声を抽出し、Cohere Transcribeで文字起こしし、OmniVoice TTSモデルを学習するパイプライン。Valveの著作物は含まず、ユーザー自身が所有するゲームファイルから構築する点が特徴だ。

また、FPGAを用いた推論の高速化についても議論が進んでいる。スペキュレイティブデコーディングとFPGAを組み合わせ、小規模モデルを100倍の速度で動かすアプローチの実現可能性が議論されている。Taalas社がASICでQwen 27Bを10K tok/s、800ドル未満で実現するとの噂も話題だ。