2026年9月23日のAIニュースまとめ。2026年8月時点で未解決のエルデシュ予想68問をLeanで解かせる新ベンチマーク「FrontierMath Erdős」では、GPT-6 Astraでも3%、他のAIは0%にとどまりました。Nathan Lambert氏は米議会の書面証言でオープンウェイトモデルの勢力図を数字で示し、北京はDeepSeekとMoonshot AIへの調査に動いています。ほかに自律的に組織化するエージェントチームや、Rustだけで164ドルの事前学習に挑んだ体験記など。

エルデシュの未解決68問、AIはほぼ全滅

数学の未解決問題に挑むAIの現在地を測るベンチマーク「FrontierMath Erdős(FME)」が公開されました。数学者ポール・エルデシュにまつわる未解決問題集サイト erdosproblems.com の652問から、数学的な面白さと難度を基準に68問を選び、AIには証明支援系Leanで各予想を証明または反証することが求められます。

評価はどのAIも同じ条件──固定された問題セット、自律実行、1問あたり300ドルの予算──で行われました。結果は、評価した5つのAIのうちGPT-6 Astraが3%を記録した以外はすべて0%。最近はAIによる数学の未解決問題解決も報じられていますが、著者らは「それらは体系的な能力研究としては不十分」と指摘します。個別の成功例と、統一条件での体系的な挑戦とでは、問われている能力のレベルが違うということです。

Lambert氏の議会証言──オープンウェイトは「中国2〜5ヶ月、米国6〜9ヶ月」遅れ

オープンソースAIの分析者として知られるNathan Lambert氏(Interconnects)が、米議会に提出した書面証言でオープンウェイトモデルの勢力図を具体的な数字で示しました。

  • Hugging Faceでの中国オープンウェイトモデルの累計ダウンロードは約32億回に対し、米国モデルは約16億回(2025年8月からの追跡)
  • OpenRouterのオープンモデルトラフィックは週あたり約1兆トークンから1年で約80兆トークンへ増加し、その80%超が中国モデル
  • クローズドフロンティアとの距離は、中国オープンウェイトが2〜5ヶ月、米国オープンウェイトは6〜9ヶ月

ギャップが最も小さいのはエージェントコーディング分野で、Qwen・GLM・Kimiがツール利用ワークロードのローカル側デファクトになっていると述べています。

北京、DeepSeekとMoonshot AIを調査へ

香港メディアThe Standardの報道として、RedditのLocalLLaMAコミュニティで伝えられたところによると、北京市はDeepSeekとMoonshot AI(Kimi)に対し、Anthropic側への潜在的なデータ漏洩をめぐる調査を進めているとのことです。コミュニティでは「Kimi幹部が逮捕された」との噂にようやく裏付けらしい情報が出てきた、実際には逮捕の可能性や罰金についての調査段階とみられる、という見方も示されています。前回取り上げた「Claudeの重み流出」報道以降、中国当局の対応が本格化しつつある形で、今後の展開が注目されます。

「組織」そのものがエージェントの能力になる

arXivに投稿された「Self-Organizing Agent Teams Learn to Reason Together」は、固定プロトコルや明示的なタスク分解に頼らない、自ら組織化を学ぶエージェントチームを提案した研究です。

5つの数学・物理ベンチマークでの平均正答率は66.7%で、最強メンバー単独の48.8%、計算量を揃えた単体推論の58.7%、メンバーの独立した回答に対するパーフェクトルーターの59.0%を上回りました。AIME 2026ではパーフェクトルーターを13.4ポイント超えています。また、8ベンチマークでの改善幅は「demonstrability(正しい推論をチームが認識できる度合い)」と強く相関(Spearman ρ=0.90)しており、正解が現れたときにそれを見抜ける問題ほどチーム協働が効くことが示唆されました。組織づくり自体をエージェントの能力として扱える、という示唆が面白い研究です。

「訓練はするが学習しない」──エージェントFDEの静かな失敗

「Trains but Doesn't Learn」は、ポストトレーニングをサービス(PTaaS)として請け負う「前線配備エンジニア(FDE)」の役割をLLMエージェントが果たせるかを測るベンチマークです。

着眼点はユニークで、ベンチマークの問いは「エージェントがメトリックを上げられるか」ではなく「デリバリーを任せられるか」。中央にあるのはTBDL(trains but does not learn)と呼ぶ静かな失敗──損失は下がり、すべてのシグナルが緑のまま、納品されたモデルがベースより良くなっていない──です。運用側が走らせる受け入れゲートはこの種の失敗を支払い前に全件捕捉でき、既知の破損ランで較正した検出器は深刻な破損を実行中に検知できるとしています。Claude Opus 5、GPT-5.6-luna、Gemini 3.7 Flash、DeepSeek V4-Proの4エージェントを、従量課金のL40S/A100/H200 GPU上で8B〜70Bのオープンベースに対して実行し、人間のFDE要員を同じ採点基準で走らせて比較しています。

Rustだけで164ドルの言語モデル事前学習

「Training a Language Model End-to-End in Rust」は、個人がPyTorchもPythonも使わず、Rustだけで約0.4Bパラメータの言語モデルをエンドツーエンドで事前学習した体験記です。費用はレンタルGPU込みで164ドル、学習はH100 1枚で54.6時間、コーパスは約20億トークンのベンガル語中心でした。

結果として、モデルはベンガル語の言語モデリング信号を強く示す一方、英語の常識多肢選択ではチャンスレベル。RustのMLフレームワークCandleとBurnについて、学習バックエンドとしての不具合を実測ベースで分類している点が実務的に貴重です。ベンガル文字のトークナイザー生育率トラップ(素朴なバイトレベル分割でベンガル語がトークンあたり約1.4文字に崩壊し、コーパスの言語バランスが知らぬ間に反転していた)のような発見も含まれます。著者自身の結論は「訓練はPyTorchに戻し、Rustはオンデバイス配信に使う」というもので、Rustで学習させることへの現実的な評価として読めます。

まとめ

体系的な条件で測ると数学の未解決問題はまだまだ遠く、一方でオープンウェイトの実利用は中国モデル中心に急伸している──今週のニュースは、AI能力の「測り方」と「実態」の両方を突きつける内容でした。エージェント研究も「できるか」から「任せられるか」へ問いが移りつつあります。