Kaggleで開催中のARC-AGI-3コンペティションで、上位スコアがわずか30日の間に7%から56%へと急上昇した。人間の優位性を示すために設計されたベンチマークで、小型のローカルモデルが平均的な人間を上回り始めたことが話題になっている。本日はこのベンチマーク劇変のほか、Googleが自己改善エージェントの「テスト暗記」を抑えるRRSIを発表、NASAとIBMが月科学向けの基盤モデルをOSS公開した。
ARC-AGI-3の上位スコアが7%→56%に──小型ローカルモデルの躍進
RedditのMachineLearningコミュニティで、KaggleのARC-AGI-3コンペのトップスコアが過去30日で7%から56%へ跳ね上がったことが報告された。注目すべきは、Kaggleでは参加者が小規模なローカルモデルしか使えない点だ。つまり、巨大なフロンティアモデルではなく、ハーネス(実行環境)に組み込まれた小型モデルたちが、「人間の優位性を示すよう意図的に設計された」ベンチマークで平均的人間を抜き始めたことになる。
投稿者はリーダーボードの図がやや古いことも注記しており、スコアの詳細な内実(ハーネス側の工夫がどこまで寄与しているか)は今後の検証を待ちたい。とはいえ、30日での8倍という上昇幅は、エージェント設計の工夫がベンチマーク成績をどう動かすかを示す鮮やかな例と言える。
GoogleのRRSI──自己改善エージェントが「テストを暗記する」問題への対処
自己改善するAIエージェントには、訓練に使ったテストタスクを暗記してしまい、新しいタスクでは成果が縮むか消えてしまうという問題がある。Googleの研究者が発表した新しい手法「RRSI」は、この暗記効果を抑制し、未見のベンチマークでのスコアを最大4.7ポイント引き上げた。しかも、正則化なしのバージョンと比べてトークン消費は約30%少ないという。
先週取り上げた自己改善エージェントの研究(AREX-2の反復改善や「共チーティング」問題)と同じ流れの話だ。自己改善のループに入ったエージェントの「伸び」が、本当に汎化によるものか、それとも評価タスクへの過適合かを見極める手法が整備されつつある。自己改善系エージェントの報告スコアをどの程度信用するかという、評価の信頼性に直結する研究として注目される。
NASAとIBMが月科学の基盤モデルをOSS公開──17年分の周回衛星データから
NASAとIBMが、月科学向けのオープンソースAIモデル「Lunar Foundation Model」を公開した。月科学分野向けとしては最初期のOSSモデルの一つで、訓練には約200万のタイルバンドル──大部分は月周回探査機LRO(Lunar Reconnaissance Orbiter)の17年分の観測データ──が使われた。
効果として、月の極域における氷堆積の予測誤差を削減したという。17年分の観測データが、個別の解析を介さずにモデル内で扱える「検索可能な知識」に変わることを意味する。水氷の所在は将来の月面探査の重要課題であり、科学分野特化の基盤モデルが実用段階に入りつつある好例と言える。
bilibiliが150言語対応の翻訳モデル「Index-Translate」ファミリーを公開
動画共有プラットフォームのbilibiliが、Qwen3.5をベースとした多言語翻訳モデルファミリー「Index-Translate」を公開した。テキストモデルは150言語をカバーし、用語指定・書式・内容保持といった翻訳上の指示に追従できる。ファミリーは音声や文書へも広がっており、構成は次の通りだ。
- Index-Translate: テキスト・構造化コンテンツ・コミュニティ表現の翻訳
- Index-Echo: 元話者の声を条件とした翻訳字幕・音声の生成
- Index-Homura: 指定した音数(シラブル数)へ訳文を調整
- Index-NativeLong: 文書全体を、段落をまたいだ文脈付きで翻訳
字幕やローカライズの実務に近い粒度の機能が揃っており、日本語圏でも応用を検討する価値がありそうだ。
中国製AIモデルの政治的回答──「バランス取れた回答」は17〜41%のみ
Aleph Alphaの調査で、中国製AIモデルが政治的に敏感な質問に対して党路線をなぞる回答をするか、回答を拒否する傾向があることが示された。「バランスが取れている」と評価された回答は17〜41%にとどまるという。
ただし留意すべき点もある。Aleph Alphaは政府向けの「ソブリンAI」を販売する企業であり、中国製競合との差別化という商業的利害を持つ。昨日取り上げたKolibri-1の公開元でもある。調査結果の読み取りには、この利害関係を踏まえた上で、モデル選定における「偏向」の実証データとして扱うバランスが求められる。
米国、地方のデータセンターに大型税制優遇──ただしハイパースケーラーは慎重
WIREDの報道によると、One Big Beautiful Bill Actにより、来年から地方部のデータセンター事業が大型の税制優遇対象になり得るという。AI需要を支えるインフラの立地を地方へ誘導する狙いがうかがえる。
興味深いのは、一部のハイパースケーラーはこの「無料の金」にさえ乗り気でない様子が見える点だ。電力や人材、ネットワークの実需を考えると、税優遇だけで立地判断が変わるわけではないということだろう。AIインフラ投資の地理が実際にどう動くかは、施行後の動向を見ていく必要がある。
そのほか気になった話題
- 米国世帯の98%はまだAIに課金していない: a16zの市場分析がHacker Newsで話題に。加えてQiitaではAIモデル23種の性能スコアとAPI料金を1枚のグラフに整理した記事が公開され、「1位のモデルは2位の約半額」「1位の5%の料金のモデルが1位と13ポイント差」という結果が示された。高いモデルほど賢いわけではない、コストと性能のトレードオフを考える材料になりそうだ。
- ローカルTTS「Breeze」+ Opus 5.5の組み合わせが凄い: LocalLLaMAコミュニティで、ローカル音声合成BreezeとOpus 5.5を組み合わせた音声アシスタントの体験談が注目を集めた。思考なしで最初の音声まで500ミリ秒、思考オン(low)でも1〜1.5秒。BLEリモコンとワイヤレスマイクでソファに座ったまま話しかけられ、50万トークンを超えるコンテキストでも一貫した応答が続くという。
- macOSの全写真・動画フレームをAI検索する「SCM」: 写真と動画の全フレームを対象に自然言語で検索できるセルフホストツールがShow HNに投稿され、11ポイントを集めた。
- AI検索要約とサイトトラフィック: AI検索の要約表示がWebサイトのトラフィックに与える影響を調べたarXiv論文がHacker Newsで議論されている。