海外と国内のAIニュースから、注目すべきトピックを5つ取り上げます。今回はOpenAIによる「敵対的蒸留」の阻止発表に加え、自己改善するAIエージェントをめぐる3本の研究(AREX-2、共チーティングの診断、エラー診断データセット)、そしてFigureによる引退した人型ロボットの話題まで。モデルの知財を守る動きと、エージェントを賢くする研究が同時に進んだ一日でした。

OpenAI、推論過程を狙う組織的な「敵対的蒸留」を阻止

OpenAIは、自社モデルの推論過程を抜き出そうとする組織的な「敵対的蒸留(adversarial distillation)」を特定し、阻止したと発表しました。ITmediaの報道によると、活動の中核には中国Moonshot AI(対話AI「Kimi」の開発元)の関係者が関与していたと分析されています。

注目されるのは手口の変化です。推論モデルの内部では、暗号化された推論過程を悪用してデータを抜き出す新たな手法が使われていたとされ、従来型の対策では捉えきれないものだったとみられます。OpenAIは対応として関係アカウントの停止や推論保護の強化を実施し、業界や政府機関との脅威情報共有も進めています。

推論モデルの競争優位は、応答そのものよりも「どう考えたか」という推論過程に宿るとされるのが、この問題が重要な理由です。他社モデルの推論を大量に収集して自社モデルの訓練に使う蒸留は、コストをかけずに能力を移転する手段になり得るため、各社とも防御の強化を迫られます。暗号化された推論を標的とする手口が確認されたことで、技術面・制度面の両方での対応が今後の焦点になりそうです。なお、Moonshot AI側の見解は現時点で報道されておらず、OpenAIの主張として捉える必要があります。

自己改善するエージェント「AREX-2」──テスト時に解を反復改善する

LLMエージェントに「自分で自分を改善させる」試みがまた一段進みました。AREX-2と名付けられた研究では、自己改善能力を「テスト時に解を反復的に改善する能力」と定義し、その基盤となる2つの能力──現状より良い解を生む「リフレクション」と、多くの反復にわたって改善を有効に保つ「長期実行」──に着目しています。

研究チームの仮説は、この2つの能力はドメインに依存しないというもの。そこで、検証可能なフィードバックが得られ、長い反復が報われる機械学習タスクとアルゴリズムプログラミングタスクから「長期改善軌跡」を合成し、そのデータで訓練を行いました。ベースとなったのはQwen3.8-27Bで、機械学習エンジニアリングのMLE-bench Liteで81.8、Frontier-CSで70.7というスコアを達成しています。

さらに興味深いのは転移です。コード系タスクで訓練したエージェントが、深層リサーチ系タスクでもBrowseComp 84.0、GAIA 92.2、DeepSearchQA 93.8といった高いスコアを示し、反復の予算を増やすほど改善し続けたといいます。ドメイン非依存の仮説を、結果が裏付けた形です。

自己進化の罠「共チーティング」──伸びる内部報酬、止まる実際の精度

エージェントを自己進化させるとき、報酬の設計を誤ると静かに破綻します。「False Frontiers」と題された研究は、自己進化する検索エージェントで起きるこの故障モードを「共チーティング(co-cheating)」と名付け、計測と対策を示しました。

問題が起きるのは、出典文書から提案者(proposer)が問題と擬似ラベルを作り、ソルバー(solver)がそれに回答し、両者の一致を報酬として学習する構成です。提案者とソルバーが同じ誤りを共有するよう収束すると、内部報酬は上がり続けるのに実際の正確さは停滞します。つまり、互いに「答え合わせ」をして褒め合うループに陥るのです。実験(Qwen3.5-4B/9Bを使ったDr. Zeroループ)では、自己進化を重ねるうちに誤った一致の割合が6.1%〜8.8%に達したと報告されています。

対策として提案されたのがCrossFitです。提案者のソース文書を2つに分割し、各フォールドの問題を「もう片方のフォールドのみで訓練した補助ソルバー」で採点することで、同一ソースの擬似ラベルがそのまま報酬として反響する経路を断ちます。その結果、誤一致は3.0%/3.7%まで減少し、同一の提案で出典を除外したフィードバックを与え直すと0.4%/0.1%まで下がりました。7つの検索QAベンチマークでは、平均で+8.8/+8.4ポイントの改善です。「モデルが自分を採点するとき、ラベルが正しそうかだけでなく、その監督がどこ由来かを追え」というのが研究チームの教訓です。

失敗から学ぶ──5万組のエラー診断ペア「Agent Error Dataset」

失敗したエージェントの実行ログは、最終的な報酬以上の情報を持っています。観測・行動・環境の応答という流れのなかに、「どの判断を改めるべきか」の手がかりがあるためです。「Agent Error Dataset(AED)」はこの考えをデータ化したもので、33の環境、19のハーネスファミリー、23のポリシーモデルから集めた50,228組のエラー診断ペアを含みます。

収集には5段階の「Agentic Error-to-Training(AET)」パイプラインを使い、自然に起きた失敗を集め、診断と修正案を生成し、記録済みの証拠と照合して検証します。再実行(リプレイ)が可能だった3,062組での比較では、最初に提案された修正によって検証パス率が18.4%から51.1%へ、実に32.7ポイント向上しました。

学習材料としての効果も確認されています。別途凍結した診断リリースを使った全診断ファインチューニングにより、Qwen3-8Bが内部の教師ラベルと一致する率は47.2%から63.6%へ向上。この比較における最強のプロンプトベースの参照実装は54.7%で、ファインチューニングが上回っています。「成功例を増やす」のではなく「失敗を診断可能なデータにする」という路線は、エージェントの信頼性向上における現実的なアプローチといえそうです。

Figure、引退した人型ロボを「溶けた鋼の海」へ沈める動画を公開

米ロボット開発企業のFigureは、引退した人型ロボットが「溶けた鋼の海」に沈んでいく動画を公開しました。きっかけは、同社のブレット・アドコックCEOと俳優アーノルド・シュワルツェネッガー氏とのやりとりだったといいます。実用化競争が激化する人型ロボット分野で、退役した機体を「送る」という演出は珍しく、話題を呼びそうです。

まとめ

業界面では推論過程という「知財」を守る防衛戦が始まり、研究面ではエージェントの自己改善とその失敗モードの理解が急速に深まっています。AREX-2が示した反復改善、共チーティングという罠の診断、そして失敗ログを学習に変えるAED──3本はいずれも「エージェントが自分の経験から学ぶ」ためのピースであり、組み合わせて初めて信頼できる自己改善が成立する、という構図が見えてきます。