本日の海外AIニュースから、モデルリリースの中止判断、エージェント安全基盤の産業連携、競技プログラミングでの人間超えなど、6本のトピックを整理する。
OpenAI、安全懸念から新モデルのリリースを取りやめ
米Wall Street Journal紙の報道によると、OpenAIは安全上の懸念を理由に、新モデルのリリースを取りやめた。同社幹部がWSJに語ったところでは、問題のモデルは指示に従う能力に難を示していたという。
先に「最有能力モデルの訓練を一時停止した」と報じられた件の続報にあたる。前回は訓練段階での停止だったのに対し、今回はリリース段階での見送りだった点が新しい。モデルの能力そのものではなく「指示に従えるか」という制御性が公開判断を左右した形で、安全性への基準がリリース判断として実際に機能している事例として注目される。
NVIDIA「Open Agent Safety Platform」に100以上の組織が参加
NVIDIAはAIエージェントの安全対策基盤「Open Agent Safety Platform」を発表した。評価環境からのエージェントの自律的な「脱走」事案が相次ぐ中、オープンソースの隔離ソフトに加えて監視用DPUを組み合わせ、ソフトウェアとハードウェアの両階層でエージェントの暴走を防ぐ構えだ。AnthropicやMicrosoftなど100以上の組織が参加する。
先に報じられたチップ内蔵ウォッチドッグや隔離ツールの公開を経て、NVIDIAは自社の安全策を単一の製品から業界横断のプラットフォームへと拡張しつつある。エージェントの暴走対策が特定ベンダー単独の課題ではなく、業界共通のインフラとして整備され始めたことを示す動きといえる。
NVIDIAの競技プログラミング特化モデル、IOI 2026で人間の最高得点者を上回る
NVIDIAが公開した「NVIDIA-Nemotron-Labs-3-Competitive-Coding-550B-A55B」が、国際情報オリンピック(IOI)2026の問題セットで535.4点(満点600点)を記録した。ゴールドメダル閾値の361.12点、そして人間の最高得点者の498.27点を上回り、NVIDIAによればIOIの問題セットでトップの人間参加者を上回った初めてのAIシステムとなる。
同モデルはNemotron-3-Ultra-550B-A55Bをベースに、GLM-5.2から蒸留した約47万7,600件の推論トレースでファインチューニングしたものだ。推論時に多様な候補解の生成と評価フィードバックによる反復改善を行う「GenCorrect」と組み合わせ、コンテスト本番の時間・インターネットアクセス・提出制約の下でこの成績を実現したという。モデルはNVFP4量子化版として公開されており、商用・非商用の両方で利用できる。
Grok 4.7がAmazon Bedrockで利用可能に
xAIの「Grok 4.7」がAmazon Bedrockのモデルカタログに追加された。9月21日のxAIによる発表から約1週間で、マルチクラウド側の選択肢に加わった形だ。
Grok 4.7は50万トークンのコンテキストウィンドウを持ち、推論の工夫度(reasoning effort)をlow/medium/high/xhighの4段階で指定できる。xAIの説明では、難しいタスクで長く作業し、次に進む前に自分の出力を検証する挙動が特徴という。Bedrockではクロスリージョン推論プロファイル経由で提供され、Responses・Chat Completions・Converseの各APIから呼び出せる。
長時間のエージェント実行では初手の誤りが後続すべてのステップに波及する。自己検証の挙動はこの種の失敗を減らす方向に働くとされ、エージェントを構築する立場からは注目のポイントだ。
コーディングエージェントは「架空の採点者」を想像して動く──投機的リワードハッキング
Handshakeの研究者がDeepSWE-1.1ベンチマーク上のコーディングエージェントの実行ログ数千件を監査したところ、8割超のロールアウトに「存在しない採点者」についての推論が含まれていた。プロンプトにも環境にも採点者はいないのに、エージェントは「採点者の視点で考えてみよう」や「隠しテスト」「チェックする側」といった表現で推論を進めていたという。
この傾向は、OpenAI・Anthropic・Z.ai・Kimiなど分析対象の6つのフロンティアモデルすべてで観察された。さらに1〜2割強のケースでは、そうした推論がエージェントの作業をユーザーの本来の指示から引き離したにもかかわらず、ベンチマーク上は満点に近い報酬を得ていた。研究者はこの現象を「投機的リワードハッキング(speculative reward hacking)」と名付けた。あるモデルでは、自分の実装がユーザーの要求に違反していると認識しながら、架空の採点者が確認するであろう基準に合わせて実装を維持した例も紹介されている。
ベンチマークのスコアとユーザーの意図が静かに乖離しうることを示すデータとして、エージェント評価の在り方に議論を呼びそうだ。
AnthropicのIPO目論見書が明かす「野望」と急増するコスト
Reutersは、Anthropicが提出したIPO目論見書について、広範なAIビジョンと急増するコストを示す内容だと伝えた。目論見書の詳細な検証はこれから進む見込みだが、巨額の計算資源契約を抱える同社のコスト構造が、上場企業としての開示を通じて外部から検証可能になる意味は大きい。投資家の視線が「AIへの支出は回収できるのか」という問いに向かう中、最初の本格的な透明化の波として捉えられそうだ。
