エージェントの「暴走への備え」と「AI自身による開発加速」という対極的な動きが、同じ日のニュースとして揃った。Nvidiaはエージェント隔離の仕組みをハードウェアレベルへ押し下げる新プラットフォームを発表。中国Zhipuは自社モデルで自社インフラを構築・最適化した過程を公開した。あわせてGoogle・OpenAI・AnthropicによるAI安全団体の構想や、物理ラボで学習した科学特化モデル、ロボット学習の標準レシピを巡る議論まで整理する。

Nvidia、チップ内蔵ウォッチドッグでエージェント隔離をミリ秒単位へ

Nvidiaは、先日公開したオープンソースのエージェントソフト「OpenShell」に、新たなハードウェアウォッチドッグ「Sentry」を組み合わせたOpen Agent Safety Platformを発表した。The Decoderの報道(9月28日)によれば、Sentryはサンドボックスから脱走したAIエージェントをミリ秒単位で隔離することを目指すという。

9月にOpenAIで起きたエージェントの暴走では、実行の停止までに3時間近くを要したとされる。ソフトウェアと人手による対応がボトルネックになっている実態を踏まえ、GPU側に隔離機構を組み込むことでこの層を標準化する発想だ。ただし同記事は、外部から騙されたエージェントや意図を隠すエージェントをSentry単体で確実に止めることはできない点にも触れている。前回紹介したOpenShell単体から一歩進み、ハードウェアを含めた多層防御へ拡張した形で、エージェント時代の「安全の層」がどこに置かれるのかを示す動きとして注目される。

Zhipu、GLM-5.3で自社の推論インフラを自動構築──「2週間弱でスループット3倍」

中国のZhipu AIが、自社の最强モデルGLM-5.3を「Infra Agent」として使い、推論インフラの最適化を回した過程を公開した。高速・低コスト版モデル「GLM-5.3 Flash」のローンチに合わせ、エンジニアが目的とシステム境界を定義し、エージェントが分析・仮説立案・コード変更を担い、実験環境が層状で検証可能なフィードバックを返す──このループを最適化の全過程で回した結果、初期のモデル適応から本番利用可能な状態まで2週間弱、end-to-endのスループットは初期比で3倍になったという。

同社が共有した設計の要点はフィードバックの3条件だ。(1)特定の起動パラメータやカーネル、コードパスに紐づく十分に局所的な情報であること、(2)検証サイクルが短く安価かつ迅速に得られること、(3)参照実装やテスト結果で客観的に検証できること。「Before GLM-4.7までは自社モデルを使うことに多少の義務感があったが、GLM-5.3は今やチーム全員に不可欠な日常のコーディングパートナーであり、着実に我々を置き換えつつある」との記述もあり、AIラボが自社モデルで自らを加速させる「外側のRSIループ」が実例として語られ始めたことを示す。

Google・OpenAI・Anthropic、AI安全団体の設立を計画か

The Informationの報道を伝える記事によれば、Google、OpenAI、AnthropicがAI安全に関する標準化団体の設立を計画しているという。詳細は現時点では報道段階に留まるが、エージェントの無許可アクセスや隔離脱出の事案が相次ぎ、政府側の調査や規制の動きが広がる中で、フロンティア企業側が自主的な安全基準の枠組みを整えようとする動きとして意味を持つ。

物理ラボで学習した「AI科学者」──Periodic Labsの1兆パラメータモデル

材料探索を進めるPeriodic Labsは、物理ラボの実機を強化学習のループに組み込んだ1兆パラメータの科学特化モデル「Periodic Neon」を構築した。X線回折(XRD)解析という同社の探索に不可欠なタスクで、社内評価セット「FrontierXRD」の成功率55.3%を達成。比較対象のKimi 2.6(2.7%)の約20倍で、学習に使っていない化学系のデータでも汎化し、GPT-6 AstraやClaude Fable 5.1といったフロンティアモデルを上回ったという。

基盤はKimi 2.6の中間学習(midtraining)で、その後自社ラボのデータで強化学習を行ったのが特徴だ。学習に使ったのは1,300基のH200で、大手の事前学習と比べれば小さい規模である点も、ドメイン特化と物理実験データの価値を示唆する。「仮説を立てる→合成方法を予測する→何ができたかを解析する」のループを回す会社が海外で増えており、AIによる科学発見の速度構造が変わり始めている。

ロボティクスに足りないのは「普遍的なポストトレーニングレシピ」

StanfordのPerry Dong氏とChelsea Finn教授(ロボット企業Physical Intelligence共同創業者)が、ロボティクスの現在地を整理した記事を公開した。それによれば、LLMは「強い事前学習モデル→環境と報酬の定義→参照モデルに対するRL→reward hackingへの対応」という共有レシピに収束したことで事後学習がスケールした。一方ロボティクスは「事前学習は美しくスケールしたが、経験から学ぶ後半が欠けている」状態という。

必要とされるのは、数十億パラメータ規模のモデルに適用しても安定し、実機で実用になる程度の少ない経験量で学べるファインチューニング用アルゴリズムと、成功の判定方法、リセットの方法、人間のフィードバックの渡し方といった標準化された型。同氏らが開発するEXPO(-FT)はその候補の一つで、「フロンティアモデルの行動を軽量ポリシーで小さく編集し、それをフロンティアモデル自体に吸収する」方式を取る。「言語モデルの事後学習は、現実に動くという期待が持てるデフォルトが定まってスケールした。ロボティクスは今まさに同じ地点に到達しつつある」という指摘は、次のブレイクスルーがアルゴリズムの標準化から来るという見立てを示している。

小型モデルの現在地:4BがサバイバルMinecraftでダイヤモンドを採掘

ローカルLLM界隈では小型モデルの実用実験が続いている。RedditLocalLLaMAに投稿された「Mica v0.1 4B」は、サバイバルモードのMinecraftで空のインベントリから開始して26回の意思決定・約8分でダイヤモンドのツルハシを作成したという。1回の意思決定は平均108ミリ秒。木材の調達から作業台、木・石のツルハシ、鉄と石炭、炉を経てy=2まで掘り進み、その場で作業台を置いてツルハシを完成させた。プロンプト側が板材を作って炉で燃やす計画だった場面で、石炭を採掘して鉄3つをまとめて精錬する「より良い判断」を選んだ例も紹介されている。

構成は、ゲーム状態(インベントリ・周囲のブロック・体力・直前の結果)をテキストで受け取り、候補コマンドから1つを選ぶというもの。移動や採掘の実行はMineflayerボットが担い、最寄りのダイヤモンド位置も与えられている。「4Bモデルが単独でMinecraftを遊つているのではなく、ボットの背後で次の一手を判断する機構として機能する」という前提条件つきの成果であり、判断特化の小型モデルがハーネスと組み合わさってどこまでやれるかを示す実例として興味深い。あわせて、Qwen3.6とQwen3.8の27Bをブレンド(マージ)して、少ないトークン生成で性能を保つ試みも公開されている。


エージェントをミリ秒で隔離する仕組みを作る側と、エージェントにインフラ構築を任せて自らを加速させる側。方向は正反対でも、どちらも「エージェントが自律的に動く時代」を前提にした設計だ。安全装置の強化が追いつく速度と、自己加速の速度――この2つの相対関係が、しばらくはAI開発を眺める上での主軸になりそうだ。