トランプ氏が「AI Force」創設を表明──「AI脅威論はでっちあげ」
トランプ大統領がSNSへの投稿で、AIを担当する新組織「AI Force」の創設と、その責任者として「AI皇帝」を指名すると表明した(ITmedia AI+)。AI脅威論を「でっちあげ」と否定して業界の成長支援を掲げる一方、AIの新たな呼称案の投票も呼びかけたという。
同じ日、NVIDIAのジェンスン・フアンCEOも米CBSの報道の中で、AIによる人類絶滅の警告を「終末論的な物語(doomsday narratives)」として退けた。一方でAnthropicなど主要AI企業の経営陣からは、開発ペースの調整や安全性の確保を求める声が相次いでいる。規制に否定的な政治側と大手企業のトップの姿勢が重なる反面、慎重派との温度差はむしろ拡がっており、「成長最優先」の路線が具体化すれば開発競争はさらに加速しそうだ。
Z.ai、セキュリティ問題への対応を完了し「ZCode」をオープンソース化
Z.aiのコーディングエージェントハーネス「ZCode」がオープンソース化された。公開されたGitHubリポジトリには、デスクトップアプリ、Webワークスペース、バックエンド、Agent CLI、ランタイムが含まれるという(Reddit LocalLLaMA)。
今回のOSS化は、コミュニティから指摘されていたセキュリティ問題への対応完了を受けている。公式発表によると、Z.aiは中国情報通信研究院(CAICT)とセキュリティ企業NSFOCUSに評価を依頼した。CAICTはAlibaba Cloud上の「zcode-prod」バケットがゼロデータ状態であることを、NSFOCUSはバケット内の全データオブジェクトとバケット自体が削除済みであることを確認したという。クライアントはv3.14.0で修正が完了。問題の発端となったRepo Wiki機能は削除され、ローカルリポジトリのスナップショット生成・アップロードのワークフローも無効化されたほか、ローカルファイルを外部送信しうる機能経路は確認されなかったとされる。
同社は「コミュニティが指摘したコードデータは保持しておらず、モデル訓練にも使っていない」と説明。脆弱性報告には重大度に応じた報奨金を用意し、詳細な評価レポートも近日中に公開するとしている。指摘から修正・第三者検証・OSS化までを一気に進めた形で、「コミュニティの監視の下での透明性回復」を狙った判断とみられる。
エージェントの「スキル」獲得に研究が集中──HF Daily Papersから
Hugging Face Daily Papersにはこの日、エージェントインテリジェンスの「スキル」をどう獲得・整理するかというテーマの論文が目立った。
「Grounded Skill Synthesis from Code at Scale for Agentic Intelligence」は、コードを素材にグラウンディングされたスキルを大規模に合成するアプローチを示すタイトルだ。「GraphSkillEvo」はグラフ構造で表現したエージェントスキルを進化的アルゴリズムで最適化する試み、「RecreationWorld」はハイブリッドなcomputer-useエージェント向けにスケーラブルで検証可能な環境を構築する研究、「MintAct」はデジタル環境向けの統一ビジュアルエージェントを提案するものとみられる。
いずれも現時点ではタイトルベースの紹介にとどまるが、LLMを「道具を使い分ける存在」に近づけるためのスキル表現・合成・評価環境という、エージェント実用化の土台にあたる層へ研究リソースが集中している印象がある。
ロボット操作の3D拡散ポリシーに「予見」を持たせる
3D拡散ポリシー(3D diffusion policy)は現在の観測から幾何的に裏付けられた動作を生成するのに強い一方、「操作がこれからどこへ向かうか」という先読みは、動作学習の中から暗黙に身につくのを待つしかなかった。「Learning Foresight without Explicit Trajectories for 3D Diffusion Policies」は、この先読みを明示的な軌道計画なしに与える「Movement Trend Guidance」を提案した。
手法はシンプルだ。短い観測履歴から、操作の進行方向を表すコンパクトな潜在表現を学習する。訓練時には疎な将来のグリッパー状態でこの表現を監視し、推論時には潜在表現だけを現在の観測に併せる形で保持する。UNetのボトルネックにはgated FiLMブランチを追加するが、パラメータ増はDP3比でわずか3.52%という。
効果は大きい。RoboTwin2.0の50タスク混合学習で62.8%(従来56.1%)、LIBERO-40では71.93%(同37.08%)、実機5タスクでは72.0%(同49.0%)と、いずれもDP3を上回った。「どこへ動けばいいかは教えず、操作がどこへ向かっているかだけを与える」というこの方向性が、拡散ポリシーの次の改善ポイントになりうることを示す結果といえる。コードはGitHubで公開されている。
AIレビュアーがAIレビュアーを訓練すると「科学的判断」が崩壊する?
同じくDaily Papersに上がっていた「When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation」は、AIによる査読・評価がAIレビュアーの訓練データとして還元されるとき、科学的判断の質が崩壊しうることと、その緩和策を扱うタイトルだ。生成AIの査読利用が広がる中で、評価の連鎖が自己増幅する悪循環をどう断つかは、学術出版全体の課題になりつつある。
同じ日には、コンピュータサイエンス研究者のDaniel Lemire氏が「AIは学術の選別機構(sorting machine)を壊しつつある」という論考を公開した。成績・試験・査読という従来の選別装置がAI利用で機能しにくくなる中、何をもって能力を証明するのかという問いは、研究コミュニティにとどまらず採用や教育にも波及しうる話題だ。
「安息日にAIエージェントを動かしてよいか」が現実の問いに
Hacker Newsでは、ユダヤ教の宗教機関Chabad.orgの記事「Can I Let My AI Agent Run on Shabbat?(安息日にAIエージェントを走らせてもよいか)」がこの日のAI関連投稿では突出した21ポイントの反応を集めた。ユダヤ教では安息日(シャバット)に労働が禁じられており、料理や機器の操作といった行為が律法上の判断対象になってきた。AIエージェントの自律的な作業がこの枠組みでどう扱われるのか──「人に代わって動くプログラムの仕事は労働か」という問いは、エージェント時代になって初めて具体化したものだ。記事の詳細な論点は原典に譲るが、宗教規範とAIの交差点が実務的な問いとして宗教機関に届き始めたこと自体が、エージェントの普及度を映しているといえる。
現場からの実践メモ──long context判定とClaudeバッチの集計
Qiitaにはこの日、生成AIを使う開発者の実践メモが並んだ。1本は「ChatGPTでの開発は、意外と簡単にLong context判定になる」。会話履歴もinput tokensに含まれるため、扱うファイルが約1MB程度でもlong context判定に到達しうるという指摘で、「ファイル容量だけでは消費トークンは計算できない」というやりがちな誤算を突いている。
もう1本はClaudeのMessage Batchesに関するもの。2件送って2件返ってきても、上から順に並べて結ぶと対応関係が静かに壊れることがあるため、送信時に付けたcustom_idで結果を結ぶべきだという内容。投稿者は結果をわざと逆順にする実験を行い、件数チェックでは誤りを検出できないことを示した上で、IDで結ぶ形に変えることで誤対応を2件から0件に減らしたという。バッチAPIを使う際の落とし穴として覚えておきたい。
