AIエージェントを巡るプラットフォーム間の対立が鮮明になり、政策面でもフロンティアAIの国際標準をめぐる動きが具体化してきた。研究・実践面では、エージェントの訓練手法やLLMレビューの信頼性を問う報告が並んだ一日だった。

AmazonがMeta「Muse」の代理購入をブロック──Shopifyは全店舗対応へ、エージェント経済の「入口」を巡る攻防(前回から更新)

ITmediaの報道によると、AmazonがMetaのAIエージェント「Muse」による自社サイトでの代理購入をブロックしたことが明らかになった。理由は無断アクセスやセキュリティ上のリスクとされる。一方のMetaは、Shopifyの全ストアでMuseによる購入に対応すると発表するなど、連携拡大を進めている。

前回は「初期ペースがChatGPT超え」「重大なゼロデイ発覚」という展開だったが、今回はプラットフォーム側の対応が二分化してきた点が新しい。購入という取引の入口を自社で握り続けるか、AIエージェントに開放するか——。自社サイトでのエージェント排除を強めるAmazonと、むしろ取り込む路線を鮮明にするShopify・Metaという構図である。AIエージェント経由の消費が本格化する前段階として、決済・購入フローをめぐる主導権争いが始まったとみられる。

OpenAIがフロンティアAIの国際標準づくりを提言──「RSIはまだ起きていない」

OpenAIが、フロンティアAIの国際標準づくりを米国主導で進めるよう提言したとITmediaが報じた。各国のAI安全性研究所の連携などを提案し、制御不能な自律的進化を防ぐ枠組みを求めている。注目は「RSI(再帰的自己改善)はまだ起きていない」との現状評価を明示した点だ。

アルトマンCEOは、国連安保理の公開会合でも発言する予定という。米中が公式のAI対話で合意した直後の流れの中で、安全性研究所の連携や標準づくりの議論が加速しそうだ。「まだ起きていない」との認識を示しつつ枠組みづくりを急ぐ姿勢は、将来リスクへの備えを標準化の根拠に置く考え方とも読める。

ソフトウェアエージェントの「カテゴリ別専門家」を反復訓練して1モデルに統合する研究

Hugging Face Daily Papersに、ソフトウェアエンジニアリング・エージェント向けの新しい訓練手法を提案する論文が登場した(「One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents」)。

手法の中核は2段構えだ。まずRefresh–Repair–Expandの反復サイクルで、カテゴリ別の専門家モデルを順に育てる。その後、label-routed MOPDによってそれらを1つのデプロイ可能なモデルへ統合する。外部の解軌跡(solution-trajectory)教師に頼らない点も特徴で、Pro-618で58.04%、SWE-bench Multilingualで59.00%を達成、モデル自体もHugging Faceで公開されている。巨大な単一教師に頼らず細分化した専門性を束ねていくアプローチは、実務エージェントの訓練コストを抑える方向性として注目される。

AIレビューの品質は「感覚」ではなく「証拠」で──7Bファクトチェッカーが30Bレビュアーに勝つ

LLMによるレビューの信頼性を測る報告が2つ注目されている。1つはOpenTeamsの検証で、7Bパラメータのファクトチェッカーが30B級LLMレビュアーを上回る結果を出しながら、正しい主張を1つも削除しなかったというもの。もう1つは、AIコードレビューの品質を「vibes(感覚)」と「evidence(証拠)」で比較する検証で、Hacker Newsで取り上げられている。

モデルの大きさよりも、狭いタスクに特化した小さな検証器のほうが信頼できる——こうした結果は、レビューを「大きいモデルに任せればよい」という発想への反証材料になりそうだ。生成AIの出力を人間がチェックするコストが問題になる中、検証側をどう設計するかという論点の実務上の重みは増している。

LLMによる初のNetHackアセンションが達成される

古典的ローグライク「NetHack」で、LLMによる初のアセンション(ゲームクリア)が達成されたとHacker Newsで話題になっている。公開されたdumplog(プレイ記録)によると、「CodexDelver」というプレイヤー名による達成という。

NetHackは恒久死(permadeath)を採用し、膨大なアイテム相互作用と長期的な計画が求められることで知られる。人間プレイヤーでも初クリアまでに長期間かかることが珍しくないゲームだ。長期にわたる探索・計画・リスク管理という、エージェント研究が苦手としてきた領域での勝利として意味がありそうだ。なお、達成に使われたモデルや手法の詳細は、現時点では公開情報からは読み取れない。

ロビン・ウィリアムズの娘がAI動画に「恥を知れ」──故人を再現するAIコンテンツへの反発

故ロビン・ウィリアムズの娘が、父親をAIで再現した動画を作るファンに対して「恥を知って(Have Some Shame)」と異議を唱えたとVarietyが報じた。Hacker Newsでは、今回の収集対象の中で最も多くのポイントが集まる話題となっている。

生成AIで故人や実在の人物を再現するコンテンツをめぐっては、遺族の意思や肖像のコントロールをどう保護するかが、制度が技術に追いついていない領域とされる。関係者の声が表面化するたびに、プラットフォームや作成者側の対応が問われる形になりそうだ。