9月20日に「RunwayがAI動画をリアルタイム配信へ」という話題を取り上げたが、その中心となった世界モデル「GWM Worlds 2」の新機能について、米メディアLatent SpaceがCTOのKamil Sindi氏らへの詳しいインタビューを掲載した。あわせて研究側でもワールドモデルの進展が目立つ一日だった。今回はその中から5本を取り上げる。
Runway「WorldPrompt」──プロンプトで生成世界を記述する
GWM Worlds 2は高精細な映像と音声の生成をリアルタイムの対話型シミュレーションに変える研究プレビューで、720p・24fpsの映像と48kHzの音声をストリーミングしながら操作できる。注目は新機能「WorldPrompt」だ。生成する世界の一部(最初のフレームを含む)を固定し、そこにタイムスタンプ付きのイベントを並べて記述する入力形式で、キャラクター・カメラ・環境への制御層として機能する。担当者は「世界の中のあらゆる対象を制御できる、コンピュータゲームのようなもの」と表現する。
ただしWorldPromptはあくまでプロンプト機構であって、MinecraftやRobloxのようなスクリプト言語や状態制御ではない。重力の法則やキャラクターの能力を指示通りに再現できるかという問いには「研究プレビューなので不完全。動きの指示はかなり信頼できる」との回答だった。技術面では、双方向拡散で一括生成していたモデルを自己回帰化して数フレームずつ生成し、さらに蒸留でノイズ除去ステップを50段階から4段階程度まで減らしてリアルタイム化するという。自己回帰生成特有のエラー蓄積や長期記憶の欠如は依然として未解決の課題で、「反実仮想的な結果を等しく現実的に生成できるか」がビデオモデルとワールドモデルの間にある大きな溝だと共同CEOのAnastasis Germanidis氏は指摘する。用途はゲームにとどまらず、ロボティクスのシミュレーション、数千の環境でのエージェント大量テスト、合成データ生成にも使える見込みだ。なお同社の評価額は直近の資金調達ベースで53億ドルと報じられている。
研究側もワールドモデルが熱い──物体恒常性と「エージェント編集」
Hugging Face Daily Papersにはワールドモデル関連の論文が並んだ。1本目は物体恒常性(見えなくなった物体の存在を理解する能力)をワールドモデルに学習させる研究。多様な認知タスクをBlenderベースのデータ生成器で用意し、各タスクを1万サンプル以上にスケールできるデータ基盤を構築、ビデオモデルとワールドモデルの物体恒常性が実際に改善することを示した。2本目の「Agent-Editing World Model(AEWM)」は発想が新しい。環境の観測を予測する代わりに、LLMエージェントの推論と行動が今後のタスク進行にどう影響するかをモデル化する。実行前に重要・探索的・ノイズな判断を識別する「Action Judge」が strongest baseline を10.6ポイント上回る70.5%のmacro-F1を達成し、統合フレームワーク「EditAct」は6つのベンチマック×3種のエージェント基盤で平均3.2〜6.7ポイント性能を向上させたという。
PUBGのAIチームメイト「Ally」──音声会話しながら実戦で学ぶ
PUBG: BATTLEGROUNDS向けの embodied agent「PUBG Ally」を紹介する論文も出た。音声でプレイヤーと会話しながら自律的に行動するAIチームメイトで、言語モデルエージェントがゲーム情報の参照・発話判断・高レベルの行動選択を担い、その下の高速な制御層が移動や戦闘を実行する二層構造。訓練には実際のゲームプレイが必要で、約3.9万セッション分のプレイ・音声・判断・フィードバックを記録して反復学習に使った。ライブ運用では141カ国のプレイヤーに調査を実施し、Allyとのプレイが記録で確認できた回答者では「Allyを推奨したい」と肯定的な回答が否定的な回答を25.1ポイント上回った。プレイヤーはAllyを道具ではなく「チームメイトや仲間」として描写したという。
GRE学習効果でAIチューターは人間並み──arXivに研究
arXivに掲載された研究が、GRE(大学院進学試験)の学習効果においてAIチュータリングは人間のチュータリングと同等の成果を示したと報じられた。詳細な数値は収集時点の情報では確認できていないが、教育分野でのAI活用の実証が進んでいることを示すデータポイントといえる。
RAM価格高騰へのDIY対策──複数デバイスのRAMを束ねる
RedditのLocalLLaMAコミュニティでは、メモリ価格の高騰で大型モデル用のマシンを買うのは現実的でないとして、手持ちの複数デバイスのRAMを束ねてローカルモデルを動かす実験が報告された。ミニPC(12GB)とMac mini(5.5GB)にまたがって30Bクラスのモデルをロードし、通常のLAN接続で毎秒30トークン強・レイテンシ約1秒を達成したという。モデルだけでなく知識ベース側も検証し、珍しい疾患の新薬について最初は誤答したものの、研究PDFを読み込ませると文書を分割して両デバイスのメモリ上に保持(ディスクには書き込まない)し、再質問に正答したとのこと。個人の実験報告ではあるが、メモリ価格がネックになるローカルLLM運用の現実的な逃げ道として興味深い。
