9月30日に収集された海外AIニュースから、注目すべきトピックを6つピックアップして解説します。今回はxAIの新しいAI同僚、AIチューティングの学習効果を検証したハーバード大学の研究、LLMコストの自動最適化、ローカルLLMの高速推論、そしてロボットとスマートグラスAIの研究動向まで幅広くカバーします。
xAIが「Team Bots」──チームで働きながら学ぶAI同僚
xAIが、チームの活動から学習するAI同僚(AI coworkers)「Team Bots」を発表しました。発表ページのタイトルは「AI coworkers that learn from your team」。汎用的な対話を提供する従来のチャットAIとは異なり、チームのコミュニケーションや仕事の進め方から学び、それを踏まえた協働を目指す構想とみられます。現時点では公開されている情報が発表ページ中心のため、提供時期や価格などの詳細は今後の追加発表を待ちたいところです。
ハーバード研究:AIチューティングが対面のアクティブラーニングを上回る
ハーバード大学の研究として紹介されている論文が、Nature系ジャーナルのScientific Reportsに掲載され、Hacker Newsで話題になっています。研究は、AIによる個別チューティングが教室で実施されるアクティブラーニング(対面での能動的学習)よりも優れた学習成果を示したと報告しているものです。もし大規模な追加検証でも同様の傾向が確認されれば、教育現場でのAI活用の位置づけが大きく変わる可能性があり、引き続き経過を追う価値がありそうです。
CloudflareのAuto Router──LLM APIコストを自動で削減
Cloudflareがブログ記事「Cut Your AI Spend with Cloudflare AI Gateway's Auto Router」を公開しました。AI Gatewayの新機能として登場したAuto Routerは、その名前が示す通りLLMへのリクエストを自動でルーティングし、AI利用のコストを抑える仕組みとみられます。複数のモデルプロバイダーを横断してコストと性能のバランスを取ろうとする運用は、LLMを本格利用する開発チーム共通の課題だけに、具体的な成果が注目される機能です。
Mac mini M5 ProでQwen3.8-27Bが40〜60 tok/s──TensorfoldがMLX系最速と話題
RedditのLocalLLaMAコミュニティで、オープンソース推論エンジン「Tensorfold」への注目が高まっています。投稿者は、Mac mini M5 Pro(メモリ64GB)でQwen3.8-27Bの4bit量子化モデル(MLX版)を、ドラフトモデル「Qwen3.8-27B-DFlash2」と併用するスペキュラティブデコーディング構成で実行し、40〜60 tok/sという生成速度を達成したと報告しています。
投稿者によれば、omlxやdflash2、lm-studio、unslothなど過去数か月に試したなかで、Mac環境でMTPLXを上回った推論エンジンはTensorfoldが初めてとのこと。RTX 3090 TiでGGUF版Qwen3.8-27B(IQ3_S、約12.1GB)を50〜70 tok/sで動かしていた環境と同等の速度が、コンパクトなMac miniで出せるとして、RTX 3090 Tiからの置き換えを検討する材料になると話題です。ただしプレフィル(プロンプト処理)は3090 Tiが約4倍高速とのことで、長いコンテキストを扱う用途ではGPU優位が残る見込みです。
スマートグラスAIの「永続メモリ」を測る──ベンチマーク「APM-Bench」
Hugging Face Daily Papersで注目されている「APM-Bench」は、一人称視点(エゴセントリック)のストリーミング動画アシスタントにおける、セッションをまたいだ永続メモリを評価する新しいベンチマークです。
スマートグラス型AIアシスタントが本当に「個人的」であるためには、過去のやり取りで得たユーザー固有の経験を保持し、後のセッションで再利用できる記憶が鍵になります。しかし従来のベンチマークの多くは、単一の連続動画内での限られた時間スパンのメモリしか評価していませんでした。現実の利用は断続的です。ユーザーはスマートグラスの電源を切り、数時間や数日後に再開します。その際、以前のやり取りの視覚的証拠を覚えておき、後の質問に答えたり先回りして支援したりする能力が求められます。
APM-Benchはこの「永続メモリ」を、保管コストと応答レイテンシを抑えながら後続タスクに活用できるかという観点で評価する枠組みを提供します。ストリーミング動画モデルが継続知覚・リアルタイム対話・先行支援へと拡張しつつある今、メモリ設計の標準的な評価軸が整う意義は大きそうです。
ロボットの世界モデルはなぜ汎化するか──「Physical Coding」アプローチ
Papers with Codeで話題の研究「What Makes World Action Models Generalize?」は、ビジョン・言語・アクションモデル(VLA)や世界行動モデル(WAM)がなぜ新しい環境で失敗しやすいのか、その根本原因を表現の問題として捉え直しています。
研究チームの指摘によれば、VLA/WAMが観測と指示を直接ロボット動作に写像する構造では、レイアウトや視点のわずかな変化で失敗し、指示の汎化もうまくいきません。タスクの要件や進捗、失敗からの回復手順が動作系列に暗黙的にエンコードされ、検査も修正も困難なためです。そこで着目されたのが、デジタルのコーディングエージェントの前例です。LLMがツールを呼び出し、結果を検証し、実行可能なコードとしてフィードバックから修正する──その働き方を物理世界に持ち込む発想です。
研究では、タスク状態と実行をコードとして表現する「Physical Coding」を提案しています。オブジェクト・関係・制約・進捗を記録する「Code as World」と、計画・検証・回復・実行を整理する「Code as Policy」の2層で構成し、VLA/WAMポリシーを含む各種ツールを呼び出しながらループ内で判断するエージェント「HexaAnything」を構築しました。RoboCasa365では複合的な未見タスクでXR-1 VLAを上回り、検証済みトレースから学習したHexaModelは全分割でベースモデルを上回ったと報告されています。物理経験を再利用可能なプログラムやメモリとして蓄え、ツールからモデル重み、さらにはアーキテクチャやタスク設計へと自己進化させる──そんな長期ビジョンを示した研究として興味深いところです。
