9月27日夜のAIニュースまとめ。StanfordとCaltechの研究チームが、GPT-6 Astraを搭載したヒューマノイドロボットで見知らぬキッチンの片付けに成功したと報告した。専用の制御層を挟まず、言語モデルが把持や移動などのモジュール化されたスキルを直接呼び出す設計が特徴だ。一方、OpenAIの研究責任者は「研究リソースの8〜9割はGPT-7以降に向いている」と明かし、NonobenchではGPT-6 Astraが15×15のノノグラムで満点を達成。Anthropicの「秘密のAIウェットラボ」が初の発見を報じられたほか、Nvidiaの話者分離モデル公開や、ローカルLLM界隈で「ハーネス(作業環境)の重要性」が再び話題になっている。

GPT-6 Astra搭載ロボット、専用制御層なしで見知らぬキッチンを掃除

The Decoderの報道によると、StanfordとCaltechの研究者らは、GPT-6 Astraを基盤とするヒューマノイドロボットが、初見のキッチンを自力で片付けることに成功したという。ポイントは「HomeBody」と呼ばれるシステムの設計で、タスクごとに特別に訓練した制御層を介さず、言語モデル自身が把持(グラスペング)や移動といったモジュール化されたスキルを直接呼び出す構成になっている。

従来のロボット操作研究では、言語モデルが大まかな計画を立て、実際の動作は個別に訓練された制御モジュールが担う分担が主流だった。その間の層を省いてLMに直接スキルを呼ばせるアプローチは、環境やタスクが変わるたびに制御部を作り直す必要が減るという点で、汎用性面での大きな一歩とみられる。キッチンの片付けは「どこに何を戻すか」の判断が環境に依存するタスクで、未知の環境での成功は示唆的だ。

人型ロボットの開発競争が活発化する中、LLMの推論能力をロボットの「頭脳」としてどう接続するかは争点の一つ。汎用モデルと身体性の組み合わせがどこまで通用するか、研究チームからの今後の検証報告に注目したい。

OpenAI「研究の8〜9割はGPT-7以降に」──最大の課題はモデル性能ではなくユーザー側に

OpenAIのApplied Research責任者を務めるBoris Power氏が、同社の研究の80〜90%はGPT-7やGPT-8、そしてその先に向けたものだと明かした。単一世代の中での改善は意図的に短期の賭けに絞っており、大きな進歩は次世代モデルの設計に寄与する形で進められているという。

興味深いのは、Power氏が「最大の問題はモデルの性能だと考えていない」と述べている点だ。同氏によれば、多くのユーザーはAIで何ができるのかをそもそも知らない状況にあり、性能向上よりも活用のギャップを埋めるほうが課題だとみているという。

モデル性能の伸びをめぐっては「頭打ち論」が繰り返し浮上しては退けられてきた経緯があるが、供給側の認識としては「次世代への投資はむしろ本格化している」という見立てになる。一方の「ユーザー側の活用が追いついていない」という指摘は、ツールを提供する側の視点として傾聴に値しそうだ。

Anthropicの「秘密のAIウェットラボ」が初の科学的発見

The Scientistの報道によると、Anthropicが極秘に進めてきたとされるAI駆動のウェットラボ(実験室)が、その存在を公にするとともに、最初の科学的発見を成し遂げたという。現時点で収集データから確認できるのは報道の見出しレベルの情報であり、実験の詳細や発見の内容は元記事で確認してほしい。

AIを科学研究に応用する動きは、文献調査や仮説生成といった「乾いた」領域から、実験を自動実行する「ウェット」な領域へと拡大しつつある。物理実験の自動化は失敗のペナルティが伴うため、閉じた環境での検証を経ての公開とみられる。詳細が判明すれば追って取り上げたい。

Nvidiaが話者分離特化の1億パラメータモデルを無料公開──最大8話者をリアルタイム識別

Nvidiaは、会話の中で「今誰が話しているか」を識別するダイアリゼーション専用モデル「Nemotron 3 Diarization」を公開した。パラメータ数は約1億(100M)と小型で、リアルタイムで最大8話者を識別できる。無料で提供される。

文字起こし(ASR)の実用精度は、話者の切り替え検出に大きく依存する。汎用LLMが巨大化する一方で、こうした単機能の小型モデルはエッジデバイスや常時稼働するシステムへの組み込みに向く。会議ログの自動整備やコールセンター解析、ローカルでの文字起こし環境など、実務での用途は広く、無料公開の意味は小さくない。

Nonobench v1.2──GPT-6 Astraが15×15ノノグラムで満点、オープン重量モデルは20×20で全滅

RedditのLocalLLaMAコミュニティで、論理パズル「ノノグラム」で43のLLMを比較するベンチマーク「Nonobench」のv1.2が話題になっている。1月の初版から、推論努力度(reasoning effort)を1実行ごとに明示、プロンプトと出力の全面公開、主要な非公開・公開モデルの追加などの改良が行われたという。

結果のハイライトは次の通り。15×15パズル30問では、GPT-6 Astraが30/30の満点を達成したのが初。オープン重量ではDeepSeek V4 Proが83%で4位タイ、DeepSeek V4.1 Flashは総コスト0.84ドルで77%だった。一方、新設のHardモード(20×20を10問)ではOpus 5.5が8/10だったのに対し、オープン重量モデルはすべて0/10だったという。

非公開のトップモデルとオープン重量モデルの差は、比較的易しいタスクでは縮まっている一方、長大な制約充足が求められるタスクでは依然として歴然としている、という構図が見える結果だ。なお現時点ではOpenRouter経由の実行のみで、ローカル実行には未対応という。

【ローカルLLM】「ハーネスが大事」再燃──Codex CLI経由でローカルモデルがGPT-5.6を逆転した体験報告

LocalLLaMAに興味深い体験談が投稿された。投稿者はRTX 3090の2枚構成で量子化版のQwen 3.8 Flash Next(W4A16)を動かしているが、本格的な作業ではGPT 5.2や最近のGPT 5.6 Lunaにまったく歯が立たなかったという。ところが、GPT 5.6 Luna自身に手伝わせてCodex CLIをローカルLLM向けに設定したところ状況が一変し、長年使っている検証用の「3Dマリオ」プロンプトで過去最高の結果が出た。さらに数日かけてLunaが進めていた実プロジェクトを同じく並行で走らせたQwen 3.8 Flash Nextが上回った、と報告している。

モデルそのものより、モデルを囲む作業環境(ハーネス)の質が体感を左右する、という「Harness matters」の議論は以前から繰り返されているが、オープン重量モデルが実務で逆転する具体例として注目を集めている。ただし単一ユーザーの体験談であり、タスクや設定次第で結果は変わり得る点は割り引いて読みたい。

同じくLocalLLaMAでは、RTX 5090(32GB)とRTX 4070 Ti Super(16GB)の合計48GB VRAM環境で、Qwen3.8-27Bのblock-FP8量子化版(28.75GiB)をvLLM 0.30.0のパイプライン並列で動かした測定も報告された。262,144コンテキストをフルに確保した設定で、コード生成で約100トークン/秒、MTPの受理率は約87%、258Kトークンの事前充填(prefill)に169秒という数字が示されている。PCIe x1接続でもボトルネックにならなかったという観察も、マルチGPU自作派には参考になりそうだ。