9月25日は、新モデルの発表よりも「AIの作り方と土台」をめぐる話題が目立った。事後学習の全工程を公開するレシピ、ロボット学習向けの大規模データセット、メモリ供給の行方をめぐる議論まで、開発の足元を固める系のニュースが並ぶ。今回はその中から6本を取り上げる。
オープンの事後学習レシピ「Rufus-Air」──公式GLM-4.5-Airを上回る全8段階を完全公開
Hugging Face Papersに掲載された「Rufus-Air: An Open LLM Post-Training Recipe」は、総106B・活性化12BのGLM-4.5-Air-Baseを土台に、SFT、推論RL、コーディングRL、指示追従RL、汎用エージェント、コーディングエージェント、検索エージェント、RLHFの8段階を直列に実行する事後学習レシピだ。データ、報酬設計、インフラ、段階順序、段階別の結果までを文書化し、再現に必要な要素を丸ごと公開している。
特徴は、独自の人手アノテーションも内製の蒸留教師も使わず、公開コンポーネントと公開データの多くをリリースされたまま利用している点だ。論文が挙げる主な知見は、多様で高品質なSFTが能力の土台を作ること、難度フィルタリングでRLのプロンプトを「学習が成立する範囲」に保つこと、報酬の信頼性が段階順序の実用的な指針になること、そしてインフラとエンジニアリングの選択自体もレシピの一部であること——の4つ。成果として、公式のGLM-4.5-Air事後学習版を上回り、同規模のオープンモデルと競争できる性能だと主張する。
ベースモデルの重みだけが公開されても事後学習は再現できない、というのがオープン陣営の長年の課題だった。段階構成から報酬設計、インフラまで含めた「完全レシピ」の公開は、再現性のハードルを一段下げる意味がありそうだ。
1,800時間の一人称視点データ「Gen-HumanEgo」──ロボットに人間のやり方を教える
Hugging Faceのトレンディングデータセットには、GenRobotによる「Gen-HumanEgo」がランクインした。6台のカメラを備えたDAS-Egoセットアップで収集した一人称視点(エゴセントリック)の実世界デモンストレーションを、総1,847.7時間・44,632エピソード・10,257タスク分収めたデータセットで、対象は家庭・店舗・工場・農業の4領域にわたる。
映像だけではない点が特徴だ。1手21点の3Dキーポイント、MANOパラメータ、手の形状情報による3D手再構成、広視野のEgo-Depthに加え、「動画→タスク→サブタスク」の3層構造で階層アノテーションが付く。例えばソファを整えるエピソードなら、タスク「ソファを片付ける」の下に「赤と黒のクッションを背もたれに置く」「右座席のソファカバーを平らにする」といったサブタスクが時間境界付きで記録される。同社のData Foundation Model(DFM)が録画を処理し、動作・空間理解・タスク理解の学習信号を生成したという。
身体性AIとロボット学習では、高品質な人間の作業記録の不足が長年のボトルネックだった。1,800時間を超える構造化データがオープンに供給される意義は小さくない。
「HBMはlousy」──Hot Chips 2026で噴出したメモリ積層への疑問
Redditのr/LocalLLaMAで議論を呼んでいるのが、半導体カンファレンスHot Chips 2026の質疑をめぐる一連の発言だ。スレッドの紹介によれば、元Intel CEOは「HBMはlousy(出来が悪い)」と切り捨て、SKハイニックスのVPも「HBMはメモリウォール問題の最終解ではない」と述べたという。
論点は「高く積む」戦略そのものだ。HBM4でスタックを20段に積めば1層あたりの帯域は希釈され、積み上げが十分に高くなると各コアダイは「ありふれたコモディティメモリより遅く」なる——それでもなぜ「速く」ではなく「高く」向かうのか、という問いが会場から投げかけられた。スレッドでは、フラッシュ系の高帯域メモリ「High Bandwidth Flash」が近づいているとの見方も示されている。
LLMの推論性能はメモリ帯域に強く依存する。HBM一辺倒の供給体制に疑問が向けられるのは、GPU構成そのものに影響しかねない材料で、今後のメモリウォール議論の火種になりそうだ。
ローカル実測──Qwen 3.8 Flash Nextの量子化版が27B FP8に精度で圧勝、速度は別の話
同じくr/LocalLLaMAでは、Qwen 3.8 Flash NextのIQ4_XS量子化版とQwen 3.8 27BのFP8版をvLLMで比較したベンチマーク結果が投稿された。MMLU-Proが83.8%対75.0%、GPQA Diamondが42.5%対27.5%、GSM8Kが97.5%対90.0%と、精度系ベンチは軒並みFlash Nextの量子化版が優勢で、IFEvalは89.6%で引き分けだった。
ただし所要時間は逆転する。250ケースの評価が、FP8 27Bでは36分27秒で完了したのに対し、Flash Next IQ4_XSは2時間5分47秒を要した。投稿者の環境は64GB DDR5メモリとR9700×2。「シングルユースなら低量子化のFlash Nextを選ぶが、同時実行の速さはFP8 27Bが約4倍」という実感も添えられている。
「量子化すれば精度が落ちる」という通念は、大規模モデルの低量子化では必ずしも当てはまらないことを示す報告が続いている。ローカルLLMの選び方は、パラメータ数よりも量子化方式とメモリ帯域のバランスで決まる時代になりつつあるようだ。
NVIDIAフアンCEO、AIとエネルギーをめぐり「救うためにはまず傷つける」
The Vergeは、NVIDIAのジェンスン・フアンCEOがAIのエネルギーと気候変動について語った発言を報じた。見出しに掲げられたのは「あなたを救うためには、まず傷つけなければならない(in order to save you, they've got to hurt you first)」という言葉で、AIがもたらす便益とそのエネルギーコストの両面に触れた文脈での発言とみられる。同メディアはこの言い回しを悪役(スーパーヴィラン)のセリフになぞらえている。
把握できている情報が見出しの範囲にとどまる点は割り引いて読みたいが、AIの電力需要をめぐる議論が各国の政策課題になる中、その最大の受益者であるNVIDIAトップの言葉は今後も引用されそうだ。
GoogleのPrivate AI Computeに永続メモリ──「処理後に消える」前提の設計を見直す
Qiitaの記事が注目したのは、Googleが9月23日に「Private AI Compute」へサーバー側の永続メモリを加える設計を発表したことだ。従来は「処理が終われば文脈は消える」を前提にAIへ情報を渡せたが、今後は一度渡した情報が次の会話でも使われるようになる。
記事の論点は、この変化を暗号化の強化だけでは扱えない、というものだ。暗号化して保存するAIは「忘れるAI」ではない。前提が「消える」から「保存され、再利用される」に変われば、AIに情報を渡す側のシステムも設計の見直しを迫られる。プライバシー設計の土台に関わる指摘と言える。
