9月28日午前のAIニュースまとめ(本日2本目)。米中首脳会談でAIを「超知能(SI)」と呼ぶことが合意され、リスク対応の定期対話の枠組みまでつくられた。先週報じられた「SI」への改名方針が、米中間の制度づくりに一歩進んだ形だ。ビジネス面では、FTが米国企業は高額なフロンティアモデルを見直しオープンモデルへ移行しつつあると報じ、WSJもAIブームの終わり方を見極める記事を掲載した。ローカルLLM界隈では、VRAM+RAMにも収まらない大規模MoEモデルをSSDから読み出して動かす推論エンジンが注目を集めた。

米中がAI呼称を「超知能(SI)」で統一──「米中SI対話」も創設

米連邦政府は、習近平国家主席の国賓訪問に関するファクトシートを公開し、首脳会談の成果を明らかにした。それによると、米中はAIを「超知能(SI:Super Intelligence)」と呼ぶことで合意。あわせて、リスクに対応する定期対話や連絡チャネル(「米中SI対話」)を創設したという。

米側がAIを「SI」と呼び替える動きは先週報じられたばかりだが、それが中国側との間で呼称としてすり合わされ、対話の枠組みまで具体化した。呼称の統一そのものは象徴的なもので、実務的な意味は今後の対話の中身次第だが、競争とリスク管理の両方を米中が同時に進めようとしている点が注目される。公式晩餐会にはイーロン・マスク氏やマーク・ザッカーバーグ氏らIT業界の首脳が集結したという。

FT「企業は高額なフロンティアを拒否、オープンモデルへ」──WSJもブーム終焉の見極め論

英フィナンシャル・タイムズ(FT)が、「米国企業は値段が高すぎるフロンティアモデルを拒否し、オープンモデルを受け入れつつある」とする報道を公開した、とRedditのLocalLLaMAコミュニティで話題になっている。有料記事のため詳細は記事本体で確認する必要があるが、APIコストの高騰を背景に、企業がオープンウェイトのモデルを自己ホストや低価格なクラウドで活用する方向へシフトしつつある、という流れを示唆する内容とみられる。

同じ頃、ウォール・ストリート・ジャーナル(WSJ)は「AIブームが崩壊する前にどう気づくか」という観点の記事を掲載し、Hacker Newsでも取り上げられた。投資過熱が続くAIセクターの持続性を、大手経済メディアが相次いで検証し始めているのは注目に値する。

VRAMに収まらないMoEをSSDから動かす──推論エンジン「Inferred-Thoughts」

LocalLLaMAでは、VRAM+RAMにも収まらない大規模MoEモデルをSSDからストリーミングして実行する推論エンジンが公開され、注目を集めた。Qwen3.8-Flash-Next(176.9Bパラメータ、NVFP4量子化GGUFで119GiB)を、RTX 5060 Ti 16GB+32GB RAM+Gen5 NVMe SSDという一般向けの構成で、1秒あたり9〜10トークンで生成できたという(ベンチマークターンで9.06、ベストターンで10.4)。

仕組みは、モデルのうちメモリに置くのは20GiBだけで、残り99GiBをSSDに置くというものだ。

  • 密な重み(attention・共有エキスパート・LM head):4.4GiB → VRAM
  • トークン埋め込みテーブル:0.6GiB → RAM
  • 最頻出のルーティングエキスパート:8.8GiB → VRAM
  • 次点のエキスパート:6.0GiB → pinned RAM
  • 残りのエキスパート:48.5GiB → SSD(オンデマンド読み出し)
  • n-gramテーブル:50.7GiB → SSD(トークンごとに16行読み出し)

各トークンは48層×10個で480個のエキスパートを使うが、うち約377個はすでにVRAMかRAMに乗っており、SSDから読むのは約103個(トークンあたり約270MiB)。エキスパート参照の約75%がメモリヒットすることが、この速度を可能にしている。次層のエキスパートを先読みするプリフェッチ、BlackwellのテンソルコアでFP4×FP4演算をそのまま実行する工夫、ホットなエキスパートの退避(GCLOCK)なども盛り込まれている。

同じマシンでのllama.cppは平均4.9 tok/sだったため、およそ2倍の速度になる。5.5kトークンのプロンプトに対するプリフィルは49.2 tok/s。開発者は、SSDストリーミングの改善でv2は14〜15 tok/sに届くと見込んでいる。同エンジンはVRAM+RAMに収まるQwen3.6-35B-A3B NVFP4もサポートしており、同一マシンで47.3 tok/s(約4kコンテキスト)、プリフィル591 tok/sを達成したという。

OpenAI互換サーバー(ツール呼び出しはまだ不安定でClineでテストしたとのこと)、回答と推論の分離表示、チャットページを同梱する。制限として、RTX 50シリーズ/Blackwell(sm_120)限定、Windows 11とWSL2のみ、greedy復号のみ。長時間実行でSSDが70度まで上昇した一方、書き込みはほぼないため摩耗は最小限とされる。コードはGitHubで公開されている。

QwenがJev競合「decision-model-preview」をひっそり公開

Jevをめぐっては、先週オープン代替の「CLM」が登場したばかりだが、今度はQwenを運営するAlibabaがすでにJevへの対抗モデルを出した、という報告がLocalLLaMAに投稿された。モデル名は「decision-model-preview」。発表やアナウンスは一切なく、ドキュメントページだけが存在するという。オープンウェイトの公開はまだなく、クラウド平台上での提供とみられる(投稿者によれば、Redditのフィルタがそのプラットフォームへのリンクを含む投稿を削除するため、直接リンクは貼れないとのこと)。

Jevという概念をめぐる追従競争が本格化しつつあるが、Qwen製の対抗モデルはウェイト非公開という点で、オープン代替のCLMとは対照的だ。正式な発表と、ウェイト公開の有無が今後の焦点になる。

QwenエージェントがWorld of Warcraftをプレイ──MCPでゲームを操作

別のLocalLLaMA投稿では、Qwenモデルを使ってエージェントにWorld of Warcraft(WoW)をプレイさせる実験が報告された。投稿者はまずエージェントにプライベートWoWサーバーを構築させ、続いてゲームをインストールせずに遊べるWebブラウザクライアント(モバイル操作にも対応)を作成。さらに汎用ブラウザエージェントより細かい操作を可能にする独自のMCPサーバーを組み込み、ローカル/クラウドのLLMをハーネスに接続してゲームをドライブしているという。

視覚入力は使っていない(将来的には有効だがレイテンシ増とのトレードオフになる)そうで、快適に動かすには50 tok/s超で生成できるモデルが望ましいとのこと。ゲーム本体はjankcraft.xyzで試せる。「Pokémonベンチマークは少し簡単になりすぎた」として、次はWrath of the Lich Kingでレベル80へのスピードランを課したい、と投稿者は述べている。

Claude Codeにプロンプト監査コマンドが追加──ただしスキルはそのままでは監査されない

Claude Code 2.1.283(2026年9月25日)のchangelogに、CLAUDE.mdなどプロンプト類を監査する「/doctor prompt-audit」(/checkup prompt-audit)コマンドが追加された。Qiitaの検証記事によると、このコマンドはそのままの状態では著者が保有するスキル49本を監査対象として認識しなかったという。CLAUDE.mdを多数のスキル・プロンプトで運用しているユーザーが監査範囲を広げるには、ひと手間必要になるようだ。

国内: IDC「AIがSaaSを消す」は誤解──離職率16.2%→6.7%の病院、熟練溶接を再現する安川のロボ

IDCは、AIエージェントの普及に伴う「SaaS終焉論」を分析したレポートを公開した。「AIがSaaSを消す」という見方は根本的な誤解で、AIはSaaSを代替するのではなくデータモデルを拡張していく、と指摘。市場ごとのAI浸透の格差や、成果型課金の急増など、「本当に起こる構造変化」を整理している。

医療現場では、筑波記念病院が組織分析AIを活用して部署ごとの職場課題を可視化し、具体的な改善策につなげている。看護職員の離職率は2021年度の16.2%から2025年度には6.7%まで低下したという。数値に表れにくい「職場の見えない課題」をAIで浮かび上がらせた事例として、人手不足に悩む医療・介護分野への波及が注目される。

ものづくりでは、安川電機が「2026国際ウエルディングショー」で、AIロボット「MOTOMAN NEXT」による熟練型アーク溶接のデモンストレーションを披露した。カメラで溶接部を見ながら、熟練工の「感覚」を再現する動きという。