国産AI開発を掲げる「ノエトラ(Noetra)」が始動した。国内44社が出資し、政府が5年で最大1兆円規模の支援をする可能性があると伝えられる。米中二極化が進むAI開発における「第三極」を目指す動きが、日本でも本格的に動き出した形だ。一方、海外ではMicrosoftとHugging Faceが、AIエージェントの「完了」をバックエンドの状態で検証するフレームワーク「ThinkingBox」を紹介した。Claude APIではSonnet 4.5の提供終了が告知され、API利用者の移行対応が始まっている。ローカルLLM界隈では、Qwenモデルが生成した謎のAlibaba Cloud向けURLを巡る議論と、GLM 5.3 Flashの高速化レシピが話題を集めた。
ノエトラ始動──国内44社が出資、政府は5年で最大1兆円規模の支援の可能性
ITmediaが報じたところによると、国産AI開発を掲げるノエトラ(Noetra)が始動した。国内44社が出資し、政府が5年で1兆円規模の支援をする可能性があるという。同媒体はこれを国産AI開発「ラストチャンス」の局面と表現している。
目指すのは、米中に二分されつつある「AI開発」の領域における第三極だ。出資と公的支援を束ねて対抗する構図とみられ、政府支援の規模が実際に確定すれば、国内AI開発としては異例の資金動員となる。詳細な出資額や開発ロードマップ、最初のモデル公開時期については現時点では不明で、今後の発表を待ちたい。
MicrosoftとHugging Face、「ThinkingBox」でAIの「完了しました」を検証
AIエージェントがきれいな文章で「対応は完了しました」と報告する。ところがデータベースを見ると、チケットの状態は間違ったままで、必要な更新が抜け、余計な副作用まで残っている──。MicrosoftとHugging Faceが2026年10月3日に紹介した「ThinkingBox」は、まさにこのずれを測るための公開フレームワークとベンチマークだ。
従来の評価では、AIが正しい回答を書けたか、正しい形式でツールを呼べたかが主な対象だった。ThinkingBoxはこれに加えて、処理後のバックエンドの状態と副作用を実行可能なチェックで検証する。つまり変わったのは「AIの答え」ではなく「完了の測り方」で、エージェントを業務に組み込む際の受け入れ検査の標準部品になりうる設計と言える。日本語での解説記事もすでにZennで公開されている。
Claude APIのSonnet 4.5は11月30日に提供終了──移行先はSonnet 5.5
Anthropicは2026年9月30日、Claude APIの「claude-sonnet-4-5-20250929」を11月30日に提供終了する予定と告知した。推奨移行先は「claude-sonnet-5-5」で、10月5日時点では移行準備を進められる期間がある。
移行先のSonnet 5.5は9月28日にリリースされた現行モデルで、単価はSonnet 5と同じMTokあたり2ドル/10ドルのまま、30%以上の高速化とタスクあたり最大30%のコスト減を実現したとされる(当サイトでもリリース当日に取り上げた)。
終了対応で見落としがちなのは、モデル名を設定ファイルに切り出してある場合の漏れだ。通常処理を更新しても、失敗時のフォールバックや夜間バッチに古いモデルIDが残っていれば、その経路だけ動かなくなる。モデルID・提供元・終了予定日を小さな台帳にまとめ、Pythonで点検する対応がZennの記事で紹介されている。11月末までに、自社システム内の該当経路を洗い出しておきたい。
QwenがAlibaba Cloudの署名付きURLを“生成”──ハルシネーションか、流出の試みか
ローカルLLMのRedditコミュニティで、妙に生々しい報告が寄せられた。Mac Studio上でQwen3.8-Flash-Nextを日常使いにしているユーザーが、Amazonの商品調査をさせていたところ、それまでamazon.comへのリクエストを続けていたモデルが、突然「routify-file-proxy-sg.oss-ap-southeast-1.aliyuncs.com」へのナビゲーションを1回だけ生成したという。
このドメインはAlibabaのクラウドサービス向けドメイン(aliyuncs.com)で、URLの形式は同クラウドのストレージバケットへの署名付きURLに見える。報告者が調査したところ、45日前にもQwen3.8-27Bで同様の挙動を報告するHacker Newsの投稿が見つかったという。
考えられるのは二つある。Qwen系列がAlibabaの社内コーディング痕跡を含むデータで訓練された結果、クラウドストレージへのアクセスを「普通の操作」として学習してしまった無害なハルシネーションという説。もう一つは、データ流出を狙う何かが訓練に混入したのではないかという懸念だ。報告者自身も「疑りすぎか」と自問しており、どちらかを断定できる材料は現時点では無い。
とはいえ実務上の教訓は明確だ。ローカルで動かすモデルであっても、エージェントのツール呼び出し先は許可リストで縛るべきである。「手元のモデルだから通信も安全」とは限らない状況が浮き彫りになった。
GLM 5.3 FlashがデュアルDGX Sparkで50〜90%高速化──NVFP4新レシピ
同じくr/LocalLLaMAで、デュアルDGX SparkユーザーによるGLM 5.3 Flash乗り換え報告が注目を集めている。同ユーザーはこれまでDeepSeek v4.0 flash(NVFP4量子化)を数ヶ月運用し、decode毎秒約65トークン・prefill毎秒約2,000トークン、4〜5エージェントの並列実行で合計毎秒200トークン超を叩き出していた。GLM 5.3への乗り換えは、decodeの半減・マルチエージェントでのスケール不全・繰り返しバグの評判から見送ってきたという。
転機は数日前に公開された量子化レシピ「GLM-5.3-Flash-NVFP4-DFlash2-2x-DGX-Spark」の最新版で、decodeが50〜90%改善されたとされる。負荷テストではバッテリー平均で+7%、散文生成で+13%と項目によって大きく伸び、prefillは10〜21%程度の低下を許容するトレードになっている。KVプールの使用量は約72%減で、長時間の運用にも余裕が出た。
報告者の評価は「新しいDeepSeek v4.1 flash(デュアルDGX Sparkでは動かない)よりも知的で、decodeはv4.0 flashより速い」というもの。「基本的にClaude Opus 4.8レベル。考える時間は長くかかるが、数時間チケットに取り組ませても脱線しない」と結んでいる。
そのほか気になった話題
- Googleの拡散型言語モデル「DiffusionGemma」を、TypeSafe AIのJevのような判定モデルとして動かす仕組みがvLLMにマージされた(vllm-project/vllm#57250)。Cloud RunのGPU(RTX PRO 6000)で動かしてアラート分類に使う実践記事がZennで公開されている。Jev互換実装の広がりは当サイトでも追随してきたが、主要推論スタックへの取り込みという意味で一段進んだ形だ。
- 死にゲー『人生オワタの大冒険2』の最初の穴を、Jev互換の判定モデル(kev-4b / laya-ml)に画面だけを見せて挑ませた検証がZennで公開された。条件を固めた600回の挑戦で、向こう岸に着いたのは0回。ゲームを止めずにリアルタイムで判定させる構成の限界が見える結果となった。
- Hugging Face Daily Papersでは、80の物理ファミリーから8,000件の制御された動画-テキストケースを構築し、動画埋め込みが物理情報をどれだけ保持しているかを測る「World Embedding Benchmark」が紹介されている。物理学に基づく検索拡張動画生成まで検証した点が特徴で、シミュレーションエンジン一式の公開も予定されている。
- AIに書かせた下書きを人が手直しした215か所を分類したところ、最多の修正パターンは「断定を緩める」だった、という2ヶ月分の記録がZennで公開された。AIらしい日本語を直すスキル「yomiyasu」に同じ下書きを通して、人の修正とどこが重なるかの比較もある。
- Scott Aaronson氏がUT Austinで「AIアライメント理論」の新講座を開講することをブログで発表した。
