大手モデルの次の一手と規制の動きが同じ日に重なった。Google DeepMindの開発責任者が「Gemini 4」の時期に触れ、AnthropicのAmodei CEOは国連安保理の壇上でリスクを訴えた。米国では超知能の禁止を盛り込んだ法案も提出されている。開発最前線と規制の両方が動く日になった。
「Gemini 4」は年末までに──DeepMind開発責任者が示唆
The Information主催のイベントで、Google DeepMindの開発責任者コーレイ・カヴクチュオール氏が、次期モデル「Gemini 4」が間もなく登場するとの見方を示したとITmediaが報じている。報道では年内の発表とされ、氏は「Googleは確かに最先端」とも主張したという。
正式な発表日程はまだ確認されていない。ただ、DeepMindの開発責任者が公の場で時期に踏み込んだ発言をした点が新しく、ここ数ヶ月のGPT-6系やOpus 5.5との衝突を見てきた通り、フロンティアモデルの投入間隔はさらに縮まりそうだ。
AnthropicのAmodei CEO、国連安保理でAIリスクを警告
Anthropicのダリオ・アモデイCEOが、国連安全保障理事会のブリーフィングでAIリスクについて警告した。演説の動画が公開され、Hacker Newsでも取り上げられている。
今週、国連側からAIエージェントの制御喪失リスクへの警告が出たばかりだが、今回の目玉は民間大手 lab の経営者本人が安保理という場で直接訴えた点だ。政府間の議論に業界側のトップが加わる形が定着してくるなら、AIガバナンスの議論の速度自体が変わってくる可能性がある。
超知能(ASI)の禁止と「AI省」創設──米国で法案提出
AP通信によると、人工超知能(ASI)の禁止と、新たな「AI省(Department of AI)」の創設を盛り込んだ法案が提案された。報道のURLからはバーニー・サンダース議員が関与しているとみられるが、条文の詳細や審議見通しは現時点では不明だ。
トランプ大統領側が「AI Force」創設を打ち出したのとは別ルートで、議会からは「開発を加速する組織」ではなく「禁止と監督」という逆向きの法案が出てきたことになる。加速と規制の綱引きが同じ週に並んで見える構図で、今後の米国のAI政策の方向性を占う材料になりそうだ。
ローカルLLM: llama.cppに「Ling 3.0 VL」サポートPR、Mac M5 Ultraは本気のベンチ待ち
ローカル推論周りは2つの話題。まず、llama.cppにLing-3.0-flash-VLのサポートを追加するプルリクエストが出されている。124Bの総パラメータに対してトークンあたりの活性化は5.5B、コンテキストは最大256Kトークン。言語・推論・長文の能力を保ったまま画像と動画の理解を統合した構成で、ViTの視覚エンコーダと2層MLPプロジェクタで視覚特徴をテキスト表現に揃える設計という。
もう一つはMac M5 Ultra(256GB)だ。RedditのLocalLLaMAでは「発売されたのに真面目なベンチマークが出ない」という不満が上がっている。出回っているのはYouTube系の表面的なレビューばかりで、小さめのモデルを動かした映像が中心。AppleシリコンがNVIDIA製GPU中心のワークフローと実際に競争できるのかを判断するには、本格的な実測が要るという指摘だ。 Unifiedメモリの容量だけが売りの機材なのか、それとも実効性能が伴うのか。ローカルLLM利用者にとっては価格に見合うかを左右する部分で、今後数週間でまともな数字が出てくるかが焦点になる。
Claude Code: 「キャッシュ92%」の出どころを9万件のログで検証
日本語圏の実務記事から。まず「Claude Codeのプロンプトキャッシュのヒット率は92%」という有名な数字の検証。出どころを辿ると、Avi Chawla氏の記事で「30分のコーディングにかかる費用を計算する」場面に置かれた前提の数値で、実測ログは伴っていなかったという。そこで9万件のログから実際のヒット率を調べ直したところ、サブエージェントのキャッシュヒット率は5分を境に変わる――つまりキャッシュの寿命をまたぐかどうかで体感コストが変わる、という実測が得られた。
もう一つはリモートコントロールの設定記。Claude Codeにはデスクトップで動くセッションをスマホや別PCのブラウザから操作できる機能(2026年2月25日のリサーチプレビュー)がある。コードの実行はすべてローカルマシンのまま、操作の橋渡しだけが行われる構成で、「デスクトップのエージェントを外出先から動かす」運用のハードルが一段下がった形だ。
Jevの実践は「検証と最適化」の段階へ
Jev(TypeSafe AIの判断特化モデル)は日本語圏でも実践の幅が広がっている。今週は実測、チューニング、運用移行の3本が出た。
1本目は、Jevの文脈で出てくる「JSON」という言葉の整理と検証。「JSON」は出力形式の話ではなく、LLMに構造化出力をトークン列として書かせる工程そのものの代名詞として使われていた、と指摘した上で、Jevが主張する速度と較正を、公開モデルのlogit直読み(候補トークンの確率分布を1回のforward passで読む)で実際に測っている。
2本目は最適化。再学習できないJevでチューニングできるのは、Choice質問のinstructions(質問文)とcriteria(候補ごとの説明)の文面だけ、という制約のもと、GEPAで文面改善を試した。結果は「効いたのはcriteriaだけで、較正誤差(ECE)は壊れなかった」というもので、安易な文面いじりが較正を壊しがちなこの手のモデルでは嬉しい知見だ。
3本目は運用移行。毎朝のリサーチでClaude Opusに任せていた「この資料は関心に関係あるか」「新しいことを言っているか」という判定をJevに切り出した。ポイントは、判定を依頼するたびに「何に対して関係あるか」という問いを一緒に渡すことだったという。
実装の解説から始まったJevの日本語記事の流れは、実測→最適化→実業務への切り出しという段階に入った。判断を生成に混ぜ込まず確率として取り出すという設計思想が、実際のワークフローのどこに収まるかが見え始めている。
大手のモデル競争は年末に向けて加速し、規制側の動きも具体化しつつある。その間でローカルと実務の現場は、実測データを積み上げる地味な作業を続けている。次のモデルが出る前に、いまの道具の性質を正確に把握しておく価値はむしろ高まっている。
