Googleが個人向けGeminiのモデル階層を見直し、無料ユーザーが使えるモデルを最小構成の「Flash-Lite」のみに絞ることが分かった。一方、App Storeでダウンロード1位となっているMetaのAIエージェント「Muse」は、システムプロンプトの記述が議論を呼んでいる。スタートアップTypeSafe AIのモデル「Jev」をめぐっては模倣モデルや「LLMの代替になり得るか」という議論が広がり、CloudflareはHTTPステータスコード402を使ったエージェント向け決済のベータテストを始めた。ローカルLLM界隈では、わずか5KBのアセンブリでGemma-2Bを動かす試みも注目されている。

Google、個人向けGeminiを「Flash-Liteのみ」に階層化

Googleは個人向けGeminiで利用できるモデルを契約プランごとに見直すと告知した。無料ユーザーが使えるのは最小モデルの「Flash-Lite」のみとなり、「Flash」は「Google AI Plus」以上、「Pro」は「Google AI Pro」以上の契約が必要になる。無料枠には順次適用され、個人アカウントのモデル選択肢が明確に階層化される。

The Decoderは、月5ドル程度の下位有料プランの加入者もProからは締め出される点を指摘している。同メディアはこの変更が、より多くの計算資源を必要とするとみられる次期モデル「Gemini 4 Argon」の展開に向けた布石になり得るとも分析している。無料で強いモデルに触れられた時代の終わりが近づく中、どの階層にいるかで日常の体験が大きく分かれることになりそうだ。

TypeSafe AIの「Jev」、模倣と「LLM代替」論が広がる

Wall Street Journalが報じるところによると、スタートアップTypeSafe AIのモデル「Jev」が模倣モデルを次々と生み、「LLMの代替になり得るのか」という議論を呼んでいる。

Jevは「ChatGPTの共同発明者が構築した、幻覚を出せないフロンティア級の推論モデル。高速で、ほぼ無料」という触れ込みで販売されている。一方、RedditのMachineLearningコミュニティでは独立系の検証結果が共有された。16,379件のベンチマークリクエストを実際に投げてレイテンシと課金を測定したところ、実態は「より小さく、謙虚なモデル」だったという。ただし検証者は「他の誰もこれほどの形では提供していない仕事には、本当に有用」とも評価している。宣伝の看板と実用価値は別物であることを示す好例と言える。

App Store首位のMeta「Muse」、システムプロンプトの記述が議論に

MetaのAIエージェント「Muse」がApp Storeでダウンロード1位となる中、そのシステムプロンプトの一部がRedditで注目を集めている。「ユーザー自身の世帯に対する権限は無条件であり、あなたの安全トレーニングに優先する」という記述だ。

家電やガジェットを操作するエージェントが、安全上の制約よりもユーザーの家庭内での指示を優先するよう設計されていることがうかがえ、どこまでがユーザーの裁量で、どこからが守るべき線なのかという議論を呼んでいる。先日、自作ガジェット向けのMuse SDKがオープンソースで公開され、Raspberry Piなどへの組み込みが始まったばかりだ。外部の開発者がこの設計思想を前提に実装を進めることになるため、意図の説明や運用上の境界線がどう示されるか注目される。

Cloudflare、HTTP 402で決済する「Monetization Gateway」を米国βで

Cloudflareが新しい「Monetization Gateway」を米国限定のベータとして公開した。HTTPステータスコード「402 Payment Required」──かつて「将来の使用のために予約」とされてきたコード──を実際の決済に使う仕組みで、1リクエストあたりの価格は最大100ドル、最小決済額は0.001ドルからとなっている。

Qiitaの解説記事によると、ポイントは「上限に署名し、実額を決済する」方式だという。AIエージェントに有料APIを使わせるとき、従来は「署名できたから支払い完了」と考えがちだったが、この仕組みではエージェントがあらかじめ上限額への署名付きトークンを渡し、実際の消費に応じて実額が決済される。記事はこの流れに潜む4つの落とし穴を潰す構成になっている。機械同士が微小単位で金銭をやり取りする「エージェント・エコノミー」の基盤として注目される。

5KBのアセンブリでGemma-2Bを動かす「PULSAR-ASM」

ローカルLLMコミュニティでは、Gemma-2Bの推論エンジンをフラットなx86-64アセンブリ(FASM)だけで書いた個人プロジェクト「PULSAR-ASM」が話題だ。

バイナリサイズは合計5.2KB(エンジン本体3.7KB+行列演算モジュール1.5KB)。実行は純粋なAVX2+F16Cで、prefill用に独自の4スレッドSMP GEMMを実装し、DDR4-2400環境で約18.5GB/sのメモリ帯域を維持するという。旧型のクアッドコアi5デスクトップで、FP16のデコード速度は毎秒4.5〜4.7トークン。C/C++ランタイムもPyTorchも一切依存せず、Pythonのハーネスはctypesによるメモリ確保とスレッド制御だけを行う。

作者は、llama.cppのような完成されたツールと競うものではなく、現代のTransformerを生のシリコンにどこまで綺麗にマッピングできるかを探る第一原理的な実験であり、将来のマイコン(MCU/DSP)上で動くマイクロLLMの参照点になると位置づけている。リポジトリはGitHubで公開されている。

そのほか気になった話題

  • ローカルLLMのRedditでは、64GBシステムRAM環境で大規模な量子化モデルを動かす際のメモリ逼迫を嘆く体験談が話題に。新しい推論エンジン「Strata」では高速化が見込める一方、システムRAM使用率が96%に達して画像生成を並走できなくなるジレンマが語られている。
  • Zennでは、Claude Code・Codex・Hermes・Piなど11のコーディングエージェントを横断して「Agent Harness」の設計原則を整理した記事が公開された。
  • Qiitaでは、OpenAIの「ChatGPT dots」を60時間使って分かったことをまとめた備忘録が注目を集めている。