9月26日(日本時間夜)時点の海外AIニュースから、コスト最適化の研究を筆頭に6本をまとめた。
Nvidiaの「SoL-Pi」──コーディングエージェントのトークン消費を最大49%削減
The Decoderの報道によると、NvidiaのSoL-Piと呼ばれるシステムは、コーディングエージェントのトークン使用量を最大49%削減しながら、性能はほとんど落とさないという。着目点がユニークで、モデルそのものを改善するのではなく、モデルと実行環境の間に挟まるコントロール層(ハーネス)を最適化するアプローチだ。
開発過程も興味深い。リサーチエージェントが152のアプローチを3,000回以上の実行で比較してシステムを組み上げたとされる。ただし報道では、効果は他のベンチマークでは小さくなることも触れられており、どの種類のタスクで効くのかという汎用性の検証がこれからと言えそうだ。
夕方に紹介したアクセンチュア調査の「タスクに応じたモデル選択でコスト増を44%抑制」と同じく、トークンコスト対策の主戦場が「利用を減らす」から「呼び出し方を最適化する」へ移りつつあることを示す成果と言える。
中国製AIモデルが世界的に普及──ワシントンが警戒感を強める
CNBCの報道によると、中国発のAIモデルがグローバルでの人気を急速に高めており、ワシントンがその動きを懸念しているという。オープンウェイトで公開される中国製モデルが価格・性能の面で選ばれる場面が増え、米国にとっては規制と競争力の両面で頭の痛い状況になりつつあるとみられる。
普及の実態がどの程度なのか、懸念の具体の中身がどこまで議論されているのかは、現時点では報道の骨格を追う段階だ。米中のAI覇権をめぐる報道は今後も増えそうで、数字が出てきたら改めて整理したい。
Meta「Muse」は大人専用──それにしてはキッズトイっぽい問題
WIREDが、MetaのAIエージェント「Muse」をめぐる奇妙なギャップを指摘した。MetaはMuseを大人専用としているものの、Labubuを思わせる愛らしいマスコットや、先日報じた たまごっち風のAIデバイスを控えており、その外見は全年齢のユーザーの警戒心を解いてしまうかもしれないという。
「親しみやすいデザイン」と「実際の対象年齢」のずれは、音声対話するAIデバイスでは特に扱いが難しい論点だ。デバイスの発売を待たずして、どの年齢層にどう使われるのかの議論がすでに始まっている。
332MBで書類を仕分ける「BeeNara」──「該当なし」と言えるのが売り
RedditのLocalLLaMAコミュニティで、小型の文書仕分けモデル「BeeNara」が紹介された。ONNX形式のcross-encoderで容量は332MB、ノートPCのCPUだけで1文書あたり0.2〜0.3秒で動く。フォルダ名のテキストをそのまま与えるゼロショット運用で、請求書・契約書などの仕分けを想定している。
特徴は精度そのものより、確信の持ち方にある。split-conformal predictionによって信頼度が較正されており、確実でない場合やどのフォルダにも当てはまらない場合は「none fits」を返して人間のレビューに回す。実際に正しいフォルダが一覧にないケースを96.8%捕捉したという。小型LLMが「わからない」と言えず、間違ったフォルダへ自信満々に放り込んでしまう問題への現実的な回答で、英語とドイツ語の文書に対応する。モデルとコードはHuggingFaceで公開されている。
Qwen3.8 flash next + ExLlamaV3──ローカルエージェントが実用速度に
同じくLocalLLaMAでの報告。Qwen3.8 flash nextの6bpw ExLlamaV3量子化を6枚のRTX 3090で動かし、80〜120トークン/秒という実用的な生成速度と品質が両立したという体験が共有された。
この推論エンジン上でHermesエージェントを常駐させ、Matrix経由でスマホから安全に指示を出し、コーディングはopencodeに委任するという日々の運用がすでに成立しているとのこと。量子化のビット数を落とせばより少ないGPUでも同等に動くとみられるとおり、自宅ハードウェアでエージェントを回すハードルは着実に下がっていそうだ。
AIとの距離を取り戻す動き──「1ヶ月AIなし」の体験談が話題、エージェント専用受信箱も
Hacker Newsでは、AIを一切使わずに1ヶ月過ごした体験談が79ポイントを集めて議論を呼んだ。便利さを手放してみて何が見えたのかという類の検証は、AI活用が当たり前になるほど参照されやすいテーマだ。
並行して、AIエージェントを「止める・抑える」側の設計も動いている。エージェント専用のメール受信箱「Agentboxd」は、メールを敵対的な入力として扱う前提で設計されており、プロンプトインジェクション対策をメール処理に持ち込んだ形だ。またa16y.aiは「誰も見ていない時にAIエージェントをどう制限するか」をテーマにした記事を公開している。今週何度も報じたOpenAIエージェントの一連の不祥事を受けて、任せ方だけでなく止め方の設計が現場の関心ごとになりつつある。