9月23日に収集した海外AIニュースから、世界のAI世論を探るGallup調査、Jevの新展開、Claude Opus 5.5の「40%安」の内訳、32GB MacでのローカルLLM実測、開発ツールの新顔をまとめました。
Gallup調査:37カ国中34カ国でAIへの前向きな感情が否定的な感情を上回る
世論調査機関Gallupが公表した世界調査によると、対象とした37カ国のうち34カ国で、AIに対する前向きな感情が否定的な感情を上回ったことが分かりました。楽観の度合いは国によって差があるものの、世界的に広がっているという結果です。
規制や投資の話題が先行しがちな中で、実際にAIを取り巻く一般の人々の受け止めを国際比較で示した点が注目されます。「AI疲れ」が語られやすい技術者コミュニティの空気とは対照的に、全体としては受容の姿勢が堅調である――そう読める数字と言えそうです。
Jev、コーダー向けの新プリミティブ登場――実装と実践の輪が同時に広がる
文章を生成せず、判定と確率だけを返す「System One モデル」として注目されるTypeSafe AIのJevについて、The Registerがコーダー向けの新しいAIプリミティブを紹介する記事を公開しました。「Shut up and calculate(黙って計算しろ)」という題が示す通り、コード支援に判定・確率というJevの特性を持ち込むアプローチのようです。記事の詳細は続報を待ちたいところです。
一方、実践側の報告は着実に増えています。Redditでは「Jev in 25 lines of Python」という最小実装の試みが投稿されました。日本語圏でも幅広い活用事例が出ています。
- ネタバレ防止用Chrome拡張:ミュートワードでは防げないネタバレを、Jevの判定でブロック
- 競馬の学術論文100本の仕分け:要旨の絞り込みをJevで行い、LLMとの速度・コストを比較
- RAG構築:「答えるか」「どの文書を使うか」「回答は正しいか」の判断をJev、回答文の作成をLLMに分担する構成で60問を検証したところ、答えのない質問20問すべてをLLMを呼ばずに止め、答えのある質問34問中33問に正答したという
- ユースケースまとめ:用途を選べばLLM比で200倍速く・400倍安く同等以上の精度になると試算
ただし懐疑的な検証もあります。Jevと同等の仕組みをGoogle Cloudで3方式自作して8,453試行で測った記事では「確率を校正しても、人手なしで捌ける割合はほとんど増えなかった。0.3〜0.7秒で返る速い方式は4〜8割しか当たらず、正確なのは思考ありのGemini 3.8 Flash」という結果が報告されています。速さと正確さのトレードオフを含めて、実装の選択肢が議論される段階に入ったと言えそうです。
Claude Opus 5.5「40%安」の内訳――effort設定が効かない落とし穴も
前回のまとめでお伝えしたClaude Opus 5.5とGPT-6 Solの同日発表。その後、日本語圏で「40%安」の中身を検証する記事が出そろってきました。
Zennの検証記事によると、Anthropicがうたう「前のモデルのOpus 5より40%安く使える」は、料金表の値段がそのまま4割下がったという意味ではありません。料金表の値下げは入力・出力が2割、一度読んだ内容を再利用するキャッシュ読みが6割。残りの分は、Opus 5.5が同じ仕事をより少ないトークンで終えられるようになった効率改善によるものです。つまり実際の請求額がどう変わるかは、キャッシュの活用度合いなど使い方に左右されるというのが要点です。
あわせて、Claude Codeのデスクトップアプリでeffort設定が効かなくなる事例も報告されました。原因はWindowsのユーザー環境変数に残っていたCLAUDE_CODE_EFFORT_LEVEL=max。アプリのUIでeffortを切り替えても、この環境変数が優先されて反映されないというものです。Opus 5.5への移行でeffortをいじって試す機会も増えそうなので、環境変数の残存には注意したいところです。
32GB MacでローカルLLMは実用になるか――M5 Air / M6 miniの実測
ローカルLLMの実力を実際のタスクで測ったレポートが2本そろいました。
1本目はMacBook Air M5(RAM 32GB)でコーディング用途のローカルLLMを探す品質測定。公開ベンチマークのスコアではなく、実装タスクを実際にやらせた結果ベースで、ツールを使わせたときにどこまでできてどう失敗するかを確かめています。
2本目はMac mini M6(32GB)で量子化モデル2本の同時使用を試した実測。フォアグラウンドのFlaskサーバーと実際のHTTPクライアント、ライセンス認証を含む本番同等の経路で検証し、2モデル合計の常駐RSS(ピーク)は約14.48GB、以前は403だったエンドポイントが200 OKを返すところまで動いたと報告しています。
ローカルLLM運用のトレードオフ(何を捨てて何を得るか)を整理した記事も公開されており、32GB級のMacでマルチエージェント構成がどこまで現実的か、判断材料が揃ってきた印象です。
無料・オフラインのAIコーディングIDE「Forger」と、エージェント艦隊を見るターミナル「Gwae」
ツールまわりの新顔を2つ紹介します。
1つ目は「Forger」。Electron製のスタンドアロンなAIコーディングエージェントIDEで、無料・BYOK(自分のAPIキー持ち込み)・完全オフライン対応をうたっています。ファイルエクスプローラー、Monacoエディター、AIチャット、Git操作を備え、GitHubで公開されています。
2つ目は「Gwae」。AIエージェントの艦隊(fleets)向けに作られた無限スクロール型のターミナルマルチプレクサです。複数のエージェントを同時に走らせる運用が広がる中で、大量のターミナル出力を「眺める」ためのUIも進化しつつあるようです。
今週はモデルの価格改定や大型モデルの発表が続きましたが、それを受け止める側――利用者の感覚、実測、ツールリング――の動きも同じ速さで充実しています。次回のまとめでも、実務に効く観点を続けます。
