9月24日に収集したAIニュースから、判断特化モデルJevのオープン代替として登場した「CLM」、元採掘ボードやMac+AMD GPUでのローカルLLM自作、そして拡散モデルとメモリの2本の研究を取り上げる。
Jevのオープン代替「CLM」──機能互換と4〜13倍速を主張
TypeSafe AIの判断特化モデル「Jev」に、オープンウェイトの対抗馬が現れた。RedditのLocalLLaMAコミュニティで話題になっている「CLM(Contrastive Language Models)」は、Qwen3-8Bに新しいprojection headを追加した構成で、JevのコアプリミティブであるChoice(候補集合の評価とカテゴリカル確率分布)、Noul(命題の真偽確率)、Score(ルーブリックに対するスコアリング)をすべて実装している。「機能的なサブセットではなく、APIと機能インターフェースのレベルでJevが対応するものはすべて対応する」とされ、TypeSafeのJevクライアント向けに書かれたコードは、clm-serveのエンドポイントを向ければそのまま動くというドロップイン互換をうたっている。
性能面での主張は大きい。Jevが状態と質問の選択肢をまとめて評価するのに対し、CLMは状態ヘッドとアクションヘッドを分離し、恒常的に使うツールやアクションの埋め込みを一度だけ計算してキャッシュできる。インタラクティブなブラウザエージェントやゲーム(T-Rex、Super Mario)のベンチマークでは、Jevの4〜13倍高速だったとされる。ヘッドは約75MBと軽量なオープンウェイトのため、自分のエージェント軌跡でファインチューニングもでき、その場合にはTerminal-Bench 2.1で87.6%、DeepSWEで81.6%に達する。ゼロショットのJevがDeepSWEで約71%だったとされる点と比べると、検証器としての使い道では上を狙える計算だ。
一方で、泣き所も率直に示されている。背後に大規模なプロプライエタリモデルを置くJevに対し、CLM-8Bはゼロショットの広域知識で見劣りする(Berkeley Function Calling Leaderboard v4でJev 99.2%に対し95.2%、WikiRacingで30/30に対し26/30)。コンテキスト長も、Jevが64Kトークンに対応するのに対し、CLM-8Bは2K〜8Kで較正済みとなっている。確率の求め方も、CLMはリクエストごとの候補集合内での相対評価になるため、絶対基準で較正されたJevとは性格が変わる。「API機能を失わずにレイテンシを大幅に改善し、APIコストをゼロにできる。失うのはニッチな領域でのゼロショット性能」──投稿者はこうまとめている。
日本でも、Qiitaで「Jevで遊ぼう!」キャンペーンが行われ、PythonやElixirからJevを呼んで試す実践記が出始めている。判断特化モデルという新しいジャンルが、早くもオープンとクローズドの両陣営で動き出している。
$300の自作リグでQwen3.6-35Bを60tok/s──MacでAMD GPUを動かす手も
ローカルLLMのハードウェアを自作する動きも続いている。あるユーザーが、かつて採掘に使われていたBC-250を2枚(1枚115ドル)で購入し、llama.cppのVulkanバックエンドとRPCで連携。2枚で合計約27GBのGPUメモリを1GbEのイーサネットで束ね、Qwen3.6-35B-A3BのQ4_K_M量子化を60 tok/s・64kコンテキストで動かしている。電源を含む総額は約300ドルで、手元にまだ数枚あるため、6枚構成でQwen 3.8 Flashを動かす計画だという。
さらに変わった構成も登場した。MacBook Pro M5 Max(128GB)に、Thunderbolt 5経由のRazer外付けケースでAMD Radeon AI PRO R9700を接続してLLMを動かす試みだ。Linux用のamdgpuドライバをmacOSに移植し、自作のLLMエンジン「LSE(LemonSeed-Engine)」でQwen3.6系のDense/MoEモデルとMTP(マルチトークン予測)を動かす。AMDの新しいHRXという仕組みを使い、MacではLoom/HRXの組み合わせで動作するという。ドライバとエンジンはいずれもGitHubで公開されている。個人プロジェクトではあるが、Apple SiliconとAMD GPUという異種混合の構成が現実のものになりつつあるのは見どころだ。
拡散モデルの特徴空間学習は「x0予測」が効く
Hugging Face Daily Papersから。視覚エンコーダの特徴空間で拡散モデルを動かす「Representation Autoencoders(RAE)」の研究において、学習のパラメータ化の選択が効くことが示された。
市販の視覚エンコーダの多くは忠実な再構成に最適化されておらず、細部の視覚情報を落とす。エンコーダを画像再構成用にファインチューンすると細部は戻るが、今度は得られる表現の実効次元が下がり、その幾何の変化が生成に影響する。具体的には、フローマッチングの標準であるvelocity予測をこの高次元空間で使うと、モデルは低次元のシグナル多様体の外にある直交するノイズ方向まで当てはめなければならず、最適化が非効率になる。そこでクリーンデータそのものを予測する「x0予測」に切り替えると、学習がシグナル多様体に集中する。複数の強力な再構成エンコーダを使った実験で、x0予測はtext-to-image生成の性能を一貫して改善したという。
記憶を「生成」する──MemoryAthenaの選択的ルーティング
これもHugging Face Daily Papersから。「有用な記憶は、ストレージから検索するだけではなく、生成できるのか」という問いを立てた研究「MemoryAthena」が発表された。
MemoryAthenaは、直接的なEngram検索に2つの生成メモリ経路を組み合わせ、軽量な因果ルータが「生成した表現で検索して得た記憶を修正するかどうか」を選択的に決める。重要な知見は、生成メモリは記憶の「置き換え」としてではなく「選択的修正」として働くときに最も効果的だという点だ。このルーティングによりQAと一般NLPの両方で性能が向上し、生成が役に立たない場面では直接検索の経路がそのまま保持されるため、検索ベースの強みを犠牲にしない設計になっている。
自治体・企業で進む「Google回帰」──Gemini Notebookの活用アイデア
国内では、生成AIを業務に取り入れる企業や自治体の中で「Google回帰」が進んでいるとITmedia AI+が報じている。重要になるのは、実際の仕事でどう使うかという視点で、既存システムや業務との兼ね合いに加え、セキュリティや運用面の検討も欠かせないという。ノートブック型ツールを業務に活用する具体例が事例とともに紹介されており、日本の組織での生成AI定着の状況をうかがえる記事になっている。
今回の取り上げトピックは、収集時点で確認できた情報に基づいています。
