AIを「外から使う」だけでなく、まわりの道具や仕組みごと作り替える動きが各所で目立った。AnthropicはコーディングエージェントClaude Codeに、開発者がコードでツールの中身を書き換えられる「Mods」の仕組みを加えた。ロボットではUnitreeが6Bパラメータのヒューマノイド基盤モデルを公開し、ベッドメイキングから洗濯物を折るまで64タスクを1つのモデルでこなすとしている。個人の実験では、iPhone 17 Pro MaxをMacの2台目のGPUに仕立ててQwen 27Bの前処理を最大44%高速化した報告が注目された。OSSの現場ではSWCがAI生成コンテンツを理由に外部PRの受付を停止。アーキテクチャの側では、成長し続けてもアクセスコストが増えないメモリを持つ「Spotlight」が登場した。

Claude Codeに「Mods」──ツール自身をJavaScriptで書き換える

Anthropicが、CLIベースのコーディングエージェントClaude Codeに「Mods」という新しいシステムを追加している。The Decoderの報道によると、Modsはツールの内部で直接動くミドルウェアで、開発者はJavaScriptやTypeScriptを使ってインターフェースや挙動を再形成できる。カスタムパネルの追加、ツール呼び出しのインターセプト、新しいコマンドの配線といった使い方が想定されるという。

これまでコーディングエージェントのカスタマイズは、指示ファイルやスキル、フックといった「設定とプロンプト」の層で行うのが主流だった。Modsはその下の層を開放する。エージェントが何を見て、何を許し、どう応答するかを、コードとして書けるようになる。拡張の中心がプロンプトからプログラムへ移れば、BIツールのダッシュボードのように「エージェントのミドルウェア」という新しいソフトウェア層が育ち始める可能性がある。Claude Codeを仕事場にしている開発者にとっては、自分のワークフローに合わせて道具そのものを鍛え直せる日が近づいたといえそうだ。

「Transformerは考えが早く止まりすぎる」──65,537パラメータのLoRAで正答率15.5%→99%

Hugging FaceのDaily Papersで注目を集めている研究が、LLMの内部に残る思わぬ弱点を突いている。実験はシンプルだ。「K = apple; B = K; D = B; print(D)」のような参照チェーンを、思考連鎖(CoT)を書かせずに直接読み解かせると、0.6Bから32Bまでの13のベースモデルはわずか1.4〜3.6行しか正確に辿れない。しかもモデルを深くしても状況は変わらず、OLMo-3を7Bから32Bにしても到達範囲は約2.6行のままだったという。

驚くべきは介入の小ささだ。Qwen3-8Bのレイヤー14に、ランク8のLoRA(65,537パラメータ、ベースの重みはすべて凍結)を学習させると、24行チェーンの正答率が15.5%から99%に跳ね上がる。長めに訓練した版は1回のフォワードパスで50行まで辿れる。仕組みとしては、このLoRA自身はトークン間で情報を移さず、凍結された中間層で各行が次の行へ意味を渡す「リレー」を始動させる。チェーンの各行が親行へ注意を向ける層(14〜22)を切断すると正答率は偶然レベルまで落ち、より後ろの層(23〜29)で切ってもほとんど影響しない。注入位置もシビアで、同じレシピでもレイヤー20なら20.5行に到達するのに対し、レイヤー21では5.2行に急落する。マルチホップQA(MuSiQue)でも、早期レイヤーに付けたLoRAが3つの標準モデルで9.4〜17.9ポイントのEM向上を示したという。

「計算能力はあるのに、早く止まってしまっている」。パラメータを増やしても解けなかった問題が、場所を間違えない小さな介入で解ける――この結果は、モデルのスケーリングと訓練後の微調整の間にまだ手つかずの設計余地が残っていることを示唆している。

Unitree「UnifoLM-WLA-1.0」──6Bモデル1つで全身64タスクをこなすヒューマノイド

Unitree Roboticsが、汎用ヒューマノイド基盤モデル「UnifoLM-WLA-1.0」を公開した。注目はその構成の割り切りの良さで、パラメータは6B、学習データは実ロボットからの約2,500時間。単一のモデルで、全身動作10タスクとテーブルトップ作業54タスクの計64タスクをこなし、平行グリッパーと2種類の異なる器用手(デクスタラスハンド)の両方に対応する。空間推論の性能も、複数のオープンソースモデルを embodied ベンチマークで上回るとされる。

アーキテクチャも独特だ。Qwen3-VLベースの身体推論モデルUnifoLM-ER-1を出発点に、光フローとVQ-VAEによる将来の動的領域予測、エンドエフェクタ・手・下半身を個別に離散化するresidual VQ、その上に連続制御のためのMMDiTアクションエキスパートを重ねる。公開されている動画では、ヒューマノイドG1がベッドを整え、洗濯機に衣類を入れ、洗濯物を畳み、物を仕分けする様子が映されている。

ロボット業界では、操作や会話など部分的な能力のモデルから、全身を1つの基盤モデルで賄う「Whole-body VLA」への移行が焦点になりつつある。UnifoLM-WLA-1.0はその公開実装としては完成度が高い部類で、研究の脚がかりになる可能性がある。

iPhone 17 Pro MaxをMacの2台目のGPUに──Qwen 27Bの前処理が最大44%高速

ローカルLLMコミュニティでは、手元の余ったシリコンを推論に動員する実験が話題になった。24GBのM4 Pro MacBookでは、Qwen 3.8 27B(IQ4_XS量子化)の隣に8ビットのコンテキストを64kまでしか置けない。そこで投稿者は、ポケットにあったiPhone 17 Pro Maxを10Gb/s対応のUSB-Cケーブル1本でMacに接続。Macが各256トークンバッチのレイヤー1〜40を計算してアクティベーションをスマートフォンへ流し、iPhone側がレイヤー41〜64をA19 ProのGPU(Metal 4のテンソル演算に対応する行列ユニット)で処理する間に、Macは次のバッチに取りかかる。パイプライン化されたこの分担で、A19 Proの担当部分は行列ユニットを使わない場合の2.4倍高速になったという。

結果は明快で、エージェントセッションへの2,000トークンのファイル読み込み(prefill)は、16kコンテキストで109 tok/sから157 tok/s(+44%)、32kで101から130(+29%)、48kで87から113(+30%)と、いずれも3割前後改善した。27kトークンのセッションを冷たい状態から立ち上げる時間も、標準のllama.cppで245秒だったところが168秒に縮んだ。64kを超えるとiPhoneの役割が変わり、古いKVページをスマートフォン側へ退避させてMacが全64層を動かす。執筆時点ではNeural Engineもこの退避処理に参加し始めているという。

マルチGPUというとデータセンターの話になりがちだが、この実験は「ポケットのスマートフォン」を第2の計算資源として動員できることを示した。iOSデバイスのGPUとNeural Engineが実用的な推論資源として使えるなら、Macユーザーの選択肢はかなり広がりそうだ。

SWCが外部PRの受付を停止──AI生成コンテンツとの線引きはOSSにも及ぶ

Rust製の高速コンパイラ/トランスパイラであるSWCが、AI生成コンテンツの増加を理由に、外部からのプルリクエストの受付を停止したと自身のXアカウントで発表した。

このところ同じ構図のニュースが続いている。前回伝えたarXivの投稿レート制限も、生成コストがほぼゼロになった場所に「それらしい貢献」が押し寄せるという現象への対応だった。今回はその波がOSSの保守現場に届いた形だ。AI支援でコードを書くことが当たり前になるほど、レビューする側の人間のコストだけが相対的に増える。プロジェクトごとに「受け入れるもの」と「断るもの」の線引きを明示する時代に入ったといえる。メンテナの負担を守るための停止が、今後も各所で選択されるのか、審査の仕組みごと作り直す動きが出るのか。OSSの持続可能性を巡る新しい論点になりそうだ。

Percepta「Spotlight」──成長し続けるメモリと、変わらない知能を分離する

スタートアップのPerceptaが、attentionを置き換える新しいアーキテクチャ「Spotlight」を発表した。主張は大胆だ。すべてのトークンが境界のないメモリに読み書きするのに、モデルは個々のメモリセルをインデックスして学習するため、各トークンが触るのは常にごく一部のセルだけ。メモリが成長しても1トークンあたりのアクセス量は変わらず、使用率はどこまでも下げられるという。専門家を固定数だけ活性化するMoE(Mixture of Experts)と違い、疎性の度合い自体が自由になるのが特徴とされる。

設計思想は「分離」にある。計算を行う知能モジュールと、知識・手順・作業状態を保持するメモリを切り離し、メモリが成長しても重みは変わらない。何をロードし、いつ上書きするかはモデル自身がトークンごとに決める。メモリには事実だけでなくスキルも保持できるため、再訓練なしで新しい能力を獲得できるとされる。

LLM運用の現場では、知識を足すたびに再学習やファインチューニングが必要になるのが長年の課題だった。知能とメモリを分離し、後者だけを育てる道が実用レベルで通じるなら、モデルの更新と知識の更新を別の周期で回せるようになる。まだ発表されたばかりのアーキテクチャであり、他モデルとの系統的な比較はこれからだが、注目に値する方向性といえる。

道具を内側から書き換えるMods、6Bで全身を動かす基盤モデル、ポケットの余剰シリコン、量産される貢献との線引き、成長するメモリ。モデルの性能そのものより、モデルのまわりが固まっていく――そんな断面の一日だった。