MTP(Multi-Token Prediction)がllama.cppにマージ――ローカルLLMの高速化が現実に
llama.cppのPR #22673がマスターにマージされ、Multi-Token Prediction(MTP)が正式にサポートされた。MTPは推論時に複数トークンを同時に予測する手法で、既存の投機的デコードと組み合わせることで大幅なスループット向上が見込める。
コミュニティではマージの知らせが一気に拡散され、Redditのr/LocalLLaMAには「LFG!!!」という歓声とともに複数のスレッドが立てられた。ローカルLLMの実用性を左右する重要なマイルストーンと言える。
次回のllama.cppリリースでMTP対応モデルの性能がどう変わるか、実際のベンチマーク待ちの段階だが、コミュニティの期待は非常に高い。
YouTubeがディープフェイク顔検出ツールを全クリエイターに開放
YouTubeは、AI生成による顔の偽装(フェイスワップ)を検出する「Likeness Detection」ツールを、18歳以上の全クリエイターに向けて公開した。これまではパートナープログラム参加者限定だったが、今回の拡大で小規模チャンネルのクリエイターも保護の対象となる。
仕組みはシンプルだ。自分の顔が他者の動画で無断使用されている場合、YouTube Studio上で検出結果を確認し、直接削除リクエストを送れる。ディープフェイク被害の増加に対するプラットフォーム側の具体的な対応として評価できる一方、検出精度や誤検知の懸念は今後の課題だ。
Sebastian RaschkaがLLMアーキテクチャ最新動向を総括
機械学習の著名な教育者・研究者であるSebastian Raschkaが、最新のオープンウェイトLLMにおけるアーキテクチャ革新をまとめた記事を公開した。Gemma 4からDeepSeek V4まで、新しいモデル群が長文脈コンテキストのコスト削減にどう取り組んでいるかを解説している。
主なトピックは3つ。KV Sharing(キー・バリューの共有によるメモリ削減)、mHC(modified Hamming Distance Cacheによる効率的な注意機構)、そしてCompressed Attention(注意行列の圧縮による計算量削減)。いずれも、長文脈を扱う際のメモリと計算のボトルネックを緩和するアプローチだ。
オープンソースLLMの性能がフロンティアモデルに追いつく中、アーキテクチャレベルの工夫が競争の鍵になりつつある。
ERC-8004:AIエージェント同士が「信頼」を築くプロトコル
AIエージェント間の通信規格であるA2A(Google)やMCP(Anthropic)は普及が進んでいるが、「目の前のエージェントが誰で、信頼できるか」を判断する仕組みは不在だった。この空白を埋める提案がERC-8004(Trust Protocol for Autonomous Agents)だ。
記事では、A2AとMCPが「どう喋るか」を規定するのに対し、ERC-8004は「誰と喋るか」の判断基準を提供すると説明している。エージェントが初対面の相手に仕事を任せてよいかを判断するための、公開鍵暗号に似た信頼の仕組みを設計している。
AIエージェントが自律的に協調する未来に向けて、プロトコルレイヤーの整備が始まった。
オープンソースでCodeRabbitの6倍安い代替品を構築
コードレビューAIツールCodeRabbitの代替を、オープンソースモデルを使って構築したプロジェクトがRedditで注目を集めている。開発者によると、同等のレビュー品質を維持しながら約6分の1のコストで運用できるという。
ローカルLLMの性能向上とMCP等のツール連携エコシステムの成熟により、SaaS型AIツールを自前で置き換える動きが増えている。セキュリティ面でコードを外部サーバーに送らない利点も大きい。
「認知的降伏」と「認知的負債」――AIに思考を奪われる問題
AIの便利さに頼りすぎることで、人間自身の思考力が低下するという問題が「認知的降伏(Cognitive Surrender)」や「認知的負債」という概念で議論されている。
コードを書くのも、文章を構成するのも、エラーの解決も、すぐにAIに投げてしまう。便利さは増したが、「このままでは自分の脳みそがヤバいのでは」という危機感を抱く開発者が増えている。海外の研究結果もこれを裏付ける方向で報告されている。
AIツールを「使う」ことと「依存する」ことの境界線をどこに引くか。2026年のAI活用における重要な問いになりつつある。
Sources:
- YouTube opens its deepfake face-swap detection tool to all adult creators (The Decoder)
- Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention (Ahead of AI)
- MTP PR Merged!!! (Reddit LocalLLaMA)
- MTP support merged into llama.cpp (Reddit LocalLLaMA)
- Built a 6x cheaper CodeRabbit alternative using open source models (Reddit LocalLLaMA)
- ERC-8004:AI エージェントが互いを信頼する仕組みの設計思想 (Zenn AI)
- 【警告】AIを使うと脳が溶ける?「認知的降伏」と「認知的負債」から身を守るAI活用術 (Zenn AI)