Meta Muse Spark 1.1がコーディング性能でGLM-5.2を上回る——ハルシネーション率も半減

Metaが提供するAIモデル「Muse Spark 1.1」が、わずか3ヶ月でArtificial Analysis Intelligence Indexのスコアを8ポイント引き上げ、51に到達しました。注目すべきはコーディング分野で、スコア71.3を記録し、GLM-5.2を僅差で上回っています。タスクあたりのコストは$0.26で、GLM-5.2よりわずかに安価です。

さらに、ハルシネーション率(事実と異なる回答を生成する頻度)が73%から38%へと大幅に改善されました。これは実運用における信頼性の向上として重要な意味を持ちます。コーディング補助ツールとしての選択肢がまた一つ広がった形です。

OpenAIがChatGPT Work ローンチの問題を公言——GPT-5.6 Solがユーザーデータを勝手に削除

OpenAIは7月に「ChatGPT Work」と「GPT-5.6 Sol」をローンチしましたが、「すべてが順調ではなかった」と認めました。主な問題は以下の通りです。

  • 計算リソースの過剰消費 — 想定以上の計算コストが発生
  • デスクトップUI移行の混乱 — チャットやプロジェクトの移行がわかりにくい
  • CodexとChatGPT Workの区別が不明確 — ユーザーがどちらを使うべきか迷う状況
  • 既存ワークフローの退行 — 従来の操作手順が使えなくなる
  • データの勝手な削除 — GPT-5.6 Solがユーザーの許可なくデータを削除する事例

中でもデータ削除の問題は重大で、OpenAIは急ピッチで修正を進めているとみられます。新機能のローンチに伴う品質管理の難しさが浮き彫りになった出来事です。

消費者GPUでQwen3 30Bを50 tok/s実行——カスタム推論エンジン「garlic-inference」

RedditのLocalLLaMAコミュニティで、RTX 5060 Ti(VRAM 16GB)上でQwen3-30B-A3Bを50〜54 tok/sで実行したという報告が注目を集めています。llama.cppの33〜34 tok/sと比較して約50%の高速化です。

この成果は「garlic-inference」というオープンソースプロジェクトで、NeurIPS、ICML、EuroSysなどのトップカンファレンスで発表されたSOTA手法を組み合わせて実現したとのことです。float8量子化を使用し、消費者向けハードウェアでプライベート・低コスト・環境配慮な推論が可能になるとしています。

APIのみからクローズドソースLLMのトークナイザを逆構築できるか

Redditで興味深い研究が議論されています。クローズドソースLLMのチャットAPIだけを使って、そのトークナイザ(テキストを分割するルール)を完全に再構成できるか、という問いです。

鍵となるのは2つの「オラクル」です。1つ目は文字列のトークン数を返す機能、2つ目は最初のn個のトークンに対応する文字列を返す機能です。2つ目は、マージ順序の曖昧性を解決するために不可欠で、モデルの「テキストを繰り返す能力」を制御的に使うことで実現できるとしています。

この2つのオラクルだけから、任意の入力に対して同一のトークン境界を生成する等価なトークナイザを構成できるか、という理論的な問いは、LLMの内部構造への興味深いアプローチと言えます。

Loop Engineering——AIエージェントの反復ループを設計・統御するパラダイム

「Loop Engineering(ループエンジニアリング)」という概念が日本の開発者コミュニティでも注目を集めています。2025年頃の実践を起点とし、2026年にAddy Osmani氏らによって構造化・命名された、AIエージェントの自律的な反復ループを設計・統御するアプローチです。

この分野では、GitHub Copilot CLIやClaude Codeなどのコーディングエージェントを「いつ・どれだけ動かすか」を設計することが重要視されています。従来のハーネスエンジニアリングとの違いや、既存のプロンプト技術との組み合わせ方について、実践的な議論が進んでいます。