コーディングエージェント周りの動きが慌ただしい。Earendilの「Pi」がバージョン1.0と、耐障害設計の「Pi Durable」を相次ぎ公開してHacker Newsのフロントページを賑わせた。画像生成ではBlack Forest Labsの「FLUX 3 Image」が4K生成に対応。国内からはELYZAの国産モデル無償公開、OpenAIからはChatGPT有料ユーザーの利用制限リセット予告と、駆け足の1日の話題を整理する。
Earendil「Pi 1.0」と「Pi Durable」──エージェントの「止まらない設計」へ
OpenClawと並んで語られることも多いコーディングエージェント「Pi」を擁するEarendilが、「Pi 1.0」と「Pi Durable」の2本を公開し、両方ともHacker Newsのフロントページに登場した。前回のまとめではMCP対応に軽く触れるだけだったが、今回はこの2本を掘り下げたい。
Pi 1.0の目玉は、MCPとJev、画像モデルをネイティブに扱う「Codemode」の導入だ。さらに仮想モデルの拡張対応、ツールの遅延ロード、Anthropic系モデル向けのキャッシュウォーミング、会話途中でのシステムメッセージ挿入(トランスクリプトを考慮したプロンプトとツールの変更)など、実運用での摩擦を減らす変更が並ぶ。
より興味深いのはPi Durableの方だ。PiをTypeScriptに移植し、状態を持つコンポーネントをすべて外部化した。すべてのステップがチェックポイント付きタスクとして記録されるため、プロセスが落ちても再起動後にエージェントとサブエージェントが最後の正確な状態から自動再開する。実行環境はNode・Bun・CloudflareなどJavaScriptランタイムがあればどこでもよく、ストレージもMemory・SQLite・JSONLから選べる。会話を並列に分岐させても互いをブロックしない並行性、ツールや拡張のコードをエージェント実行中にホットスワップできる拡張性、トークン上限に合わせて古いメッセージをバックグラウンドで要約・圧縮する文脈管理など、「長時間動かし続ける」ことを前提にした設計が一貫している。
エージェントの出来を左右するのはモデルだけでなく、実行を支えるハーネス側の設計だ、という考え方の体現だ。この視点は後述する研究動向ともつながってくる。
Black Forest Labs「FLUX 3 Image」──4K生成・参照10枚・マルチターン編集
Black Forest Labsが画像生成モデル「FLUX 3 Image」を発表した。ネイティブ生成の解像度が最大4Kに対応し、参照画像を最大10枚まで与えられる。バウンディングボックスによるレイアウト指定、触っていない画素はそのまま保つとするマルチターン編集など、生成と編集を1つのモデルでこなす方向性が明確だ(画素の完全保持はベンダー側の能力主張であり、独立した検証ではない点には留意したい)。
商用向けウェイトはすでに利用可能で、オープンウェイト版も「今後数週間のうちに」と予告されている。falやKreaでのホスト提供も始まった。加えて10月8日まで、API利用が一時的に50%オフになる(基本価格は今回の投稿では示されていない)。
ローカル環境で画像生成基盤を運用している立場からは、オープンウェイト版の登場時期が気になるところだ。
KDDI傘下のELYZA、LLM-jp-4ベース「ELYZA-Thinking-1.0」を無料公開
KDDIグループのAI開発企業ELYZAは、「ELYZA-Thinking-1.0-llm-jp-4-33b」および「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」を発表し、無料で公開した。国立情報学研究所(NII)が開発したオープンなAIモデル「LLM-jp-4」シリーズをベースに事後学習を実施し、性能を強化したという。「完全国産」を掲げる点が特徴だ。
フロンティアモデルと比べると絶対性能の差はあるとみられるが、ベースが公開済みのLLM-jp-4であることから、ライセンス条件の範囲で自社環境への組み込みや検証を進めやすい。データ主権や国内インフラでの運用を重視する企業での採用が進む可能性がある。
OpenAI、ChatGPT有料ユーザーの利用制限をリセット──日本時間10月3日午前3時から
OpenAIのプロダクト責任者ティボー・ソティオ氏は、ChatGPTの全有料ユーザーを対象に、利用制限枠をリセットすると発表した。日本時間10月3日午前3時の実施を予定している。リセットの理由は記事中で詳述されていないが、直近で制限に達して困っていたユーザーには嬉しいニュースだ。
同じOpenAIでは、先日DevDayで発表された「GPT-6.1 Sol」の独立系実測も出始めている。Sam Altman氏は同モデルを「同社で最も速く成長しているモデル」と述べ、ローンチ直後の負荷問題の後に提供性能が改善したと説明した。計測サイトArtificial Analysisによると、最大努力時のIntelligence Indexタスクあたりコストは0.72ドルで、GPT-6 Solの1.04ドル、Astraの3.26ドルを大きく下回る。改善の要因は生成トークン数そのものより、タスク完了までのターン数減とキャッシュ読み取りの低価格化とされる。発表時の「5分の1コスト」の主張が、独立系計測でも裏付けられつつある形だ。
また画像エンコーディングの不具合修正により、Lunaは同指数で1ポイント上昇(視覚ドキュメント・ナレッジワーク系の評価で改善)、Solはほぼ変化がなかったという。
Gemini 4 Argon続報──コーディング性能をめぐる報道対立
前回紹介したGoogleの新モデル「Gemini 4 Argon」をめぐっては、コーディング性能に関する報道の対立が生じている。Bloomberg誌が匿名の内部関係者の話としてコーディング面の弱点を報じたのに対し、その後DeepMindの上級エンジニアがこの見方を否定する投稿を行ったと伝えられた。ベンチマークの数字も社員の反応も決定的な証拠ではないため、実用上のコーディング品質をめぐる争点は現時点では未解決とみるのが妥当だろう。
一方、Google側は新しいGeminiのリビジョンが、リリース前に社内の数千人のソフトウェアエンジニアによる数週間のテストを経るようになったと説明している(Logan Kilpatrick氏)。事前学習データの配合見直しや長期タスク向けの事後学習データ、メモリ最適化・コード移行・数学への社内活用といった開発者側の説明も紹介された。自社評価ではAstraやFable 5.1、Opus 5.5を多くの項目で上回るとされ、当面はサイバー防御組織などへの限定提供、一般提供は「できるだけ早く」とのことで、年内の一般提供に向けた調整が進められているとみられる。
Upstage「Solar Mini 4」──100万トークン文脈の低価格MoE、ただし弱点も
韓国Upstageの独自モデル「Solar Mini 4」は、テキスト特化の推論モデルで、総パラメータ35B・アクティブ3BのMoE構成、100万トークンのコンテキストウィンドウと262Kの出力上限をうたう(ウェイトは非公開のため、パラメータ構成はベンダー申告値にとどまる)。料金も100万トークンあたり入力0.10ドル・出力0.40ドル・キャッシュヒット0.01ドルと手頃だ。
一方でArtificial Analysisの計測では、総合スコア24、長文脈推論83%に対し、Terminal-Bench 4.0はわずか1%という明確な弱点がある。出力速度は208トークン/秒と速いものの、タスクあたり約88Kトークンを出力する傾向があり、平均完了まで7.1分、タスクコストはLunaの約5倍になるという。「安くて長い文脈」という強みと引き換えに、エージェント用途の実効コストは見かけほどではなかった、という料金表からは読めない教訓として参考になる。
研究動向──ハーネス探索の自動化と、モデル側へ移る「文脈間推論」
Hugging FaceのデイリーペーパーとarXivから、ハーネス設計に関連する2本を紹介する。
1本目は「MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution」。エージェントの長期タスク性能を左右するハーネス設計は組合せ的に膨大な探索空間を持ち、モデルが変わるたびに人の手でやり直す必要があった。プロンプトやスキルの一部だけを最適化する既存手法を超え、複数エージェントの進化によってハーネス全体を自動探索する枠組みだという。
2本目の「Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling」は、推論時の計算拡大(テスト時スケーリング)を複数のコンテキストウィンドウにまたがって効かせるために、「新しいコンテキストをどう割り当て、何を引き継ぐか」という判断(著者らの呼ぶコンテキスト間推論)を、ハーネス側の規則ではなくモデル自身に学習させるアプローチを提案する。
Pi Durableがハーネス側で突き詰めた「状態の外部化」に対し、研究側は「その判断自体をモデルへ移す」方向を探る。何をハーネスが担い、何をモデルが担うかという線引きが、いま流動期にあることがうかがえる。
