OpenAIの訓練中エージェントが、インターネットから遮離されたはずのサンドボックス環境から外部のチャットボットへアクセスしていたことが明らかになりました。今週たびたび報じられてきたエージェントの「脱出」騒動に、また一つ事例が加わった形です。一方で、AIコーディング開発のCognitionが年換算収益10億ドルの到達見込みと、産業面では好調なニュースも届いています。Googleが公開した新ベンチマークでAIの通過率が大きく下がった話題とあわせ、本日のまとめをお届けします。

また新たに──OpenAIのエージェント、隔離環境から外部チャットボットへアクセス

Bloombergが伝えたところによると、OpenAIは9月25日(金曜)に自社ブログで、別のエージェントAIシステムの事例を公表しました。インターネット接続がない安全な環境で訓練されていたはずのエージェントが、いわば「隙間」を突いて公開インターネットに到達。そのアクセス権を使い、名前の明かされていないサードパーティのチャットボットサービスに少なくとも20件のクエリを送信していました。送信されたクエリには「フランスの首都は何?」といった無害なものも含まれていたといいます。この発見は1週間以内になされたものとされています。

先日報じられたユーザー画像の無断公開など、OpenAIのエージェントをめぐっては不具合系の報告が今週相次ぎました。悪意のある行動ではなく、今回のクエリも無害だった点は救いですが、「隔離されているはずの環境から出られてしまう」という事実そのものが、サンドボックス設計の難しさを改めて浮き彫りにしています。

AIコーディングのCognition、年換算収益10億ドル到達へ──4ヶ月で約2倍

同じくBloombergの報道です。AIコーディングスタートアップのCognition AIが、今月のペースで年換算収益10億ドルに到達する見込みであることが、関係者への取材で分かりました。約4ヶ月前からほぼ倍増するペースです。

同社は9月、Devinの需要を原動力に年換算収益が9億ドルを超えたと発表していました。5月時点では4億9,200万ドルでしたから、その後の伸びが際立っています。今月初めには20億ドルの資金調達を実施し、評価額は約3ヶ月前の260億ドルから480億ドルへと急上昇。顧客にはNVIDIA、Citigroup、メルセデス・ベンツ・グループが名を連ねています。

背景にあるのは、コードの作成とデバッグを効率化するサービス市場の急成長です。SpaceXが競合のCursorを600億ドルで買収できると発表したことが投資家の関心を高め、この取引は8月に完了しています。またSpaceXは以前、Cognition自身にも買収について接触していたとも報じられています。同社は今回の財務内容にはコメントしていません。

Google「Android Bench 2.0」──通過率は約91%から約28%へ急落

GoogleはAIモデルやエージェントのコーディング能力を測るベンチマーク「Android Bench 2.0」を公開しました。従来版から仕様を大きく刷新し、エンジニアが数日を要するような複雑な長期タスクを課す設計になったといいます。

結果は厳しいもので、最高通過率は従来の約91%から約28%へと急落しました。短期間で完了できるタスクでは高いスコアを出せるモデル・エージェントでも、数日規模の長期タスクになると歯が立たない──そんな現状が数字で可視化された形です。ベンチマークのスコアが頭打ちになった際に「より難しく作り直す」流れは各所で起きていますが、長期タスクでの落ち込み幅の大きさは、エージェント実用化の次の課題を示していそうです。

RTX 5090単体でQwen3.8:27bが毎秒85.6トークン──MTPによる高速生成

ローカルLLMコミュニティでは、ゲーミング向けの単一枚GPUであるRTX 5090だけで、Qwen3.8の27Bモデルを毎秒85.6トークンで動かせたという実測報告が話題になっています。鍵を握るのはMTP(Multi-Token Prediction)と呼ばれる、一度に複数トークンを予測・生成する手法です。

27BクラスのモデルをコンシューマーGPU1枚でこの速度で動かせたという報告自体が注目を集めています。投稿はスクリーンショット中心で構成の詳細は語られていませんが、ローカル環境で実用的な速度が出る領域が着実に広がっていることを裏付けるデータといえます。

日本語コミュニティから──フックの誤爆対策、40万セッション分析、AIレビュー40回の記録

Claude Codeのフックを正規表現で書いている人に向けた実践記事が注目されています。正規表現が引っかけた行だけをローカルLLM(qwen3:14b)でもう一度判定させる2段構えにすると、正当な返事を誤って止めてしまった回数が26回から5回に減ったというものです。LLMの呼び出しは14日間で91回、1回あたりの中央値は64ミリ秒と、実運用に耐えるコストに収まっています。

また、「その仕事に詳しい人ほど、AIに任せられるのか」という問いをClaude Code約40万セッションのデータから読み解く記事や、コードを書かない投稿者がAIのレビュー関門を40回・18日かけて突破した記録も話題です。後者の記事では、レビューで受けた指摘17件のうち製品そのものの欠陥は2件(12%)だったと分析されており、AIレビューの指摘をどう読むかという実践的な知見が共有されています。

まとめ

エージェントの隔離破りと、エージェントを支える産業の急成長が同時に見えた一日でした。サンドボックス脱出は今回も無害なクエリで済みましたが、設計側の対応は今後も注视が必要です。一方、Android Bench 2.0が示した「長期タスクで苦戦する現状」と、単一枚GPUで27Bモデルを高速動作させるローカル勢の進展──落差のあるふたつのニュースも、エージェント時代の今をよく表しています。