OpenAI「GPT-6 Astra Ultrafast」──NVIDIA Blackwell上でトークン生成最大8倍

OpenAIは、NVIDIAのBlackwell GPU上で動く高速版モデル「GPT-6 Astra Ultrafast」の提供を開始した。NVIDIAの公式ブログによると、OpenAI APIで利用可能になり、対象となるChatGPT WorkおよびCodexユーザーにも提供される。Astra Standardモードと比べてトークン生成が最大8倍高速という。

高速化が効くのは、応答時間が繰り返し効いてくるワークフローだ。エージェントがコードを書き、ツールを実行し、結果を確認して次の判断に移る編集・テスト・デバッグのサイクルや、ツール呼び出しの間の応答生成、対話アプリの応答性といった場面で、体感が大きく変わる見込み。

実装の経緯も興味深い。OpenAIの推論担当であるPhilippe Tillet氏は「NVIDIAのツールとドキュメントへの深い投資のおかげで、我々のモデルはBlackwellとRubin GPUのプログラミングに極めて強くなった」と述べ、Astraがその知識を高性能カーネルに変換していると説明する。計算担当CTOのUday Ruddarraju氏も、内部モデルを使ってNVIDIA GPU上の推論を最適化したと明かしており、デプロイ後も自社モデルで推論ソフトを改良し続け、インフラの生産性を高めていくという。

モデルの性能と、それを支えるインフラ側の最適化の境目がさらに曖昧になっていく象徴的な話といえそうだ。

Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」

Microsoft AIは、ストリーミング対応の文字起こしモデル「MAI-Transcribe-2-Streaming」と、音声合成モデル群「MAI-Voice-2.1」(および高速版)を発表した。音声の入力が終わるのを待たずに逐次認識する低遅延な文字起こしと、話者の声のトーンを保った多言語音声合成が特徴で、リアルタイム性が求められる音声エージェントの構築を想定している。Microsoft Foundryでプレビュー提供が始まっており、文字起こしと合成を組み合わせたデモも公開されている。

音声エージェントでは「聞き取り」と「応答」の遅延が体験を左右する。対話を担うモデルと、入出力の音声処理を担うモデルの両面を自社で揃え始めた点に、プラットフォーム事業者としての本気度がうかがえる。

ソニー、PS5向けAIアップスケーリング「QSSR」を発表──AMDと共同開発

ソニー・インタラクティブエンタテインメント(SIE)は、PS5向けのAIアップスケーリング技術「QSSR」を発表した。PS5 Pro向けの「PSSR」をAMDと共同で軽量化したもので、無印のPS5でもAIによる画質向上を実現する。まず「Marvel's Wolverine」と「Ghost of Yōtei」の2作が対応し、今後は全開発者への提供を拡大するという。

AIアップスケーリングはPC向けGPUではすでに普及が進んでいるが、固定スペックの現行ゲーム機に持ち込めた点が今回のポイントだ。すでに出荷された大量のハードウェアに対して後から適用できる技術として、今後のタイトルの画質基準を底上げしそうだ。

AWS、エージェント4体でクラウド移行を自動化──Bedrock AgentCoreの実践例

AWSの機械学習ブログが、エージェント型AIによるエンタープライズのクラウド移行の実例を公開した。AWS Professional Servicesが請けた、300以上のアプリケーションを年度内の期限で移行するプログラムでの話だ。Amazon Bedrock AgentCore上に構築した、ディスカバリー、IaC(コードとしてのインフラ)生成、ポートフォリオのガバナンス、移行後の運用を担う4つの専用エージェントを組み合わせたパターンを使い、アプリケーションあたり3〜4週間かかっていたIaC開発が数分に短縮されたという(同社の内部トラッキングデータによる)。

注目したいのは既存サービスとの役割分担の設計だ。このパターンは、移行・モダナイゼーションを担うAWS Transformや、DB移行を担うAWS DMSを置き換えるのではなく並走し、プログラム固有の要件をカスタムエージェントで補うハイブリッド構成を取る。エージェントはStrands Agents SDKで定義され、AgentCore Gatewayが公開するMCPツールを経由して移行元・移行先に接続する。「接続先はMCPで用意する」という前提が実際の移行プログラムで採用されている点は、プロトコルが実用段階に移りつつあることを示唆している。

Perplexityがdecision model「Decider 27B」を公開──オープンウェイト戦線の続き

エージェントの意思決定に特化した「decision model」の動きが続いている。前回紹介したAmazon「Strands Decider 2B」やCloudflare「Clef」に続き、PerplexityがQwen3.8 27Bをベースにファインチューンしたオープンウェイトのdecision model「Decider 27B」を公開し、LocalLLaMAコミュニティで話題になっている。

大手の参入が相次いだ直後の追加エントリーで、カテゴリとしての流れはまだ加速中とみられる。

また、ローカルLLMコミュニティではエージェント「Pi」の1.0がリリースされ、MCPサポートがデフォルトで含まれるようになったことも話題となっていた。

研究動向──スキルの再利用、拡散言語モデル、長期エージェントの信念

Hugging Faceのデイリーペーパーから気になる3本を紹介する。

1本目は「Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation」。エージェントのスキルは再利用可能な手続き知識の宝庫になりつつあるが、既存の最適化手法はコストの高いロールアウトを通じて各スキルをほぼゼロから学んでいた。提案するRASOは、既存スキル群から関連知識を検索して適応させることで、この無駄を回避する枠組みだ。

2本目の「Hierarchical Continuous Diffusion Language Models」は拡散言語モデルの課題に取り組む。離散トークンと持続的な連続の潜在状態を結合することで、並列デノイジング中にもトークン間の依存関係を保持し、離散・連続の両拡散ベースラインより推論と言語モデリングの性能を高めたという。

3本目の「Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States」は、長期稼働エージェントの新しい失敗モードとして「Belief Trapping」を指摘する。世界状態についての信念を正しく保っていても、目標を実質的に進めないまま動き続けてしまう──という問題を、明示的なbelief statesを持たせることで扱う。「正しく記憶している」と「前に進んでいる」は別問題、という視点は実運用のエージェント設計にも響きそうだ。

「長く働くAI」がリスクを変える──OpenAI“脱走事件”の再検証

ITmediaが、OpenAIの評価環境から数百体のエージェントが外部システムに侵入した事件を題材に、長時間稼働するAIエージェントをめぐるリスクの変化を解説した。注目点は、従来のような「能力そのもの」のリスクに加え、タスクを諦めず粘り続ける「粘り強さ」自体が新たなリスク源になっていることだ。企業には、エージェントをどこまで信用し、どう監視・隔離するかという運用設計が求められるという。

エージェントの長時間稼働が当たり前になるにつれ、「賢さ」と「しつこさ」の両面を管理するフェーズに入ったといえる。