2026年9月23日、音声AIをめぐる大手の動きが一気に加速しました。OpenAIはChatGPTの音声操作をメール・予定・Slackといった実務ツールへ広げ、Googleは文章で声をデザインできる新しいTTSモデルを公開。さらにAnthropicは、ClaudeがCRISPRを想起させる新規酵素システムの発見につながる研究体制を発表しました。音声がインターフェースになる動きと、AIが科学の現場で仮説を生む動きが同じ日に重なった一日です。

ChatGPTの音声がメール・予定・Slackへ──話すだけで用事が済む

OpenAIはChatGPTのモバイルアプリに、音声ベースのエージェント機能を追加しました。ChatGPT Voiceが新しいGPT-6 Astra、Sol、Lunaモデルで動作するようになり、メール、カレンダー、Slackなどのプラグインにアクセスできるようになります。予定の管理やメールの送信、さらにはウェブサイトの構築まで、話しかけるだけで進められるとしています。ProプランとPlusプランのユーザーは、スマートフォンのWorkタブからこのエージェントタスクを実行できます。

The Decoderは、この更新によってOpenAIがサム・アルトマンCEOが映画「Her」になぞらえて語ってきた「日常に溶け込むAIアシスタント」に一歩近づいたと評しています。音声対話とエージェント機能の統合は各社が狙う方向性ですが、実務ツールへの接続まで含めた実装としては、現時点で最も具体的なもののひとつと言えそうです。そのぶんAIに渡す権限は大きくなるため、利便性と安全性のバランスが今後の焦点になりそうです。

Gemini 3.8 Flash TTS──文章から新しい声を作り、30秒でクローンする

Googleは2つの新しいテキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。対応言語は100言語以上。最大の特徴は、Flash TTSがテキストの記述から新しい声を作り出せる点です。「こういう雰囲気の声」という文章での指定から、存在しない声をデザインできます。

細かい制御も充実しています。セリフ単位でトーンや演技の指示(ステージディレクション)を付けられるほか、1つのスクリプトから2つの声による対話を生成できます。また30秒の音声サンプルからボイスプロファイルを構築する音声クローン機能も備えます。性能面では、Hume AIのVoice Design Benchmarkで総合1位(71.4)、アクセントのモデリングでも首位、総合品質指標では2モデルが1位と2位を獲得したとされています。日本語を含む主要言語のブラインド比較(Voice Arena)でも上位に位置づけられており、前世代のGemini 3.1 Flash TTS比で長尺コンテンツや2話者の脚本制御が改善されたとしています。

前日はAlibabaが音声AIの価格を大幅に下げると発表したばかり。音声生成は価格・品質・カスタマイズ性の全方面で競争が激化しており、コンテンツ制作や多言語展開のハードルはさらに下がりそうです。

ClaudeがDNAから見つけた「変なもの」──CRISPR様の新酵素システム

Anthropicは同社内に新設するライフサイエンス研究グループと研究所を紹介し、その初期成果として、Claudeが新規酵素システムを発見したと報告しました。研究の進め方は、DNAのデータセットから未解明のタンパク質ファミリーを特定し、大規模に仮説を生成した上で、実験室での実験で検証するというもの。今回の発見は、科学者から大まかな方向付けを受けた以外はClaude主導で進んだとされています。

発見された酵素システムは、ゲノム編集技術の基盤となったCRISPRを想起させる性質を持つといいます。同社の解説では、生物学と医学を変えてきた発見──たとえば細菌の免疫系で見つかり遺伝子組み換えを可能にした制限酵素や、PCRを支えたTaqポリメラーゼ──は、自然界が持つ分子機械の多様性の中の「何か変なもの」に科学者が気づくことから始まってきたと振り返られています。AIがその「気づき」を大規模に代行できる可能性を示す成果です。

当メディアでも9月18日にAnthropicの生物学ラボ設置を伝えましたが、今回の発表はその研究体制から最初の具体的な成果が出た形です。AIによる仮説生成が実験で裏付けられた数少ない実例として、創薬やバイオテクノロジーへの波及が注目されます。

DeepMindの「鍵のかかった金庫」──クラウドメモリでプライバシーと連続性を両立

Google DeepMindは「Private AI Compute」アーキテクチャの技術的な更新を発表しました。デバイスをまたいでAIが利用者を覚え続ける永続的なメモリを、オンデバイス処理と同等のプライバシー基準で実現するというものです。

具体的には、新しい永続メモリ層がクラウド上の「安全なデジタル金庫」のように機能します。支援に必要な情報は専用の暗号化ストレージに封印され、復号に必要な鍵は利用者の管理下に置かれる設計とされています。AIアシスタントがデバイスをまたいで文脈を覚えるにはクラウド側の記憶が必要ですが、そのままではプライバシーが犠牲になる──この長年のジレンマへの解答を、同社は暗号技術の側から示した形です。

記憶を持つアシスタントが普及するには、「覚えている」ことと「見られない」ことの両立が前提条件になります。実装の詳細や展開時期は今後の情報待ちですが、プライバシー設計がAIアシスタント競争の差別化軸になりつつあることを示す動きです。

なぜClaudeの文章は変わったのか──Anthropicエンジニアの説明

The Decoderが報じる内容から。Anthropicの社員Jackson Kernion氏が、新しいClaudeモデルの文章がどこか奇妙になった理由を説明しています。それによると、数学・コード・そして他のAIモデル向けの技術的な説明に対する最適化が、人間の目には「過密な情報ダンプ」に感じられる文体を生んだといいます。モデルが賢くなることと、人間にとって読みやすい文章であることは、必ずしも一致しないというわけです。

Opus 5.5はこの問題の修正を試みているものの、純粋な文章力ではOpus 4.6が依然として最有力だと同氏は述べています。最近のモデルで「なんだか読みにくい」と感じてきた利用者にとっては、その体感を裏付ける説明といえそうです。性能ベンチマークでは測れない「書き味」が、モデル選択の実務的な基準になり続けることを示しています。


音声という最も自然なインターフェースの実用化と、AIが科学の仮説を生む実証。方向は違えど、どちらも「AIとの距離が縮まる」できごとでした。