Google DeepMind、オープンモデル「Gemma 4」をリリース
Google DeepMindは、オープンモデルの最新版「Gemma 4」をリリースした。同社は「byte for byteで最も高性能なオープンモデル」と謳っている。エッジ向けのE2BおよびE4Bモデルはマルチモーダル機能と低遅延処理を優先しており、デバイス上での実用性を高めた設計となっている。
オープンモデルの競争が激化する中、Gemma 4はMetaのLlamaシリーズやMistralと直接競合する位置づけだ。
MicrosoftとOpenAI、提携の次フェーズへ
Microsoftは「The next phase of the Microsoft-OpenAI partnership」と題する記事を公開し、両社のパートナーシップが新たな段階に入ったことを発表した。AIの進歩をMicrosoftの「地球上のすべての人と組織を支援する」というミッションに基づいていると強調している。
前日のOpenAI-Microsoft間のAWS販売合意と合わせ、両社の関係が排他的から柔軟な形へと再構築されている流れが明確になった。
Gemini 3.1 Flash TTSとGemini Robotics-ER 1.6
Google DeepMindは、次世代テキスト音声合成モデル「Gemini 3.1 Flash TTS」も発表した。表現力の制御性と効率性が向上しており、リアルタイム応用への適用が見込まれる。
また、実世界のロボティクスタスク向け「Gemini Robotics-ER 1.6」もリリース。ロボットが単に指示に従うだけでなく、環境を理解し自律的に対応する能力の強化が図られている。
NVIDIA、マルチモーダル統合モデル「Nemotron 3 Nano Omni」を公開
NVIDIAは、ビジョン・音声・言語を単一モデルで統合する「Nemotron 3 Nano Omni」をリリースした。従来AIエージェントシステムでは視覚・音声・言語それぞれに別モデルを使い、変換時にコンテキストを失う課題があったが、このモデルで一括処理が可能になる。
すでにAmazon SageMaker JumpStartでも利用可能になっており、エッジデバイスへの展開も想定されている。
Anthropic、Claude Codeの品質に関するアップデートを報告
Anthropic Engineering Blogで、Claudeのレスポンス品質が一部ユーザーで低下しているという報告に対する調査結果が公開された。インフラストラクチャのノイズがエージェント型コーディング評価に与える影響の定量化や、品質改善に向けた取り組みが詳細に説明されている。
同時に、Claude Codeの自動モードにおける権限スキップの安全性改善や、マルチエージェントによるCコンパイラ構築の実験など、技術的な取り組みも多数紹介された。
AWS、テキストエージェントから音声アシスタントへの移行ガイドを公開
AWS Machine Learning Blogで、Amazon Nova 2 Sonicを使ったテキストエージェントから音声アシスタントへの移行手法が紹介された。従来のテキストベースの対話システムを、自然な会話ができる音声アシスタントにアップグレードする具体的なアプローチが解説されている。