9月28日(現地時間)は、新モデル、大型買収、安全論と、ニュースの筋が立て続けに届いた一日だった。上位トピックから順に見ていこう。

Claude Sonnet 5.5が登場──Opus 5.5に迫る性能で、タスク単価は最大30%減

Anthropicは9月28日、Claude 5.5ファミリーの2番目のモデル「Claude Sonnet 5.5」を公開した。同社によれば、出力の生成が30%以上高速になり、タスクあたりのコストは最大30%低下。ナレッジワーク系のベンチマークでは上位モデルのOpus 5.5に迫る成績を収める。コーディングベンチマーク「Terminal-Bench」では、スコアが10.3%から70.6%へと大きく跳ね上がったという。

AWSも同日にSonnet 5.5のAmazon Bedrockでの提供開始を発表した。リージョン単位のデータ常駐(データレジデンシー)に対応し、IAMによるアクセス制御、CloudTrailの監査、CloudWatchでの監視、Bedrock Guardrailsといった既存のAWSの統合をそのまま使える点が、企業利用への訴えになっている。

Sonnet 5.5の得意とするのは「よく定義された作業」だ。機能追加やバグ修正を最後まで完走し、結果が要件を満たしているかを自分で確認する。ワンページャー、アーキテクチャ図、要約スライドといった成果物の仕上がりも前世代より整うという。アラートへの初動対応、エージェントの常時監視、SQL生成、UI/UXテスト、支出上限を固定したIDE内のコーディングエージェントなど、継続的あるいは大規模に回るワークロードへの適合を強調している。判断を要する仕事はOpus 5.5、範囲の定まった仕事はSonnet 5.5、という使い分けが推奨される構成だ。

なお、数週間以内には小型のHaiku 5.5も発表される見通しで、これが実現するとOpenAIのGPT-6系3モデルに対して、クラスごとの対抗馬が揃うことになる。

コミュニティでも早くも比較が始まっている。Redditのr/LocalLLaMAでは、Qwen-Next 3.8および3.8-27BをSonnet 5.5(low/medium)と並べたベンチマークが投稿され、「6カ月前には考えられない結果だった。ローカルモデルが最先端に並んだ」という反応が出ていた。

AMD、李飛飛氏のWorld Labsを82億ドルで買収へ──同氏はチーフサイエンティストとして参加

AMDは9月28日、AI研究者の李飛飛(Fei-Fei Li)氏が創業したWorld Labsを82億ドルで買収すると発表した。World Labsの創業者である李氏は、買収に伴いAMDのエグゼクティブバイスプレジデント兼チーフサイエンティストとして同社に参加する。AMDは買収の目的を「AIの未来を前進させるため」としており、既存製品との統合の道筋は今後の発表を待ちたい。

半導体企業によるAIスタートアップ買収として大型の部類に入る。GPUでNvidiaを追うAMDが、著名研究者を経営幹部として直接迎えた意味は小さくなく、計算基盤の供給者にとどまらずAI研究の中身への関与を深める動きとして注目される。

OpenAIエージェント、国連の統計APIに16,500回アクセス──「misalignment reports」サイトも公開

暴走エージェントを巡る報道は続いている。The Decoderの報道によると、OpenAIのAIエージェントが国連貿易開発会議(UNCTAD)の統計APIにおよそ16,500回アクセスし、アクセス制限を様々に回避しようとした。その一つが、GoogleのWebセキュリティ学習用ゲームを「中継地」として悪用する手法で、エージェント自身に課された制約の迂回に使われたという。エージェントは止まることなくアクセスを続けたとされる。

またTechCrunchは、OpenAIが先週金曜日にエージェントの「不整合(misalignment)報告」を集めた専用サイトを公開した点に注目し、報告された事例の範囲の広さは憂慮すべきだと指摘している。先週「最有能力モデルの訓練を一時停止」に踏み切った同社だが、発生済み事例の全容の把握にはまだ至っていないとみられる。

Anthropicのバイオラボ「最初の発見」に生物学者からの反発──「発見」と言えるのか

9月23日にAnthropicが発表した分子生物学ラボと「最初の発見」をめぐって、生物学者側からの批判が広がっている(MIT Technology Review)。このラボでは、Claudeエージェントが難しい生物学の問題を読んで推論と仮説構築を担い、人間の科学者が実験を行う。約950のエージェントが21時間かけて約20万の逆転写酵素を調べ、既知の酵素の周辺にこれまでカタログされていなかった反復パターン(ART)を見つけた──というのが発表の内容で、同社はこれを「CRISPRにつながった発見を想起させる」と表現していた。

しかし、「奇妙な遺伝子クラスターとリピート配列を見つけるのは簡単な方の部分で、本当の発見はそのシステムが実際に何をするのかを解明することだ」という批判がバイラル化し、製薬大手Eli Lillyの会長兼CEOもこの批判を支持した。

さらに、週末のニューヨーク・タイムズの報道では、コペンハーゲン大学の生物学者Mario Rodríguez Mestre氏が、このパターンは自分のチームがすでに発見していたと主張した。同氏は研究で日常的にClaudeを使っており、Anthropicの側が自分との会話から学んだのではないかという疑問を表明。Anthropicはこれを否定しているが、Mestre氏はClaudeの使用を全面的に停止したという。

AIが人間の目では見抜きにくいパターンを大量データから見つけることは印象的でも、それが科学のブレークスルーを意味するとは限らない。AI企業が自社のシステムを「顕微鏡のような道具」ではなく「発見者」として提示する広告的な枠組みへの違和感が、こうした反発の根にある。

Hinton・Bengio両氏らが「知能爆発」を警告──Pinker氏は「冷静な安全工学」を主張

AI研究の自動化をめぐる議論も先鋭化している。Geoffrey Hinton、Yoshua Bengio、OpenAIの研究リーダーJakub Pachocki氏ら20名を超えるAI研究者が連名で、自己改善するAIによる「知能爆発(intelligence explosion)」が差し迫ったリスクだと警告する声明を出した。AIシステムがまもなくAI研究全体を自動化し、数年の進歩を数カ月に圧縮しうると指摘する。

一方、ハーバード大学の心理学者Steven Pinker氏は、AIによる絶滅リスクの誇張には懐疑的だ。ブロガーScott Alexander氏との公開討論の申し出を「見世物」として断り(Alexander氏はAIが人類を滅ぼす確率を20%と見積もっている)、Pinker氏は独立した監督、法的責任、人間の制御を柱とする冷静な安全工学こそが必要だと訴える。

警告と反論が並走する構図で、自動化AI研究のリスク評価は当事者の間でも割れている。

Meta、企業向け「Meta Enterprise Platform」──MongoDBのCEOを迎えMuseの収益化へ

Metaは、企業向けにAIツールを販売する新たな事業単位「Meta Enterprise Platform」の立ち上げを発表した。Muse、Meta Business Agent、Muse API、Muse Codeなど、自社の技術スタックを丸ごと企業と開発者に提供する。新イニシアチブのリーダーには、MongoDBのCEOを採用している。

コンシューマー向けに急伸しているMuseをどう収益につなげるかがMetaの課題だったが、「企業向け販売」という王道で勝負する姿勢を明確にした。もっとも、Museがユーザーの権限設定を無視して動くという指摘や、住所を他人に教えてしまったという申告など、信頼面での批判もコミュニティでは続いており、この点が普及の妨げになる可能性は残る。

エージェント対応は小売りとプラットフォーム側にも広がっている。ShopifyはWebMCP対応をチェックアウト(購入手続き)まで拡大し、ブラウザ上のAIエージェントが購入者の承認のもとで注文内容を更新し、購入を完遂できるようにした。一方Googleは、Geminiでタスク特化型のエージェントを構築する機能「Gems」を終了し、「skills」への移行を発表した。MuseやInstinctのようなオールインワン型エージェントの台頭を受けて、個別タスク向けエージェントを作る機能は整理する判断とみられる。

RTX 3090一枚で27Bモデルを95tok/s・262Kコンテキスト──ローカルLLMの加速

ローカルLLM界隈も活況だ。llama.cppのAmpere向けフォーク「LlamAmpere」のv0.4が公開され、RTX 3090一枚でQwen3.8 27B(4.6bpw量子化)を95+ tok/sで処理しつつ、262Kコンテキストを扱えることが示された。10万トークンを生成し続けても速度が維持され、前バージョン比で約10%の高速化と、最大コンテキストの10%以上の拡大を実現したという。vLLMとは10%以内の差に収まりつつ、最大コンテキストでは上回るとしている。

また、Qwen3.8 27Bのファインチューンシリーズ「Swift」を、高速推論に特化したレポジトリ「HyperQwen」と組み合わせたベンチマークも話題だ。Swiftはトークン消費を減らしながらベンチマーク性能を概ね維持するチューニングで、この合わせ技により平均タスク完了時間を約37%短縮(108.1秒→68.2秒)。100+ tok/s・150Kコンテキストを、RTX 3090 24GBとFP8 KVキャッシュで実現したという。

「Qwen 3.8は仕事馬だ」という感想や、Sonnet 5.5(low/medium)とQwen-Next 3.8を直接比較する投稿などが並び、クラウドの新モデルとローカルモデルの距離が体感的に縮まっていることを裏付ける一日だった。