9月28日朝のAIニュースまとめ。Anthropicが、AIエージェントが顕微鏡やロボットアームといった実験・製造機器を安全に操作するための共通仕様「Model Hardware Standard(MHS)」の研究プレビューを最初のパートナーに向けて公開した。あわせて世界の科学者1万人へのClaudeサブスクリプション無償提供も発表しており、同社の「科学支援」戦略が一気に具体化した形だ。一方、政治面ではAmodei CEOがトランプ大統領と初めて一対一で会食すると報じられ、AI安全をめぐる対立の行方が注目されている。ローカルLLM界隈では、M1 Maxで125BのMoEモデルを動かす推論エンジンが話題を集めた。

AIエージェントが実験機器を動かす──Anthropicの「Model Hardware Standard」とは

Anthropicは、AIエージェントが物理デバイスを安全に操作するための共通仕様「Model Hardware Standard(MHS)」の研究プレビューを、最初のグループとなる科学研究ラボと先進製造企業に向けて公開した。対象は顕微鏡、リキッドハンドラー、ロボットアームなどで、エージェントが複数の実験・製造機器を並行して操作し、定型的な創薬実験から量子コンピュータのレーザーキャリブレーションまでこなすことを想定している。

背景にあるのは、実験設備の統合の難しさだ。各デバイスはそれぞれ独自のプログラミングインターフェースを持ち、相互に通信しないため、これまでは専門家が個別の統合を構築する必要があり、数週間から数か月かかるのが普通だった。MHSはこの統合作業を数時間〜数分に短縮するという。仕組みとしては、OSとハードウェアの間を翻訳する標準ドライバを導入し、「read(温度を取得)」「write(温度を設定)」のようなシンプルなプリミティブで任意のデバイスを操作できるようにする。プログラマブルなインターフェースを持つ機器なら何でも対応し、モデル非依存で、MCP(Model Context Protocol)などの標準プロトコル経由でどんなエージェントハーネスからもアクセスできる。

MHSの開発は、Anthropicと米ハワード・ヒューズ医学研究所(HHMI)のJanelia Research Campusとの協業から始まった。同社は、科学・ロボティクス・電子・製造分野のパートナーと安全性評価とベストプラクティスを共同構築した上で、標準をオープンソース化する方針を示している。エージェントがチャットやコードだけでなく物理世界の機器を動かす時代への足がかりとして、業界横断の影響が注目される発表だ。

あわせて科学者1万人にClaudeを無償提供──「AI for Science」も拡大

同じタイミングで、Anthropicは科学者向けの支援策を大幅に拡大した。世界の科学者1万人に対し、新設の「科学者向けClaudeチームプラン」を通じてClaudeサブスクリプションを1年間無償(標準シート)または割引価格(利用上限5倍のプレミアムシートは月15ドル)で提供する。対象は学術・非営利研究機関のPI(研究所長ら)とその研究室で、今後数か月で1万人を大きく超える規模へ拡張する意向という。

あわせて、高インパクト研究に無料クレジットを提供する「AI for Science」プログラムも拡大する。これまで主に生物科学を支援してきたが、今後はリーマンゼータ関数での進展やタンパク質設計のような大規模計算研究など他分野にも対象を広げ、プロジェクトあたり最大5万ドルのクレジットを付与する。なお生物・化学研究者には当面Opusクラスのモデルのみ提供され、軽量なFableモデルは専門的な生物学・創薬クエリをブロックし続ける。米政府と連携したライフサイエンス向けアクセスプログラムも始まったばかりとのことで、安全上の権限設計を慎重に進めながら、というスタンスが読み取れる。

「Claudeをどう封じ込めるか」──権限プロンプトの93%は承認される

Anthropicのエンジニアリングブログに、Claudeの権限管理の内実を語る長文記事「How we contain Claude across products」が掲載された。12か月前なら「内部サービスを停止させかねない」と拒否していたレベルのアクセス権限付与が、今では日常的になっており、開発者の生産性は上がっているという。リスクは「故障の起こりやすさ」と「被害規模(blast radius)」の2要素で捉え、前者は安全策とモデル訓練で着実に下がっている一方、後者は能力とアクセスの拡大とともに増える一方。エンジニアリングの課題は「被害規模に上限をかけること」だとする。

興味深いのは実測値の開示だ。Claude Codeの権限プロンプトについて、テレメトリではユーザーが約93%を承認していたという。承認を重ねるほどユーザーの注意が薄れる「承認疲れ」を確認し、より安全な承認を自動化するauto modeを構築したが、確率的な防御には必ず見逃しがあるとする。そこで本記事の主眼が「containment(封じ込め)」だ。エージェントの行動を監視するのではなく、サンドボックス・仮想マシン・送信(egress)制御などで「何ができるか」自体に境界を課すアプローチで、同社のエンジニアリング努力の大部分と、最も驚くべきセキュリティ失敗の多くはここに集中しているという。なおClaude Mythos Previewは、2026年4月時点では被害規模が大きすぎると判断され出荷を見送られたモデルであり、防御側の体制が成熟すれば同程度の能力を持つモデルの広範なリリースも適切になると見込む、と述べている。

Amodei CEO、トランプ大統領と初の一対一──夕食会へ

Bloombergなどが報じたところによると、AnthropicのDario Amodei CEOは日曜夜、トランプ大統領と夕食会の席を持つ。AI安全論争で正反対の立場にいる両者の、初めての私的な一対一の会談となる。両者の関係は、年初のペンタゴンとの苛立たしい契約紛争や、6月に商務省が同社のブレークスルーモデル「Mythos」に一時的に輸出規制を課したことで悪化しており、その落ち着き先として注目される。

同じ週末、Microsoft共同創業者のビル・ゲイツ氏がNBC「Meet the Press」のインタビューで、破滅的リスクに対する政府の安全策は米中競争の妨げにならないとの見解を示した。「すべての国が安全策を導入すべきだ。『中国は安全策を導入しない』と言う人にはまったく同意しない」と述べたもので、トランプ政権の概ね自由放任的なアプローチと対照的な主張だ。規制の是非をめぐる議論が米中競争の文脈と絡み合う中、業界側からは安全策擁護の声も上がり始めた格好だ。余談だが、Amodei氏は米大人番組SNLのネタにもなり、「AI is the devil and I its maker(AIは悪魔、私はその造り主)」という決め台詞を紹介されたという。

中国、AlibabaやByteDanceにNvidia新チップ購入を容認へ──The Information報道

The Informationの報道をBloombergが伝えたところによると、中国政府は、AlibabaやByteDanceなどがNvidiaの新チップ「RTX Pro 5500」を購入することを容認する意向を示したという。工業情報化省が最近、一部企業に対し、今月リリースされたばかりのこのハイエンドGPUについて、購入数や用途を含む購入計画の報告を求め、一部には承認する意向を伝えたという。

米国の輸出規制と中国の調達動向はAI開発の物量を左右するテーマだ。高性能チップへのアクセスが実際に緩むなら、中国勢のAI訓練・推論基盤の制約が一段緩む可能性がある。ただし現時点では関係者談ベースの報道であり、正式な決定や購入の実行については今後の展開を待つ必要がある。

ローカルLLM:「wait」「maybe」「perhaps」にペナルティで精度改善、M1 Maxで125Bモデルが12-15 tok/s

RedditのLocalLLaMAコミュニティでは、推論時の小細工が2本注目を集めた。1本はMetaの論文の追試で、「wait」「maybe」「perhaps」といった"考え直し"を示すトークン(overthinkingマーカー)にlogitバイアス(-2)をかけるとQwen 3.5-4Bの精度が向上するかを、llama.cppの各種量子化でMATH-500の50問により検証したもの。モデルが自己訂正のループに陥るのを抑えるアプローチが、量子化環境でも再現できるかを確かめた試みといえる。

もう1本は推論エンジン「MoEspresso」の作者による報告で、2021年製のM1 Max(ユニファイドメモリ32GB)でQwen3.8-Flash-Next(125BのMoEモデル)をデコード12〜15トークン/秒で動かしたという。メモリに常駐したエキスパートにバイアスをかける「Cache-Prior」というルーティング工夫が肝で、IQ2_Kといった高圧縮の量子化フォーマットを組み合わせて実現している。作者の48問ベンチではQwen 3.8 Flash(MoEspresso動作)が84.3%を叩き出し、Claude Opus 4.8 xhigh(80.3%)などを上回ったとされる。ホストされた強力モデルに、ローカルの低メモリ環境が肉薄しつつあることを示す実演として話題を呼んでいる。

モデル開発の55%はAIエージェント、ただし決定の85%以上は人間──769タスクの分析

The Decoderが伝えた研究では、ある研究チームが自社AIモデルの構築過程から769件のタスクログを分析した。その結果、手法の提案の最大55%をAIエージェントが供出していた一方、最終的な意思決定の85%以上は人間が行っていたという。またタスクの3分の1は、AIがなければそもそも試みられなかったものだった。

「エージェントの活動が増えても、それは自律性の増加を意味しない」という著者らの指摘は、AI開発の現場で人間の役割がどう変わっているかを示すデータとして興味深い。提案の量的生産はエージェントに移り、取捨選択と判断が人間に残る──という分業が、今後の開発組織の標準になりつつあるのかもしれない。