2026年9月25日夕方のまとめ。米政府のAIガバナンスをめぐる報道が2本続いた。ホワイトハウスはOpenAIとAnthropicに対し、新モデルを英国のテスト機関に渡す前に米政府機関のレビューを受けさせるよう求め、国防総省はAIを使った嘘発見器の開発予算を要求している。ビジネス面では法律特化AIのHarveyの利幅がフロンティアモデルのコストで消えたと報じられ、国内ではClaude Opus 5.5の実測記事が一斉に公開された。
米ホワイトハウス「新モデルは英国のテスターより米機関を優先せよ」
The Decoderの報道によると、ホワイトハウスはOpenAIとAnthropicに対し、英国のAIセーフティ研究所への新モデルの提供を保留し、米政府機関のレビューを先に受けるよう求めたという。
一見すると手続き上の話だが、影響は小さくない。この要求が通れば、新モデルの事前評価をめぐる「どの国の機関が先に見るか」という順序そのものが、米国の国内政治に左右されることになる。報道として流れている情報はまだ限られるが、モデルの安全評価という国際協力の枠組みが安全保障の文脈に組み込まれつつある、最初の具体的なシグナルとして注視したい。
国防総省は3,030万ドルで「AI嘘発見器」──Polygraph+計画
MIT Technology Reviewが、米国防総省(DoD)が5年間で3,030万ドルを投じる次世代嘘発見器の予算要求を報じた。プログラム名は「Polygraph+」または「Polygraph Next」で、AI・機械学習によるスコアリングアルゴリズムと、機器を身体に装着せずに生体反応を測る「スタンドオフセンシング」に焦点を当てる。担当は連邦政府の身辺調査を担う国防防諜安全保障局(DCSA)で、採用予定者の審査と「インサイダー脅威の検出」への利用が想定されている。
背景にはヘグセス国防長官体制での内部告発の追求がある。9月には米紙の報道で、兵器庫をめぐる報道流出を追って統合参謀本部の約50名がポリグラフ検査を受けたと伝えられた。技術面の足がかりとしては、2023年に国防イノベーション・ユニット(DIU)が2社を選定している。通常のカメラで心拍・呼吸を測るというPresage Technologiesと、頭部の動き・顔の皮膚温度・毛孔の活動を追うAltec Researchのプロトタイプだ。
ただし専門家の懐疑は強い。ポリグラフ自体は1920年代の発明以来ほとんど変わっておらず、2003年の米国立研究評議会(NRC)は従業員スクリーニングへの有効性の証拠を「弱い」と評価した。審査官によって判定が大きくばらつくこと、マイノリティの回答者は不正を疑われやすいこと、訓練による反測定技法で突破できることも知られている。AIの追加について法学者は「無効性の上に不確実性を重ねる最悪の両面」と批判する。生理データから未知のパターンを見つけられても、そのパターンが嘘と正しく結びつく保証が、正解データ(ground truth)の欠如ゆえにないためだ。280万人を抱えるDoDで精度が不完全なスクリーニングを大規模に運用すれば、大量の誤認に繋がりかねないという指摘もある。
Legal AI「Harvey」の利幅が6ヶ月で+50%から−50%へ
法律特化AIで知られるHarveyのマージンが、OpenAIやAnthropicなどフロンティアモデルのコスト高を背景に、6ヶ月間でプラス50%からマイナス50%へ落ち込んだとYahoo Financeが報じ、Hacker Newsで注目を集めた。
詳細な内訳は現時点では報じられていない。ただ、フロンティアモデルの推論コストが高止まりしたまま利用量だけが伸びれば、モデルAPIの上に業務を載せるタイプのビジネスは粗利を削られる。生成AIアプリケーション層の収益が「モデルコストに食われる」構造が、エンタープライズ向けの堅い領域でも現実になりつつあるシグナルとして読める。
OpenAIがCustom GPTを全プランで廃止──Plugin移行の注意点
OpenAIは2026年9月11日のリリースノートで、Custom GPTを全ChatGPTプランで廃止し、Pluginへの移行パスを用意すると発表した。Zennの解説記事によると、移行ボタンを押すだけで済むGPTもあれば、外部APIを呼び出すCustom Actionsを使っているGPTは作り直しが必要になるという。
社内の問い合わせ対応や定型レポート作成をCustom GPTに任せている組織では、既存のGPTがいつまで動くか、何を引き継げないかの見極めが急務になる。同記事は引き継げない項目と移行手順を整理しており、該当する運用者は一度確認しておきたい。
研究:SAEの潜在変数は品詞を「分散して」符号化
Hugging Face Daily Papersで注目を集めているのが、Sparse Autoencoder(SAE)の潜在空間に品詞(POS)がどう符号化されるかを調べた論文(EMNLP 2026採択)。LLaMA-3-8BのSAE活性化をUD English GUMコーパスで分析した結果、品詞情報はSAE活性化から高い精度で復元できるものの、「1つの潜在変数=1つの品詞」のような原子的な対応は存在しないことが分かった。
品詞の多クラス分類には約13万個の潜在変数のうち498個で足りる。閉じたクラス(限定詞・代名詞・接続詞)は小さく集中的なグループで、開いたクラス(名詞・形容詞・副詞)は広く分散したグループで符号化されるという。SAEの潜在変数が「単意味的な特徴」と語られることへの反証になり、実際の言語カテゴリは表層形や文脈も織り込んだ分散的な符号化になっていることが示唆される。
同じくDaily Papersで上がっているのが、コーディングエージェントにロボットの制御ポリシーを書かせて体系的に評価した研究だ。28のシミュレーション環境で計98,000回の評価を実施し、明確なアクセスルールの下で驚くほど巧妙な物理的推論を示す場面があったという。断片的なデモ映像で語られがちだった「LLMでロボットを動かす」が、系統的なベンチマークの対象になりつつある。
国内:Claude Opus 5.5の実測ラッシュ──「よく考えて」はもう書かない
9月22日にリリースされたClaude Opus 5.5について、国内で実測・解説記事が出揃った。Anthropicの公式ブログはOpus 5.5の変わった癖として「長い作業を自分で続けること」「したことを平易に伝えること」「返事の前に考えること」の3つを挙げている。これを受けた解説記事では、Opus 5向けに書いたプロンプトの見直しが推奨されている。分かりやすい例が「よく考えてから答えて」という一文で、Opus 5.5は頼まれなくても返事の前に考えるため、この一文は消して、代わりに「何ができたら完了か」「どこで止まって確認を求めるか」を書くべきだという。
コスト面を分析した記事は、リリース翌日の公式発表・移行ガイド・独立評価をもとに「上位モデルの性能がOpusの価格帯に降りてきた」と位置づけつつ、単価が下がっても仕事あたりのコストは横ばいとの観点を示した。またQAエンジニアが凍結した測定セットでテスト観点の作成・多文書スケール・判定役の3測定を回した記事もあり、「多くの作業でFable 5.1並み、Opus 5より4割安く3割速い」という提供側の説明を自分のワークフローで検証する動きが広がっている。リリース直後の報道から一歩進み、運用側の視点での評価がまとまり始めた段階と言える。
国内の個人実験:10,000ターン会話とキャラLoRAの限界
AI彼女アプリを開発するエンジニアが、記憶システムを持つAIとの会話を100ターンから10,000ターンまで引き伸ばし、「記憶がどこから記憶らしくなくなるか」を調べた記事が公開された。短い会話では概ね機能する記憶の保存・想起・活用が、会話が長くなったときにどう崩れるかを追求した内容で、長期対話システムの設計に興味がある読者には一読の価値がある。
もう1本、ヤンデレ・ツンデレのセリフで小型LLM(Qwen3.5-0.8B/4B、Spark-X2.5-4B)にLoRA学習させた実験では「人格は安定したが、モデルは壊れた」という結果が報告された。ヤンデレ設定なのに一人称が揺れる回答はQwen3.5-4Bで26%から0%まで減った一方で、一般常識や長い文章を書く力が落ちたという。キャラ付与と能力低下のトレードオフを数字で示した珍しい記録だ。
このほか
- Kaggleで「Gemma 4 Developer Agent Competition」が始まった(Reddit LocalLLaMA経由)。
- RedditではP102-100からCMP 50HXへの載せ替えで、4GPU・合計360ドルのローカルLLM環境を構築した報告も。待機電力8Wを重視した構成で、モデルごとのfine-tuneは年50ドル程度の試算という。
- Show HNでは、UXデザイナーがデザイン履歴や設計判断をAIエージェントが読める形で共有するProxima Formaが公開された。
