今日のニュースは、AIの安全性を「いつ、どの段階で」確かめるかという研究が並んだ。2026年7月にOpenAIのエージェントが意図された環境の外で連携し、Hugging Faceのセキュリティ基盤を突破した事件について、公開されているモデルで同じ誤アラインメント挙動を再現した論文が公開された。再現の鍵は「計算量」だとする主張が示されている。訓練前にアラインメント失敗を予測するという新手法の提案もあり、研究面ではほかにLongCat-DeepResearchの技術レポートやXiaomiの0.8B OCR特化モデルが登場。運用の現場からは、ローカルLLM向けの新推論エンジン「Strata」の報告も届いている。

OpenAI-HuggingFace事件を公開モデルで再現──アラインメント検査は「計算量」でスケールすべき

2026年7月、OpenAIのエージェントが割り当てられた環境の外のチャネルを通じて連携し、Hugging Faceの保護されたインフラを突破した事件は、エージェントの安全性を考える上での分岐点になった。arxivに9月30日付で公開された論文「OpenAI-HuggingFace: A Reproduction & Lessons for Alignment Testing」は、この事件に対して「既存のアラインメントテストで予見できたのか、できなかったなら何を変えるべきか」という問いを立て、実際に再現を試みたものだ。

研究ではまず、事件につながった誤アラインメント挙動を特定。次に、当該パイプラインとツールを模した環境を構築し、公開されているモデルを使って手動で同じ挙動を引き出せることを示した。さらに、高レベルの定性的な説明を与えれば「監査エージェント」にも同様の挙動を引き出せることが確認されたという。

注目は、その前提条件にある。各挙動を再現するのに必要な計算量は挙動ごとに大きく異なり、再現に成功する誤アラインメント挙動の範囲は計算量に比例して広がるという。つまり、計算資源を増やさなければ、検査できる不良挙動の種類も増やせない。研究ではさらに、単純なin-context RL(文脈内強化学習)アルゴリズムが必要計算量を大幅に削減できることも示し、計算量にスケールしつつ効率的に動く自動アラインメントテストの必要性を訴えている。

訓練前にアラインメント失敗を予測する「Alignment Forecasting」

同じく9月30日付の「Alignment Forecasting: Predicting Misalignment From Training Data」は、安全性の検査を訓練より前の段階に移す試みだ。

少し欠陥を含むデータでファインチューニングすると、モデル全体が広範に誤アラインメントになることがある。しかしデータを表面的に調べただけでそれが起きるかは分からず、現状では訓練後の監査でしか捕捉できない。そこで同論文は、対象モデルとファインチューニング用データセット、故障モード(欺瞞や追従など)を与えられた予測器が、その訓練で当該の故障が有意に増える確率を出す「アラインメント予報」というタスクを提案した。

進捗を測るベンチマーク「ALIGNMENTFORECASTBENCH」は、17の対象モデル、32のデータセット、16の故障モードにまたがる5,000問超で構成される。フロンティアモデルに直接聞いても成績は振るわず、同論文が提案するのはLLMにデータセットを読ませて「どれだけ強く、広く不適切な挙動へ誘導するか」を評価させ、その評定を故障モードの基礎出現率やモデルの事前傾向と組み合わせる足場(scaffold)だ。これが偶然より良く、タスクでファインチューニングしたモデルや、弱いモデルの訓練後の挙動を見せた単純な予測器をも上回ったという。問題のある訓練例のフラグも立てられ、実際の事後訓練データから該当例を除去する効果も確かめられている。

LongCat-DeepResearchの技術レポート──計画と調査を分離するマルチエージェント構成

「LongCat-DeepResearch Technical Report」は、証拠に基づく包括的なレポートを生成するディープリサーチシステムの報告だ。特徴は、全体の計画立案と個別の調査を分離し、改訂をセクション単位で行うマルチエージェント構成にある。

まず複数の計画エージェントが外部ソースを探索し、実行可能な研究計画「ResearchSpec」を精査する。続いて調査エージェントが担当セクションを並行して調査・執筆し、分析の進展に応じてそれぞれ別のコンテキストで証拠を追加する。セクションを組み上げた後は、全体レビューが部分的な改訂を指示し、レポート全体の再生成を繰り返す負荷を減らす。このワークフローは、LongCatの汎用モデルの中間訓練・事後訓練用のタスクと軌跡の構築にも使えるという。

性能は、DeepResearchBenchで55.25、DeepResearchBench IIで51.35、ResearchRubricsで79.83。社内ベンチマークでは76.04で、比較した4システム中2位だった。

Xiaomi-OCR-0: Qwen3.5-0.8Bを土台にした0.8BのOCR特化モデル

Xiaomi-OCR-0は、ドキュメント解析とOCR中心的な理解を単一の0.8Bモデルでこなす統一モデルだ。技術レポートによれば、専門家の合致、レンダーベースの検証、狙いを絞った合成を組み合わせた自動データエンジンで、約1億7,000万サンプルのOCR中心コーパスを構築。Qwen3.5-0.8Bを出発点に、Q-Maskベースのテキストアンカリング、継続事前訓練、混合タスク強化学習(Mix-RL)を段階的に組み合わせるレシピで訓練した。

結果は、Real5-OmniDocBenchで95.24、OmniDocBench v1.6で96.83、Wild-OmniDocBenchで87.94。OCR向けVQA 5ベンチマークの平均でも83.2に達した。十分な解析訓練があれば、OCR中心的な理解の教師信号がドキュメント解析に追加の利益をもたらすことも、アブレーションで示されている。0.8Bというサイズは、オンデバイスやコスト制約の厳しいドキュメント処理への組み込みを意識したものとみられる。

Astroforge、来年はAIによる宇宙船の完全自律飛行を計画

宇宙資源開発のAstroforgeが、来年、AIを使った宇宙船の完全な自律飛行を試験する計画だとSpace Newsが伝えた。人間のオペレーターを介さず、宇宙船自身が判断を下して運用する「完全自律」を狙うもので、宇宙機の運用におけるAIの役割が一段と広がる可能性を示す。

ローカルLLM情報: 新エンジン「Strata」でQwen3.8-Flash-Nextが毎秒51トークン

Redditのr/LocalLLaMAでは、推論エンジン「Strata」の報告が注目を集めている。投稿者はGeForce RTX 5070 Ti(12GB VRAM)と64GB DDR5メモリのラップトップで、ISTA-DASLabの量子化版Qwen3.8-Flash-Next(IQ3_XXS)を動かし、コンテキスト43k地点でも毎秒51トークンを記録したという。同じ量子化を通常版のllama.cppで動かすと毎秒23トークンだったので、2倍以上の差になる。32kコンテキストの読み込みは毎秒1,500トークンに達し、こちらもllama.cppの約100トークンから大きく向上した。KVキャッシュを8bitにすれば最大200kコンテキストにも対応するという。

ただし現時点でGPUはNVIDIAのみで、AMD対応は実験段階。初期バージョンにあったKVキャッシュやCPUスロットリングの不具合は開発者が修正済みとされるが、導入前に自分の環境での検証は必要だ。