本日収集したAIニュースから注目トピックを6本まとめました。OpenAIの安全性に関する新ガイドライン、コードを見せずに能力が伝わるという興味深い蒸留研究、生成画像を自分で修復する統合モデル、AI要約と人間の記憶に関する研究、AWSのオープンソースツール、ローカルLLMの新しいラインナップを拾っています。

OpenAI、フロンティアAI訓練の「セーフティケース」初期ガイドラインを公開

前回のまとめでは、安全上の懸念から新モデルのリリースを取りやめたというOpenAIの動きを伝えました。その後、同社はフロンティアAIの訓練に向けた「セーフティケース(safety cases)」の初期ガイドラインを公開しています。

ガイドラインがカバーするのは、技術的なセーフガード、運用面のプラクティス、そしてミスアライメント(整合性の喪失)事案の調査という3つの領域です。モデル訓練の安全性を個別に論証していくための初期の指針と位置づけられます。

安全懸念によるリリース見送りと、安全性の論証手法をまとめたガイドライン公開が短期間に並んだことで、フロンティアモデルの開発と安全性の担保をどう両立させるかという同社の姿勢が読み取れそうです。あくまで初期段階のガイドラインとされていますが、今後の更新で実運用にどう組み込まれていくかに注目したいところです。

コードを見せずにコーディング能力が伝わる──「行動の影」を利用した蒸留研究

Hugging FaceのDaily Papersで注目を集めている研究の1つが、ポストトレーニングがモデルの無関係な決定に残す「行動の影(behavioral shadow)」を扱ったものです。

驚くべきことに、コーディング訓練を受けた教師モデルが、コーディングとは無関係な数千のプロンプトに単語1語ずつで答えたデータだけで学習した生徒モデルは、コードを一切見なくてもコーディング能力が向上します。具体的には、わずか5,664個の単語回答だけで、HumanEval+で比較対象を5.34ポイント上回る結果を示したといいます。

仕組みとしては、ポストトレーニングが「普通の単語間のわずかな選好の偏り」として分散した痕跡を残し、それが無関係な文脈にも漏れ出ることが分かってきました。提案手法のATD(Active Taskless Distillation)は、ベースモデルがほぼ決めかねている決定に着目することで、この小さな偏りから更新の方向を捉えます。従来、この経路で伝わるのは「選好」だと知られていましたが、「能力」が伝わることを示した点が新しいとされています。効果は科学・常識・読解の各タスクや、モデルサイズ・モデルファミリーをまたいでも確認されたとのことです。

学習済みの能力は訓練タスクからはるか外側へ漏れ出ている──一見無意味に見える大量の挙動変化の集合が、ポストトレーニングの豊かな痕跡を担っているという示唆は、蒸留やモデル間の影響理解のあり方を見直すきっかけになりそうです。

生成画像を自分で診断して直す──統合マルチモーダルモデルの反射学習

同じくHugging Face Daily Papersから、統合マルチモーダルモデルの自己修復に関する研究が上がっています。画像を「見る」ことも「生成する」こともできる統合モデルは、原理的には自分の生成結果を修復できます。何が悪いかを診断し、改訂し、結果を観察し、再度診断する──このループです。

難しいのは、改訂が有効だったかどうかがレンダリング後でなければ分からない点です。そのため反射テキストと画像生成を、ループ全体として共同学習させる必要があると研究チームは指摘します。教師ありファインチューニング(SFT)では出発点は作れるものの成功率の高い修復パスは見つけられず、レンダラ側だけを最適化する素朴な強化学習(RL)でも大半の利得を取りこぼしてしまいます。

提案手法のUMM-Reflectionは、1つの統合モデル内部の完全な反射トラジェクトリにRLを適用します。兄弟トラジェクトリが同じ初期画像を共有する設計により、group-relative advantageで反射戦略同士を比較し、トラジェクトリレベルのadvantageで反射トークンとフローベースの改訂の両方を一度に更新します。外部の批判モデルを挟むパイプラインと違って複数ラウンド間・両方の役割にクレジットが流れ、推論時には検証器が不要になる点が特徴です。

BAGELというモデルでの検証では、GenEvalがSFT比で12.05ポイント改善。さらに訓練に使っていないWISE(+10.97)、OneIG-Bench(+3.48)、T2I-CompBench++(+4.63)にも利得が転移しました。

誤解を招くAI要約は人間の記憶を歪めうる──ジョージタウン大学の新研究

AI生成の要約をめぐっては、読み手への影響を調べた研究も報じられています。ジョージタウン大学の新しい研究は、誤解を招く内容を含むAI生成の要約が、人間の記憶を歪める可能性を指摘しています。

要約は情報への「入り口」として便利な一方、要約の段階で混入した誤りは、原文に当たる機会が減りがちな環境ではそのまま記憶に定着しかねません。AI要約がニュースや資料の閲覧体験に組み込まれていく中で、生成側の正確性だけでなく、読み手の記憶への影響という視点も重要性を増しそうです。

AWS、LLMを入れ替えられるエージェント自作ツール「Strandsハーネス」をOSS公開

AWSは、GPTやClaude、Gemini、Ollamaなど主要なLLM・LLMランタイムを組み合わせて高性能なAIエージェントを手軽に自作できるツール「Strandsハーネス」をオープンソースで公開しました。

特定のLLMに依存せず、モデルを入れ替えられる点が特徴です。エージェント構築では特定プロバイダのSDKに深く依存すると、モデルの交代やコスト最適化の自由度が下がりがちです。大手クラウド事業者が中立的な位置から複数のランタイムに対応した道具を公開した意味は小さくなく、エージェント開発の入り口が一段低くなりそうです。

Ornith-1.5に投機的デコーディング用ドラフト同梱版「DFlash」が登場

ローカルLLMコミュニティでは、Ornith-1.5シリーズに投機的デコーディング用のDFlashドラフトモデルをペアにしたバリアントが公開されたことが話題になっています。

ラインナップはOrnith-1.5-9B-DFlash、Ornith-1.5-35B-A3B-DFlash、Ornith-1.5-397B-DFlashの3種。いずれも本体モデルとDFlashドラフトモデルの組み合わせとして提供されます。投機的デコーディングは、小型のドラフトモデルに候補を先行生成させて大型モデルで検証することで推論を高速化する手法で、ローカル実行時の速度に直結するため、手元で大型モデルを動かすユーザーには嬉しいリリースといえそうです。

以上、本日の6本でした。安全性の論証が開発プロセスの表舞台に上がりつつある一方、モデルの内部で何が起きているかを探る研究も深まり続けています。明日も最新情報をまとめます。