LLMは医療現場でいとも簡単に騙される — MedMisBenchの警告

LLMが医療試験で高得点を叩き出しても、それは「Conditionsが整った時だけ」の話にすぎないかもしれない。

MedMisBenchと名付けられた新しいベンチマークは、LLMがもっともらしい誤誘導文脈を与えられた際、正しい医療判断を維持できるかを測定する。10,932の医療問題と48,889の誤誘導文脈オプションペアを構築し、主要LLMの耐性を検証した結果は深刻だ。

精度が71.1%から38.0%に急落。攻撃成功率は51.5%に達し、とくに「権威を借用した偽情報」は69.5%の成功率を記録した。7カ国14名の臨床パネルがレビューした結果、38.2%のケースに「深刻な危害の可能性」があると判断された。

高いクリーン精度が医療判断の堅牢性を意味しない——これが本研究の核心的なメッセージである。医療現場でのLLM導入を検討する際、誤誘導に対する耐性評価が不可欠だ。

動画生成を訓練なしで最大2.6倍加速 — RhymeFlow

動画生成モデルの推論コストは実用化の最大の障壁の一つだが、追加学習なしでこの壁を大きく下げる手法が発表された。

RhymeFlow(Asynchronous Denoising Flow Scheduling)は、キーフレームと非キーフレームでノイズ除去の密度を変えるという発想に基づく。キーフレームのみが密なステップバイステップのノイズ除去を行って構造的整合性を確保し、非キーフレームは段階的にノイズ除去ステップをスキップして計算コストを削減する。

結果は顕著だ。CogVideoX-v1.5で1.93倍、Wan 2.1で1.66倍、HunyuanVideoで2.60倍の高速化を達成。追加の学習が不要である点は、実用面での魅力が大きい。

職場のAIが生む「ボットシッティング」 — Glean Work AI Index Report

GleanのWork AI Instituteが発表したレポートが、職場でのAI利用の裏側にある人間の労働に光を当てている。

レポートは「botsitting(ボットシッティング)」という言葉を使い、AIエージェントの背後で人間が監視、修正、管理を行う隠れた労働を指摘。AIが自律的にタスクをこなしているように見えても、実際には人間が介入して出力を整え、エラーを修正し、結果を検証している実態が浮き彫りになった。

AIの導入が進むほど、この「見えない人件費」も増大する。生産性指標の向上がAI単独の成果と誤解されるリスクがあり、AI導入のROI評価においてこの隠れコストをどう扱うかが重要な論点となる。

エージェント間プロトコルの相互運用を実現 — AgentBridge

AIエージェントのエコシステムが拡大する中、異なるプロトコル間の通信とガバナンスの課題に取り組むオープンソースプロジェクト「AgentBridge」が公開された。

複数のAIエージェントフレームワークやプロトコルが乱立する現状では、エージェント同士が通信できず、システム全体のガバナンスも困難になる。AgentBridgeはプロトコル間の翻訳層を提供し、異なるエージェント間の呼び出しを仲介するとともに、ガバナンスルールを適用できる仕組みを提供する。

マルチエージェントシステムの実用化において、相互運用性と制御の両立は中核課題であり、この方向性の探求は注目に値する。

長時間動画のRAG — 「何を検索し、どう使うか」を見直す

Hugging Face Daily Papersに掲載された研究が、長時間動画に対するRAG(Retrieval-Augmented Generation)の根本的な問い直しを提示している。

従来の動画RAGは「どの程度の精度で検索できるか」に焦点を当てがちだったが、本研究は「何を検索すべきか」と「検索した情報をどう使うか」の2つの軸で再定義。長時間動画という特殊なコンテキストでは、検索対象の選択と検索後の統合方法が、精度に予想以上の影響を与えるという。

動画理解モデルの実用化が進む中、RAGの設計思想そのものを見直すアプローチは今後の研究の指針となる可能性がある。