Meta社がAIで休暇取得従業員をレイオフ対象としてタグ付け――集団訴訟へ
Meta(旧Facebook)が、AIシステムを用いて医療・家族休暇を取得していた従業員をレイオフ対象として自動的にタグ付けしていたことが、裁判で明らかになった。ガーディアン紙の報道によると、元従業員らが提起した訴訟において、Metaの人事システムがAIを活用して休暇取得者のパフォーマンス評価を引き下げ、解雇リストに自動追加していたと主張されている。
AIを人事判断に導入する動きは多くの企業で進んでいるが、本件は「AIの自動分類が労働者の権利を侵害した」という点で重要な先行事例になりそうだ。判決の行方は、今後の企業におけるAI人事利用のガイドラインに大きな影響を与える可能性がある。
「トークン削減=コスト削減」は本当か?Claude Codeでの大規模実験結果
APIベースのコーディングエージェント(Claude Codeなど)において、コンテキストの圧縮が実際のコスト削減につながるかどうかを検証した研究が発表された。2,908回の課金対象実行(103タスク・7リポジトリ・3モデル)という大規模なpaired比較実験の結果、驚くべき結論が得られている。
主な発見は以下の3点だ:
- プロンプトキャッシュがコストの約87%を占める — 圧縮がトークン量を減らしても、キャッシュの作成・読み取りが主要なコスト要因であり、削減効果が相殺される
- ツール出力の38%削減が、逆に6.8%のコスト増加につながった — 信頼区間もプラス側に偏っており、削減量とコスト削減の相関は弱い(Pearson r = 0.15)
- 圧縮がタスク完了率を低下させる — SWE-benchベースのテストで、パッチ適用成功率が27/40から15/40に悪化。verbatim編集アンカーが破損したため
この研究は、「トークン削減率ではなく、成功調整済みの実際の課金コストで評価すべきだ」という新しい評価基準を提案している。RAGパイプラインやコーディングエージェントを運用するチームにとって、非常に実用的な知見だ。
SRM-LoRA:リーマン計量でLLMのハルシネーションを数学的に抑制
ICML 2026 Workshop(FoGen)で採択された論文で、サブ・リーマン計量を用いてLoRAのパラメータ更新方向を制御し、LLMのハルシネーションを削減する手法「SRM-LoRA」が発表された。
この手法は、LoRAパラメータ空間において感度ベースのリーマン計量を構築し、ハイコストな更新方向(ハルシネーションを引き起こしやすい方向)の勾配を抑制する。重要なのは、推論時のコストを一切変更せずに、学習時の勾配方向のみを調整する点だ。
HaluEval-QAのみで学習したにもかかわらず、関連ベンチマークおよび分布外ベンチマークの両方で事実信頼性が向上したとのこと。「数学的理論がLLLM改善に実際に貢献できる」という点でも注目すべき研究と言える。
13のLLMを評価した「マルチエージェント協調ベンチマーク」――協調が最大のボトルネックに
長期間・オープンエンドな環境でLLMエージェント群が協力できるかを測る新しいベンチマーク「ALEM」が公開された。13の最新LLMを評価した結果、大多数のモデルは正規化リターン平均わずか約6%にとどまった。
最も興味深い発見は、最難設定においてゼロショットのGemini 3.1 Proが、10億ステップで学習した最高のMARLエージェントと同等の性能を示したことだ。また、アブレーション実験から、長期間タスク遂行能力とは別に「協調」が独立したボトルネックであり、特にコミュニケーション能力が最大の影響を持つことが分かった。
エージェント間通信の設計が、今後のマルチエージェントシステム開発における鍵になりそうだ。
Qwen 3.5 122B HereticをStrix Haloで動かす――コミュニティの挑戦
LocalLLaMAコミュニティで、Qwen 3.5 122B(A10B=10Bアクティブパラメータ)のROCmFP4 iMatrix量子化版が公開された。AMD Strix Halo(統合メモリ)環境で、122B総パラメータ・10Bアクティブで60.70 GiBのメモリ使用量、28.45 tok/sの生成速度を達成している。
また同コミュニティでは「384GB(RTX PRO 6000 x4)があれば何を動かすか」という議論も活発で、DeepSeek V4 Flashや複数モデルの並行稼働など、エンタープライズ用途でのローカルLLM運用に向けた実践的な知見が交わされている。