2026年9月28日の海外AIニュースまとめ。XiaomiによるMiMo-V2.6のツール呼び出し不具合の診断と修正、無検閲ローカルLLMを使ったEDR回避のセキュリティ実験、30Bモデルを「幅で半分」にして蒸留した14Bモデル、EC検索向けのリランキングモデル、財務デューデリジェンスのベンチマーク、そして損保ジャパンでのGemini Enterprise大量展開を取り上げる。

Xiaomi、MiMo-V2.6のツール呼び出し連発を診断・修正

先週、MiMo-V2.6-Proがオープンウェイトモデルの首位に立つなど話題になったMiMo-V2.6シリーズについて、Xiaomiが不具合の診断と修正を報告した。同シリーズは、同一またはよく似たツール呼び出しを繰り返してコンテキストを消耗し、タスクが止まってしまうことがあり、特にMiMo Desktop・MiMo Code・OpenCodeで顕著だったという。

原因として挙げられたのは、RLをスケールさせた際の「報酬の盲点(reward blind spot)」。報酬が最終回答の正しさだけを追う設計だと、道中の非効率な振る舞いに報酬がまったく響かず、学習規模が大きくなるほど増幅されてしまう。具体的には、ツール呼び出しの大量連発へのペナルティが「1ターンあたり32回超」で初めて発動する仕組みになっており、しきい値未満の繰り返しは完全に野放しだったという。

修正を軽量な再学習で済ませた点も特徴的だ。繰り返しに特化したRL教師モデルをわずか12ステップ・約7,000例で学習し、MOPDという手法で本体にマージした。フル再学習(mixRL)の約4%のコストで、各種実行環境とコンテキスト長をまたいで繰り返しが大きく減り、ベンチマーク成績は維持されたとされる。

無検閲ローカルLLMがEDR2製品の検知を回避

セキュリティ研究者のEddie Zhang氏が、改変して検閲を外したローカルのQwen 3.8 27Bを使い、Windowsの資格情報を収集するツール(LSASSメモリをダンプする実行ファイル)を検知回避が可能な形に書き換え、最新のEDR(エンドポイント検知・対応)製品2つの検知をすり抜けたと報告した(Cybersecurity News)。

同氏の投稿では、クラウドプロバイダーがガードレールを強くしすぎた結果、正規のセキュリティテストまでブロックされる現状も指摘されている。完全な制御のためにはローカルモデルが現実的な選択肢になる一方、長時間のエージェントタスクをローカルで回す計算コストや運用負担は大きい。「ローカルの無検閲モデルをエージェントとして使い倒すか、クラウドモデルとローカル実行を組み合わせるか」という問いがコミュニティに投げかけられた。

オープンウェイトモデルが誰でも入手できる時代に、ガードレールの緩い派生モデルが既存ツールの改変に使えることを示す事例である。防御側は「ローカルLLMで生成・改変されたマルウェア」を前提とした検知設計を迫られることになりそうだ。

Muse派生の30Bを「幅で半分」に──蒸留だけで作った14B

r/LocalLLaMAのコミュニティ開発者が、Muse-Glimmer-30Bを幅(隠れ層の次元数)で半分に切り詰めて蒸留し直した「Xyntetik-Kvist-14B」を公開した。RLは一切使わず蒸留のみ。どのタイミングで考え、どのツールを呼ぶかの判断はOrnith-1.0-9Bが教師(ポリシーティーチャー)を務め、実際の文章は親モデルが担う分担だという。

出来栄えは数字で語られる。連絡先・天気・航空券・為替・日付・単位・株価などの閉ループタスク60問のうち57問をこなし、親モデルは60問。採点はツール呼び出しを実際に再実行して正解と照合する厳格な方式だ。24GBのGPUにQ8_0(15.4GB)で丸ごと載り、Q5_0ミックスなら10.3GBに収まる。OpenAI・Anthropic・Responses互換のAPIをXyntetik Runner経由で提供するため、既存のエージェントループにそのまま組み込める。

透明性も売りだ。試行はゲート付きで12回、うち完走2回、出荷1回。事前登録(プリレジストレーション)や修正記録、欠陥まで、何がどこで壊れたかを確認できる形で公開されている。ただし算術には電卓ツールが必須で、ないと「2,340の17%」のような計算を間違える――モデルカードに注意書きがある誠実さも含め、個人開発のオープンモデルとして参考になる作りだ。

EC検索に特化したリランカー「ZooWork-ShopRanker」

ウェブ検索向けに訓練されたオープンのリランカーは、EC(電子商取引)検索への転移がうまくいかないことが知られる。トピックの関連性に加えて、ユーザーの好み、商品側の制約、競合商品との比較適合がランキングを左右するためだ。これらの選好シグナルは、本物の検索トラフィックからはきれいなペアラベルが得られにくく、大規模な教師あり学習が難しい。

この課題へのアプローチとして「ZooWork-ShopRanker」が公開された。異なるファミリーの推論LLMパネルを「選好オラクル」として使い、位置バイアスを除去した判定と合意の強さによる段階分け付きで学習ペアを作成。0.6B・4B・8Bの3サイズを展開し、8Bフラッグシップを教師に4Bと0.6Bへ蒸留する構成を取る。

評価には、非公開トラフィックの選好ペア約1万組を使った汚染対策済みベンチマーク「ShopRank-Bench」を導入した。結果は、8Bと4Bが当時最強のオープンリランカー基準を有意に上回り、各モデルは未調整のベースモデル自身を上回り、0.6Bは同サイズ帯の競合を破った。効果はMTEBなど一般ベンチマークにも及ぶという。モデルとベンチマークの両方が公開されており、EC検索の基盤モデル研究のたたき台になりそうだ。

AIエージェントは財務デューデリジェンスをどこまでやれるか

元EYメンバーのチームが、財務デューデリジェンス(DD)の裏方の作業でAIエージェントを試す「FAB(Finance Agents Benchmark)」を公開した。世界経済を支える複雑な財務業務をAIがどこまでこなせるかを測るのが狙いで、ベンチマーク本体はGitHubとHugging Faceで公開されている。

現時点の示唆は明快だ。エージェントは関連する事実を「見つける」ことはできるものの、それを完全で信頼できる分析まで持ち切る(carry through)ことがまだ難しいという。同チームは対象企業の追加と検証モデルの拡大を段階的に進める予定で、金額のかかる実務タスクでのエージェント信頼性をどう測るかという論点をくれるベンチマークになりそうだ。

損保ジャパン、Gemini Enterpriseを約2万人に展開

国内事例として、損保ジャパンがGoogleの「Gemini Enterprise」を従業員約2万人に展開したことが、講演レポートで明かされた(ITmedia)。標準機能やクォータの上限といった制約を、どんな仕組みで補ったのか──その工夫の中身をチーフエンジニアの城市由佳理氏が講演で説明したという。全社展開後に標準機能の制約をどう自前で埋めるかは、大企業での生成AI導入の成否を分ける論点であり、日本企業の参考事例として注目される。