9月22日、Xiaomiの「MiMo-V2.6-Pro」が評価ベンチマークでオープンウェイトモデルの首位に立ったと伝えられました。前回は同シリーズの「MiMo-V2.6-Flash-RL」の公開をお伝えしましたが、今回はProの評価詳細と、Qwen3.5-9Bをベースにした9Bの蒸留モデル、さらに既存モデルを「後から」高速化する試みなど、オープンモデル研究の水位が一段と上がるニュースがそろいました。
Xiaomi「MiMo-V2.6-Pro」がオープンウェイト首位──RL1本を約260万ドル・130時間で(前回から更新)
Latent Spaceのまとめによれば、MiMo-V2.6-Proは総パラメータ1.02兆・アクティブ42BのMoEモデルで、評価機関Artificial AnalysisのIntelligence Indexで46点を獲得し、オープンウェイトモデルとして首位にデビューしたといいます。API価格は入力100万トークンあたり0.435ドル、出力0.87ドルと低価格帯で、ライセンスはMITです。同シリーズには、品質を保ったまま出力速度を最大20倍に高める「MiMo-V2.6-Pro-UltraSpeed」も用意されています。
注目すべきはRL(強化学習)のスケーリング手法です。報じられているところでは、この結果を支えたRLの訓練ラン1本は130時間・750億トークン・約260万ドル(見出し上は300万ドル規模と表記)で回ったといい、事前学習の巨人級の投資と比べて桁違いに安いコストでフロンティアに近い性能に届きつつあります。訓練はJAXとTPU上に構築されており、スケーリングは「ほぼ設定の変更」で済むという指摘もあります。
さらにXiaomiは、RL環境のコードと訓練レシピをすでに公開しており、約7,000件のRL環境の公開も予定しています(7,000件超のタスクデータセットは未リリース)。前回触れた「最終RL訓練ランをライブ公開」という異例の透明性と合わせ、高品質なオープンなRL環境が、前サイクルにおける事前学習コーパスと同じ戦略的重要性を持つ可能性が指摘されている点が興味深いところです。
Qwen3.5-9Bベースの「MiMo-V2.6-Distill-Qwen-9B」──9Bサイズでエージェント性能が跳ね上がる
あわせて公開されたのが、Qwen3.5-9BをMiMo生成データで教師ありファインチューニングした9Bのエージェントモデル「MiMo-V2.6-Distill-Qwen-9B」です。Hugging Faceのトレンド上位に浮上し、Redditのr/LocalLLaMAでも話題になっています。
ベースのQwen3.5-9Bからの向上幅が大きいのが特徴で、技術報告の数値では、SWE Verified(avg@3)が60.0→61.1、SWE Proが32.0→44.6、社内ベンチマークのMiMo Code(mini)は19.5→51.6、MiMo Cyber(mini)は5.7→31.3、AutomationBenchは5.0→30.3、JobBenchは2.6→18.3と、エージェント系のタスクで大きく伸びています。
学習データはコード・汎用エージェント・視覚コーディング・サイバーセキュリティの4領域をカバーする77.4Bトークン(うち損失計算対象27.2Bトークン)。Xiaomi自身が「エージェントRL研究の出発点となるSFTチェックポイント」と位置づけており、フロンティアのRLレシピを小さいモデルで追試する土台として、ローカルLLM界隈への影響もありそうです。
Model Grafting──既存モデルを「後から」エンコーダー・デコーダー化、128K処理が最大3.7倍に
DeepSeek-V4.1-Flashが示した「因果エンコーダー・デコーダー」構成(プロンプト処理を担うエンコーダー部と生成を担うデコーダー部を分けるアーキテクチャ)は、本来スクラッチからの訓練が必要でした。「Model Grafting」と呼ばれる手法は、これを既存モデルに事後適用しようという試みです。
具体的には、モデルをある深さで切断し、下層にプロンプトを読み込ませ、上層をデコーダーとして使います。下層の出力は単位行列で初期化したアダプタを経由してprefix KVとして上層に供給し、その後、改変していない親モデルからの自己蒸留で性能を回復させます。デコード部分の構造は元のままです。
r/LocalLLaMAに投稿された実装では、Qwen3.5-4Bにこのレシピを適用した2つのバリアント(graft8/graft16)が公開されています。graft8は128Kプロンプトの処理が約3.7倍高速化する一方で精度はやや低下、graft16は2.0倍高速化で精度低下は最小限にとどまるといいます。長いプロンプトの前処理は推論コストに直結するため、再訓練なしに既存モデルを高速化できるこの方向性は、実運用側にも大きな意味を持ちそうです。
Complex KDA──Kimi Delta Attentionの表現力を拡張する研究が公開
効率的なアテンション手法のひとつ、Kimi Delta Attention(KDA)の表現力を拡張する研究「Complex KDA(CKDA)」が公開されました。OpenEuroLLMなどのチームによるもので、著者にはFrank Hutter氏やAaron Klein氏らが名を連ねます。
deltaルールベースの線形RNNは効率的な反面、低ランクの更新しかできないため表現力が制限されます。従来は2つのdeltaルール遷移を合成して2D回転を表現していましたが、この方法はランクと更新コストが増える難点がありました。CKDAが着目したのは、KDAのチャネル方向ゲートが「2つ目の反射」として使えるという点です。ゲートの値域を[−1,1]、deltaルールの係数βを[0,2]へ拡張するだけで、単一の遷移で2D回転を表現できるようになります。
しかも遷移はdiagonal-plus-rank-oneかつ非膨張のまま保たれるため、KDAの安定性と効率を損なわずに、DeltaProduct2相当の状態追跡表現力に到達するといいます。効率的アテンションの系譜における着実な前進として注目される研究です。
OmniEdu──K-12教育のためのオープン基盤モデルファミリー
K-12(小中高校相当)の学習と教育のためのオープン基盤モデルファミリー「OmniEdu」が公開されました。4B・9B・27Bの3サイズで展開されています。
特色は、教育に必要な能力を「教科の力」「カリキュラム接地」「診断的推論」「教育的支援(足場かけ)」の4軸で整理し、100以上の教育リソースと一般の指示データをこの軸に沿って再構成した点です。決定論的なクリーニング、意味の監査と書き換え、タスク別の品質スコアリング、トークン予算を考慮した多様性選択までをパイプライン化し、69,999例・約1,596万応答トークン(うち60,951例が教育固有)の学習データを構築しました。
27BモデルはK12-Benchで63.12% EM/76.69% F1、MathFishで85.89%、EDUMATHで86.95%などを達成。教育向けのチューニングは3つの教育系ベンチグループすべてをモデル規模を問わず改善し、一般能力を大きく損なわなかったといいます。教育×LLMは実用性の高い領域だけに、日本語での同等の取り組みを考える上でも参考になりそうです。
日本語圏では──QiitaでJevの実践記が相次ぐ
日本語圏では、意思決定に特化した構造化モデル「Jev」の実践記がQiitaに相次ぎました。日本語の問い合わせ54件を窓口ごとに振り分け、モデルが出すconfidenceの値で「人が確認する件数」を決めるという実測記事や、Amazonのレビュー1,000件を感情分析させた記事、「Jev AIとは?」という解説記事などが並んでいます。
またVercelが「What you can build with TypeSafe AI Jev」というユースケース集のページを公開し、Hacker Newsでも取り上げられています。ここ数日、Jev関連の話題はほぼ毎日登場していますが、分類・ルーティングといった「地味な」用途にこれほど需要があることが可視化されてきたのは、特化モデルという方向性の実需を示唆しているようにみえます。
そのほかの動き
英フィナンシャル・タイムズは、AI企業の従業員たちが「AIが社会にもたらす脅威」への恐怖から精神的な負担を訴えていると報じました。安全性への懸念を抱えながら開発を続ける当事者の実態として、注目される報道です。
企業文書のRAG取り込みを検索前提で行うチャンキング手法「D-RAC」も公開されました。任意のフォーマットをPDFに正規化してページ画像化し、マルチモーダルLLM1回のパスで検索に最適化したMarkdownへ変換するもので、テーブルの各行を列ヘッダ付きの自己完結した文に変えるなど、検索精度を意識した設計が特徴です。
また、Apple Silicon向けMLXフレームワーク「oMLX」の作者でメンテナーのJun Kim氏がHugging Faceに加わり、MLXコミュニティの支援を担当すると発表されました。
