MiMo-V2.5-Proとは?
MiMo-V2.5-Proは、Xiaomiがこれまでに公開した中で最も高性能なオープンソースモデルです。総パラメータ数1.02T、トークンあたりのアクティブパラメータ数42B、最大コンテキスト長1MトークンのMixture-of-Expertsネットワークを採用しています。Xiaomiは、負荷の高いエージェント処理、複雑なソフトウェアエンジニアリング、長期にわたるタスク向けに開発し、数千回のツール呼び出しを通じても一貫性を維持するとしています。重みは2026年4月にMITライセンスでHugging Faceに公開されました。
| 仕様 | MiMo-V2.5-Pro |
|---|---|
| 総パラメータ数 | 1.02T |
| アクティブパラメータ数 | トークンあたり42B |
| アーキテクチャ | MoE、ルーティング対象のエキスパート384個、トークンあたり8個 |
| 層数 | 70(デンス層1 + MoE層69) |
| 隠れ層の次元数 | 6144 |
| アテンション | ハイブリッド:スライディングウィンドウアテンション60層、フルアテンション10層 |
| アテンションヘッド数 | クエリ128、KV 8(GQA) |
| ヘッドの次元数 | QK 192、V 128 |
| フィードフォワード層の幅 | エキスパートあたり2048、デンス層16384(層0) |
| コンテキスト長 | 1Mトークン(Baseチェックポイントでは256K) |
| 複数トークン予測 | デンスFFNを備えた3個のMTPモジュール |
| 事前学習 | 27兆トークン、FP8混合精度、ネイティブのコンテキスト長32k |
| 事後学習 | SFT、エージェント向けRL、複数教師によるオンポリシー蒸留 |
| 重みの精度 | FP8(E4M3)混合精度 |
| 言語 | 英語と中国語 |
| 公開日 | 2026年4月27日 |
| ライセンス | MIT |
1Mのコンテキスト長を実用的にしているのは、アテンションの設計です。70層のうち60層はウィンドウ幅128トークンのスライディングウィンドウアテンションを使い、グローバルアテンションを維持するのは10層だけです。Xiaomiによると、この6:1の交互配置によってKVキャッシュの保存容量をほぼ7分の1に削減し、学習可能なアテンションシンクのバイアスによって長いコンテキストでの品質を維持しています。三つのMTPモジュールは軽量なデンスFFNであり、従来の投機的デコーディングとは異なり、Xiaomiは学習と推論にネイティブに統合しています。同社によると、これらのモジュールによって推論時の出力速度が三倍になります。
MiMo-V2.5-Proのベンチマーク
Xiaomiのモデルカードには、事前学習済みベースモデルのスコアと、MiMo-V2.5、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2との比較が掲載されています。比較対象はすべてベース版です。
| ベンチマーク | MiMo-V2.5-Pro | MiMo-V2.5 | DeepSeek-V4-Pro | DeepSeek-V4-Flash | Kimi-K2 |
|---|---|---|---|---|---|
MMLU 一般知識 | 89.4 | 86.3 | 90.1 | 88.7 | 87.8 |
MMLU-Pro 学術知識 | 68.5 | 65.8 | 73.5 | 68.3 | 69.2 |
GPQA-Diamond 専門的な科学知識 | 66.7 | 58.1 | - | - | 48.1 |
GSM8K 小学校の算数 | 99.6 | 83.3 | 92.6 | 90.8 | 92.1 |
MATH 高度な数学 | 86.2 | 67.7 | 64.5 | 57.4 | 70.2 |
LiveCodeBench v6 競技プログラミング | 39.6 | 35.5 | - | - | 26.3 |
SWE-Bench (AgentLess) ソフトウェアエンジニアリング | 35.7 | 30.8 | - | - | 28.2 |
このベースモデルは、上記の数学とコーディングの全項目で首位です。GSM8Kは99.6で、MATHでは掲載された競合のうち最も近いモデルに16ポイントの差をつけています。より大規模な1.6TモデルであるDeepSeek-V4-Proは、幅広い知識を測るMMLUとMMLU-Proで首位を維持しています。また、科学とコーディングの項目ではDeepSeekの列が空欄のため、これらの項目での勝利はMiMo-V2.5とKimi-K2だけを比較対象としています。全項目で勝っているわけではありません。Xiaomiのより詳しい表では、HumanEval+でKimi-K2が84.8なのに対し、このモデルは75.6です。
Xiaomiは、GraphWalksによる長いコンテキストでの評価結果も公開しています。GraphWalksはOpenAIのベンチマークで、16進ハッシュをノードとする有向グラフでプロンプトを埋め、指定した深さまでの幅優先探索、またはあるノードの親を求めます。Anthropicが説明した修正を適用し、32kから1Mまでの全範囲で採点しています。MiMo-V2.5-Proのスコアは、512kでBFSが0.56、Parentsが0.92、1Mではそれぞれ0.37と0.62です。一方、以前のV2 Proは128kを超えると急速に性能が低下し、1Mでは両サブタスクとも0.00になります。エージェントとしての振る舞いは、MiMo-V2-Flashの三段階の学習手順に由来します。選別したペアによるSFT、数学・安全性・ツール使用それぞれに別の教師モデルを用いる分野別RL、そして複数教師によるオンポリシー蒸留です。最後の段階では、一つの生徒モデルが、これらの教師からトークン単位の指導を受けながら自身の出力を使って学習します。
MiMo-V2.5-Proのハードウェア要件
システム要件で確認すべきなのはメモリです。1.02Tパラメータのモデルは、大幅に量子化しても約304 GBからとなります。Xiaomiはサーバー側での提供向けにFP8の重みを公開しています。以下のGGUFビルドはunsloth/MiMo-V2.5-Pro-GGUFで公開されているコミュニティ製の量子化版で、サイズは分割ファイルの合計です。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 320 GB | UD-IQ1_M | 304.1 GB |
| 384 GB | UD-Q2_K_XL | 338.4 GB |
| 512 GB | UD-IQ3_XXS | 412.7 GB |
| 640 GB | UD-Q4_K_S | 588.6 GB |
| 768 GB | UD-Q4_K_M | 629.6 GB |
| 896 GB | UD-Q5_K_M | 758.0 GB |
| 1 TB | UD-Q6_K | 846.6 GB |
| 1.5 TB以上 | Q8_0 | 1087.5 GB |
二つのビルドがどちらもKVキャッシュ用の余裕を残してメモリに収まるなら、大きい方を選んでください。これは最初の二つの行で特に重要です。UD-IQ1_MのサイズはQ8_0の四分の一をわずかに上回る程度で、この領域では品質が最も急激に低下します。Xiaomiのデプロイに関する説明では、SGLangとvLLMが挙げられており、どちらも実装手順をまとめたガイドが公開されています。また、ローカルでの実行にはtemperature 1.0とtop_p 0.95を推奨しています。同社のSGLangコマンドは、16分割のテンソル並列化とEAGLEによる投機的デコーディングを使い、コンテキスト長を最大の1,048,576トークンに設定してFP8の重みで推論を提供します。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic ChatでMiMo-V2.5-Proを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでMiMo-V2.5-Proを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
ほかのラインアップについては、ローカルで実行できるMiMoモデルの一覧をご覧ください。より小さいモデルを探す場合は、全モデルのカタログをご覧ください。
MiMo-V2.5-Proのライセンス
MiMo-V2.5-Proは、最も制約の少ないライセンスの一つであるMITライセンスで公開されています。商用利用、改変、再配布がロイヤリティなしで認められており、唯一の義務は、著作権表示とライセンス表示をコードとともに保持することです。Xiaomiは自社のMiMo APIプラットフォームでもこのモデルを提供していますが、MITライセンスの条件により、量子化の有無にかかわらず、自分で重みを実行できます。
