MiMo-V2.5-Pro

更新
05.10.2026
ツール利用
思考
推論
コード生成
多言語

MiMo-V2.5-Proは、総パラメータ数1.02T、アクティブパラメータ数42B、コンテキスト長1MトークンのXiaomi製MoEモデルです。MITライセンスで公開されています。最小のGGUFビルドは304 GBです。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計1.02T、アクティブ42B
  • コンテキスト長: 1Mトークン
  • モダリティ: テキスト(英語と中国語)
  • 最小ハードウェア要件: 最小のGGUFビルド(UD-IQ1_M)に304 GBのメモリ

MiMo-V2.5-Proとは?

MiMo-V2.5-Proは、Xiaomiがこれまでに公開した中で最も高性能なオープンソースモデルです。総パラメータ数1.02T、トークンあたりのアクティブパラメータ数42B、最大コンテキスト長1MトークンのMixture-of-Expertsネットワークを採用しています。Xiaomiは、負荷の高いエージェント処理、複雑なソフトウェアエンジニアリング、長期にわたるタスク向けに開発し、数千回のツール呼び出しを通じても一貫性を維持するとしています。重みは2026年4月にMITライセンスでHugging Faceに公開されました。

仕様MiMo-V2.5-Pro
総パラメータ数1.02T
アクティブパラメータ数トークンあたり42B
アーキテクチャMoE、ルーティング対象のエキスパート384個、トークンあたり8個
層数70(デンス層1 + MoE層69)
隠れ層の次元数6144
アテンションハイブリッド:スライディングウィンドウアテンション60層、フルアテンション10層
アテンションヘッド数クエリ128、KV 8(GQA)
ヘッドの次元数QK 192、V 128
フィードフォワード層の幅エキスパートあたり2048、デンス層16384(層0)
コンテキスト長1Mトークン(Baseチェックポイントでは256K)
複数トークン予測デンスFFNを備えた3個のMTPモジュール
事前学習27兆トークン、FP8混合精度、ネイティブのコンテキスト長32k
事後学習SFT、エージェント向けRL、複数教師によるオンポリシー蒸留
重みの精度FP8(E4M3)混合精度
言語英語と中国語
公開日2026年4月27日
ライセンスMIT

1Mのコンテキスト長を実用的にしているのは、アテンションの設計です。70層のうち60層はウィンドウ幅128トークンのスライディングウィンドウアテンションを使い、グローバルアテンションを維持するのは10層だけです。Xiaomiによると、この6:1の交互配置によってKVキャッシュの保存容量をほぼ7分の1に削減し、学習可能なアテンションシンクのバイアスによって長いコンテキストでの品質を維持しています。三つのMTPモジュールは軽量なデンスFFNであり、従来の投機的デコーディングとは異なり、Xiaomiは学習と推論にネイティブに統合しています。同社によると、これらのモジュールによって推論時の出力速度が三倍になります。

MiMo-V2.5-Proのベンチマーク

Xiaomiのモデルカードには、事前学習済みベースモデルのスコアと、MiMo-V2.5、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2との比較が掲載されています。比較対象はすべてベース版です。

ベンチマークMiMo-V2.5-ProMiMo-V2.5DeepSeek-V4-ProDeepSeek-V4-FlashKimi-K2
MMLU
一般知識
89.486.390.188.787.8
MMLU-Pro
学術知識
68.565.873.568.369.2
GPQA-Diamond
専門的な科学知識
66.758.1--48.1
GSM8K
小学校の算数
99.683.392.690.892.1
MATH
高度な数学
86.267.764.557.470.2
LiveCodeBench v6
競技プログラミング
39.635.5--26.3
SWE-Bench (AgentLess)
ソフトウェアエンジニアリング
35.730.8--28.2

このベースモデルは、上記の数学とコーディングの全項目で首位です。GSM8Kは99.6で、MATHでは掲載された競合のうち最も近いモデルに16ポイントの差をつけています。より大規模な1.6TモデルであるDeepSeek-V4-Proは、幅広い知識を測るMMLUとMMLU-Proで首位を維持しています。また、科学とコーディングの項目ではDeepSeekの列が空欄のため、これらの項目での勝利はMiMo-V2.5とKimi-K2だけを比較対象としています。全項目で勝っているわけではありません。Xiaomiのより詳しい表では、HumanEval+でKimi-K2が84.8なのに対し、このモデルは75.6です。

Xiaomiは、GraphWalksによる長いコンテキストでの評価結果も公開しています。GraphWalksはOpenAIのベンチマークで、16進ハッシュをノードとする有向グラフでプロンプトを埋め、指定した深さまでの幅優先探索、またはあるノードの親を求めます。Anthropicが説明した修正を適用し、32kから1Mまでの全範囲で採点しています。MiMo-V2.5-Proのスコアは、512kでBFSが0.56、Parentsが0.92、1Mではそれぞれ0.37と0.62です。一方、以前のV2 Proは128kを超えると急速に性能が低下し、1Mでは両サブタスクとも0.00になります。エージェントとしての振る舞いは、MiMo-V2-Flashの三段階の学習手順に由来します。選別したペアによるSFT、数学・安全性・ツール使用それぞれに別の教師モデルを用いる分野別RL、そして複数教師によるオンポリシー蒸留です。最後の段階では、一つの生徒モデルが、これらの教師からトークン単位の指導を受けながら自身の出力を使って学習します。

MiMo-V2.5-Proのハードウェア要件

システム要件で確認すべきなのはメモリです。1.02Tパラメータのモデルは、大幅に量子化しても約304 GBからとなります。Xiaomiはサーバー側での提供向けにFP8の重みを公開しています。以下のGGUFビルドはunsloth/MiMo-V2.5-Pro-GGUFで公開されているコミュニティ製の量子化版で、サイズは分割ファイルの合計です。

メモリ選ぶビルドファイルサイズ
320 GBUD-IQ1_M304.1 GB
384 GBUD-Q2_K_XL338.4 GB
512 GBUD-IQ3_XXS412.7 GB
640 GBUD-Q4_K_S588.6 GB
768 GBUD-Q4_K_M629.6 GB
896 GBUD-Q5_K_M758.0 GB
1 TBUD-Q6_K846.6 GB
1.5 TB以上Q8_01087.5 GB

二つのビルドがどちらもKVキャッシュ用の余裕を残してメモリに収まるなら、大きい方を選んでください。これは最初の二つの行で特に重要です。UD-IQ1_MのサイズはQ8_0の四分の一をわずかに上回る程度で、この領域では品質が最も急激に低下します。Xiaomiのデプロイに関する説明では、SGLangとvLLMが挙げられており、どちらも実装手順をまとめたガイドが公開されています。また、ローカルでの実行にはtemperature 1.0とtop_p 0.95を推奨しています。同社のSGLangコマンドは、16分割のテンソル並列化とEAGLEによる投機的デコーディングを使い、コンテキスト長を最大の1,048,576トークンに設定してFP8の重みで推論を提供します。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic ChatでMiMo-V2.5-Proを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでMiMo-V2.5-Proを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、ローカルで実行できるMiMoモデルの一覧をご覧ください。より小さいモデルを探す場合は、全モデルのカタログをご覧ください。

MiMo-V2.5-Proのライセンス

MiMo-V2.5-Proは、最も制約の少ないライセンスの一つであるMITライセンスで公開されています。商用利用、改変、再配布がロイヤリティなしで認められており、唯一の義務は、著作権表示とライセンス表示をコードとともに保持することです。Xiaomiは自社のMiMo APIプラットフォームでもこのモデルを提供していますが、MITライセンスの条件により、量子化の有無にかかわらず、自分で重みを実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro
from transformers import AutoModel
model = AutoModel.from_pretrained("XiaomiMiMo/MiMo-V2.5-Pro")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

MiMo-V2.5-Proは、Xiaomi(XiaomiMiMo)が重みを公開しているMixture-of-Experts言語モデルで、総パラメータ数は約1023.2B、トークンあたりのアクティブパラメータ数は約42Bです。エージェントによるツール使用、ソフトウェアエンジニアリング、長期にわたる推論向けに開発され、コンテキスト長は1,048,576トークンです。重みはMITライセンスでHugging Faceに公開されています。

モデル全体が大きいため、コンシューマー向けGPUが一枚あるだけでは足りません。すべての重みを使って実行するには、現実的には80GBクラスのカードによるマルチGPU構成(H100を2枚など)、または複数枚のRTX 4090が必要です。量子化ビルドなら必要なメモリを減らせますが、小規模なローカルLLMと比べると、依然として負荷の高いモデルです。

はい。重みはMITライセンスで公開されているため、モデルをダウンロードして自分で実行する場合、ライセンス料はかかりません。必要な費用は、実行するためのハードウェア代または電気代だけです。MITライセンスでは商用利用と改変も認められています。

はい。Hugging Faceから重みを一度ダウンロードすれば、すべての推論は自分のマシン上で行われ、ネットワーク接続は不要です。Atomic Chatでは、モデルの読み込みから実行まですべてデバイス上で行われるため、プロンプトや出力がコンピューターの外に出ることはありません。

長時間にわたる多段階のエージェントワークフロー、コーディングタスク、大規模な入力に対する推論を想定しています。ツール呼び出しをネイティブにサポートし、多数のツール呼び出しにまたがる一連のタスクを継続できます。また、1Mトークンのコンテキストにより、大規模なコードベースや文書群を一度に処理できます。英語と中国語の両方に対応しています。