MiniMax-M2.5

更新
04.10.2026
思考
ツール利用
推論
コード生成
ウェブ検索

MiniMaxが開発した、エージェントによるコーディング、ツール利用、検索向けのMoEモデルです。パラメータ数は229B(アクティブパラメータ数は10B)で、コンテキスト長は200Kです。

基本情報

  • ライセンス: Modified MIT
  • パラメータ数: 合計228.7B
  • コンテキスト長: MiniMaxのモデルカードには記載されていません
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ96 GB。最小のGGUFビルドである55.8 GBのUD-TQ1_0を実行する場合

MiniMax-M2.5とは?

MiniMax-M2.5は、総パラメータ数228.7BのMiniMax製オープンウェイトモデルで、数十万の複雑な実世界環境で強化学習を行っています。MiniMaxは、コーディング、エージェントによるツール利用と検索、オフィス業務で最先端(SOTA)の性能を持つと位置づけています。また、ネイティブで毎秒100トークンの速度で提供し、その速度で1時間連続生成した場合の費用を$1に設定しています。重みは2026年2月12日にModified MITライセンスでHugging Faceに公開され、量子化されたGGUFビルドは最小55.8 GBです。

仕様MiniMax-M2.5
総パラメータ数228.7B
モダリティテキスト入力、テキスト出力
バージョンM2.5(50 tokens/s)とM2.5-Lightning(100 tokens/s)。能力は同一です
学習200,000以上の実世界環境での強化学習
API料金入力1,000,000トークンあたり$0.30、出力1,000,000トークンあたり$2.40(Lightning)。M2.5の料金はその半額です
推奨サンプリング設定temperature 1.0、top_p 0.95、top_k 40
リリース日2026年2月12日
ライセンスModified MIT

特徴的なのは、コーディングの学習です。M2.5は、Go、C++、TypeScript、Rust、Kotlin、Python、Java、PHPなど十を超える言語にわたる200,000以上の環境で学習しました。MiniMaxは、フロントエンドのデモだけでなく、サーバー側のAPIやデータベースを備えたWeb、Android、iOS、Windowsのプロジェクトを使い、システム設計と環境構築、機能の反復改善、コードレビュー、システムテストまで、開発ライフサイクル全体にわたって学習させています。学習中には、ある習慣が生まれました。コードを書く前に、経験豊富なソフトウェアアーキテクトのようにプロジェクトを分解し、機能、構造、UIを計画します。実際の処理も高速です。SWE-bench Verifiedのタスクにかかる時間は平均22.8分で、Claude Opus 4.6の22.9分と同等ですが、タスクあたりの費用は約十分の一です。

MiniMax-M2.5のベンチマーク

MiniMaxが主に掲げる数値は、エージェントとしての性能を測るものです。SWE-bench Verifiedで80.2、Multi-SWE-Benchで51.3、コンテキスト管理を使用したBrowseCompで76.3を記録しています。モデルカードの付録には、Claude、Gemini、GPTの各モデルと汎用能力を比較する表も掲載されています。

ベンチマークMiniMax-M2.5MiniMax-M2.1Claude Sonnet 4.5Claude Opus 4.5Claude Opus 4.6Gemini 3 ProGPT-5.2 (thinking)
AIME25
競技数学
86.383.088.091.095.696.098.0
GPQA-D
専門的な科学問題
85.283.083.087.090.091.090.0
HLE w/o tools
専門知識を問う問題
19.422.217.328.430.737.231.4
SciCode
科学分野のコーディング
44.441.045.050.052.056.052.0
IFBench
指示への追従
70.070.057.058.053.070.075.0
AA-LCR
長いコンテキストでの推論
69.562.066.074.071.071.073.0

M2.5はこれらのどの項目でも首位ではありませんが、最下位でもありません。IFBenchではClaudeの3モデルすべてを上回り、70.0でGemini 3 Proと並んでいます。また、GPQA-D、ツールなしのHLE、AA-LCRではClaude Sonnet 4.5を上回っています。試験形式の評価スコアが売りというわけではありません。同じモデルカードのコーディングの節では、MiniMaxが首位となる結果が二つ報告されています。どちらも異なるコーディングエージェントの実行基盤でSWE-bench Verifiedを実行した結果です。DroidではM2.5が79.7、Claude Opus 4.6が78.9で、OpenCodeではそれぞれ76.1、75.9でした。

MiniMax-M2.5のハードウェア要件

システム要件で確認すべきなのはメモリです。以下のビルドはunsloth/MiniMax-M2.5-GGUFリポジトリで配布されています。大半は分割ファイルで提供されるため、記載したサイズは全ファイルの合計です。ファイルサイズに含まれるのは重みだけなので、メモリ欄の値にはKVキャッシュやシステムのほかの処理に必要な余裕を持たせています。

メモリ推奨ビルドファイルサイズ
96 GBUD-TQ1_055.8 GB
128 GBUD-Q2_K_XL85.9 GB
192 GBUD-Q4_K_XL131.3 GB
256 GBQ5_K_M162.3 GB
384 GB以上Q8_0243.1 GB

二つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。1ビットと2ビットのファイルは品質の低下が最も大きいため、メモリに余裕があれば、より大きいビルドに切り替えてください。元の重みを使って推論サービスを提供する場合、MiniMaxはSGLang、vLLM、Transformers、KTransformersを推奨しています。量子化ファイルを初めて使う方は、GGUFとは何かからご覧ください。

Atomic ChatでMiniMax-M2.5を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでMiniMax-M2.5を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、関連モデルのMiniMax-M3のページも含め、ローカルで実行できるMiniMaxモデルをすべてご覧ください。

MiniMax-M2.5のライセンス

MiniMax-M2.5はModified MITライセンスで提供されています。正確な条文は、MiniMax-M2.5のGitHubリポジトリにあるLICENSEファイルに記載されています。基となるMITライセンスは、ロイヤリティなしでの商用利用、改変、再配布を認めています。このモデルを使って製品を開発する前に、変更された条項を確認してください。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download MiniMaxAI/MiniMax-M2.5
# vLLMで推論を提供:
vllm serve MiniMaxAI/MiniMax-M2.5 --trust-remote-code --tensor-parallel-size 2
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.5",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}],
    "temperature": 1.0,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("MiniMaxAI/MiniMax-M2.5", trust_remote_code=True, device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MiniMaxAI/MiniMax-M2.5", trust_remote_code=True)
messages = [{"role": "user", "content": "Write a Python function to reverse a linked list."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=512, temperature=1.0, top_p=0.95)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "MiniMaxAI/MiniMax-M2.5",
  messages: [{ role: "user", content: "Plan the file structure for a CLI todo app." }],
  temperature: 1.0,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

MiniMax-M2.5は、総パラメータ数229BのMixture-of-Experts(MoE)モデルで、トークンごとに約10Bのパラメータがアクティブになります。各順伝播で8個のエキスパートを有効にすることで、はるかに大きなデンスモデルの能力を維持しながら、推論コストを低く抑えています。

アクティブになるパラメータは10Bだけですが、MiniMax-M2.5は229Bすべての重みをメモリに保持する必要があります。fp8の重みは約230 GBなので、24 GBの一般消費者向けGPUが1基だけでは足りません。実用的なローカル構成には、VRAMとシステムRAMの合計で96 GB以上が必要です。例えば、2x H100 80 GB、または複数の一般消費者向けGPUとCPUオフロードを組み合わせた構成です。量子化されたGGUFビルドではサイズを縮小できます。3ビット量子化では約101 GBとなり、80 GBのH100で毎秒約25トークンの速度で動作します。

重みはModified MITライセンスでHugging Faceに公開されているため、モデルのダウンロード、実行、ファインチューニング、商用利用が可能です。学習データとパイプライン全体は公開されていないため、完全なオープンソースではなく、オープンウェイトです。MiniMaxはホスト型APIも提供しており、M2.5の料金は入力1,000,000トークンあたり約$0.30、出力1,000,000トークンあたり約$2.40です。

MiniMax-M2.5は約204,800トークン(約200K)のコンテキスト長に対応しています。この余裕は、エージェントの長時間実行、大規模なコードベース、複数文書を対象とする検索タスクに適しています。非常に長いブラウジングセッションでは、トークン使用量が増えると履歴を破棄するように設計されており、MiniMaxが報告しているBrowseCompの結果もこの方式によるものです。

MiniMax-M2.5は、エージェントによるコーディングとツール利用向けに設計されています。報告されているスコアは、SWE-Bench Verifiedで80.2%、Multi-SWE-Benchで51.3%、BrowseCompで76.3%です。十を超えるプログラミング言語にわたる200,000以上の実世界環境で学習しています。WordやPowerPointを使う業務、Excelでの財務モデリングなどのオフィス業務にも対応します。モデルは行動する前に段階的に思考し、ネイティブで最大毎秒100トークンの速度で動作します。