MiniMax-M3

更新
04.10.2026
思考
画像認識
推論
コード生成

427BのMoEモデル、MiniMax-M3をAtomic Chatでローカル実行。プライバシーを守りながら、オフラインで長いコンテキストを使った推論ができます。APIキー不要、制限なし。無料です。

基本情報

  • ライセンス: MiniMax Community License
  • パラメーター数: 総数~428B、有効~23B(MoE)
  • コンテキスト長: 1Mトークン
  • モダリティ: テキスト・画像・動画入力
  • 最小ハードウェア要件: メモリ160 GB、最小のGGUFの合計サイズは128.4 GB

MiniMax-M3とは?

MiniMax-M3は、MiniMax Agentプラットフォームや従来のM2シリーズを開発したMiniMaxによる、ネイティブマルチモーダルの混合エキスパートモデルです。総パラメーター数は約428Bですが、トークンごとに有効になるのは約23Bのみです。テキスト、画像、動画を読み取り、コンテキスト長は1Mトークンです。ローカルで使ううえでは、この組み合わせが重要です。最先端規模のモデルでありながら、約23Bのモデルと同程度のコストでデコードでき、注意機構の設計によって膨大なコンテキストの処理コストも抑えています。重みは2026年6月2日にMiniMax Community Licenseの下でHugging Faceに公開されました。

仕様MiniMax-M3
総パラメーター数~428B
有効パラメーター数トークンあたり~23B
アーキテクチャMiniMax Sparse Attention(MSA)を採用した混合エキスパート
コンテキスト長1Mトークン
モダリティテキスト・画像・動画入力、テキスト出力
推論有効(enabled)、自動判断(adaptive)、無効(disabled)の三つのモード
リリース日2026年6月2日
ライセンスMiniMax Community License

特徴的なのは注意機構の層です。MiniMax Sparse Attention(MSA)は百万トークン規模のコンテキスト向けに設計されたスパース注意演算で、MiniMaxは具体的な数値も示しています。コンテキスト長が1Mの場合、M3はM2よりプリフィルが9倍、デコードが15倍高速で、トークンあたりの計算量は1/20に削減されています。推論は、三つのモードを持つthinkingパラメーターで制御します。enabledでは常に推論し、adaptiveでは追加の思考が有効かどうかをモデルが判断し、disabledでは推論を省略してレイテンシーを最小に抑えます。MiniMaxはtemperatureを1.0、top_pを0.95に設定することを推奨しています。

MiniMax-M3が得意なこと

MiniMaxはM3を、コーディングと協働作業向けのモデルとして位置づけています。モデルが計画を立て、ツールを呼び出し、多くのステップにわたって試行を繰り返す、長期的なエージェント作業が対象です。モデルカードでは、長期的なエージェント作業の各種ベンチマークで最先端水準の性能を主張しています。ただし、比較は数値表ではなくグラフ画像として公開されているため、ここに転載できる正確なスコアはありません。二つ目の柱はネイティブマルチモーダル対応です。M3は後から視覚エンコーダーを追加したのではなく、学習の最初のステップから複数のモダリティを混在させて学習しています。MiniMaxは、これによってテキスト、画像、動画の意味情報をより深く融合できると説明しています。

三つ目は長いコンテキストへの対応です。MSAの効率に関する数値は、コンテキスト長を最大の1Mまで使って測定されています。つまり、コンテキストは宣伝文句にとどまらず、実際に使うことを前提に設計されています。Atomic Chat以外では、MiniMaxはモデルのサービングにSGLang、vLLM、Transformers、KTransformersを、GGUFにはUnslothを、MXFP4/MXFP8にはATOMを推奨しています。

MiniMax-M3のハードウェア要件

システム要件で確認すべきなのはメモリです。428Bのモデルには大量のメモリが必要です。MiniMaxが案内しているGGUFビルドはunsloth/MiniMax-M3-GGUFにあります。各ビルドは約50 GBずつの分割ファイル一式として配布されており、以下のサイズはビルドごとの合計です。

メモリ選択するビルドファイルサイズ
160 GBUD-IQ2_M134.2 GB
192 GBUD-IQ3_XXS159.4 GB
256 GBUD-IQ4_NL211.8 GB
384 GBUD-Q5_K_XL318.5 GB
512 GB以上Q8_0452.7 GB

リポジトリ内で最小のビルドであるUD-IQ1_Mでも、合計サイズは128.4 GBです。そのため、システムとコンテキストキャッシュが使う分も考えると、128 GBのマシンでは最低限必要な容量に届きません。二つのビルドがどちらも収まる場合は大きいほうを選びますが、十分な空き容量を確保してください。これほど長いコンテキストでは、重みに加えてメモリが必要になります。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでMiniMax-M3を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでMiniMax-M3を検索し、Download Optionsを開きます。
  3. 使用できるメモリ容量に収まるビルドを選び、チャットを開始します。

お使いのマシンが上の表に該当しない場合は、ローカルで実行できるMiniMaxモデルの一覧、または前世代のMiniMax-M2.7をご覧ください。

MiniMax-M3のライセンス

MiniMax-M3はMiniMax Community Licenseの下で配布されています。これは標準的なオープンソースライセンスではなく、提供元独自の利用条件で、Hugging Faceでは「other」に分類されています。重みはダウンロード可能な形で公開されており、モデルカードにもローカル環境へのデプロイ方法が直接記載されています。ただし、正確な条件はリポジトリのLICENSEファイルに記載されているため、このモデルを利用した商用製品を開発する前に確認してください。

Hugging Faceからモデルをダウンロード

huggingface-cli download MiniMaxAI/MiniMax-M3
from transformers import AutoModel
model = AutoModel.from_pretrained("MiniMaxAI/MiniMax-M3")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

MiniMax-M3は、MiniMaxAIが開発した、重みが公開されている混合エキスパート型の言語モデルです。総パラメーター数は約427Bで、トークンごとに有効になるのは約23Bです。ネイティブマルチモーダルに対応し、MiniMax Sparse Attentionによって1,048,576トークンのコンテキストを処理します。コーディング、エージェント処理、推論のタスクを対象としています。重みをダウンロードし、Atomic Chatを通じてローカルで実行できます。

かなり高いスペックが必要です。最小のGGUF量子化版でもディスク上で約128GBあるため、KVキャッシュを加えると、RAMまたはユニファイドメモリは少なくとも130GB以上を見込んでください。512GBのMac Studio M3 Ultraでは長い生成を実行でき、GPUサーバーでは通常、8分割のテンソル並列処理を使用します。一般的なノートパソコンや、単体のコンシューマー向けGPUで使うモデルではありません。

重みは誰でもダウンロードして自分で実行できるよう公開されているため、Atomic Chatを通じたローカル利用ではトークン単位の料金はかかりません。独自の「other」ライセンスで公開されているため、商用利用の前にHugging FaceでMiniMaxAIの利用条件を確認してください。MiniMaxAI自身がホストするAPIは別のサービスで、トークン単位で課金されます。

はい。Hugging Faceから重みをダウンロードした後は、インターネット接続を必要とせず、モデルをすべて自分のハードウェア上で実行できます。Atomic Chatではプロンプトとファイルが端末内にとどまります。これが、クラウドAPIを呼び出す代わりにセルフホストする主な理由です。

最も得意とする分野はコーディングとエージェント型ワークフローで、MiniMaxAIはSWE-Bench Proで約59%と報告しています。コンテキスト長が1Mトークンあるため、コードベース全体や大量の文書群を対象とした推論に役立ちます。また、ネイティブの視覚対応により、テキストとともにスクリーンショット、図、グラフを読み取れます。