MiniMax-M3とは?
MiniMax-M3は、MiniMax Agentプラットフォームや従来のM2シリーズを開発したMiniMaxによる、ネイティブマルチモーダルの混合エキスパートモデルです。総パラメーター数は約428Bですが、トークンごとに有効になるのは約23Bのみです。テキスト、画像、動画を読み取り、コンテキスト長は1Mトークンです。ローカルで使ううえでは、この組み合わせが重要です。最先端規模のモデルでありながら、約23Bのモデルと同程度のコストでデコードでき、注意機構の設計によって膨大なコンテキストの処理コストも抑えています。重みは2026年6月2日にMiniMax Community Licenseの下でHugging Faceに公開されました。
| 仕様 | MiniMax-M3 |
|---|---|
| 総パラメーター数 | ~428B |
| 有効パラメーター数 | トークンあたり~23B |
| アーキテクチャ | MiniMax Sparse Attention(MSA)を採用した混合エキスパート |
| コンテキスト長 | 1Mトークン |
| モダリティ | テキスト・画像・動画入力、テキスト出力 |
| 推論 | 有効(enabled)、自動判断(adaptive)、無効(disabled)の三つのモード |
| リリース日 | 2026年6月2日 |
| ライセンス | MiniMax Community License |
特徴的なのは注意機構の層です。MiniMax Sparse Attention(MSA)は百万トークン規模のコンテキスト向けに設計されたスパース注意演算で、MiniMaxは具体的な数値も示しています。コンテキスト長が1Mの場合、M3はM2よりプリフィルが9倍、デコードが15倍高速で、トークンあたりの計算量は1/20に削減されています。推論は、三つのモードを持つthinkingパラメーターで制御します。enabledでは常に推論し、adaptiveでは追加の思考が有効かどうかをモデルが判断し、disabledでは推論を省略してレイテンシーを最小に抑えます。MiniMaxはtemperatureを1.0、top_pを0.95に設定することを推奨しています。
MiniMax-M3が得意なこと
MiniMaxはM3を、コーディングと協働作業向けのモデルとして位置づけています。モデルが計画を立て、ツールを呼び出し、多くのステップにわたって試行を繰り返す、長期的なエージェント作業が対象です。モデルカードでは、長期的なエージェント作業の各種ベンチマークで最先端水準の性能を主張しています。ただし、比較は数値表ではなくグラフ画像として公開されているため、ここに転載できる正確なスコアはありません。二つ目の柱はネイティブマルチモーダル対応です。M3は後から視覚エンコーダーを追加したのではなく、学習の最初のステップから複数のモダリティを混在させて学習しています。MiniMaxは、これによってテキスト、画像、動画の意味情報をより深く融合できると説明しています。
三つ目は長いコンテキストへの対応です。MSAの効率に関する数値は、コンテキスト長を最大の1Mまで使って測定されています。つまり、コンテキストは宣伝文句にとどまらず、実際に使うことを前提に設計されています。Atomic Chat以外では、MiniMaxはモデルのサービングにSGLang、vLLM、Transformers、KTransformersを、GGUFにはUnslothを、MXFP4/MXFP8にはATOMを推奨しています。
MiniMax-M3のハードウェア要件
システム要件で確認すべきなのはメモリです。428Bのモデルには大量のメモリが必要です。MiniMaxが案内しているGGUFビルドはunsloth/MiniMax-M3-GGUFにあります。各ビルドは約50 GBずつの分割ファイル一式として配布されており、以下のサイズはビルドごとの合計です。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 160 GB | UD-IQ2_M | 134.2 GB |
| 192 GB | UD-IQ3_XXS | 159.4 GB |
| 256 GB | UD-IQ4_NL | 211.8 GB |
| 384 GB | UD-Q5_K_XL | 318.5 GB |
| 512 GB以上 | Q8_0 | 452.7 GB |
リポジトリ内で最小のビルドであるUD-IQ1_Mでも、合計サイズは128.4 GBです。そのため、システムとコンテキストキャッシュが使う分も考えると、128 GBのマシンでは最低限必要な容量に届きません。二つのビルドがどちらも収まる場合は大きいほうを選びますが、十分な空き容量を確保してください。これほど長いコンテキストでは、重みに加えてメモリが必要になります。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでMiniMax-M3を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでMiniMax-M3を検索し、Download Optionsを開きます。
- 使用できるメモリ容量に収まるビルドを選び、チャットを開始します。
お使いのマシンが上の表に該当しない場合は、ローカルで実行できるMiniMaxモデルの一覧、または前世代のMiniMax-M2.7をご覧ください。
MiniMax-M3のライセンス
MiniMax-M3はMiniMax Community Licenseの下で配布されています。これは標準的なオープンソースライセンスではなく、提供元独自の利用条件で、Hugging Faceでは「other」に分類されています。重みはダウンロード可能な形で公開されており、モデルカードにもローカル環境へのデプロイ方法が直接記載されています。ただし、正確な条件はリポジトリのLICENSEファイルに記載されているため、このモデルを利用した商用製品を開発する前に確認してください。
