Atomic ChatのModel Hubにはこのモデルが掲載されていますが、2026年9月25日時点のエンジンはMiMoのツール呼び出しの修正より前のバージョンです。ツールを試す場合は、以下で説明する新しいバージョンのllama.cppを単体で使う方法を利用してください。
このガイドでは、次の内容を説明します。
- MiMo-V2.6 9Bとは何かと、Xiaomiのベンチマークが示す結果。
- ダウンロードするGGUFの選び方と、必要なメモリ容量の見積もり方。
- Atomic Chatで見つける方法、またはllama.cppを設定する方法。
MiMo-V2.6 9Bとは?
Xiaomiは2026年9月にMiMo-V2.6-Distill-Qwen-9Bを公開しました。MiMoが生成したデータを使ってQwen3.5-9Bに教師ありファインチューニング(SFT)を施したモデルで、評価はコーディングとエージェントのタスクを中心に行われています。Xiaomiは追加の強化学習実験についても説明しているため、ある結果を公式9Bリポジトリで入手できる重みの結果とみなす前に、その評価で使われたバージョンを確認してください。公式モデルカード。
| 項目 | 公開された9Bチェックポイント |
|---|---|
| ベースモデル | Qwen3.5-9B |
| アーキテクチャ | 線形アテンション層とフルアテンション層を備えたQwen3.5 |
| 入力 | テキストと画像。ローカルで画像を使うには互換性のあるプロジェクターが必要 |
| 設定上の最大コンテキスト長 | 262,144トークン |
| 推論の制御 | チャットテンプレート内のenable_thinking |
| ツール呼び出し | MiMo固有の形式。ランタイムとテンプレートの対応が必要 |
| ライセンスの表記 | XiaomiのリポジトリのメタデータではMIT |
このコンテキスト長の値は、公式設定のmax_position_embeddingsに基づいています。最初は大幅に小さい値にしてください。デスクトップでこの設定上の上限に近づける前に、使用予定のハードウェアで、メモリ使用量と長いプロンプトに対するモデルの挙動の両方を確認してください。
MiMo-V2.6コレクションには、ProとFlashのリリースも含まれています。これらは重みとハードウェア要件が異なる別のモデルです。MiMoカタログには、MiMoファミリーのほかのリリースも掲載されています。このガイドでは、名前がDistill-Qwen-9Bで終わるリポジトリを選んでください。ProやFlashのGGUFを代わりにダウンロードして使うことはできません。
MiMo-V2.6 9Bのベンチマーク
Xiaomiは独自の評価環境で、公開したSFTチェックポイントをQwen3.5-9Bと比較しています。これらは開発元が公開した結果であり、Atomic Chatによるテストでも、以下のGGUFファイルで測定したスコアでもありません。モデルカード、技術レポートの表6。
SWE VerifiedとSWE Proはソフトウェアエンジニアリングを評価します。エージェントのベンチマークは、APIワークフロー(AutomationBench)、ターミナルでのタスク(Terminal Bench)、複数アプリケーションにまたがるツール使用(Toolathlon)、職場のワークフロー(JobBench)を対象としています。
| ベンチマーク | Qwen3.5-9B | MiMo-V2.6 9B SFT |
|---|---|---|
SWE Verified ソフトウェアエンジニアリング | 60.0 | 61.1 |
SWE Pro ソフトウェアエンジニアリング | 32.0 | 44.6 |
AutomationBench v1.0.6 APIワークフロー | 5.0 | 30.3 |
Terminal Bench 2.1 ターミナルエージェント | 27.0 | 37.1 |
Toolathlon-Verified 長期にわたるツール使用 | 25.9 | 35.2 |
JobBench 職場のワークフロー | 2.6 | 18.3 |
スコアは高いほど良好です。Xiaomiは2つのSWEベンチマークについて、タスクごとに3回試行した結果を平均しています。残りの4つは、タスクごとに1回の試行です。
SWE Verifiedの変化はわずかですが、自動化やその他のエージェント評価では、より大きな改善が見られます。ツールへのアクセスと実行条件もこれらの結果に関わっているため、別のエージェントクライアントで動作するGGUFについては、使用予定のリポジトリとタスクでテストする必要があります。
入手できるMiMo-V2.6 9BのGGUFファイル
9月25日の確認では、このモデルのAtomicChat GGUFは見つかりませんでした。代わりに利用できるのは、bartowskiの量子化版とggml-orgのQ8_0変換版です。
以下のサイズはすべて、リポジトリのファイルサイズから計算した10進表記のGBです。ここで選んだ言語モデルの量子化版は、それぞれ単一のファイルです。
| 公開元 | 言語モデルの正確なファイル名 | モデルファイル | 公開元の選定プロジェクターを含むサイズ |
|---|---|---|---|
| bartowski | MiMo-V2.6-Distill-Qwen-9B-Q4_K_M.gguf | 5.84 GB | 6.76 GB |
| bartowski | MiMo-V2.6-Distill-Qwen-9B-Q5_K_M.gguf | 6.88 GB | 7.79 GB |
| bartowski | MiMo-V2.6-Distill-Qwen-9B-Q6_K.gguf | 7.79 GB | 8.71 GB |
| bartowski | MiMo-V2.6-Distill-Qwen-9B-Q8_0.gguf | 9.55 GB | 10.46 GB |
| ggml-org | MiMo-V2.6-Distill-Qwen-9B-Q8_0.gguf | 9.53 GB | 10.15 GB |
bartowskiの合計サイズには、別途ダウンロードする0.92 GBのmmproj-MiMo-V2.6-Distill-Qwen-9B-f16.ggufを使用しています。ggml-orgの合計サイズには、別途ダウンロードする0.62 GBのmmproj-MiMo-V2.6-Distill-Qwen-9B-Q8_0.ggufを使用しています。プロジェクターは、同じ公開元のモデルファイルと組み合わせてください。テキストのみのllama.cppセッションでは省略できます。
メモリに余裕がない場合は、Q4_K_Mから始めてください。形式の基礎については、GGUFと量子化を参照してください。Q5_K_M、Q6_K、Q8_0は重みをより高い精度で保持し、より多くのメモリを必要とします。MiMo固有の量子化精度の測定結果はないため、タスクの品質でこれらを順位付けすることはできません。
ggml-orgの変換版には、説明が公開されているチャットテンプレートのパッチが含まれています。これは引数のシリアライズと、思考部分の開始境界を修正します。以下の単体実行の手順では、GGUF公開元がリンクしているテンプレートをbartowskiのQ4_K_Mに明示的に適用します。
Apple Silicon向けには、MLXコミュニティの変換版もあります。このガイドでは一貫してGGUFとllama.cppを使用しており、MLX変換版はここではテストしていません。
MiMo-V2.6 9Bのハードウェア要件
ディスク容量は、ダウンロードした重みを保存するためのものです。セッションに必要なメモリを見積もるには、読み込んだ重みに実行時の状態と計算用バッファを加え、さらに会話用の容量を確保します。画像を使う場合は、プロジェクターと画像処理用の作業領域も加えてください。
以下はテキストのみで初回テストを行うための計画用の概算であり、実測した最低要件でも、メモリ内に収まることを保証するものでもありません。コンテキスト長は8,192トークン、同時に処理するリクエストは1件から始めてください。
| 使用できるハードウェア | 試す量子化版の第一候補 | メモリの制約 |
|---|---|---|
| 8 GBのNVIDIA GPU | Q4_K_M | 容量に余裕がないため、メモリ確保に失敗した場合はコンテキスト長を短くするか、オフロードする層を減らす |
| 12 GBのNVIDIA GPU | Q5_K_M | コンテキストと画面表示によるVRAM使用量のために余裕を残す |
| 16 GBのNVIDIA GPU | Q6_KまたはQ8_0 | コンテキスト長を伸ばす前や画像を追加する前に、実際に確保されるメモリ量を確認する |
| 16 GBのApple Silicon Mac | Q4_K_M | macOSとほかのアプリが同じメモリプールを共有する |
| 24 GBまたは32 GBのApple Silicon Mac | Q6_KまたはQ8_0 | 実行時バッファ用の容量には余裕が増すが、長いコンテキストについては引き続きテストが必要 |
システムRAMにモデルとその作業用メモリを収められる場合は、CPU推論も選択肢になります。GPUに一部をオフロードする構成でも、システムRAMを使用します。このガイドでは、どのハードウェアでも生成速度を測定していません。
MiMoは、線形アテンションとフルアテンションを組み合わせたQwen3.5の構成を継承しています。従来のフルアテンション用KVキャッシュの計算式だけでは、実行時の状態すべてを捉えることはできません。コンテキスト長とメモリの基本的な関係については、KVキャッシュが保存する内容を参照してください。より長いコンテキスト長を選ぶ前に、モデルを読み込んだプロセスのメモリ使用量を測定してください。ここでは、1トークンあたりのメモリ量は確定していません。
公開されているローカルテスト
公開されている2つのレポートは、特定のMacで得られた結果を示しています。使用した量子化版とワークロードが異なるため、速度を直接比較することはできません。
| テストの著者とハードウェア | ファイルとランタイム | 公開された結果 |
|---|---|---|
| ModelFit、M4 MacBook Pro、16 GBの統合メモリ | ggml-org Q8_0、llama.cpp b11149、Metal、テキストのみ。報告されたコンテキスト長は4,096トークン | 64トークンのプロンプト処理で66.78トークン/秒、32トークンの生成で6.04トークン/秒。2回繰り返して測定。 |
| OFOX、M3 Pro、18 GiBの統合メモリ | bartowski Q3_K_M、llama.cpp b10470。コンテキスト長は2,048トークン、出力上限は256トークン | 3回のコーディング実行で、生成速度は13.7〜15.3トークン/秒でした。3回とも、隣接していない重複を含むケースに失敗しました。 |
ModelFitは、テスト前からスワップを大量に使用していたことを明記しており、後半のコマンド例では測定の説明とは異なるコンテキスト長を指定しています。OFOXの最初の2回の実行は、ブログのビルドと重なっていました。ダウンロード可能なテスト記録には、プロンプトと失敗したケースが保存されています。Q3モデルは読み込めましたが、そのコードはタスクに合格しませんでした。どちらの情報源も、Atomic Chatでの性能を測定したものではありません。
Atomic ChatでMiMo-V2.6 9Bを見つける
互換性の確認、2026年9月25日:Atomic Chat 2.0.44のModel Hubには、GGUFリポジトリが掲載されています。利用可能なllama.cppバックエンドは、エンジンの更新を確認した後もb10809でした。報告されていたMiMoのツールパーサーの問題は、上流のb11102で修正されています。以下のカタログと設定は確認しましたが、Atomic Chatでこのモデルを使ったテキスト、画像、ツールの実行は検証していません。Atomicのリリース、エンジンのマニフェスト、上流の修正。
単体で実行する構成については、llama.cppの手順に進んでください。初回起動時にGGUFを直接ダウンロードするため、以下の任意のAtomicでのダウンロード手順は省略できます。
1. エージェントのワークフローを使う前にエンジンを確認する
Settings > MODEL PROVIDERS > llama.cpp > Engine settingsを開きます。Version & Backendの選択欄にはインストール済みのエンジンが表示され、Check engine updatesではその更新チャンネルを確認できます。調査時点では、そのチャンネルで提供されていたのはまだb10809でした。アプリの更新やこのボタンの操作によってMiMoパーサーの修正が提供されるとは限りません。
エンジン設定にはFit context to device memoryもあります。コンテキスト長を手動で設定する場合はこれをオフにし、8,192トークンから始めてください。
2. 正しいリポジトリを見つける
Atomic Chatを開き、サイドバーでModel Hubを選択して、MiMo-V2.6-Distill-Qwen-9Bを検索します。
公開元とモデルの正式名称の両方を確認してください。検索結果には、abliteration処理を施したバージョンなど、コミュニティが改変したモデルも表示されます。Q4_K_Mにはbartowski/MiMo-V2.6-Distill-Qwen-9B-GGUFを選んでください。
3. 必要に応じてAtomic経由でダウンロードする
Atomic経由でダウンロードするには、モデルカードのDownload Optionsを開き、Q4_K_Mを選択して、Downloadを使います。開始前にディスクの空き容量を確認してください。上の表には、モデルとプロジェクターそれぞれのサイズを示しています。アプリの選択画面に表示される合計サイズを、言語モデルの重みだけのサイズとして扱わないでください。
これらの操作項目は、重みをダウンロードせずに確認しました。
llama.cppでMiMo-V2.6 9Bを実行する
MiMoのツール呼び出しパーサーの修正を利用するには、b11102以降を使ってください。メッセージの形式はテンプレートで制御されるため、コマンドではGGUF公開元がリンクしている修正版テンプレートも読み込みます。この初回セッションでは、Q4_K_Mをテキストのみのモードで使用します。これらの手順は上流のドキュメントとモデルファイルに照らして確認していますが、この記事のためにモデルを実行したわけではありません。
1. 新しいバージョンをビルドする
Git、CMake、C++コンパイラをインストールします。NVIDIA向けのビルドには、動作するCUDAツールキットも必要です。llama.cppを新しいディレクトリにクローンします。
git clone https://github.com/ggml-org/llama.cpp cd llama.cpp
Apple Siliconでは、Metalがデフォルトで有効になっています。
cmake -B build -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j
LinuxでNVIDIAを使う場合は、ビルドの設定時にCUDAを指定します。
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build --config Release -j
使用するプラットフォーム向けのビルドコマンドを実行してから、実行ファイルを確認します。
./build/bin/llama-server --version
これらのシェルの例はmacOSとLinux向けです。Windowsでは、llama.cppのリリースから対応するバイナリを使用し、サーバーのコマンドをコピーする前に、実行ファイルのパスと行継続の記法を使用するシェルに合わせて調整してください。プラットフォームごとの前提条件については、ビルドのドキュメントを参照してください。
2. 修正版のチャットテンプレートをダウンロードする
llama.cppディレクトリで、ggml-orgの公開元がリンクしているテンプレートのリビジョンを保存します。
curl -fL \ 'https://gist.githubusercontent.com/coder543/d8f56cd6db67de4cafbb5bdb6c2dfb4d/raw/2de233e76a97021485d2eaff56699e5a37c9051f/mimo-v2.6-distill-chat-template.jinja' \ -o mimo-v2.6-distill-chat-template.jinja
このコミュニティのパッチは、JSON形式のツール引数と思考部分の境界を処理します。ggml-orgのQ8_0にはすでにこのパッチが組み込まれています。ここではファイルを明示的に指定することで、bartowskiの量子化版で使うテンプレートを明確にします。
3. ローカルサーバーを起動する
初回起動時には、指定したGGUFをHugging Faceからダウンロードして読み込んだ後、リクエストの受け付けを開始します。そのため、ブラウザーのインターフェースを使う間や、別のターミナルからAPIリクエストを送る間は、このターミナルを実行したままにしてください。
./build/bin/llama-server \
-hf bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF \
-hff MiMo-V2.6-Distill-Qwen-9B-Q4_K_M.gguf \
--no-mmproj \
--jinja \
--chat-template-file ./mimo-v2.6-distill-chat-template.jinja \
--chat-template-kwargs '{"enable_thinking":true}' \
--temp 0.6 --top-k 20 --top-p 0.95 --min-p 0 \
-ngl all -c 8192 --parallel 1 \
--host 127.0.0.1 --port 8080 \
--alias mimo-v2.6-9bbartowskiの別の量子化版を使う場合は、-hffの後の値を、GGUFの表にある正確なファイル名に置き換えてください。リポジトリと明示的に指定したテンプレートは変更しないでください。
Temperature、top-k、top-pは、Xiaomiの生成設定に従っています。--min-p 0は、追加のサンプラーフィルターを無効にします。これらの設定で開発元のベンチマーク実行環境が再現されるわけではありません。
--no-mmprojにより、この初回実行はテキストのみになります。これを指定しない場合、Hugging Faceからのモデル読み込み時にプロジェクターが自動取得されることがあります。-ngl allは、全層のGPUオフロードを要求します。メモリが不足する場合は、コンテキスト長を短くするか、allをより少ない層数に置き換えてください。CPU推論には-ngl 0を使います。これらの設定項目は、サーバーのドキュメントで説明されています。
サーバーが待ち受けを開始したと表示されたら、ローカルのインターフェースを開きます。基本的なAPIの確認として、別のターミナルで次を実行します。
curl -f http://127.0.0.1:8080/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "mimo-v2.6-9b",
"messages": [{"role": "user", "content": "What is 15% of 240? Reply with the number only."}],
"chat_template_kwargs": {"enable_thinking": false},
"max_tokens": 128
}'期待される回答は、チャット補完レスポンス内の36です。少ない出力トークン枠を最終回答に使えるよう、思考を無効にしています。ツールは、以下の説明に従って別途テストしてください。
APIを確認したら、ローカルのブラウザーインターフェースで小規模なコード修正を試してください。この演習では、OFOXが公開したテストで失敗した、順序を保持しながら重複を除去する動作を確認します。このガイドでは、この修正用プロンプトを実行していません。
Fix this Python function so it removes duplicate strings while preserving their first appearance:
def unique(items):
return list(set(items))
Include tests for [], ["a", "a"], and ["b", "a", "b"]. The expected results are [], ["a"], and ["b", "a"]. Explain why the original implementation does not guarantee the required order.より大きな変更でモデルを試す前に、返されたテストを自分で実行してください。
4. テキストの確認後に画像やツールを追加する
画像を使う場合は、同じ公開元のリポジトリから、対応するモデルとプロジェクターをダウンロードしてください。Hugging Faceからの読み込み用引数と--no-mmprojの代わりに-m /path/to/model.gguf --mmproj /path/to/projector.ggufを指定して、サーバーを起動します。テンプレートとその他の設定は維持してください。画像リクエストについては、マルチモーダルのドキュメントに従ってください。モデルのみのダウンロードでは、画像エンコーダーは得られません。
ツールを使う場合は、ツールの定義を渡し、返された呼び出しを実行するAPIクライアントを使用してください。クライアントが操作を実行し、その結果をモデルに送り返す必要があります。
確認方法の例として、引数を取らずにlocal-tool-okを返す、local_statusという名前の関数を定義します。モデルにその関数を呼び出すよう依頼してください。クライアントがlocal_statusの構造化された呼び出しを受け取り、関数を実行することを確認します。その結果を会話内で返してください。次のモデルの応答では、その値が使われるはずです。ツールのマークアップが表示されただけでは、クライアントが何かを実行した証拠にはなりません。リクエストの構造は、llama.cppの関数呼び出しガイドで示されています。この記事では、この確認を実行していません。
トラブルシューティング
モデルの実行中にメモリが不足する
読み込みに失敗する場合は、まずQ4_K_Mをテキストのみのモードで使い、GPUオフロードを減らす前に空きメモリを確認してください。長いプロンプトの場合にだけ失敗するなら、コンテキスト長と同時リクエスト数を減らしてください。短いチャットが成功しても、長いコンテキストを処理できる容量があるとは確認できません。
思考タグが表示される、または最終回答が返らない
どのテンプレートが有効になっているか確認してください。最終回答が出る前に推論で出力トークン枠を使い切ることがあるため、修正版テンプレートを明示的に読み込んだうえで、短い診断用リクエストにenable_thinking: falseを指定して試してください。
ツール呼び出しが繰り返される、またはトークン上限まで続く
b11102以降と、MiMoに対応したテンプレートを使っていることを確認してください。報告されていたパーサーの問題はクローズされており、以前の回避策は不要になっている可能性があります。Atomicでは、アプリのバージョンとは別にバックエンドを確認してください。確認した更新チャンネルでは、まだb10809が提供されていました。また、検索経由でダウンロードした場合は、リポジトリの正式名称も確認してください。検索結果には、ここで使用する2つの公開元のモデルと並んで、コミュニティによる改変版も表示されます。
画像入力に失敗する
サーバーが対応するプロジェクターを読み込んでいることと、クライアントが対応形式で画像を送信していることを確認してください。
ローカルのページにアクセスできない
まずサーバーの読み込みエラーを確認し、次にポート8080で待ち受けていることを確認してください。モデルの読み込みが完了してから、ローカルのインターフェースを開いてください。
よくある質問
MiMo-V2.6 9BはMiMo-V2.6 ProやFlashと同じですか?
いいえ。9Bのダウンロード対象は、Qwen3.5-9BをベースにしたMiMo-V2.6-Distill-Qwen-9Bです。ProとFlashは別のリリースです。量子化版を選ぶ前やハードウェアに関する助言に従う前に、リポジトリの正式名称を確認してください。
MiMo-V2.6 9BのGGUFは、どれを第一候補としてダウンロードすべきですか?
小規模なテキストのみの構成では、bartowskiのQ4_K_Mから始めてください。ディスク上のサイズは5.84 GBです。メモリに十分な余裕がある場合、ggml-orgのQ8_0には説明が公開されているテンプレートのパッチが含まれています。ここでは、これらの変換版のタスク品質を比較する測定は行っていません。
MiMo-V2.6 9Bは8 GBのGPUで動作しますか?
短いコンテキストでテキストのみのテストを行うなら、Q4_K_Mが候補になります。ファイルサイズだけを見ればある程度の空き容量が残りますが、全層をオフロードできるかどうかは、実行時バッファ、コンテキスト、その他のVRAM使用量で決まります。8 GBはテスト対象の容量として扱い、動作が保証された最低容量とは考えないでください。
16 GBのMacでMiMo-V2.6 9Bを実行できますか?
Apple SiliconでQ4_K_Mを控えめなコンテキスト長に設定して試し、読み込み後のメモリプレッシャーを確認してください。モデル、macOS、ほかのアプリが統合メモリを共有します。上記のModelFitのQ8_0の結果は、すでにスワップを大量に使用していたマシンで得られたものであり、余裕を持って動作するメモリ容量を示すものではありません。
画像に対応していますか?
公開されたアーキテクチャには視覚エンコーダーが含まれており、bartowskiとggml-orgのリポジトリではプロジェクターファイルが提供されています。画像の利用には、そのプロジェクターと、対応するランタイムおよびクライアントが必要です。Atomic Chatでこのモデルを使った画像推論は、引き続き未検証です。
思考を無効にできますか?
チャットテンプレートはenable_thinking: falseを受け付けます。上記のAPIの例では、chat_template_kwargsを通じて渡しています。使用するクライアントでこの設定を指定できるか確認してください。汎用的な推論の設定項目があるだけでは、テンプレートにその設定が渡された証拠にはなりません。
262,144トークンのコンテキストは、自分のコンピューターのメモリに収まりますか?
その数値は設定上の上限です。デスクトップでのメモリ使用量の見積もりではありません。8,192トークンから始め、読み込んだモデルのメモリ使用量と、長い入力に対する挙動を確認してから増やしてください。
MiMo-V2.6 9BはOllamaで利用できますか?
コミュニティのパッケージがmaternion/mimo-v2.6として公開されており、thinking版とinstruct版があります。このガイドではテストしていません。上記のコマンドは、指定したHugging FaceのGGUFとテンプレートを使用するため、この別パッケージを検証するものではありません。
現在、Atomic Chatで対応していますか?
Atomic Chat 2.0.44のModel Hubには掲載されていますが、完全な互換性は確認されていません。2026年9月25日時点で提供されていたb10809エンジンは、既知のツールパーサーの修正より前のバージョンです。アプリ上での検証が完了していない間は、ツールの実験に新しいllama.cppの単体ビルドを使用してください。
どの構成から始めるべきですか?
初回テストでは、新しいllama.cppビルドでQ4_K_Mを使い、コンテキスト長を8,192トークンに設定して、テキストのみで実行してください。短い回答が返ることを確認したら、メモリの割り当てを増やしたりツールを追加したりする前に、実際に行いたいコーディングタスクを試してください。

