Qwen3.6-27B-MTPとは?
Qwen3.6-27B-MTPは、Multi-Token Predictionヘッドを有効にして動作するQwen3.6-27Bです。QwenはMTPヘッドを複数ステップで学習させ、その内容をモデルカードに記載しています。これにより、推論基盤は1回の順伝播で複数のトークン候補を生成し、まとめて検証できます。これは、別のドラフトモデルを必要としない投機的デコーディングです。投機的デコーディングとはで解説している仕組みが、チェックポイント自体に組み込まれています。
| 仕様 | Qwen3.6-27B-MTP |
|---|---|
| ベースモデル | Qwen3.6-27Bと同じ重み |
| パラメータ数 | 27.8Bのデンスモデル、64層 |
| アーキテクチャ | ハイブリッドアテンション:Gated DeltaNet + Gated Attentionに視覚エンコーダを追加 |
| MTP | 複数ステップで学習 |
| コンテキスト長 | 標準で262,144、1,010,000まで拡張可能 |
| リリース日 | 2026年4月、GGUFは2026年5月 |
| ライセンス | Apache 2.0 |
MTPで変わること
品質は変わらず、変わるのは速度です。MTPでは、モデルが数トークン先まで候補を生成し、メインの順伝播でその1つひとつを検証するため、出力分布は通常のデコーディングと同一です。利点は実際の処理時間の短縮にあります。採用されたトークン候補の処理コストは、完全な順伝播を行う場合よりも大幅に低くなります。効果の大きさは、処理するタスクでの候補の採用率によって決まります。そのため、コーディングや構造化テキストでは特に効果が得られる傾向があります。
Qwenのモデルカードには、推論サーバーを起動するための具体的なコマンドが記載されています。vLLMでは、methodをqwen3_next_mtp、投機的に生成するトークン数を2にした投機的デコーディングの設定を渡します。SGLangでは、speculative-algoをNEXTN、投機的生成のステップ数を3、top-kを1、ドラフトトークン数を4にして起動します。どちらのコマンドでも、262,144トークンのコンテキスト長をすべて維持します。
Qwen3.6-27B-MTPのハードウェア要件
重みが同じなので、必要なメモリ容量はQwen3.6-27Bと同じです。以下のサイズは、MTPテンソルを含むUnslothのGGUFリポジトリに基づきます。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 16 GB | UD-IQ2_M | 11.0 GB |
| 24 GB | Q4_K_M | 17.1 GB |
| 32 GB | Q6_K | 22.9 GB |
| 48 GB以上 | Q8_0 | 29.1 GB |
視覚プロジェクタを追加すると、さらに0.93 GB必要です。2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。
Atomic ChatでQwen3.6-27B-MTPを動かす方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザでQwen3.6-27Bを検索し、Download Optionsを開きます。
- メモリ容量に収まるビルドを選び、チャットを始めます。
MTPテンソルはGGUFに含まれています。上記のvLLMとSGLangのコマンドは、GPU搭載マシンで投機的デコーディングを使った推論サーバーを動かすためにベンダーが提示している方法です。ほかのモデルはQwenファミリーのページをご覧ください。
Qwen3.6-27B-MTPのライセンス
重みはQwen3.6-27Bと同じくApache 2.0で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。
