Qwen3.6-27B-MTP

更新
05.10.2026
思考
ツール利用
画像認識

Qwen3.6-27B-MTPは、Multi-Token Predictionヘッドを有効にして動作するQwen3.6-27Bです。モデルが各ステップで複数のトークン候補を生成し、ローカルでの生成を高速化します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 27.8Bのデンスモデル、Qwen3.6-27Bと同じ重み
  • コンテキスト長: 262,144トークン、1,010,000まで拡張可能
  • モダリティ: テキストと画像の入力
  • 最小ハードウェア要件: GGUFはUD-IQ2_Mで11 GB、Q4_K_Mで17.1 GB

Qwen3.6-27B-MTPとは?

Qwen3.6-27B-MTPは、Multi-Token Predictionヘッドを有効にして動作するQwen3.6-27Bです。QwenはMTPヘッドを複数ステップで学習させ、その内容をモデルカードに記載しています。これにより、推論基盤は1回の順伝播で複数のトークン候補を生成し、まとめて検証できます。これは、別のドラフトモデルを必要としない投機的デコーディングです。投機的デコーディングとはで解説している仕組みが、チェックポイント自体に組み込まれています。

仕様Qwen3.6-27B-MTP
ベースモデルQwen3.6-27Bと同じ重み
パラメータ数27.8Bのデンスモデル、64層
アーキテクチャハイブリッドアテンション:Gated DeltaNet + Gated Attentionに視覚エンコーダを追加
MTP複数ステップで学習
コンテキスト長標準で262,144、1,010,000まで拡張可能
リリース日2026年4月、GGUFは2026年5月
ライセンスApache 2.0

MTPで変わること

品質は変わらず、変わるのは速度です。MTPでは、モデルが数トークン先まで候補を生成し、メインの順伝播でその1つひとつを検証するため、出力分布は通常のデコーディングと同一です。利点は実際の処理時間の短縮にあります。採用されたトークン候補の処理コストは、完全な順伝播を行う場合よりも大幅に低くなります。効果の大きさは、処理するタスクでの候補の採用率によって決まります。そのため、コーディングや構造化テキストでは特に効果が得られる傾向があります。

Qwenのモデルカードには、推論サーバーを起動するための具体的なコマンドが記載されています。vLLMでは、methodをqwen3_next_mtp、投機的に生成するトークン数を2にした投機的デコーディングの設定を渡します。SGLangでは、speculative-algoをNEXTN、投機的生成のステップ数を3、top-kを1、ドラフトトークン数を4にして起動します。どちらのコマンドでも、262,144トークンのコンテキスト長をすべて維持します。

Qwen3.6-27B-MTPのハードウェア要件

重みが同じなので、必要なメモリ容量はQwen3.6-27Bと同じです。以下のサイズは、MTPテンソルを含むUnslothのGGUFリポジトリに基づきます。

メモリ選ぶビルドファイルサイズ
16 GBUD-IQ2_M11.0 GB
24 GBQ4_K_M17.1 GB
32 GBQ6_K22.9 GB
48 GB以上Q8_029.1 GB

視覚プロジェクタを追加すると、さらに0.93 GB必要です。2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。

Atomic ChatでQwen3.6-27B-MTPを動かす方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザでQwen3.6-27Bを検索し、Download Optionsを開きます。
  3. メモリ容量に収まるビルドを選び、チャットを始めます。

MTPテンソルはGGUFに含まれています。上記のvLLMとSGLangのコマンドは、GPU搭載マシンで投機的デコーディングを使った推論サーバーを動かすためにベンダーが提示している方法です。ほかのモデルはQwenファミリーのページをご覧ください。

Qwen3.6-27B-MTPのライセンス

重みはQwen3.6-27Bと同じくApache 2.0で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。

Hugging Faceからモデルをダウンロード

# Unslothが公開している、MTPテンソルを含むGGUF:
huggingface-cli download unsloth/Qwen3.6-27B-MTP-GGUF --include "*Q4_K_M*"
# 元の重み:
huggingface-cli download Qwen/Qwen3.6-27B
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.6-27B",
    "messages": [{"role": "user", "content": "Refactor this function and explain the change."}]
  }'
# Qwenが推奨するMTPのサービングコマンド(vLLM):
# vllm serve Qwen/Qwen3.6-27B --port 8000 \
#   --reasoning-parser qwen3 \
#   --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
res = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B",
    messages=[{"role": "user", "content": "Summarise this repository layout."}],
)
print(res.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3.6-27B",
  messages: [{ role: "user", content: "Write a Python function that parses a GGUF header." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Multi-Token Predictionヘッドを有効にして動作するQwen3.6-27Bです。QwenはMTPヘッドを複数ステップで学習させているため、推論基盤は1回の順伝播で複数のトークン候補を生成し、まとめて検証できます。これは、別のドラフトモデルを必要としない投機的デコーディングです。重み、品質、262,144トークンのコンテキスト長はQwen3.6-27Bと同じです。

Qwenのモデルカードには、主要な2つの推論基盤ですぐに使えるコマンドが記載されています。vLLMでは、methodをqwen3_next_mtp、num_speculative_tokensを2にした投機的デコーディングの設定を渡します。SGLangでは、speculative-algoをNEXTN、投機的生成のステップ数を3、ドラフトトークン数を4にして起動します。MTPテンソルを含むllama.cpp向けのビルドは、GGUFとして公開されています。

いいえ。投機的デコーディングでは、先のトークン候補を生成し、メインモデルがそのすべてを検証するため、出力分布はモデルを通常どおり実行する場合と一致します。向上するのは生成速度で、高速化の度合いは、処理するタスクで生成されたトークン候補がどれだけ採用されるかによって決まります。

Qwen3.6-27Bと同じです。Q4_K_MのGGUFは17.1 GBなので、24 GBのGPUや32 GBのMacなら余裕を持って動作します。11 GBのUD-IQ2_Mビルドは、16 GBのマシンに収まります。視覚プロジェクタを追加すると、さらに約0.9 GB必要です。