Qwen3.6-27Bとは?
Qwen3.6-27Bは、Qwenチームが開発した27.8Bのデンス型視覚言語モデルで、Qwen3.6シリーズ初のオープンウェイトリリースです。Qwenは、27Bのデンスモデルでフラッグシップ級のコーディング性能を実現するとアピールしています。重みは2026年4月21日にApache 2.0の下でHugging Faceに公開されました。
| 仕様 | Qwen3.6-27B |
|---|---|
| 総パラメータ数 | 27.8B |
| アーキテクチャ | デンスモデル、ハイブリッドアテンション(Gated DeltaNet + Gated Attention)、視覚エンコーダー搭載 |
| 層数 | 64 |
| 層構成 | Gated DeltaNetの3層に続けてGated Attentionの1層を配置し、この構成を16回繰り返す |
| 隠れ次元数 | 5,120 |
| Gated Attentionのヘッド | Q:24、KV:4、ヘッド次元数:256、回転位置埋め込みの次元数:64 |
| Gated DeltaNetのヘッド | V:48、QK:16、ヘッド次元数:128 |
| FFNの中間次元数 | 17,408 |
| トークン埋め込み | 248,320、パディング済み |
| コンテキスト長 | 標準で262,144トークン、YaRNで1,010,000まで拡張可能 |
| モダリティ | テキスト、画像、動画の入力 |
| 推論 | 思考モードはデフォルトで有効、無効化可能。過去のターンも保持可能 |
| 複数トークン予測 | 複数ステップのMTPで学習 |
| 学習段階 | 事前学習と事後学習 |
| 推論提供用のソフトウェアスタック | Transformers, vLLM, SGLang, KTransformers |
| リリース日 | 2026年4月21日 |
| ライセンス | Apache 2.0 |
この構成では、64層のうち48層が線形アテンションを使用し、通常はトークンが増えるたびに大きくなる一般的なKVキャッシュを保持するのは16層だけです。また、複数ステップの複数トークン予測を行うよう学習されているため、順伝播のたびに複数のトークン候補を生成できます。これは投機的デコーディングを支える仕組みと同じです。3.6で新たに追加されたpreserve_thinkingオプションは、過去のメッセージの推論過程を保持します。Qwenは、エージェントの処理ループで同じ推論を無駄に繰り返すことを減らし、KVキャッシュの再利用を改善するために、このオプションを追加しました。
Qwen3.6-27Bのベンチマーク
モデルカードに掲載されたQwenのリリース時の数値では、27BをQwen3.5-27B、Qwen3.5-397B-A17B、Qwen3.6-35B-A3B、Gemma4-31B、Claude 4.5 Opusと比較しています。
| ベンチマーク | Qwen3.6-27B | Qwen3.5-27B | Qwen3.5-397B-A17B | Qwen3.6-35B-A3B | Gemma4-31B | Claude 4.5 Opus |
|---|---|---|---|---|---|---|
SWE-bench Verified ソフトウェア開発 | 77.2 | 75.0 | 76.2 | 73.4 | 52.0 | 80.9 |
SWE-bench Pro 高難度のソフトウェア開発 | 53.5 | 51.2 | 50.9 | 49.5 | 35.7 | 57.1 |
Terminal-Bench 2.0 ターミナル操作エージェント | 59.3 | 41.6 | 52.5 | 51.5 | 42.9 | 59.3 |
SkillsBench エージェントスキル | 48.2 | 27.2 | 30.0 | 28.7 | 23.6 | 45.3 |
LiveCodeBench v6 競技プログラミング | 83.9 | 80.7 | 83.6 | 80.4 | 80.0 | 84.8 |
GPQA Diamond 専門的な科学知識 | 87.8 | 85.5 | 88.4 | 86.0 | 84.3 | 87.0 |
MMLU-Pro 学術知識 | 86.2 | 86.1 | 87.8 | 85.2 | 85.2 | 89.5 |
同じモデルファミリー内では、27Bはここに示したすべての項目でQwen3.5-27Bを上回り、コーディングエージェント関連の項目ではQwen3.5-397B-A17Bを上回っています。表の大半の項目では依然としてClaude 4.5 Opusがリードしていますが、27BはTerminal-Bench 2.0で同等の成績を収め、SkillsBenchでは上回っています。
Qwen自身が強調している点は、この表が扱う範囲よりも限定的です。安定性と実用性をうたい、フロントエンドのワークフローやリポジトリ全体を対象とした推論を、より円滑かつ正確にこなせるとしています。モデルカードには、それを裏付ける数値も掲載されています。Qwen社内のフロントエンド生成ベンチマークであるQwenWebBenchは、3.5 27Bの1068から1487へ、NL2Repoは27.3から36.2へ、SWE-bench Multilingualは69.3から71.3へ向上しています。視覚分野では、MMMUで82.9、字幕付きのVideoMMEで87.7、AndroidWorldで70.3を記録しています。
Qwen3.6-27Bのハードウェア要件
システム要件で確認すべきなのはメモリです。量子化ビルドはコミュニティのリポジトリunsloth/Qwen3.6-27B-GGUFで提供されており、9.39 GBの2-bitファイルから、2つのパートに分割された53.8 GBのBF16エクスポートまであります。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 12 GB | UD-IQ2_XXS | 9.39 GB |
| 16 GB | Q3_K_M | 13.59 GB |
| 20 GB | IQ4_XS | 15.44 GB |
| 24 GB | Q4_K_M | 16.82 GB |
| 32 GB | Q5_K_M | 19.51 GB |
| 48 GB | Q6_K | 22.52 GB |
| 64 GB以上 | Q8_0 | 28.60 GB |
隣り合うビルドのサイズ差は一、二ギガバイトなので、どちらもメモリに収まるなら、大きい方を選んでください。特に重要なのは小さいビルドを選ぶ場合です。12 GBのカードにモデルを収められるのは2-bitファイルだからこそですが、この領域では品質の低下も最も急になります。画像や動画の入力には、同じリポジトリにあるF16で0.93 GBのmmprojファイルも必要です。メインのGGUFファイルと同じ場所に置いてください。この形式に馴染みがなければ、まずGGUFとは何かを読み、次に16 GBのMacに最適なローカルLLMを参照してください。
量子化していない重みについて、QwenはTransformers、vLLM、SGLang、KTransformersを挙げており、本番環境でのスループットを重視する場合はSGLang、KTransformers、vLLMを案内しています。推奨設定は、思考モードではtemperature 1.0、top_p 0.95、top_k 20、正確さが求められるコーディングではtemperature 0.6、思考モードを無効にした場合はtemperature 0.7、top_p 0.80、presence_penalty 1.5で、ほとんどのクエリでは出力を32,768トークンに設定します。メモリが逼迫する場合はコンテキスト長を縮めつつ、少なくとも128Kトークンを確保するよう勧めています。
Atomic ChatでQwen3.6-27Bを動かす方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでQwen3.6-27Bを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで動かせるすべてのQwenモデルをご覧ください。
Qwen3.6-27Bのライセンス
Qwen3.6-27BはApache 2.0の下で公開されており、ライセンスファイルはHugging Faceのリポジトリにあります。このライセンスはロイヤリティなしでの商用利用、改変、再配布を認めているため、このモデルを基に製品を開発し、利用料を支払わずに自分のハードウェアで実行できます。
