Qwen3.6-27B

更新
05.10.2026
ツール利用
思考
埋め込み
画像認識
推論
コード生成
多言語

Qwen3.6-27Bは、262Kのコンテキスト長を備え、思考モードがデフォルトで有効な27.8Bのデンス型視覚言語モデルです。GGUFビルドは最小9.39 GBで、12 GBのマシンで動作します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 27.8B、デンスモデル
  • コンテキスト長: 262,144トークン、YaRNで1,010,000まで拡張可能
  • モダリティ: テキスト、画像、動画の入力
  • 最小ハードウェア要件: 12 GBのRAMまたはVRAM、最小のGGUFビルドは9.39 GB

Qwen3.6-27Bとは?

Qwen3.6-27Bは、Qwenチームが開発した27.8Bのデンス型視覚言語モデルで、Qwen3.6シリーズ初のオープンウェイトリリースです。Qwenは、27Bのデンスモデルでフラッグシップ級のコーディング性能を実現するとアピールしています。重みは2026年4月21日にApache 2.0の下でHugging Faceに公開されました。

仕様Qwen3.6-27B
総パラメータ数27.8B
アーキテクチャデンスモデル、ハイブリッドアテンション(Gated DeltaNet + Gated Attention)、視覚エンコーダー搭載
層数64
層構成Gated DeltaNetの3層に続けてGated Attentionの1層を配置し、この構成を16回繰り返す
隠れ次元数5,120
Gated AttentionのヘッドQ:24、KV:4、ヘッド次元数:256、回転位置埋め込みの次元数:64
Gated DeltaNetのヘッドV:48、QK:16、ヘッド次元数:128
FFNの中間次元数17,408
トークン埋め込み248,320、パディング済み
コンテキスト長標準で262,144トークン、YaRNで1,010,000まで拡張可能
モダリティテキスト、画像、動画の入力
推論思考モードはデフォルトで有効、無効化可能。過去のターンも保持可能
複数トークン予測複数ステップのMTPで学習
学習段階事前学習と事後学習
推論提供用のソフトウェアスタックTransformers, vLLM, SGLang, KTransformers
リリース日2026年4月21日
ライセンスApache 2.0

この構成では、64層のうち48層が線形アテンションを使用し、通常はトークンが増えるたびに大きくなる一般的なKVキャッシュを保持するのは16層だけです。また、複数ステップの複数トークン予測を行うよう学習されているため、順伝播のたびに複数のトークン候補を生成できます。これは投機的デコーディングを支える仕組みと同じです。3.6で新たに追加されたpreserve_thinkingオプションは、過去のメッセージの推論過程を保持します。Qwenは、エージェントの処理ループで同じ推論を無駄に繰り返すことを減らし、KVキャッシュの再利用を改善するために、このオプションを追加しました。

Qwen3.6-27Bのベンチマーク

モデルカードに掲載されたQwenのリリース時の数値では、27BをQwen3.5-27B、Qwen3.5-397B-A17B、Qwen3.6-35B-A3B、Gemma4-31B、Claude 4.5 Opusと比較しています。

ベンチマークQwen3.6-27BQwen3.5-27BQwen3.5-397B-A17BQwen3.6-35B-A3BGemma4-31BClaude 4.5 Opus
SWE-bench Verified
ソフトウェア開発
77.275.076.273.452.080.9
SWE-bench Pro
高難度のソフトウェア開発
53.551.250.949.535.757.1
Terminal-Bench 2.0
ターミナル操作エージェント
59.341.652.551.542.959.3
SkillsBench
エージェントスキル
48.227.230.028.723.645.3
LiveCodeBench v6
競技プログラミング
83.980.783.680.480.084.8
GPQA Diamond
専門的な科学知識
87.885.588.486.084.387.0
MMLU-Pro
学術知識
86.286.187.885.285.289.5

同じモデルファミリー内では、27Bはここに示したすべての項目でQwen3.5-27Bを上回り、コーディングエージェント関連の項目ではQwen3.5-397B-A17Bを上回っています。表の大半の項目では依然としてClaude 4.5 Opusがリードしていますが、27BはTerminal-Bench 2.0で同等の成績を収め、SkillsBenchでは上回っています。

Qwen自身が強調している点は、この表が扱う範囲よりも限定的です。安定性と実用性をうたい、フロントエンドのワークフローやリポジトリ全体を対象とした推論を、より円滑かつ正確にこなせるとしています。モデルカードには、それを裏付ける数値も掲載されています。Qwen社内のフロントエンド生成ベンチマークであるQwenWebBenchは、3.5 27Bの1068から1487へ、NL2Repoは27.3から36.2へ、SWE-bench Multilingualは69.3から71.3へ向上しています。視覚分野では、MMMUで82.9、字幕付きのVideoMMEで87.7、AndroidWorldで70.3を記録しています。

Qwen3.6-27Bのハードウェア要件

システム要件で確認すべきなのはメモリです。量子化ビルドはコミュニティのリポジトリunsloth/Qwen3.6-27B-GGUFで提供されており、9.39 GBの2-bitファイルから、2つのパートに分割された53.8 GBのBF16エクスポートまであります。

メモリ選択するビルドファイルサイズ
12 GBUD-IQ2_XXS9.39 GB
16 GBQ3_K_M13.59 GB
20 GBIQ4_XS15.44 GB
24 GBQ4_K_M16.82 GB
32 GBQ5_K_M19.51 GB
48 GBQ6_K22.52 GB
64 GB以上Q8_028.60 GB

隣り合うビルドのサイズ差は一、二ギガバイトなので、どちらもメモリに収まるなら、大きい方を選んでください。特に重要なのは小さいビルドを選ぶ場合です。12 GBのカードにモデルを収められるのは2-bitファイルだからこそですが、この領域では品質の低下も最も急になります。画像や動画の入力には、同じリポジトリにあるF16で0.93 GBのmmprojファイルも必要です。メインのGGUFファイルと同じ場所に置いてください。この形式に馴染みがなければ、まずGGUFとは何かを読み、次に16 GBのMacに最適なローカルLLMを参照してください。

量子化していない重みについて、QwenはTransformers、vLLM、SGLang、KTransformersを挙げており、本番環境でのスループットを重視する場合はSGLang、KTransformers、vLLMを案内しています。推奨設定は、思考モードではtemperature 1.0、top_p 0.95、top_k 20、正確さが求められるコーディングではtemperature 0.6、思考モードを無効にした場合はtemperature 0.7、top_p 0.80、presence_penalty 1.5で、ほとんどのクエリでは出力を32,768トークンに設定します。メモリが逼迫する場合はコンテキスト長を縮めつつ、少なくとも128Kトークンを確保するよう勧めています。

Atomic ChatでQwen3.6-27Bを動かす方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen3.6-27Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで動かせるすべてのQwenモデルをご覧ください。

Qwen3.6-27Bのライセンス

Qwen3.6-27BはApache 2.0の下で公開されており、ライセンスファイルはHugging Faceのリポジトリにあります。このライセンスはロイヤリティなしでの商用利用、改変、再配布を認めているため、このモデルを基に製品を開発し、利用料を支払わずに自分のハードウェアで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3.6-27B
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3.6-27B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3.6-27Bは、Qwen(Alibaba Cloud)が開発した27.8Bパラメータのマルチモーダル言語モデルで、デンスモデルです。テキスト、画像、動画を扱い、推論とツール呼び出しに対応し、262,144トークンのコンテキスト長を備えています。重みはApache-2.0の下で公開されているため、APIを使わずにAtomic Chatでローカル実行できます。

Q4_K_Mの重みは約16.8 GBで、16 GBのVRAMには重み全体を載せられません。本文では24 GBクラスを目安にしていますが、KVキャッシュ、実行環境、画像用のmmprojにも追加のメモリが必要です。Q3_K_Mのファイルも約13.6 GBあるため、12 GBで収まるとは言えません。CPUへのオフロードやコンテキスト長の調整で必要なVRAMは変わります。

はい。Qwen3.6-27BはApache-2.0ライセンスの下で公開されており、商用環境への導入を含め、ロイヤリティや利用料なしで無料で使えます。Hugging Faceから重みをダウンロードし、自分のハードウェアで費用をかけずに実行できます。

はい。重みをダウンロードすれば、ネットワーク接続なしで、すべての処理を自分のマシン上で実行できます。Atomic Chatではプロンプト、コード、ファイルがデバイスの外に出ることは一切ないため、機密性が求められる作業や、ネットワークから隔離された環境での作業に適しています。

最も得意とするのはエージェントによるコーディングです。Qwenの報告では、SWE-bench Verifiedで77.2を記録し、より大規模なQwen3.5-397B-A17Bを上回っています。また、標準でマルチモーダルに対応しており、画像、OCR文書、長時間の動画を読み取れます。さらに、複数ステップのエージェントタスクに向けたツール呼び出しと思考モードにも対応しています。