Qwen3.6-35B-A3Bとは?
Qwen3.6-35B-A3Bは、Qwenチームが開発した混合エキスパート(MoE)方式の視覚言語モデルで、Qwen3.6で初めて重みが公開されたバリアントです。総パラメータ数は35Bですが、トークンごとにアクティブになるのは3Bのみです。そのため、35Bモデル相当のメモリを必要としながら、各トークンを3Bモデル相当の計算コストで生成します。このリリースは、エージェントによるコーディングを軸に、フロントエンドのワークフロー、リポジトリ全体を対象とする推論、ターン間で推論コンテキストを保持する新しいオプションに重点を置いています。Qwenは2026年4月15日にApache 2.0の下で重みを公開しました。
| 仕様 | Qwen3.6-35B-A3B |
|---|---|
| 総パラメータ数 | 35B、トークンごとに3Bがアクティブ |
| アーキテクチャ | ハイブリッドアテンション(Gated DeltaNet + Gated Attention)を採用したMoE |
| エキスパート | 256、ルーティングで選ばれる8 + 共有の1がアクティブ |
| 層数 | 40 |
| コンテキスト長 | 標準で262,144トークン、最大1,010,000まで拡張可能 |
| モダリティ | テキスト、画像、動画の入力 |
| 推論 | 思考モードはデフォルトで有効、APIパラメータで無効化可能 |
| 複数トークン予測 | 複数ステップで学習 |
| リリース日 | 2026年4月15日 |
| ライセンス | Apache 2.0 |
隠れ層では、各ブロックの出力をMoEブロックに渡す3つのGated DeltaNetブロックに続き、出力をMoEブロックに渡す1つのGated Attentionブロックを配置する構成を10回繰り返します。そのため、4層中3層がGated DeltaNetを使用し、Gated Attention層では16個のクエリヘッドに対して2個のキー/バリューヘッドを使用します。各層は256個のエキスパートのプールを通じてルーティングを行い、トークンごとにアクティブになるのは、ルーティングで選ばれる8個のエキスパートと1個の共有エキスパートだけです。このモデルは、投機的デコーディングの基盤となる仕組みである複数トークン予測(Multi-Token Prediction)向けにも学習されています。そのため、対応する推論基盤では、1回の順伝播で複数のトークン候補を生成できます。3.6で新たに導入されたのが、思考の保持です。preserve_thinkingオプションを有効にすると、モデルは以前のメッセージの推論過程を保持します。Qwenによると、これによりエージェントのループ内で意思決定の一貫性が向上し、冗長な推論トークンを削減できます。
Qwen3.6-35B-A3Bのベンチマーク
モデルカードに掲載されたQwenのリリース時の数値では、35B-A3BをQwen3.5-27B、前世代のQwen3.5-35B-A3B、Gemma4-31B、Gemma4-26B-A4Bと比較しています。
| ベンチマーク | Qwen3.6-35B-A3B | Qwen3.5-27B | Qwen3.5-35B-A3B | Gemma4-31B | Gemma4-26B-A4B |
|---|---|---|---|---|---|
SWE-bench Verified ソフトウェア開発 | 73.4 | 75.0 | 70.0 | 52.0 | 17.4 |
SWE-bench Pro 高難度のソフトウェア開発 | 49.5 | 51.2 | 44.6 | 35.7 | 13.8 |
Terminal-Bench 2.0 ターミナル操作エージェント | 51.5 | 41.6 | 40.5 | 42.9 | 34.2 |
Claw-Eval Avg エージェントによるコーディング | 68.7 | 64.3 | 65.4 | 48.5 | 58.8 |
NL2Repo リポジトリ全体のコーディング | 29.4 | 27.3 | 20.5 | 15.5 | 11.6 |
GPQA 専門レベルの科学 | 86.0 | 85.5 | 84.2 | 84.3 | 82.3 |
AIME26 数学競技 | 92.7 | 92.6 | 91.0 | 89.2 | 88.3 |
新モデルは、掲載した7項目のうち、Terminal-Bench 2.0、Claw-Eval Avg、NL2Repo、GPQA、AIME26の5項目で最高スコアを記録しています。SWE-benchの2項目ではQwen3.5-27Bのスコアが高く、Verifiedでは73.4に対して75.0、Proでは49.5に対して51.2です。Qwenの表にあるほかの項目でも、Qwen3.5-27BはSWE-bench Multilingualで67.2に対して69.3、Tool Decathlonで26.9に対して31.5、MCP-Atlasで62.8に対して68.4、WideSearchで60.1に対して66.4を記録しています。35B-A3Bは、QwenWebBenchで1068点に対して1397点、MCPMarkで36.3に対して37.0、SkillsBench Avg5で27.2に対して28.7と上回っています。Qwenは視覚ベンチマークの表も公開しています。そこでは35B-A3BがRealWorldQAで85.3、OmniDocBench1.5で89.9、VideoMMMUで83.7、ODInW13で50.8を記録しており、Qwen3.5-35B-A3Bのスコアはそれぞれ84.1、89.3、80.4、42.6です。
Qwen3.6-35B-A3Bのハードウェア要件
システム要件で確認すべきなのはメモリです。GGUFビルドの配布元はunsloth/Qwen3.6-35B-A3B-GGUFリポジトリで、以下のサイズはそこに掲載されている実際のファイルサイズです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 12 GB | UD-IQ2_M | 11.52 GB |
| 16 GB | UD-IQ3_S | 13.68 GB |
| 24 GB | UD-IQ4_XS | 17.73 GB |
| 32 GB | UD-Q4_K_XL | 22.36 GB |
| 48 GB以上 | UD-Q6_K_XL | 31.84 GB |
サイズが隣り合うファイルの差は1〜2ギガバイトなので、2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。画像や動画の入力には、同じリポジトリにあるmmprojファイルが必要で、重みに加えて約0.9 GBを使用します。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen3.6-35B-A3Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでQwen3.6-35B-A3Bを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
ほかのラインアップについては、ローカルで実行できるQwenモデルの一覧をご覧ください。
Qwen3.6-35B-A3Bのライセンス
Qwen3.6-35B-A3BはApache 2.0の下で公開されており、リポジトリにはライセンスファイルが含まれています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を許可しています。そのため、重みをファインチューニングしたり、自社製品に組み込んで配布したり、自分のハードウェアでモデルを実行したりする際に、使用料はかかりません。
