Qwen3.6-35B-A3B

更新
05.10.2026
ツール利用
思考
埋め込み
画像認識
推論
コード生成
多言語

Qwen3.6-35B-A3Bは、QwenのオープンなMoE視覚モデルです。総パラメータ数は35B、アクティブパラメータ数は3B、コンテキスト長は262Kで、ライセンスはApache 2.0です。低ビットのGGUFビルドは12 GBに収まります。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計35B、トークンごとに3Bがアクティブ
  • コンテキスト長: 標準で262,144トークン、最大1,010,000まで拡張可能
  • モダリティ: テキスト、画像、動画の入力
  • 最小ハードウェア要件: メモリ12 GB(UD-IQ2_M GGUF、11.52 GB)

Qwen3.6-35B-A3Bとは?

Qwen3.6-35B-A3Bは、Qwenチームが開発した混合エキスパート(MoE)方式の視覚言語モデルで、Qwen3.6で初めて重みが公開されたバリアントです。総パラメータ数は35Bですが、トークンごとにアクティブになるのは3Bのみです。そのため、35Bモデル相当のメモリを必要としながら、各トークンを3Bモデル相当の計算コストで生成します。このリリースは、エージェントによるコーディングを軸に、フロントエンドのワークフロー、リポジトリ全体を対象とする推論、ターン間で推論コンテキストを保持する新しいオプションに重点を置いています。Qwenは2026年4月15日にApache 2.0の下で重みを公開しました。

仕様Qwen3.6-35B-A3B
総パラメータ数35B、トークンごとに3Bがアクティブ
アーキテクチャハイブリッドアテンション(Gated DeltaNet + Gated Attention)を採用したMoE
エキスパート256、ルーティングで選ばれる8 + 共有の1がアクティブ
層数40
コンテキスト長標準で262,144トークン、最大1,010,000まで拡張可能
モダリティテキスト、画像、動画の入力
推論思考モードはデフォルトで有効、APIパラメータで無効化可能
複数トークン予測複数ステップで学習
リリース日2026年4月15日
ライセンスApache 2.0

隠れ層では、各ブロックの出力をMoEブロックに渡す3つのGated DeltaNetブロックに続き、出力をMoEブロックに渡す1つのGated Attentionブロックを配置する構成を10回繰り返します。そのため、4層中3層がGated DeltaNetを使用し、Gated Attention層では16個のクエリヘッドに対して2個のキー/バリューヘッドを使用します。各層は256個のエキスパートのプールを通じてルーティングを行い、トークンごとにアクティブになるのは、ルーティングで選ばれる8個のエキスパートと1個の共有エキスパートだけです。このモデルは、投機的デコーディングの基盤となる仕組みである複数トークン予測(Multi-Token Prediction)向けにも学習されています。そのため、対応する推論基盤では、1回の順伝播で複数のトークン候補を生成できます。3.6で新たに導入されたのが、思考の保持です。preserve_thinkingオプションを有効にすると、モデルは以前のメッセージの推論過程を保持します。Qwenによると、これによりエージェントのループ内で意思決定の一貫性が向上し、冗長な推論トークンを削減できます。

Qwen3.6-35B-A3Bのベンチマーク

モデルカードに掲載されたQwenのリリース時の数値では、35B-A3BをQwen3.5-27B、前世代のQwen3.5-35B-A3B、Gemma4-31B、Gemma4-26B-A4Bと比較しています。

ベンチマークQwen3.6-35B-A3BQwen3.5-27BQwen3.5-35B-A3BGemma4-31BGemma4-26B-A4B
SWE-bench Verified
ソフトウェア開発
73.475.070.052.017.4
SWE-bench Pro
高難度のソフトウェア開発
49.551.244.635.713.8
Terminal-Bench 2.0
ターミナル操作エージェント
51.541.640.542.934.2
Claw-Eval Avg
エージェントによるコーディング
68.764.365.448.558.8
NL2Repo
リポジトリ全体のコーディング
29.427.320.515.511.6
GPQA
専門レベルの科学
86.085.584.284.382.3
AIME26
数学競技
92.792.691.089.288.3

新モデルは、掲載した7項目のうち、Terminal-Bench 2.0、Claw-Eval Avg、NL2Repo、GPQA、AIME26の5項目で最高スコアを記録しています。SWE-benchの2項目ではQwen3.5-27Bのスコアが高く、Verifiedでは73.4に対して75.0、Proでは49.5に対して51.2です。Qwenの表にあるほかの項目でも、Qwen3.5-27BはSWE-bench Multilingualで67.2に対して69.3、Tool Decathlonで26.9に対して31.5、MCP-Atlasで62.8に対して68.4、WideSearchで60.1に対して66.4を記録しています。35B-A3Bは、QwenWebBenchで1068点に対して1397点、MCPMarkで36.3に対して37.0、SkillsBench Avg5で27.2に対して28.7と上回っています。Qwenは視覚ベンチマークの表も公開しています。そこでは35B-A3BがRealWorldQAで85.3、OmniDocBench1.5で89.9、VideoMMMUで83.7、ODInW13で50.8を記録しており、Qwen3.5-35B-A3Bのスコアはそれぞれ84.1、89.3、80.4、42.6です。

Qwen3.6-35B-A3Bのハードウェア要件

システム要件で確認すべきなのはメモリです。GGUFビルドの配布元はunsloth/Qwen3.6-35B-A3B-GGUFリポジトリで、以下のサイズはそこに掲載されている実際のファイルサイズです。

メモリ選ぶビルドファイルサイズ
12 GBUD-IQ2_M11.52 GB
16 GBUD-IQ3_S13.68 GB
24 GBUD-IQ4_XS17.73 GB
32 GBUD-Q4_K_XL22.36 GB
48 GB以上UD-Q6_K_XL31.84 GB

サイズが隣り合うファイルの差は1〜2ギガバイトなので、2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。画像や動画の入力には、同じリポジトリにあるmmprojファイルが必要で、重みに加えて約0.9 GBを使用します。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen3.6-35B-A3Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen3.6-35B-A3Bを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、ローカルで実行できるQwenモデルの一覧をご覧ください。

Qwen3.6-35B-A3Bのライセンス

Qwen3.6-35B-A3BはApache 2.0の下で公開されており、リポジトリにはライセンスファイルが含まれています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を許可しています。そのため、重みをファインチューニングしたり、自社製品に組み込んで配布したり、自分のハードウェアでモデルを実行したりする際に、使用料はかかりません。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3.6-35B-A3B
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3.6-35B-A3B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen(AlibabaのAIチーム)が開発した、重みが公開されている混合エキスパート(MoE)方式の言語モデルです。総パラメータ数は36Bで、トークンごとに約3Bがアクティブになります。テキスト、視覚入力、ツール呼び出し、思考モード、262,144トークンのコンテキスト長に対応しており、これらはすべてApache-2.0ライセンスの下で提供されます。Atomic Chatでは、処理のすべてを自分のハードウェア上で実行します。

Q4_K_M量子化では重みが約21 GBなので、RTX 3090、4090、5090などの24 GB GPU、または32 GB以上のユニファイドメモリを搭載したMacで快適に動作します。Q8_0ビルドは37 GB近くあり、48 GBクラスのハードウェアが必要です。16 GBのカードでは、大幅なオフロードを行わない限り、Q4でも容量が足りません。

はい。モデルはApache-2.0ライセンスの下で公開されており、無料での利用、改変、商用導入が認められています。Atomic Chatを通じてローカルで実行すれば、API料金やトークンごとの費用はかからず、必要なのは自分のハードウェアと電気代だけです。

はい。重みをダウンロードした後は、インターネット接続なしで、モデルを完全にデバイス上で実行できます。すべてのプロンプトと応答は自分のマシン内にとどまり、Alibabaやその他のサーバーには何も送信されません。これが、Atomic Chatで実行する主な理由です。

最も簡単なのはAtomic Chatを使う方法です。アプリを開き、モデル一覧からQwen3.6-35B-A3Bを見つけ、クリックして量子化ビルドをダウンロードし、読み込みます。コマンドラインを使いたい場合は、huggingface-cli download Qwen/Qwen3.6-35B-A3Bで重みを取得し、Transformers、vLLM、llama.cppのいずれかを通じて推論サービスとして提供します。