Qwen3-235B-A22B

更新
04.10.2026
思考
推論
コード生成
多言語
ツール利用

AlibabaのQwen3シリーズに属する235Bの混合エキスパート型LLMです。22Bのパラメータを有効化し、思考モードと非思考モードを切り替えられます。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計235B、有効22B(エキスパート数128、有効数8)
  • コンテキスト長: 標準で32,768、YaRN使用時は131,072
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ160 GB(Q4_K_M GGUF、142.2 GB)

Qwen3-235B-A22Bとは?

Qwen3-235B-A22Bは、QwenチームがQwenシリーズの最新世代の大規模言語モデルと位置づけるQwen3の混合エキスパートモデルです。総パラメータ数は235Bですが、トークンごとに有効化するのは22Bのみです。そのため、はるかに大きなモデルの重みを活用しながら、各応答に必要な計算量は22Bモデル相当となります。同じチェックポイントで、複雑な論理推論、数学、コーディング向けの思考モードと、効率的な汎用対話向けの非思考モードを切り替えられます。重みは2025年4月にApache 2.0ライセンスでHugging Faceに公開されました。

仕様Qwen3-235B-A22B
総パラメータ数235B、トークンごとに22Bを有効化
アーキテクチャ混合エキスパート型、エキスパート数128、有効数8
レイヤー数94
アテンションGQA、クエリヘッド数64、KVヘッド数4
コンテキスト長標準で32,768トークン、YaRN使用時は131,072トークン
推論思考モードはデフォルトで有効、ターンごとに切り替え可能
対応言語100以上の言語と方言
リリース日2025年4月
ライセンスApache 2.0

思考モードの切り替えには、ハード指定とソフト指定があります。チャットテンプレートのenable_thinkingフラグによるハード指定では、セッション全体の推論を有効または無効にします。一方、任意のメッセージに/thinkまたは/no_thinkタグを入れるソフト指定では、ターンごとに切り替えます。思考モードでは、モデルは回答する前に<think>ブロック内で推論します。Qwenは、思考モードが有効な場合は温度0.6、無効な場合は0.7を推奨しています。また、思考モードでは貪欲デコーディングを使用しないよう求めており、性能が低下して際限のない繰り返しが生じる可能性があると警告しています。

Qwen3-235B-A22Bが得意なこと

モデルカードにはベンチマーク表が掲載されていないため、以下はQwenによる説明です。思考モードでは、数学、コード生成、常識に基づく論理推論で従来のQwQを上回り、思考モードを無効にした場合は、同じタスクでQwen2.5の指示チューニング済みモデルを上回るとしています。またQwenは、創作、ロールプレイ、複数ターンの対話、指示追従において、人間の好みによく沿うと主張しています。

もう1つ、強みとして挙げられているのがエージェント処理です。Qwenは、複雑なエージェントタスクにおいてオープンソースモデルの中でトップクラスの性能を発揮し、どちらのモードでも正確にツールを呼び出せると報告しています。また、設定ファイルを通じてモデルをMCPサーバーや組み込みツールに接続する、自社のQwen-Agentフレームワークを紹介しています。このモデルは100以上の言語と方言に対応し、多言語での指示追従と翻訳も強みとして挙げられています。

Qwen3-235B-A22Bのハードウェア要件

確認すべきシステム要件はメモリです。トークンごとの計算に使われるのは22Bのみですが、235Bすべてのパラメータをメモリに常駐させます。Qwenは公式のGGUFビルドをQwen/Qwen3-235B-A22B-GGUFで公開しています。以下のサイズは、そのリポジトリにある分割ファイルの合計です。

メモリ選択するビルドファイルサイズ
160 GBQ4_K_M142.2 GB
192 GBQ5_K_M166.8 GB
256 GBQ6_K193.0 GB
512 GB以上Q8_0250.0 GB

どちらのビルドもメモリに収まる場合は、大きい方を選んでください。最小はQ4_K_Mです。このリポジトリにはそれより小さいビルドがないため、メモリが約160 GB未満の環境では、このチェックポイントは利用できません。サーバーのエンドポイントとして提供する場合、Qwenはsglang 0.4.6.post1以降またはvllm 0.8.5以降を挙げており、掲載されているSGLangコマンドは8分割のテンソル並列で実行する構成です。ローカルでの利用については、提供元はllama.cpp、Ollama、LMStudio、MLX-LM、KTransformersを挙げています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen3-235B-A22Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen3-235B-A22Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

142 GBがお使いのマシンのメモリ容量を超える場合は、同じシリーズのはるかに小さいMoEモデルQwen3-30B-A3Bが次の候補です。その他のラインアップは、ローカルで実行できるQwenモデルをすべてまとめた当サイトのページに掲載しています。

Qwen3-235B-A22Bのライセンス

Qwen3-235B-A22BはApache 2.0ライセンスで公開されており、リポジトリにはライセンスファイルが同梱されています。このライセンスでは、ロイヤリティなしでの商用利用、改変、再配布が認められているため、モデルを基に製品を開発し、自前のハードウェアで利用料なしで推論を提供できます。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.51.0"
huggingface-cli download Qwen/Qwen3-235B-A22B
# vLLMで推論を提供(8分割テンソル並列)
vllm serve Qwen/Qwen3-235B-A22B --enable-reasoning --reasoning-parser deepseek_r1 --tensor-parallel-size 8
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-235B-A22B",
    "messages": [{"role": "user", "content": "Explain mixture-of-experts in one paragraph."}],
    "temperature": 0.6,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-235B-A22B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=32768)
print(tokenizer.decode(out[0][len(inputs.input_ids[0]):], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3-235B-A22B",
  messages: [{ role: "user", content: "Explain mixture-of-experts in one paragraph." }],
  temperature: 0.6,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-235B-A22Bは、AlibabaのQwenチームによる混合エキスパート(MoE)型の大規模言語モデルです。総パラメータ数は235Bですが、トークンごとに有効化するのは22Bのみで、各順伝播では128のエキスパートのうち8を使用します。2025年にリリースされたQwen3シリーズのフラッグシップモデルで、推論向けの思考モードと一般的な対話向けの非思考モードの両方に対応しています。

このページで紹介する公式Q4_K_M GGUFは、分割ファイルの合計が約142.2 GBです。本文の160 GBという目安は、重みに加えて実行用メモリを確保するための概算で、長いコンテキストでの動作を保証する値ではありません。48 GBのVRAMだけで重み全体を保持することはできず、CPUにオフロードする場合は残りの重みを保持できるRAMと追加の作業領域が必要です。実際の必要量は量子化、実行環境、コンテキスト長で変わります。

はい。Qwen3-235B-A22BはApache 2.0ライセンスで公開されており、無料での利用、改変、商用導入が認められています。重みはHugging Faceからダウンロードできます。自前のハードウェアで実行することも、OpenRouterやAlibaba Model Studioなどのホスト型APIプロバイダーを通じて利用することもできます。これらのプロバイダーは計算リソースの利用に対して課金します。

Qwen3-235B-A22Bは、標準で32,768トークンのコンテキスト長に対応しています。RoPEスケーリング手法のYaRNを使用すると、131,072トークン(128K)まで拡張できます。Qwenは、長い文書や長い会話での利用について検証済みとしています。YaRNはtransformers、llama.cpp、vLLM、SGLangでサポートされていますが、Qwenチームは、実際に長いコンテキストが必要な場合にのみ有効にすることを推奨しています。静的なYaRNは、短い入力での性能をわずかに低下させる可能性があるためです。

Qwen3-235B-A22Bは、単一のモデル内で2つのモードを切り替えられます。デフォルトで有効な思考モードでは、最終回答の前に<think>...</think>ブロックで囲まれた推論過程を生成し、数学、コード、論理に関する結果を改善します。非思考モードでは、このブロックを使わずに直接回答し、標準的な指示チューニング済みモデルと同様に動作して、一般的なチャットにより速く応答します。enable_thinkingフラグを使うか、プロンプトに/thinkまたは/no_thinkを追加することで、モードを切り替えられます。