Qwen3-235B-A22Bとは?
Qwen3-235B-A22Bは、QwenチームがQwenシリーズの最新世代の大規模言語モデルと位置づけるQwen3の混合エキスパートモデルです。総パラメータ数は235Bですが、トークンごとに有効化するのは22Bのみです。そのため、はるかに大きなモデルの重みを活用しながら、各応答に必要な計算量は22Bモデル相当となります。同じチェックポイントで、複雑な論理推論、数学、コーディング向けの思考モードと、効率的な汎用対話向けの非思考モードを切り替えられます。重みは2025年4月にApache 2.0ライセンスでHugging Faceに公開されました。
| 仕様 | Qwen3-235B-A22B |
|---|---|
| 総パラメータ数 | 235B、トークンごとに22Bを有効化 |
| アーキテクチャ | 混合エキスパート型、エキスパート数128、有効数8 |
| レイヤー数 | 94 |
| アテンション | GQA、クエリヘッド数64、KVヘッド数4 |
| コンテキスト長 | 標準で32,768トークン、YaRN使用時は131,072トークン |
| 推論 | 思考モードはデフォルトで有効、ターンごとに切り替え可能 |
| 対応言語 | 100以上の言語と方言 |
| リリース日 | 2025年4月 |
| ライセンス | Apache 2.0 |
思考モードの切り替えには、ハード指定とソフト指定があります。チャットテンプレートのenable_thinkingフラグによるハード指定では、セッション全体の推論を有効または無効にします。一方、任意のメッセージに/thinkまたは/no_thinkタグを入れるソフト指定では、ターンごとに切り替えます。思考モードでは、モデルは回答する前に<think>ブロック内で推論します。Qwenは、思考モードが有効な場合は温度0.6、無効な場合は0.7を推奨しています。また、思考モードでは貪欲デコーディングを使用しないよう求めており、性能が低下して際限のない繰り返しが生じる可能性があると警告しています。
Qwen3-235B-A22Bが得意なこと
モデルカードにはベンチマーク表が掲載されていないため、以下はQwenによる説明です。思考モードでは、数学、コード生成、常識に基づく論理推論で従来のQwQを上回り、思考モードを無効にした場合は、同じタスクでQwen2.5の指示チューニング済みモデルを上回るとしています。またQwenは、創作、ロールプレイ、複数ターンの対話、指示追従において、人間の好みによく沿うと主張しています。
もう1つ、強みとして挙げられているのがエージェント処理です。Qwenは、複雑なエージェントタスクにおいてオープンソースモデルの中でトップクラスの性能を発揮し、どちらのモードでも正確にツールを呼び出せると報告しています。また、設定ファイルを通じてモデルをMCPサーバーや組み込みツールに接続する、自社のQwen-Agentフレームワークを紹介しています。このモデルは100以上の言語と方言に対応し、多言語での指示追従と翻訳も強みとして挙げられています。
Qwen3-235B-A22Bのハードウェア要件
確認すべきシステム要件はメモリです。トークンごとの計算に使われるのは22Bのみですが、235Bすべてのパラメータをメモリに常駐させます。Qwenは公式のGGUFビルドをQwen/Qwen3-235B-A22B-GGUFで公開しています。以下のサイズは、そのリポジトリにある分割ファイルの合計です。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 160 GB | Q4_K_M | 142.2 GB |
| 192 GB | Q5_K_M | 166.8 GB |
| 256 GB | Q6_K | 193.0 GB |
| 512 GB以上 | Q8_0 | 250.0 GB |
どちらのビルドもメモリに収まる場合は、大きい方を選んでください。最小はQ4_K_Mです。このリポジトリにはそれより小さいビルドがないため、メモリが約160 GB未満の環境では、このチェックポイントは利用できません。サーバーのエンドポイントとして提供する場合、Qwenはsglang 0.4.6.post1以降またはvllm 0.8.5以降を挙げており、掲載されているSGLangコマンドは8分割のテンソル並列で実行する構成です。ローカルでの利用については、提供元はllama.cpp、Ollama、LMStudio、MLX-LM、KTransformersを挙げています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen3-235B-A22Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen3-235B-A22Bを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
142 GBがお使いのマシンのメモリ容量を超える場合は、同じシリーズのはるかに小さいMoEモデルQwen3-30B-A3Bが次の候補です。その他のラインアップは、ローカルで実行できるQwenモデルをすべてまとめた当サイトのページに掲載しています。
Qwen3-235B-A22Bのライセンス
Qwen3-235B-A22BはApache 2.0ライセンスで公開されており、リポジトリにはライセンスファイルが同梱されています。このライセンスでは、ロイヤリティなしでの商用利用、改変、再配布が認められているため、モデルを基に製品を開発し、自前のハードウェアで利用料なしで推論を提供できます。
