Qwen3-30B-A3Bとは?
Qwen3-30B-A3Bは、AlibabaのQwenチームが開発した、Qwen3世代の混合エキスパート(MoE)モデルです。総パラメータ数は30.5Bですが、トークンごとに有効化されるのは3.3Bのみです。各順伝播では、128のエキスパートのうち8つに処理が振り分けられます。この違いがローカル実行の特性を決めます。30.5Bのパラメータすべてをメモリに常駐させる必要がある一方、各トークンの処理に使う計算量は、有効な3.3Bのパラメータに相当します。Qwenは2025年4月27日に、Apache 2.0の下で重みを公開しました。
| 仕様 | Qwen3-30B-A3B |
|---|---|
| 総パラメータ数 | 30.5B(埋め込みを除くと29.9B) |
| 有効パラメータ数 | トークンごとに3.3B |
| エキスパート | 合計128、有効8 |
| レイヤー数 | 48 |
| アテンション | GQA、Qは32ヘッド、KVは4ヘッド |
| コンテキスト長 | 標準で32,768トークン、YaRN使用時は131,072 |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | 思考モードはデフォルトでオン、ハードスイッチとソフトスイッチでオフに切り替え可能 |
| リリース日 | 2025年4月27日 |
| ライセンス | Apache 2.0 |
特徴的なのは思考モードの切り替えです。Qwen3は、推論と通常のチャットを同じモデルで扱います。チャットテンプレート内のハードスイッチenable_thinkingで、推論を完全にオンまたはオフにできます。ソフトスイッチでは、進行中の会話で動作を指定できます。いずれかのメッセージの末尾に/thinkまたは/no_thinkを追加すると、モデルは直近の指示に従います。両モードでは適切なサンプリング設定が異なります。Qwenは、思考モードではTemperature 0.6とTopP 0.95、思考モードを使わない場合はそれぞれ0.7と0.8を推奨しています。また、思考モードでの貪欲デコーディングは、モデルが際限なく同じ内容を繰り返す原因になり得るため、使用しないよう注意を促しています。
Qwen3-30B-A3Bが得意なこと
Qwenは、Qwen3シリーズの重点を推論、エージェント、対応言語の広さに置いています。思考モードでは、数学、コード生成、常識に基づく論理推論で従来のQwQを上回り、思考モードをオフにすると、置き換え対象のQwen2.5の指示チューニング済みモデルを上回ります。Qwenはまた、複雑なエージェントタスクでオープンソースモデルの中でもトップクラスの性能を持つと主張しています。このモデルは両モードで正確にツールを呼び出すよう学習されており、開発元のQwen-Agentフレームワークを使えば、ツール用のパーサーを手書きする代わりに、設定ファイルでMCPサーバーに接続できます。
もう一つの強みとして挙げられているのは、対応範囲の広さです。100以上の言語と方言に対応し、多言語での指示追従と翻訳が可能です。さらに、人間の好みに合わせる事後学習も行われており、Qwenはこれを創作、ロールプレイ、複数ターンの対話と結び付けています。モデルカードにはベンチマーク別のスコアが掲載されていないため、これらは測定値ではなく、開発元の主張として捉えてください。
Qwen3-30B-A3Bのハードウェア要件
システム要件で確認すべきなのはメモリです。トークンごとに有効になるのは3.3Bでも、30.5Bのパラメータすべてが読み込まれたままになります。QwenはQwen/Qwen3-30B-A3B-GGUFで公式のGGUFビルドを公開しています。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 24 GB | Q4_K_M | 18.56 GB |
| 32 GB | Q5_K_M | 21.73 GB |
| 48 GB | Q6_K | 25.09 GB |
| 64 GB以上 | Q8_0 | 32.48 GB |
公式リポジトリで提供される最小のビルドはQ4_K_Mなので、VRAMまたはユニファイドメモリは24 GBが実用上の下限です。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。21.08 GBのQ5_0と21.73 GBのQ5_K_Mの差は1ギガバイト未満で、この場合はK_M版を選びます。GGUFは初期設定では標準の32,768トークンのコンテキスト長で動作します。131,072に拡張するには、llama.cppでQwenのYaRNフラグを指定します。ただし、開発元は、実際に長い入力をモデルに与える場合を除き、スケーリングをオフにしておくよう勧めています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen3-30B-A3Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでQwen3-30B-A3Bを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
このチェックポイントから派生した新しいモデルには、それぞれQwen3-30B-A3B-Instruct-2507とQwen3-Coder-30B-A3Bの専用ページがあります。全ラインアップは、当サイトのQwenファミリーページで確認できます。
Qwen3-30B-A3Bのライセンス
Qwen3-30B-A3BはApache 2.0の下で公開されており、リポジトリにライセンスファイルが同梱されています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を許可しています。そのため、利用料なしで、このモデルを使った製品の開発、ファインチューニング、所有するハードウェアでの実行ができます。
