Qwen3-30B-A3B

更新
04.10.2026
ツール利用
思考
推論
コード生成
多言語

Qwen3-30B-A3Bは、トークンごとに3.3Bのパラメータを有効化する30.5BのMoEモデルです。思考モードを切り替えられ、100以上の言語に対応しています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計30.5B、トークンごとに3.3Bが有効
  • コンテキスト長: 標準で32,768、YaRN使用時は131,072
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ24 GB(Q4_K_M、18.56 GB)

Qwen3-30B-A3Bとは?

Qwen3-30B-A3Bは、AlibabaのQwenチームが開発した、Qwen3世代の混合エキスパート(MoE)モデルです。総パラメータ数は30.5Bですが、トークンごとに有効化されるのは3.3Bのみです。各順伝播では、128のエキスパートのうち8つに処理が振り分けられます。この違いがローカル実行の特性を決めます。30.5Bのパラメータすべてをメモリに常駐させる必要がある一方、各トークンの処理に使う計算量は、有効な3.3Bのパラメータに相当します。Qwenは2025年4月27日に、Apache 2.0の下で重みを公開しました。

仕様Qwen3-30B-A3B
総パラメータ数30.5B(埋め込みを除くと29.9B)
有効パラメータ数トークンごとに3.3B
エキスパート合計128、有効8
レイヤー数48
アテンションGQA、Qは32ヘッド、KVは4ヘッド
コンテキスト長標準で32,768トークン、YaRN使用時は131,072
モダリティテキスト入力、テキスト出力
推論思考モードはデフォルトでオン、ハードスイッチとソフトスイッチでオフに切り替え可能
リリース日2025年4月27日
ライセンスApache 2.0

特徴的なのは思考モードの切り替えです。Qwen3は、推論と通常のチャットを同じモデルで扱います。チャットテンプレート内のハードスイッチenable_thinkingで、推論を完全にオンまたはオフにできます。ソフトスイッチでは、進行中の会話で動作を指定できます。いずれかのメッセージの末尾に/thinkまたは/no_thinkを追加すると、モデルは直近の指示に従います。両モードでは適切なサンプリング設定が異なります。Qwenは、思考モードではTemperature 0.6とTopP 0.95、思考モードを使わない場合はそれぞれ0.7と0.8を推奨しています。また、思考モードでの貪欲デコーディングは、モデルが際限なく同じ内容を繰り返す原因になり得るため、使用しないよう注意を促しています。

Qwen3-30B-A3Bが得意なこと

Qwenは、Qwen3シリーズの重点を推論、エージェント、対応言語の広さに置いています。思考モードでは、数学、コード生成、常識に基づく論理推論で従来のQwQを上回り、思考モードをオフにすると、置き換え対象のQwen2.5の指示チューニング済みモデルを上回ります。Qwenはまた、複雑なエージェントタスクでオープンソースモデルの中でもトップクラスの性能を持つと主張しています。このモデルは両モードで正確にツールを呼び出すよう学習されており、開発元のQwen-Agentフレームワークを使えば、ツール用のパーサーを手書きする代わりに、設定ファイルでMCPサーバーに接続できます。

もう一つの強みとして挙げられているのは、対応範囲の広さです。100以上の言語と方言に対応し、多言語での指示追従と翻訳が可能です。さらに、人間の好みに合わせる事後学習も行われており、Qwenはこれを創作、ロールプレイ、複数ターンの対話と結び付けています。モデルカードにはベンチマーク別のスコアが掲載されていないため、これらは測定値ではなく、開発元の主張として捉えてください。

Qwen3-30B-A3Bのハードウェア要件

システム要件で確認すべきなのはメモリです。トークンごとに有効になるのは3.3Bでも、30.5Bのパラメータすべてが読み込まれたままになります。QwenはQwen/Qwen3-30B-A3B-GGUFで公式のGGUFビルドを公開しています。

メモリ選ぶビルドファイルサイズ
24 GBQ4_K_M18.56 GB
32 GBQ5_K_M21.73 GB
48 GBQ6_K25.09 GB
64 GB以上Q8_032.48 GB

公式リポジトリで提供される最小のビルドはQ4_K_Mなので、VRAMまたはユニファイドメモリは24 GBが実用上の下限です。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。21.08 GBのQ5_0と21.73 GBのQ5_K_Mの差は1ギガバイト未満で、この場合はK_M版を選びます。GGUFは初期設定では標準の32,768トークンのコンテキスト長で動作します。131,072に拡張するには、llama.cppでQwenのYaRNフラグを指定します。ただし、開発元は、実際に長い入力をモデルに与える場合を除き、スケーリングをオフにしておくよう勧めています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen3-30B-A3Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでQwen3-30B-A3Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

このチェックポイントから派生した新しいモデルには、それぞれQwen3-30B-A3B-Instruct-2507とQwen3-Coder-30B-A3Bの専用ページがあります。全ラインアップは、当サイトのQwenファミリーページで確認できます。

Qwen3-30B-A3Bのライセンス

Qwen3-30B-A3BはApache 2.0の下で公開されており、リポジトリにライセンスファイルが同梱されています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を許可しています。そのため、利用料なしで、このモデルを使った製品の開発、ファインチューニング、所有するハードウェアでの実行ができます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3-30B-A3B
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-30B-A3B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-30B-A3Bは、Qwenが重みを公開している混合エキスパート(MoE)モデルです。総パラメータ数は30.5Bで、トークンごとに約3Bが有効になります。128Kのコンテキスト長、ツール呼び出し、多言語テキスト、段階的な推論のために切り替え可能な思考モードに対応しています。名前のA3Bは、有効パラメータ数の3Bを指しており、これにより小規模モデル並みの速度を実現しています。

MoEモデルなので、トークンごとに使われるパラメータは3Bだけでも、30.5Bのパラメータすべてをメモリに読み込みます。4ビット量子化版(Q4_K_M)には約17 GBが必要で、RTX 4090のような24 GBのGPUに収まります。また、Apple Siliconでは、少なくとも32 GBのシステムメモリまたはユニファイドメモリで実行している人も多くいます。精度を高くすると、さらに多くのメモリが必要です。

はい。Apache 2.0ライセンスの下で公開されているため、Hugging Faceから重みを無料でダウンロードでき、無料で実行できます。このライセンスは商用利用と改変も許可しているため、自分で実行する場合、トークン単位の料金やAPI料金はかかりません。

重みをダウンロードした後は、完全にオフラインで動作します。Atomic Chatでは、モデルがお使いのハードウェアに読み込まれ、インターネット接続なしで回答するため、プロンプトやファイルはデバイス内にとどまります。そのため、機密性が求められる作業や、外部ネットワークから隔離された環境での作業に適しています。

Qwen3-30B-A3Bは、デフォルトで思考モードが有効になっています。プロンプトに/thinkまたは/no_thinkを追加するとターンごとに切り替えられます。また、チャットテンプレートやAPIを通じてenable_thinkingパラメータをFalseに設定することもできます。オフにすると、単純なチャットでは回答が速く、短くなります。オンのままにすると、推論、数学、コードに役立ちます。