Qwen3-Coder-30B-A3B-Instructとは?
Qwen3-Coder-30B-A3B-Instructは、Qwenチームがエージェント型コーディング向けに開発したQwen3-Coderファミリーの軽量モデルです。Qwen3-Coderには複数のサイズがあり、Qwenによると、このモデルは性能と効率を維持しています。Mixture of Experts設計を採用し、48層全体で総パラメータ数は30.5B、トークンあたりに有効化されるパラメータ数は3.3Bです。ローカルで実行できるかどうかを決める数値はファイルサイズです。4ビットのQ4_K_M版は18.56 GBで、下表ではメモリ24 GBの区分に入ります。ライセンスはApache 2.0です。
| 仕様 | Qwen3-Coder-30B-A3B-Instruct |
|---|---|
| 種類 | 因果言語モデル |
| 学習段階 | 事前学習と事後学習 |
| 総パラメータ数 | 30.5B |
| アクティブパラメータ数 | トークンあたり3.3B |
| アーキテクチャ | Mixture of Experts、エキスパート数128、有効化数8 |
| 層数 | 48 |
| アテンション | Grouped Query Attention、Qは32ヘッド、KVは4ヘッド |
| コンテキスト長 | ネイティブで262,144トークン、Yarnで最大1Mトークン |
| モダリティ | テキスト |
| 推論 | 非思考モードのみ、出力にthinkブロックなし |
| リリース日 | 2025年7月31日 |
| ライセンス | Apache 2.0 |
名前に含まれるA3Bは、アクティブパラメータ数を表しています。各MoE層には128のエキスパートがあり、トークンごとにそのうち8が有効化されます。3.3Bという数値は、この構成に由来します。このモデルは非思考モードでのみ動作します。直接回答し、出力にthinkブロックを生成しないため、enable_thinking=Falseを渡す必要はなくなりました。
Qwen3-Coder-30B-A3B-Instructが得意なこと
Qwen自身のモデルカードでは、エージェント型の作業向けと位置づけられています。エージェント型コーディング、エージェントによるブラウザ操作、その他の基本的なコーディングタスクで、オープンモデルの中でも高い性能を発揮するとしています。ツール呼び出し用に専用設計された関数呼び出し形式を備え、Qwenは対応プラットフォームとしてQwen CodeとCLINEを挙げています。このモデルは、単にコードスニペットを補完するだけでなく、エージェントの処理ループに組み込み、OpenAI互換エンドポイントを通じてユーザーが定義したツールを呼び出すことを想定しています。
もうひとつの主要な機能がコンテキスト長です。ネイティブで262,144トークン、Yarnで1Mトークンまで拡張できます。Qwenは、単一のファイルではなくコードベース全体を扱う、リポジトリ規模の理解に向けて最適化しています。最良の結果を得るために、Qwenはtemperature 0.7、top_p 0.8、top_k 20、繰り返しペナルティ1.05、出力トークン数の上限65,536を推奨しています。ローカル実行では、対応ランタイムとしてOllama、LM Studio、MLX-LM、llama.cpp、KTransformersを挙げています。代わりにtransformersを使う場合は、4.51.0以降を使用してください。古いバージョンでは、このアーキテクチャでKeyError: qwen3_moeが発生して動作しません。
Qwen3-Coder-30B-A3B-Instructのハードウェア要件
確認すべきシステム要件はメモリです。Qwenはオリジナルのsafetensors形式の重みを公開しています。以下の量子化版とその実際のファイルサイズは、Hugging Faceのunsloth/Qwen3-Coder-30B-A3B-Instruct-GGUFリポジトリに基づいています。
| メモリ | 選ぶ量子化版 | ファイルサイズ |
|---|---|---|
| 12 GB | Q2_K | 11.26 GB |
| 16 GB | UD-Q3_K_XL | 13.81 GB |
| 24 GB | Q4_K_M | 18.56 GB |
| 32 GB | Q5_K_M | 21.73 GB |
| 48 GB以上 | Q8_0 | 32.48 GB |
このリポジトリには、表にあるものより小さい版と大きい版もあります。最小のUD-TQ1_0は8.01 GBで、最大のBF16の重みは49.66 GBと11.44 GBのファイルに分割されています。その間には、16.38 GBのIQ4_XS、21.08 GBのQ5_K_S、25.09 GBのQ6_Kなどの中間の選択肢があります。隣り合う版のサイズ差は1ギガバイトか2ギガバイト程度なので、どちらもメモリに収まる場合は大きいほうを選んでください。コンテキスト用の余裕も確保してください。リポジトリを扱う長いセッションではファイルサイズを超えるメモリが必要です。Qwenは、メモリ不足エラーが発生した場合、コンテキスト長を32,768トークンに減らすことを勧めています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen3-Coder-30B-A3B-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザでQwen3-Coder-30B-A3B-Instructを検索し、Download Optionsを開きます。
- お使いのメモリに収まる版を選び、チャットを開始します。
ほかのラインアップについては、ローカルで実行できるすべてのQwenモデル、または汎用の兄弟モデルQwen3-30B-A3B-Instruct-2507をご覧ください。
Qwen3-Coder-30B-A3B-Instructのライセンス
Qwen3-Coder-30B-A3B-InstructはApache 2.0で公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められています。そのため、利用料を支払うことなく、このモデルを使った製品の開発、ファインチューニング、自分のハードウェアでの実行ができます。
