Qwen3-Coder-30B-A3B-Instruct

更新
05.10.2026
ツール利用
推論
コード生成
多言語

Qwen3-Coder-30B-A3B-Instructは、エージェント型コーディング向けのQwenのMoEモデルです。総パラメータ数は30.5B、トークンあたりのアクティブパラメータ数は3.3B、ネイティブのコンテキスト長は262Kです。ライセンスはApache 2.0です。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計30.5B、トークンあたりのアクティブ数3.3B
  • コンテキスト長: ネイティブで262,144トークン、Yarnで最大1Mトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: メモリ12 GB(Q2_K GGUF、11.26 GB)

Qwen3-Coder-30B-A3B-Instructとは?

Qwen3-Coder-30B-A3B-Instructは、Qwenチームがエージェント型コーディング向けに開発したQwen3-Coderファミリーの軽量モデルです。Qwen3-Coderには複数のサイズがあり、Qwenによると、このモデルは性能と効率を維持しています。Mixture of Experts設計を採用し、48層全体で総パラメータ数は30.5B、トークンあたりに有効化されるパラメータ数は3.3Bです。ローカルで実行できるかどうかを決める数値はファイルサイズです。4ビットのQ4_K_M版は18.56 GBで、下表ではメモリ24 GBの区分に入ります。ライセンスはApache 2.0です。

仕様Qwen3-Coder-30B-A3B-Instruct
種類因果言語モデル
学習段階事前学習と事後学習
総パラメータ数30.5B
アクティブパラメータ数トークンあたり3.3B
アーキテクチャMixture of Experts、エキスパート数128、有効化数8
層数48
アテンションGrouped Query Attention、Qは32ヘッド、KVは4ヘッド
コンテキスト長ネイティブで262,144トークン、Yarnで最大1Mトークン
モダリティテキスト
推論非思考モードのみ、出力にthinkブロックなし
リリース日2025年7月31日
ライセンスApache 2.0

名前に含まれるA3Bは、アクティブパラメータ数を表しています。各MoE層には128のエキスパートがあり、トークンごとにそのうち8が有効化されます。3.3Bという数値は、この構成に由来します。このモデルは非思考モードでのみ動作します。直接回答し、出力にthinkブロックを生成しないため、enable_thinking=Falseを渡す必要はなくなりました。

Qwen3-Coder-30B-A3B-Instructが得意なこと

Qwen自身のモデルカードでは、エージェント型の作業向けと位置づけられています。エージェント型コーディング、エージェントによるブラウザ操作、その他の基本的なコーディングタスクで、オープンモデルの中でも高い性能を発揮するとしています。ツール呼び出し用に専用設計された関数呼び出し形式を備え、Qwenは対応プラットフォームとしてQwen CodeとCLINEを挙げています。このモデルは、単にコードスニペットを補完するだけでなく、エージェントの処理ループに組み込み、OpenAI互換エンドポイントを通じてユーザーが定義したツールを呼び出すことを想定しています。

もうひとつの主要な機能がコンテキスト長です。ネイティブで262,144トークン、Yarnで1Mトークンまで拡張できます。Qwenは、単一のファイルではなくコードベース全体を扱う、リポジトリ規模の理解に向けて最適化しています。最良の結果を得るために、Qwenはtemperature 0.7、top_p 0.8、top_k 20、繰り返しペナルティ1.05、出力トークン数の上限65,536を推奨しています。ローカル実行では、対応ランタイムとしてOllama、LM Studio、MLX-LM、llama.cpp、KTransformersを挙げています。代わりにtransformersを使う場合は、4.51.0以降を使用してください。古いバージョンでは、このアーキテクチャでKeyError: qwen3_moeが発生して動作しません。

Qwen3-Coder-30B-A3B-Instructのハードウェア要件

確認すべきシステム要件はメモリです。Qwenはオリジナルのsafetensors形式の重みを公開しています。以下の量子化版とその実際のファイルサイズは、Hugging Faceのunsloth/Qwen3-Coder-30B-A3B-Instruct-GGUFリポジトリに基づいています。

メモリ選ぶ量子化版ファイルサイズ
12 GBQ2_K11.26 GB
16 GBUD-Q3_K_XL13.81 GB
24 GBQ4_K_M18.56 GB
32 GBQ5_K_M21.73 GB
48 GB以上Q8_032.48 GB

このリポジトリには、表にあるものより小さい版と大きい版もあります。最小のUD-TQ1_0は8.01 GBで、最大のBF16の重みは49.66 GBと11.44 GBのファイルに分割されています。その間には、16.38 GBのIQ4_XS、21.08 GBのQ5_K_S、25.09 GBのQ6_Kなどの中間の選択肢があります。隣り合う版のサイズ差は1ギガバイトか2ギガバイト程度なので、どちらもメモリに収まる場合は大きいほうを選んでください。コンテキスト用の余裕も確保してください。リポジトリを扱う長いセッションではファイルサイズを超えるメモリが必要です。Qwenは、メモリ不足エラーが発生した場合、コンテキスト長を32,768トークンに減らすことを勧めています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen3-Coder-30B-A3B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザでQwen3-Coder-30B-A3B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まる版を選び、チャットを開始します。

ほかのラインアップについては、ローカルで実行できるすべてのQwenモデル、または汎用の兄弟モデルQwen3-30B-A3B-Instruct-2507をご覧ください。

Qwen3-Coder-30B-A3B-Instructのライセンス

Qwen3-Coder-30B-A3B-InstructはApache 2.0で公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められています。そのため、利用料を支払うことなく、このモデルを使った製品の開発、ファインチューニング、自分のハードウェアでの実行ができます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3-Coder-30B-A3B-Instruct
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-Coder-30B-A3B-Instruct")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen(Alibaba)が開発した、コーディングに特化した大規模言語モデルです。Mixture-of-Experts設計を採用し、総パラメータ数は30.5B、トークンあたりのアクティブパラメータ数は約3.3Bです。コードの作成、コードの編集、エージェント型コーディングのワークフローの実行に向けて指示チューニングされており、256Kトークンのコンテキスト長に対応しています。Atomic Chatでは、自分のハードウェア上でローカルに実行できます。

4ビット量子化(Q4_K_M)では、モデルはおよそ18-22GBのVRAMに収まるため、RTX 4090のような24GBのカードなら余裕を持って実行できます。Q6_K版には約27GB、フルFP16の重みには約67GBが必要です。システムRAMが32GBあればCPUでも実行でき、ユーザーからは4ビットで毎秒12-15トークンという報告があります。

はい。このモデルはApache 2.0ライセンスで公開されており、個人利用も商用利用も無料です。Hugging Faceから重みを無料でダウンロードし、APIキーやサブスクリプションなしでAtomic Chatを使ってローカルに実行できます。

はい。重みをダウンロードすれば、インターネット接続なしで、モデルはすべて自分のマシン上で動作します。プロンプトとコードはデバイス内にとどまるため、非公開リポジトリや機密性の高いプロジェクトに適しています。Atomic Chatがダウンロードを処理し、その後モデルを完全にデバイス上に読み込みます。

エージェント型コーディング向けに開発されており、複数のステップからなるコーディングタスク、ツール呼び出し、多くのプログラミング言語でのコード編集を得意としています。256Kのコンテキスト長により、単一のコードスニペットではなく、大規模なコードベース全体を対象に推論できます。ただし、非思考モードで動作し、出力に独立した推論ブロックは含まれません。