Qwen3-30B-A3B-Instruct-2507とは?
Qwen3-30B-A3B-Instruct-2507は、Qwenチームが2025年7月28日に公開した、Qwen3-30B-A3Bの非思考モードの更新版です。128のエキスパートを備える因果言語モデルで、総パラメータ数は30.5B、アクティブパラメータ数は3.3Bです。Qwenは、元のモデルと比べて、指示追従、論理的推論、文章理解、数学、科学、コーディング、ツール利用が大幅に改善したと報告しています。また、複数言語にわたるロングテール知識が大幅に向上し、主観的なタスクや正解が一意に定まらないタスクでのアラインメントが改善したほか、256Kの長いコンテキストを理解する能力も強化されたとしています。
| 仕様 | Qwen3-30B-A3B-Instruct-2507 |
|---|---|
| 総パラメータ数 | 30.5B |
| 埋め込み以外のパラメータ数 | 29.9B |
| アクティブパラメータ数 | トークンあたり3.3B |
| アーキテクチャ | 混合エキスパート型の因果言語モデル |
| エキスパート数 | 合計128、アクティブ8 |
| 層数 | 48 |
| アテンション | GQA、Q用32ヘッド、KV用4ヘッド |
| コンテキスト長 | 標準で262,144トークン、Dual Chunk Attentionで1M |
| 学習段階 | 事前学習と事後学習 |
| モード | 非思考モードのみ、<think>ブロックなし |
| モダリティ | テキスト入力、テキスト出力 |
| 公開日 | 2025年7月28日 |
| ライセンス | Apache 2.0 |
モデルの128のエキスパートのうち8が、48層にわたってアクティブになり、Q用32ヘッドとKV用4ヘッドのグループ化クエリアテンションを使用します。Qwenは、Dual Chunk AttentionとMInferenceのスパースアテンションを組み合わせた1Mトークン構成も文書化しています。Qwenの測定では、1Mトークンに近いシーケンスで標準アテンションの最大3倍の速度を達成しています。この構成では、重み、KVキャッシュ、ピーク時のアクティベーションのために、合計で約240 GBのGPUメモリが必要です。サンプリングについては、Qwenはtemperature 0.7、top-p 0.8、top-k 20、min-p 0、出力長16,384トークンを推奨しています。また、際限のない繰り返しを減らすために、presence penaltyを0から2の間に設定することを推奨しています。
Qwen3-30B-A3B-Instruct-2507のベンチマーク
以下の数値はQwenチームのモデルカードに基づきます。このモデルカードでは、2507更新版を、元のQwen3-30B-A3B、より大規模なQwen3-235B-A22B、DeepSeek-V3-0324、GPT-4o-0327、Gemini-2.5-Flashと比較しています。いずれも非思考モードでの比較です。
| ベンチマーク | Qwen3-30B-A3B-Instruct-2507 | Qwen3-30B-A3B | Qwen3-235B-A22B | DeepSeek-V3-0324 | GPT-4o-0327 | Gemini-2.5-Flash |
|---|---|---|---|---|---|---|
MMLU-Pro 学術知識 | 78.4 | 69.1 | 75.2 | 81.2 | 79.8 | 81.1 |
GPQA 専門的な科学知識 | 70.4 | 54.8 | 62.9 | 68.4 | 66.9 | 78.3 |
AIME25 数学コンテスト | 61.3 | 21.6 | 24.7 | 46.6 | 26.7 | 61.6 |
ZebraLogic 論理パズル | 90.0 | 33.2 | 37.7 | 83.4 | 52.6 | 57.9 |
LiveCodeBench v6 競技プログラミング | 43.2 | 29.0 | 32.9 | 45.2 | 35.8 | 40.1 |
MultiPL-E 多言語コーディング | 83.8 | 74.6 | 79.3 | 82.2 | 82.7 | 77.7 |
Arena-Hard v2 人間の選好 | 69.0 | 24.8 | 52.0 | 45.6 | 61.9 | 58.3 |
Creative Writing v3 創作文 | 86.0 | 68.1 | 80.4 | 81.6 | 84.9 | 84.6 |
2507更新版は、この比較対象の中でZebraLogic、MultiPL-E、Arena-Hard v2、Creative Writing v3の最高スコアを記録し、数学のAIME25では前モデルのほぼ3倍のスコアを達成しています。MMLU-ProとLiveCodeBench v6では引き続きDeepSeek-V3-0324が、GPQAとAIME25ではGemini-2.5-Flashが首位です。
同じ表のほかの項目では、Qwenは2507がIFEvalで84.7、WritingBenchで85.5、PolyMATHで43.1を記録し、いずれも首位だったとしています。また、HMMT25では元のモデルの12.0に対して43.0と報告しています。劣る項目も明確です。Aider-PolyglotはQwen3-235B-A22Bの59.6に対して35.6、TAU2-Telecomの12.3はその行で最低のスコアで、INCLUDEの71.9はGemini-2.5-Flashの83.8を下回っています。最も大きく変化したのは長いコンテキストでの性能です。Qwenは、RULERの1M版で、元のモデルの72.0に対して平均正解率86.8を報告しており、128kで89.1、256kで82.5、1000kで72.8を維持しています。
Qwen3-30B-A3B-Instruct-2507のハードウェア要件
システム要件で確認すべき点はメモリです。以下のファイルサイズは、unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFリポジトリにある実際のGGUFビルドのものです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 10 GB | UD-IQ1_M | 9.69 GB |
| 12 GB | UD-IQ2_M | 10.85 GB |
| 16 GB | UD-Q3_K_XL | 13.83 GB |
| 24 GB | Q4_K_M | 18.56 GB |
| 32 GB | Q5_K_M | 21.73 GB |
| 40 GB | Q6_K | 25.09 GB |
| 48 GB以上 | Q8_0 | 32.48 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。9.69 GBのUD-IQ1_Mに下げるのは、それより大きいビルドがどれも収まらない場合だけにしてください。
Atomic ChatでQwen3-30B-A3B-Instruct-2507を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでQwen3-30B-A3B-Instruct-2507を検索し、Download Optionsを開きます。
- 利用可能なメモリに収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで実行できるQwenモデルの一覧、元のQwen3-30B-A3B、またはコーディング向けの姉妹モデルQwen3-Coder-30B-A3B-Instructをご覧ください。
Qwen3-30B-A3B-Instruct-2507のライセンス
Qwen3-30B-A3B-Instruct-2507はApache 2.0で公開されています。このライセンスはロイヤリティなしでの商用利用、改変、再配布を認めているため、このモデルを基に製品を開発したり、自分のハードウェアで実行したりする際に利用料はかかりません。
