Qwen3-30B-A3B-Instruct-2507

更新
04.10.2026
推論
コード生成
多言語
ツール利用

AlibabaのQwen3シリーズに属する、総パラメータ数30.5B(アクティブパラメータ数3.3B)の指示チューニング済みMoEモデルです。256Kのコンテキスト長に対応し、推論、コーディング、ツール利用に優れています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計30.5B、アクティブ3.3B(エキスパート128、アクティブ8)
  • コンテキスト長: 標準で262,144トークン、Dual Chunk Attentionで1M
  • モダリティ: テキストの入力と出力
  • 最小ハードウェア要件: メモリ10 GB(UD-IQ1_M GGUF、9.69 GB)

Qwen3-30B-A3B-Instruct-2507とは?

Qwen3-30B-A3B-Instruct-2507は、Qwenチームが2025年7月28日に公開した、Qwen3-30B-A3Bの非思考モードの更新版です。128のエキスパートを備える因果言語モデルで、総パラメータ数は30.5B、アクティブパラメータ数は3.3Bです。Qwenは、元のモデルと比べて、指示追従、論理的推論、文章理解、数学、科学、コーディング、ツール利用が大幅に改善したと報告しています。また、複数言語にわたるロングテール知識が大幅に向上し、主観的なタスクや正解が一意に定まらないタスクでのアラインメントが改善したほか、256Kの長いコンテキストを理解する能力も強化されたとしています。

仕様Qwen3-30B-A3B-Instruct-2507
総パラメータ数30.5B
埋め込み以外のパラメータ数29.9B
アクティブパラメータ数トークンあたり3.3B
アーキテクチャ混合エキスパート型の因果言語モデル
エキスパート数合計128、アクティブ8
層数48
アテンションGQA、Q用32ヘッド、KV用4ヘッド
コンテキスト長標準で262,144トークン、Dual Chunk Attentionで1M
学習段階事前学習と事後学習
モード非思考モードのみ、<think>ブロックなし
モダリティテキスト入力、テキスト出力
公開日2025年7月28日
ライセンスApache 2.0

モデルの128のエキスパートのうち8が、48層にわたってアクティブになり、Q用32ヘッドとKV用4ヘッドのグループ化クエリアテンションを使用します。Qwenは、Dual Chunk AttentionとMInferenceのスパースアテンションを組み合わせた1Mトークン構成も文書化しています。Qwenの測定では、1Mトークンに近いシーケンスで標準アテンションの最大3倍の速度を達成しています。この構成では、重み、KVキャッシュ、ピーク時のアクティベーションのために、合計で約240 GBのGPUメモリが必要です。サンプリングについては、Qwenはtemperature 0.7、top-p 0.8、top-k 20、min-p 0、出力長16,384トークンを推奨しています。また、際限のない繰り返しを減らすために、presence penaltyを0から2の間に設定することを推奨しています。

Qwen3-30B-A3B-Instruct-2507のベンチマーク

以下の数値はQwenチームのモデルカードに基づきます。このモデルカードでは、2507更新版を、元のQwen3-30B-A3B、より大規模なQwen3-235B-A22B、DeepSeek-V3-0324、GPT-4o-0327、Gemini-2.5-Flashと比較しています。いずれも非思考モードでの比較です。

ベンチマークQwen3-30B-A3B-Instruct-2507Qwen3-30B-A3BQwen3-235B-A22BDeepSeek-V3-0324GPT-4o-0327Gemini-2.5-Flash
MMLU-Pro
学術知識
78.469.175.281.279.881.1
GPQA
専門的な科学知識
70.454.862.968.466.978.3
AIME25
数学コンテスト
61.321.624.746.626.761.6
ZebraLogic
論理パズル
90.033.237.783.452.657.9
LiveCodeBench v6
競技プログラミング
43.229.032.945.235.840.1
MultiPL-E
多言語コーディング
83.874.679.382.282.777.7
Arena-Hard v2
人間の選好
69.024.852.045.661.958.3
Creative Writing v3
創作文
86.068.180.481.684.984.6

2507更新版は、この比較対象の中でZebraLogic、MultiPL-E、Arena-Hard v2、Creative Writing v3の最高スコアを記録し、数学のAIME25では前モデルのほぼ3倍のスコアを達成しています。MMLU-ProとLiveCodeBench v6では引き続きDeepSeek-V3-0324が、GPQAとAIME25ではGemini-2.5-Flashが首位です。

同じ表のほかの項目では、Qwenは2507がIFEvalで84.7、WritingBenchで85.5、PolyMATHで43.1を記録し、いずれも首位だったとしています。また、HMMT25では元のモデルの12.0に対して43.0と報告しています。劣る項目も明確です。Aider-PolyglotはQwen3-235B-A22Bの59.6に対して35.6、TAU2-Telecomの12.3はその行で最低のスコアで、INCLUDEの71.9はGemini-2.5-Flashの83.8を下回っています。最も大きく変化したのは長いコンテキストでの性能です。Qwenは、RULERの1M版で、元のモデルの72.0に対して平均正解率86.8を報告しており、128kで89.1、256kで82.5、1000kで72.8を維持しています。

Qwen3-30B-A3B-Instruct-2507のハードウェア要件

システム要件で確認すべき点はメモリです。以下のファイルサイズは、unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFリポジトリにある実際のGGUFビルドのものです。

メモリ選ぶビルドファイルサイズ
10 GBUD-IQ1_M9.69 GB
12 GBUD-IQ2_M10.85 GB
16 GBUD-Q3_K_XL13.83 GB
24 GBQ4_K_M18.56 GB
32 GBQ5_K_M21.73 GB
40 GBQ6_K25.09 GB
48 GB以上Q8_032.48 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。9.69 GBのUD-IQ1_Mに下げるのは、それより大きいビルドがどれも収まらない場合だけにしてください。

Atomic ChatでQwen3-30B-A3B-Instruct-2507を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでQwen3-30B-A3B-Instruct-2507を検索し、Download Optionsを開きます。
  3. 利用可能なメモリに収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるQwenモデルの一覧、元のQwen3-30B-A3B、またはコーディング向けの姉妹モデルQwen3-Coder-30B-A3B-Instructをご覧ください。

Qwen3-30B-A3B-Instruct-2507のライセンス

Qwen3-30B-A3B-Instruct-2507はApache 2.0で公開されています。このライセンスはロイヤリティなしでの商用利用、改変、再配布を認めているため、このモデルを基に製品を開発したり、自分のハードウェアで実行したりする際に利用料はかかりません。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.51.0"
huggingface-cli download Qwen/Qwen3-30B-A3B-Instruct-2507
# またはvLLMでOpenAI互換エンドポイントを提供:
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --max-model-len 262144
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-30B-A3B-Instruct-2507",
    "messages": [{"role": "user", "content": "Explain mixture-of-experts in one paragraph."}],
    "temperature": 0.7,
    "top_p": 0.8
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-30B-A3B-Instruct-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Give me a short intro to MoE models."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=16384)
print(tokenizer.decode(out[0][len(inputs.input_ids[0]):], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3-30B-A3B-Instruct-2507",
  messages: [{ role: "user", content: "Explain mixture-of-experts in one paragraph." }],
  temperature: 0.7,
  top_p: 0.8,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-30B-A3B-Instruct-2507は、AlibabaのQwenチームが2025年7月に公開した、指示チューニング済みの言語モデルです。混合エキスパート(MoE)設計を採用し、総パラメータ数は30.5Bですが、トークンごとにアクティブになるのは3.3Bのみです(エキスパート128、アクティブ8)。非思考モードでのみ動作するため、<think>推論ブロックを出力しません。元のQwen3-30B-A3Bと比べて、指示追従、数学、コーディング、ツール利用が向上しています。

30.5Bのパラメータのうちトークンごとにアクティブになるのは3.3Bのみなので、30Bのデンスモデルよりも実行負荷が軽くなります。4ビット量子化では重みが約18-20 GBに収まるため、RTX 4090などの24 GB GPU 1枚で、適度なコンテキスト長なら実行できます。コンテキスト長を上限の256Kまで使うには、はるかに多くのメモリが必要で、1Mトークン構成では複数のカードにまたがる合計約240 GBのGPUメモリが必要です。

はい。このモデルはApache 2.0ライセンスで公開されており、ロイヤリティを支払わずに商用利用、改変、再配布ができます。重みはHugging Faceで一般公開されており、ライセンスが求めるのは著作権表示とライセンス表示を保持することだけです。セルフホストすることも、OpenRouterやFireworks AIなどのAPIプロバイダーを通じて利用することもできます。

両モデルは同じ30B-A3BのMoE基盤を共有していますが、異なる用途に向けて調整されています。Qwen3-30B-A3B-Instruct-2507は、推論、数学、文章作成、多言語タスクに幅広く強い汎用チャットモデルです。Coder版は、ソフトウェアエンジニアリングとエージェントによるコーディングに特化した事後学習を受けているため、コードのベンチマークやツールを使ったリポジトリ上のタスクで高いスコアを出す傾向があります。一方、Instructモデルは総合的な対応力で優れています。

このモデルは標準で262,144トークン(256K)に対応しています。Dual Chunk AttentionとMInferenceのスパースアテンション技術を使い、付属のconfig_1m.jsonを適用すると約1,000,000トークンまで拡張できますが、この構成には約240 GBのGPUメモリが必要です。長いコンテキストを評価するRULERベンチマークでは、256Kを大きく超えても性能をよく維持し、長いコンテキストで元のQwen3-30B-A3Bを大幅に上回るスコアを記録しています。