Qwen3-4B-Thinking-2507とは?
Qwen3-4B-Thinking-2507は、Qwenチームが開発した4Bパラメータの推論モデルです。Qwen3-4BのThinking版を更新したモデルで、2025年8月5日にHugging Faceで公開されました。思考モードのみで動作し、すべての回答が推論過程から始まるよう、チャットテンプレートで強制されます。ローカルで使ううえでの魅力は、そのサイズです。Q4_K_M版のファイルサイズは2.50 GBで、ネイティブのコンテキスト長は262,144トークンです。
| 仕様 | Qwen3-4B-Thinking-2507 |
|---|---|
| 総パラメータ数 | 4.0B(埋め込み以外は3.6B) |
| モデルの種類 | 因果言語モデル |
| 層数 | 36 |
| アテンション | GQA、クエリヘッド32個、キー/バリューヘッド8個 |
| コンテキスト長 | ネイティブで262,144トークン |
| モダリティ | テキストの入出力 |
| 推論 | 思考モードのみ、無効化不可 |
| 学習段階 | 事前学習と事後学習 |
| 推奨出力長 | 32,768トークン、競技数学とコーディングでは81,920トークン |
| リリース日 | 2025年8月5日 |
| ライセンス | Apache 2.0 |
Qwenは2507版を、初代Qwen3-4Bの思考能力について、推論の質と深さの両方を高めるためにさらに3か月開発を続けた成果と位置づけています。モデルカードの主張は具体的です。通常は人間の専門知識が求められる論理推論、数学、科学、コーディング、学術ベンチマークでの性能が大幅に向上したこと、指示追従、ツール使用、テキスト生成、人間の好みへの適合といった汎用能力が著しく改善したこと、256Kの長いコンテキストの理解力が強化されたことを挙げています。Qwenは、その代償も明言しています。この版は思考が長くなっており、チームは非常に複雑な推論タスクへの使用を強く推奨しています。
この更新の要点は、思考に割り当てるトークン数です。Qwenは、ほとんどのクエリで32,768トークン、競技数学やプログラミングでは81,920トークンの出力長を推奨し、サンプリング設定にはtemperature 0.6、top-p 0.95、top-k 20、min-p 0を指定しています。出現ペナルティを0から2の範囲に設定すると際限のない繰り返しを抑えられますが、範囲の上限付近では言語の混在やわずかな品質低下が生じるリスクがあります。テンプレート自体が推論ブロックを開始するため、応答には終了タグの</think>だけが含まれます。また、過去のターンの思考内容は自動的に除去されます。サービングには、Qwenはsglang 0.4.6.post1以降またはvllm 0.8.5以降を挙げ、いずれもdeepseek-r1推論パーサーを使用するよう指定しています。ローカルで利用するユーザーには、Ollama、LMStudio、MLX-LM、llama.cpp、KTransformersを案内しています。
Qwen3-4B-Thinking-2507のベンチマーク
Qwenがモデルカードで公開している数値は、更新版の2507と、初代Qwen3-4B Thinking、およびはるかに大きいQwen3-30B-A3B Thinkingを比較したものです。
| ベンチマーク | Qwen3-4B-Thinking-2507 | Qwen3-4B Thinking | Qwen3-30B-A3B Thinking |
|---|---|---|---|
MMLU-Pro 学術知識 | 74.0 | 70.4 | 78.5 |
GPQA 専門的な科学知識 | 65.8 | 55.9 | 65.8 |
AIME25 競技数学 | 81.3 | 65.6 | 70.9 |
HMMT25 数学オリンピック | 55.5 | 42.1 | 49.8 |
LiveCodeBench v6 競技プログラミング | 55.2 | 48.4 | 57.4 |
IFEval 指示追従 | 87.4 | 81.9 | 86.5 |
BFCL-v3 ツール呼び出し | 71.2 | 65.9 | 69.1 |
TAU2-Retail 小売業向けエージェント | 53.5 | 38.6 | 34.2 |
更新版はすべての項目で初代4Bを上回り、Qwen3-30B-A3B Thinkingに対しても8項目中5項目で勝っています。その中には数学とエージェント関連の全項目が含まれ、GPQAでも同点です。幅広い知識と競技プログラミングでは、30Bが引き続き優位に立っています。開発元が公開する、より多くの項目を含む表でも、同じような得意分野の違いが見られます。多言語での指示追従では4Bが上回り(MultiIFは77.3対72.2)、WritingBenchでも同様です(83.3対77.0)。一方、MMLU-Redux、SuperGPQA、Arena-Hard v2と、知識を重視する多言語評価セットのMMLU-ProX、INCLUDEでは、30Bが引き続き上回っています。
Qwen3-4B-Thinking-2507のハードウェア要件
システム要件で確認すべきなのはメモリです。以下に示す各ビルドのサイズは、unsloth/Qwen3-4B-Thinking-2507-GGUFの実際のファイルサイズです。
| メモリ | 推奨ビルド | ファイルサイズ |
|---|---|---|
| 4 GB | UD-Q2_K_XL | 1.70 GB |
| 6 GB | UD-Q3_K_XL | 2.13 GB |
| 8 GB | Q4_K_M | 2.50 GB |
| 10 GB | Q5_K_M | 2.89 GB |
| 12 GB | Q6_K | 3.31 GB |
| 16 GB | Q8_0 | 4.28 GB |
| 24 GB以上 | F16 | 8.05 GB |
リポジトリには表にあるものより小さいビルドもあり、1.53 GBのUD-IQ2_Mや1.08 GBのUD-IQ1_Sまで用意されています。ただし、この領域では品質低下が最も急になります。これらのファイルは、ほかの量子化段階よりも重みを強く圧縮する一方で、UD-Q2_K_XLから削減できるのはわずか数百メガバイトです。Q4_K_MからQ8_0までの全段階でサイズ差は1.8 GBなので、1段階上げても負担は小さく、2つのビルドがどちらもメモリに収まるなら、大きいほうを選んでください。このモデルは長く推論するため、コンテキスト用のメモリには通常より多くの余裕を残してください。Qwenは、可能であればコンテキスト長を131,072トークン超に保ち、メモリ不足エラーが発生した場合にのみ短くすることを推奨しています。この形式に馴染みがなければ、まずGGUFとは何かを参照してください。同じ環境に収まるほかのモデルについては、16 GBのMacに最適なローカルLLMも参考になります。
Atomic ChatでQwen3-4B-Thinking-2507を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでQwen3-4B-Thinking-2507を検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
ほかのラインナップについては、ローカルで実行できるQwenモデルの全一覧をご覧ください。
Qwen3-4B-Thinking-2507のライセンス
Qwen3-4B-Thinking-2507はApache 2.0で公開されています。ロイヤリティなしで商用利用、改変、再配布が認められるため、このモデルを基にした製品を提供でき、自分のハードウェア上でも利用料なしで実行できます。
