Qwen3-4B-Thinking-2507

更新
05.10.2026
思考
推論
コード生成
ツール利用
多言語

AlibabaのQwen3シリーズに属する、常に段階的に思考する4Bの推論重視LLMです。256Kのコンテキスト長に対応し、数学、コーディング、エージェントタスクで高いスコアを示します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 4.0B(埋め込み以外は3.6B)
  • コンテキスト長: 262,144トークン
  • モダリティ: テキストの入出力
  • 最低ハードウェア要件: 1.70 GBのUD-Q2_K_XL版を使用する場合、メモリ4 GB

Qwen3-4B-Thinking-2507とは?

Qwen3-4B-Thinking-2507は、Qwenチームが開発した4Bパラメータの推論モデルです。Qwen3-4BのThinking版を更新したモデルで、2025年8月5日にHugging Faceで公開されました。思考モードのみで動作し、すべての回答が推論過程から始まるよう、チャットテンプレートで強制されます。ローカルで使ううえでの魅力は、そのサイズです。Q4_K_M版のファイルサイズは2.50 GBで、ネイティブのコンテキスト長は262,144トークンです。

仕様Qwen3-4B-Thinking-2507
総パラメータ数4.0B(埋め込み以外は3.6B)
モデルの種類因果言語モデル
層数36
アテンションGQA、クエリヘッド32個、キー/バリューヘッド8個
コンテキスト長ネイティブで262,144トークン
モダリティテキストの入出力
推論思考モードのみ、無効化不可
学習段階事前学習と事後学習
推奨出力長32,768トークン、競技数学とコーディングでは81,920トークン
リリース日2025年8月5日
ライセンスApache 2.0

Qwenは2507版を、初代Qwen3-4Bの思考能力について、推論の質と深さの両方を高めるためにさらに3か月開発を続けた成果と位置づけています。モデルカードの主張は具体的です。通常は人間の専門知識が求められる論理推論、数学、科学、コーディング、学術ベンチマークでの性能が大幅に向上したこと、指示追従、ツール使用、テキスト生成、人間の好みへの適合といった汎用能力が著しく改善したこと、256Kの長いコンテキストの理解力が強化されたことを挙げています。Qwenは、その代償も明言しています。この版は思考が長くなっており、チームは非常に複雑な推論タスクへの使用を強く推奨しています。

この更新の要点は、思考に割り当てるトークン数です。Qwenは、ほとんどのクエリで32,768トークン、競技数学やプログラミングでは81,920トークンの出力長を推奨し、サンプリング設定にはtemperature 0.6、top-p 0.95、top-k 20、min-p 0を指定しています。出現ペナルティを0から2の範囲に設定すると際限のない繰り返しを抑えられますが、範囲の上限付近では言語の混在やわずかな品質低下が生じるリスクがあります。テンプレート自体が推論ブロックを開始するため、応答には終了タグの</think>だけが含まれます。また、過去のターンの思考内容は自動的に除去されます。サービングには、Qwenはsglang 0.4.6.post1以降またはvllm 0.8.5以降を挙げ、いずれもdeepseek-r1推論パーサーを使用するよう指定しています。ローカルで利用するユーザーには、Ollama、LMStudio、MLX-LM、llama.cpp、KTransformersを案内しています。

Qwen3-4B-Thinking-2507のベンチマーク

Qwenがモデルカードで公開している数値は、更新版の2507と、初代Qwen3-4B Thinking、およびはるかに大きいQwen3-30B-A3B Thinkingを比較したものです。

ベンチマークQwen3-4B-Thinking-2507Qwen3-4B ThinkingQwen3-30B-A3B Thinking
MMLU-Pro
学術知識
74.070.478.5
GPQA
専門的な科学知識
65.855.965.8
AIME25
競技数学
81.365.670.9
HMMT25
数学オリンピック
55.542.149.8
LiveCodeBench v6
競技プログラミング
55.248.457.4
IFEval
指示追従
87.481.986.5
BFCL-v3
ツール呼び出し
71.265.969.1
TAU2-Retail
小売業向けエージェント
53.538.634.2

更新版はすべての項目で初代4Bを上回り、Qwen3-30B-A3B Thinkingに対しても8項目中5項目で勝っています。その中には数学とエージェント関連の全項目が含まれ、GPQAでも同点です。幅広い知識と競技プログラミングでは、30Bが引き続き優位に立っています。開発元が公開する、より多くの項目を含む表でも、同じような得意分野の違いが見られます。多言語での指示追従では4Bが上回り(MultiIFは77.3対72.2)、WritingBenchでも同様です(83.3対77.0)。一方、MMLU-Redux、SuperGPQA、Arena-Hard v2と、知識を重視する多言語評価セットのMMLU-ProX、INCLUDEでは、30Bが引き続き上回っています。

Qwen3-4B-Thinking-2507のハードウェア要件

システム要件で確認すべきなのはメモリです。以下に示す各ビルドのサイズは、unsloth/Qwen3-4B-Thinking-2507-GGUFの実際のファイルサイズです。

メモリ推奨ビルドファイルサイズ
4 GBUD-Q2_K_XL1.70 GB
6 GBUD-Q3_K_XL2.13 GB
8 GBQ4_K_M2.50 GB
10 GBQ5_K_M2.89 GB
12 GBQ6_K3.31 GB
16 GBQ8_04.28 GB
24 GB以上F168.05 GB

リポジトリには表にあるものより小さいビルドもあり、1.53 GBのUD-IQ2_Mや1.08 GBのUD-IQ1_Sまで用意されています。ただし、この領域では品質低下が最も急になります。これらのファイルは、ほかの量子化段階よりも重みを強く圧縮する一方で、UD-Q2_K_XLから削減できるのはわずか数百メガバイトです。Q4_K_MからQ8_0までの全段階でサイズ差は1.8 GBなので、1段階上げても負担は小さく、2つのビルドがどちらもメモリに収まるなら、大きいほうを選んでください。このモデルは長く推論するため、コンテキスト用のメモリには通常より多くの余裕を残してください。Qwenは、可能であればコンテキスト長を131,072トークン超に保ち、メモリ不足エラーが発生した場合にのみ短くすることを推奨しています。この形式に馴染みがなければ、まずGGUFとは何かを参照してください。同じ環境に収まるほかのモデルについては、16 GBのMacに最適なローカルLLMも参考になります。

Atomic ChatでQwen3-4B-Thinking-2507を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen3-4B-Thinking-2507を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

ほかのラインナップについては、ローカルで実行できるQwenモデルの全一覧をご覧ください。

Qwen3-4B-Thinking-2507のライセンス

Qwen3-4B-Thinking-2507はApache 2.0で公開されています。ロイヤリティなしで商用利用、改変、再配布が認められるため、このモデルを基にした製品を提供でき、自分のハードウェア上でも利用料なしで実行できます。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.51.0"
huggingface-cli download Qwen/Qwen3-4B-Thinking-2507
# またはOllamaで実行:
ollama run qwen3:4b-thinking-2507
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-4B-Thinking-2507",
    "messages": [{"role": "user", "content": "Prove that sqrt(2) is irrational."}],
    "temperature": 0.6,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-4B-Thinking-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Solve: what is 17 * 23?"}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=32768)
print(tokenizer.decode(out[0][len(inputs.input_ids[0]):], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3-4B-Thinking-2507",
  messages: [{ role: "user", content: "Explain the proof of the Pythagorean theorem." }],
  temperature: 0.6,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-4B-Thinking-2507は、AlibabaのQwenチームが2507(2025年7月)にリリースした、4Bパラメータの因果言語モデルです。思考モードのみで動作し、最終回答の前に<think>タグ内で明示的な推論過程を生成します。数学、科学、コーディング、エージェントによるツール使用にわたる複雑な推論のために設計されています。

このモデルは4Bパラメータで、比較的控えめな性能のハードウェアでも動作します。4ビットに量子化したGGUFに必要なのは、およそ4-6 GBのVRAMまたはユニファイドメモリなので、8 GBのGPUやApple Silicon搭載Macで動作します。量子化していないbf16の重みは約8 GBです。ただし、このモデルは長く推論するため、チームは131K超のコンテキスト長を推奨しており、長い生成ではKVキャッシュのメモリ使用量が増える点に注意してください。

はい。Qwen3-4B-Thinking-2507はApache 2.0ライセンスで公開されており、無料での利用、改変、再配布、ロイヤリティなしでの商用導入が認められています。Hugging Faceから重みをダウンロードし、transformers、vLLM、SGLang、Ollama、LM Studio、llama.cppを通じてローカルで実行できます。

このモデルは、ネイティブで262,144トークン(256K)のコンテキスト長に対応しています。この2507版では、初代Qwen3-4Bと比べて、特に長いコンテキストの理解力が強化されています。長い推論のために長いトークン列が必要になることが多いため、Qwenチームは、可能であればコンテキスト長を131,072トークン超に保つことを推奨しています。

Thinking版は推論モードのみで動作し、回答前に必ず思考の連鎖を出力するため、難しい数学、科学、コーディングの問題に強くなっています(たとえばAIME25では81.3)。同系列のInstruct-2507は、可視の思考過程を出さずに直接回答するため、より高速で、深い推論を必要としない単純なチャットや指示追従に適しています。