Qwen2.5-32B-Instruct

更新
04.10.2026
推論
コード生成
多言語
ツール利用

AlibabaのQwen2.5シリーズに属する、32.5Bの指示チューニング済みLLMです。コーディングと数学に強く、29以上の言語に対応します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 32.5B(埋め込みを除くと31.0B)
  • コンテキスト長: 131,072トークン、生成は8,192トークン
  • モダリティ: テキスト入力とテキスト出力
  • 最低ハードウェア要件: Q2_Kビルド(12.3 GB)でメモリ16 GB

Qwen2.5-32B-Instructとは?

Qwen2.5-32B-Instructは、Alibaba CloudのQwen2.5シリーズに属する32.5Bの指示チューニング済みモデルで、2024年9月にApache 2.0で公開されました。このシリーズには、0.5Bから72Bパラメータまでのベースモデルと指示チューニング済みモデルがあります。本格的な汎用モデルでありながら、24 GBのGPU 1枚に収まる規模です。公式のQ4_K_Mビルドの合計サイズは19.9 GBです。Hugging Faceリポジトリのダウンロード数は2,300,000回を超えています。

仕様Qwen2.5-32B-Instruct
総パラメータ数32.5B(埋め込みを除くと31.0B)
正確なパラメータ数safetensors形式の重みでは32,763,876,352
モデルの種類因果言語モデル
学習段階事前学習と事後学習
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたTransformer
レイヤー数64
アテンションヘッド数(GQA)Qが40、KVが8
コンテキスト長131,072トークン
config.jsonに設定されたコンテキスト長32,768トークン。倍率4.0のYaRNで最大コンテキスト長まで拡張
最大生成長8,192トークン
モダリティテキスト入力とテキスト出力
対応言語中国語、英語、フランス語、スペイン語、ドイツ語、ロシア語、日本語、韓国語、アラビア語など、29を超える言語
チャットテンプレートトークナイザーに同梱され、apply_chat_templateで適用
フレームワークの最低バージョンtransformers 4.37.0
Qwen推奨のデプロイ用スタックvLLM
ベースモデルQwen2.5-32B
公開日2024年9月、リポジトリの作成日は9月17日
ライセンスApache 2.0

コンテキスト長には注意点があります。同梱のconfig.jsonでは32,768トークンに設定されています。最大の131,072トークンを使うには、設定でYaRNのRoPEスケーリングを有効にし、元の32,768トークンに対して倍率4.0を指定するrope_scalingブロックを追加する必要があります。静的なYaRNスケーリングは短いプロンプトで品質を多少低下させる場合があるため、Qwenは実際に長い入力を処理するときだけ追加するよう勧めています。長いコンテキストでの推論サービスの提供には、チームはvLLMを推奨しています。これはモデルカードに名前が挙がっている唯一のデプロイ用スタックです。Pythonで重みを読み込むにはtransformers 4.37.0以降が必要です。古いバージョンではqwen2に対するKeyErrorが発生し、読み込めません。

Qwen2.5-32B-Instructが得意なこと

Qwenのモデルカードには、32Bのベンチマーク別スコアは掲載されていません。詳細な評価結果はQwen2.5のブログに、GPUメモリ使用量とスループットの数値はQwenドキュメント内の別の速度ベンチマークページに掲載されています。モデルカードで述べられているのは、Qwen2と比べて、この世代は知識が大幅に増え、コーディングと数学の能力が大きく向上したということです。両分野の専門モデルを用いて学習されています。

そのほかの改善点も、自分のプロンプトで確認できるほど具体的に示されています。Qwenは、指示への追従、8Kトークンを超える長文の生成、表などの構造化データの理解、特にJSONをはじめとする構造化出力の生成が大幅に改善したと述べています。また、「多様なシステムプロンプトに、より堅牢に対応できる」とし、ロールプレイの実装やチャットボットの条件設定と関連付けています。システムプロンプトで固定のペルソナや厳密な出力規約を指定する場合に重要な点です。これらの改善はすべて、前世代のQwen2との比較であり、他社のモデルとの比較ではありません。

対応言語は幅広く、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語など、29を超える言語をカバーします。そのため、単一のローカルLLMで多言語チャット、コーディング、構造化データの抽出を同時にこなす必要がある場合に、実用的な選択肢となります。

Qwen2.5-32B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。Qwenは公式のGGUF変換版をQwen/Qwen2.5-32B-Instruct-GGUFとして公開しています。各量子化版は、1ファイルあたり約4 GBを上限とする分割ファイルで提供されており、以下のサイズは各ビルドの合計です。

メモリ選ぶビルドファイルサイズ
16 GBQ2_K12.3 GB
20 GBQ3_K_M15.9 GB
24 GBQ4_K_M19.9 GB
32 GBQ5_K_M23.3 GB
36 GBQ6_K26.9 GB
48 GBQ8_034.8 GB
80 GB以上fp1665.5 GB

隣り合うビルドのサイズ差は数GBなので、どちらもメモリに収まる場合は大きい方を選んでください。これは、品質の低下が最も急な表の低ビット側で特に重要です。12.3 GBのQ2_Kはリポジトリ内で最小のビルドで、Q3_K_Mに上げると、ディスク容量が3.6 GB増える代わりに、品質の回復幅が最も大きくなります。リポジトリには、ランタイムが必要とする場合に備えて、従来の形式である18.6 GBのQ4_0と22.6 GBのQ5_0もあります。量子化されていないfp16変換版の合計サイズは65.5 GBなので、フル精度での実行には複数のGPUが必要です。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen2.5-32B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen2.5-32B-Instructを検索し、Download Optionsを開きます。
  3. 使用できるメモリに収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるQwenモデルの一覧や、コーディング向けの姉妹モデルQwen2.5-Coder-32B-Instructをご覧ください。20 GBの重みがお使いのマシンに収まらない場合は、Qwen2.5-14B-Instructをご覧ください。

Qwen2.5-32B-Instructのライセンス

Qwen2.5-32B-InstructはApache 2.0で公開されています。ライセンスファイルはリポジトリに含まれ、モデルカードからもリンクされています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められているため、モデルを使った製品を開発し、使用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-32B-Instruct
# またはOllamaで実行
ollama run qwen2.5:32b-instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-32B-Instruct",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-32B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_name)
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.batch_decode(out, skip_special_tokens=True)[0])
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "sk-noauth" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-32B-Instruct",
  messages: [{ role: "user", content: "Hello!" }]
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-32B-Instructは、Alibaba CloudのQwenチームが2024年9月に公開した、32.5Bパラメータの指示チューニング済み大規模言語モデルです。Qwen2.5シリーズに属し、Qwen2.5-32Bベースモデルをチャット、指示への追従、コーディング、数学向けにファインチューニングしています。128Kトークンのコンテキスト長と、29を超える言語に対応します。

4ビット量子化(Q4_K_M / GGUFまたはAWQ)のQwen2.5-32B-Instructには、約20 GBのメモリが必要です。RTX 3090やRTX 4090などの24 GBのGPU 1枚、または32 GBのユニファイドメモリを搭載したApple Silicon Macで実行できます。フルFP16精度では約64 GBが必要なため、複数のGPU、または64 GB以上のメモリを搭載したMacが必要です。コンテキスト長を短くすると、メモリ使用量をさらに減らせます。

はい。Qwen2.5-32B-InstructはApache 2.0ライセンスで公開されており、ライセンス料なしで研究利用と商用利用の両方が認められています。Apache 2.0の標準的な条件を守れば、Hugging Faceから重みをダウンロードし、ローカルで実行したり、ファインチューニングしたり、商用製品に組み込んでデプロイしたりできます。

Qwen2.5-32B-Instructは最大131,072トークン(128K)のコンテキスト長に対応し、1回の応答で最大8,192トークンを生成できます。同梱のconfig.jsonのデフォルトは32,768トークンです。最大の128Kを使うにはYaRNのRoPEスケーリングを有効にします。Qwenチームは、実際に長いコンテキストの処理が必要な場合にだけ有効にすることを推奨しています。

72Bモデルは、MMLU、GSM8K、HumanEvalを含むほとんどのベンチマークで、より高いスコアを記録しています。一方、Qwen2.5-32B-InstructはGPUあたりの性能がはるかに優れています。4ビットでは24 GBのGPU 1枚で動作しますが、72Bモデルにははるかに多くのメモリが必要です。多くのチャット、推論、コーディングのタスクでは、32B版がローカル環境へのデプロイに実用的な選択肢となり、旧世代のQwen2-72Bを上回る性能を発揮します。