Qwen2.5-Coder-32B-Instruct

更新
04.10.2026
コード生成
推論
ツール利用
多言語

AlibabaのQwen2.5-Coderシリーズに属する、コードに特化した32.5BパラメータのLLMです。オープンモデルで最高水準のコーディング能力と128Kのコンテキスト長を備えています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 32.5B(埋め込みを除くと31.0B)
  • コンテキスト長: 131,072トークン(デフォルトは32,768、それを超える場合はYaRNを使用)
  • モダリティ: テキストのみ
  • 最小ハードウェア要件: メモリ16 GB(Q2_K GGUF、12.31 GB)

Qwen2.5-Coder-32B-Instructとは

Qwen2.5-Coder-32B-Instructは、AlibabaのQwen2.5-Coderシリーズで最大のモデルです。このシリーズは、以前CodeQwenと呼ばれていた、コードに特化したQwenモデルの系統です。Qwenは、ソースコード、テキストとコードの対応付けデータ、合成データからなる5.5兆トークンでこのシリーズを学習させました。Qwenは32Bを、リリース時点で最先端のオープンソースのコード向けLLMと位置付け、コーディング能力はGPT-4oに匹敵すると報告しています。このモデルは32.5Bパラメータのデンスモデルで、提供元自身のQ4_K_Mビルドは24 GBのGPU一基に収まります。Alibabaは2024年11月6日に、Apache 2.0で重みを公開しました。

仕様Qwen2.5-Coder-32B-Instruct
総パラメータ数32.5B(埋め込みを除くと31.0B)
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたデンス型Transformer
層数64
アテンションヘッド数GQA、Qは40、KVは8
コンテキスト長131,072トークン(YaRNなしでは32,768)
モダリティテキストのみ
学習データ5.5兆トークン:ソースコード、テキストとコードの対応付けデータ、合成データ
リリース日2024年11月6日
ライセンスApache 2.0

仕様のうち、一点は詳しく確認する必要があります。配布されているconfig.jsonでは、コンテキスト長は32,768トークンに設定されています。最大の131,072を利用するには、RoPEのスケーリング手法であるYaRNを設定内で有効にし、係数を4.0にします。Qwenは、実際に入力が長くなる場合に限って、この設定を追加するよう勧めています。Qwenが推奨する推論サーバーのvLLMは静的YaRNにのみ対応しており、入力の長さにかかわらずスケーリング係数が一定に保たれるため、短いテキストでは品質が低下する可能性があります。日常的なコーディングには、デフォルトの32Kのコンテキスト長がより適しています。

Qwen2.5-Coder-32B-Instructが得意なこと

モデルカードでは、このシリーズがCodeQwen1.5を上回った分野として、コード生成、コードに関する推論、コード修正の三つを挙げています。32B-Instructはシリーズの六つのサイズ(0.5B、1.5B、3B、7B、14B、32Bパラメータ)の中で最も高性能で、GPT-4oとの比較対象になっているモデルです。Qwenはモデルカード自体にはスコア表を掲載していないため、このページにもベンチマーク表はありません。詳細な評価結果は、Qwen2.5-Coderファミリーのブログ記事に掲載されています。

Qwenは、このモデルをコードエージェントの基盤としても位置付けています。学習では、コードのスコアを優先して数学や汎用能力を犠牲にするのではなく、ベースとなるQwen2.5の能力を維持しました。これは、エージェントが単に差分を出力するだけでなく、タスクについて推論する必要がある場合に重要です。

Qwen2.5-Coder-32B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。Qwenは公式のGGUF変換版をQwen/Qwen2.5-Coder-32B-Instruct-GGUFとして公開しており、以下のファイルサイズはそのリポジトリに基づいています。

メモリ選択するビルドファイルサイズ
16 GBQ2_K12.31 GB
24 GBQ4_K_M19.85 GB
32 GBQ5_K_M23.26 GB
48 GBQ6_K26.89 GB
64 GB以上Q8_034.82 GB

二つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。品質の向上と引き換えに必要なのは、ディスク容量だけです。GGUF形式を初めて使う方は、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen2.5-Coder-32B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen2.5-Coder-32B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

32Bがお使いのマシンに収まらない場合は、同じ手法を採用しながらサイズを大幅に抑えたQwen2.5-Coder-7B-Instructがあります。ローカルで実行できるすべてのQwenモデルは、ファミリーページに掲載されています。

Qwen2.5-Coder-32B-Instructのライセンス

Qwen2.5-Coder-32B-InstructはApache 2.0で公開されています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を認めているため、モデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-Coder-32B-Instruct
# または量子化モデルをローカルで実行:
ollama run qwen2.5-coder:32b
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-Coder-32B-Instruct",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-Coder-32B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_name)
messages = [{"role": "user", "content": "Write a quicksort in Python."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "not-needed" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-Coder-32B-Instruct",
  messages: [{ role: "user", content: "Write a binary search in TypeScript." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-Coder-32B-Instructは、AlibabaのQwenチームによる、コードに特化した32.5Bパラメータの大規模言語モデルです。Qwen2.5-Coder-32Bに指示チューニングを施したモデルで、ソースコード、テキストとコードの対応付けデータ、合成データからなる5.5兆トークンで学習されています。コード生成、コードに関する推論、コード修正を対象とし、128Kトークンのコンテキスト長に対応しています。

はい。Qwen2.5-Coder-32B-InstructはApache 2.0ライセンスで公開されています。このライセンスでは、帰属表示を伴う商用および私的な利用、改変、再配布が無料で認められています。重みはHugging Faceで公開されており、無料でダウンロードしてローカルで実行できます。

4ビット量子化では、32Bモデルはおよそ24 GBのVRAMに収まるため、RTX 3090や4090などの24 GB GPU一基で実行できます。量子化せずBF16精度で実行するには約65 GBが必要で、通常は大容量メモリを搭載したGPU二基を使用します。また、32 GB以上のユニファイドメモリを搭載したApple Silicon Macでも、llama.cppまたはOllamaと量子化済みのGGUFビルドを使って実行できます。

リリース時点では最も高性能なオープンソースのコード向けモデルで、Qwenチームは、そのコーディング能力がGPT-4oに匹敵すると報告しています。EvalPlus、LiveCodeBench、BigCodeBenchではオープンモデルの中で首位に立ち、コード修正ベンチマークのAiderで73.7、40を超えるプログラミング言語を対象としたMcEvalで65.9を達成しています。

このモデルは、最大131,072トークン(128K)のコンテキスト長に対応しています。デフォルトのconfig.jsonでは、コンテキスト長の上限は32,768トークンです。より長い入力を処理するには、設定内でYaRNによるRoPEスケーリングを有効にします。静的YaRNは短い入力での性能に影響する可能性があるため、Qwenは、長いコンテキストの処理が実際に必要な場合に限って有効にするよう勧めています。