Qwen2.5-Coder-7B-Instruct

更新
04.10.2026
コード生成
推論
ツール利用

AlibabaのQwen2.5-Coderシリーズに属する7.6Bのコード特化型LLMです。コード生成、推論、修正向けに調整されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 7.61B(埋め込みを除くと6.53B)
  • コンテキスト長: 131,072トークン(デフォルトは32,768、それを超える場合はYaRNを使用)
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: 6 GBの空きメモリ(Q3_K_M GGUF、3.81 GB)

Qwen2.5-Coder-7B-Instructとは?

Qwen2.5-Coder-7B-Instructは、AlibabaのQwen2.5-Coderファミリーに属する、パラメータ数7.61Bの指示チューニング済みモデルです。このファミリーは、以前はCodeQwenと呼ばれていた、コードに特化したQwenモデル群です。シリーズには0.5Bから32Bまでの6つのサイズがあり、7Bはその中間に位置します。量子化版ならメモリ8 GBのノートパソコンに収まるサイズです。重みは2024年9月にApache 2.0ライセンスでHugging Faceに公開されました。

仕様Qwen2.5-Coder-7B-Instruct
総パラメータ数7.61B(埋め込みを除くと6.53B)
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えた因果Transformer
層数28
アテンションヘッド数GQA、クエリ用28、KV用4
コンテキスト長131,072トークン(デフォルトは32,768、それを超える場合はYaRNを使用)
学習事前学習と事後学習、シリーズ全体で5.5兆トークン
リリース日2024年9月
ライセンスApache 2.0

配布時の設定では、コンテキスト長の上限は32,768トークンです。これを超える場合、Qwenは倍率4.0のYaRNによるRoPEスケーリングを使用し、最大131,072トークンまで利用できるようにします。開発チームは、実際に長い入力を渡す場合にのみrope_scalingブロックを追加するよう勧めています。サポートされている実装は静的なため、すべての入力長にスケーリングが適用され、短いプロンプトでは品質が多少低下する可能性があります。モデルの読み込みにはtransformers 4.37以降が必要で、Qwenは推論の提供にvLLMを推奨しています。

Qwen2.5-Coder-7B-Instructが得意なこと

QwenはCoderシリーズを、コード生成、コードに関する推論、コード修正という3つの用途に位置付けており、いずれもCodeQwen1.5から大幅に改善したとしています。この改善を支えるのは規模の拡大です。学習データは5.5兆トークンに増え、Qwen2.5をベースに、ソースコード、テキストとコードの対応付けデータ、合成データを組み合わせています。開発チームはコードエージェントも想定用途に挙げており、コードのために他の能力をすべて犠牲にするのではなく、Qwen2.5の数学能力と汎用的な能力を維持していると述べています。

モデルカードにはベンチマーク表が掲載されておらず、QwenはCoderファミリーに関するブログ記事で詳細な評価結果を公開しています。モデルカードにある唯一の比較に関する主張は、フラッグシップの32Bについてです。Qwenはこれを最先端のオープンソースのコードLLMと呼び、コーディング能力はGPT-4oに匹敵するとしています。7Bでは、同じ学習手法をローカルで実行できるサイズで利用できます。より大きなモデルを動かせるメモリがある場合は、Qwen2.5-Coder-32B-Instructをご覧ください。

Qwen2.5-Coder-7B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。モデルファイルがRAMまたはVRAMに収まり、さらにコンテキスト用の空き容量が残る必要があります。Qwenは公式GGUF版をQwen/Qwen2.5-Coder-7B-Instruct-GGUFで公開しています。実際のファイルサイズは以下のとおりです。

メモリ選ぶビルドファイルサイズ
6 GBQ3_K_M3.81 GB
8 GBQ4_K_M4.68 GB
12 GBQ6_K6.25 GB
16 GBQ8_08.10 GB
24 GB以上FP1615.24 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。同じリポジトリには、上の表にある単一ファイルに加え、複数のビルドの分割版も掲載されています。fp16は連番付きの4つのファイルに、q8_0は3つのファイルに分割されています。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen2.5-Coder-7B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォームに対応したAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen2.5-Coder-7B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

ファミリーの他のモデルについては、ローカルで実行できるQwenモデルの一覧をご覧ください。

Qwen2.5-Coder-7B-Instructのライセンス

Qwen2.5-Coder-7B-InstructはApache 2.0ライセンスで公開されており、ライセンスファイルはリポジトリに含まれています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められているため、製品への組み込み、ファインチューニング、自分のハードウェアでの実行を利用料なしで行えます。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-Coder-7B-Instruct
# またはOllamaで量子化モデルを実行:
ollama run qwen2.5-coder:7b-instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-Coder-7B-Instruct",
    "messages": [{"role": "user", "content": "Write a quicksort in Python."}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-Coder-7B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_name)
messages = [{"role": "user", "content": "Write a quicksort in Python."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.batch_decode(out, skip_special_tokens=True)[0])
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "sk-local" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-Coder-7B-Instruct",
  messages: [{ role: "user", content: "Write a quicksort in Python." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-Coder-7B-Instructは、AlibabaのQwenチームが2024年9月にリリースした、パラメータ数7.61Bのコード特化型大規模言語モデルです。Qwen2.5-Coder-7Bの指示チューニング版で、コード生成、コードに関する推論、バグ修正向けにファインチューニングされています。Qwen2.5-Coderシリーズは、ソースコードやテキストとコードの対応付けデータを含む5.5兆トークンで学習されました。

量子化していないBF16精度では、このパラメータ数7.61Bのモデルには約16 GBのVRAMが必要です。4ビット量子化(GGUFまたはGPTQ)なら約8 GBに余裕を持って収まるため、RTX 3060/4060などの一般消費者向けGPU 1基で実行でき、llama.cppを使えばApple Siliconでも実行できます。Ollamaやllama.cppで使用できる量子化済みGGUF版が公開されています。

はい。Qwen2.5-Coder-7B-InstructはApache 2.0ライセンスで公開されており、帰属表示を行うことで、無料での商用利用、改変、再配布が認められています。重みはHugging Faceで一般公開されているため、モデルを無料でダウンロードし、セルフホストできます。

このモデルは最大131,072トークン(128K)のコンテキスト長に対応しています。デフォルトのconfig.jsonは32,768トークンに設定されており、それを超える入力を扱うには、設定でYaRNによるRoPEスケーリングを有効にします。Qwenチームは長いコンテキストでの運用にvLLMを推奨しており、静的なYaRNは短い入力での性能にわずかに影響する可能性があるとしています。

Qwen2.5-Coder-32B-Instructはシリーズのフラッグシップで、コーディングのベンチマークではより高いスコアを記録しており、Qwenチームはそのコーディング能力をGPT-4oに匹敵すると説明しています。7Bモデルは精度がやや下がる代わりに、ハードウェア要件が大幅に低くなっています。一般消費者向けGPU 1基で動作し、速度も大幅に速いため、32Bモデルでは負荷が大きすぎる場合に、ローカルのコーディングアシスタントやIDEへの組み込みに適した実用的な選択肢です。