Qwen2.5-7B-Instruct

更新
04.10.2026
推論
コード生成
多言語
ツール利用

AlibabaのQwen2.5シリーズに属する、指示チューニング済みの7.61B LLMです。コーディング、数学、29以上の言語での多言語処理に優れています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計7.61B、埋め込み以外は6.53B
  • コンテキスト長: 131,072トークン(配布時の設定では32,768)
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: Q3_K_M GGUF(3.81 GB)には6 GBのメモリ

Qwen2.5-7B-Instructとは

Qwen2.5-7B-Instructは、Alibaba CloudのQwen2.5シリーズに属する、指示チューニング済みの7Bモデルです。このシリーズには、パラメータ数が0.5Bから72Bまでのベースモデルと指示チューニング済みモデルが含まれます。Qwenチームが2024年9月にApache 2.0で公開し、Hugging Faceでのリポジトリのダウンロード数は11,500,000回を超えています。Qwen2と比べて知識が増え、コーディングと数学の能力が向上しています。パラメータ数は7.61Bで、Q4_K_M GGUFビルドのサイズは2つの分割ファイルを合わせて4.68 GBです。

仕様Qwen2.5-7B-Instruct
総パラメータ数7.61B
埋め込み以外のパラメータ数6.53B
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたTransformerベースのデンスモデル
層数28
アテンションヘッド数(GQA)クエリ用が28、キー用とバリュー用がそれぞれ4
コンテキスト長131,072トークン(配布時の設定では32,768)
最大生成トークン数8,192トークン
対応言語英語、中国語、フランス語、スペイン語、ロシア語、日本語、アラビア語を含む29以上の言語
リリース日2024年9月
ライセンスApache 2.0

配布時のconfig.jsonでは、コンテキスト長が32,768トークンに設定されています。これを超えて最大131,072トークンまで利用する方法として、Qwenはfactorを4.0にしたYaRNのrope_scalingブロックを設定に追加する手順を示し、デプロイにはvLLMを推奨しています。vLLMが現在サポートしているのは静的YaRNのみで、入力の長さにかかわらずスケーリング係数が一定のため、短いプロンプトでは品質が多少低下する可能性があります。Qwenは、実際に長いテキストを処理する場合にのみ有効にするよう勧めています。

Qwen2.5-7B-Instructが得意なこと

Qwenはモデルカード自体にはベンチマークの数値を掲載していません。詳しい評価結果はQwen2.5のブログ記事に掲載されています。それでも、モデルカードに記載された性能に関する主張は具体的です。Qwen2と比べて知識が大幅に増え、コーディングと数学の能力も大きく向上しているとされています。Qwenは、これらの向上は各分野向けに学習させた専門モデルによるものだと説明しています。

指示チューニングは、実用的なチャットボットの用途を対象としています。具体的には、指示追従性の向上、8Kトークンを超える長文の生成、表などの構造化データの理解、特にJSONをはじめとする構造化出力の生成です。またQwenは、多様なシステムプロンプトに対してモデルがより安定して対応できるようになったとしており、ロールプレイの設定やチャットボットの条件設定に役立ちます。対応言語は29を超え、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などを含みます。

Qwen2.5-7B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。ファイルがRAMまたはVRAMに収まり、コンテキスト用の空き容量も残る必要があります。Qwenは公式GGUFビルドをQwen/Qwen2.5-7B-Instruct-GGUFで公開しています。一部は分割ファイルとして配布されており、以下のサイズはダウンロードするファイルの合計です。

メモリ選ぶビルドファイルサイズ
6 GBQ3_K_M3.81 GB
8 GBQ4_K_M4.68 GB
12 GBQ6_K6.25 GB
16 GBQ8_08.10 GB
24 GB以上FP1615.23 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。また、7Bモデルと、同じメモリ容量で動くほかのモデルとの比較については、16 GB Macに最適なローカルLLMをご覧ください。

Atomic ChatでQwen2.5-7B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでQwen2.5-7B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを始めます。

このシリーズには、さらに大きなモデルもあります。次のサイズはQwen2.5-14B-Instructです。ローカルで実行できるすべてのQwenモデルは、シリーズのページに掲載されています。

Qwen2.5-7B-Instructのライセンス

Qwen2.5-7B-InstructはApache 2.0で公開されており、リポジトリにはライセンスファイルが含まれています。このライセンスでは、ロイヤルティなしでの商用利用、改変、再配布が認められています。そのため、このモデルを基に製品を開発し、利用料を払わずに自分のハードウェアで実行できます。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-7B-Instruct
# またはOllamaで量子化モデルを実行:
ollama run qwen2.5:7b-instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-7B-Instruct",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-7B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_name)
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "sk-local" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-7B-Instruct",
  messages: [{ role: "user", content: "Hello!" }]
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-7B-Instructは、Alibaba CloudのQwenチームが開発し、2024年9月に公開した、パラメータ数7.61Bの指示チューニング済み大規模言語モデルです。チャット、指示追従、コーディング、数学向けに事後学習されており、最大128Kトークンのコンテキスト長に対応しています。

フル精度では、7.61Bモデルに約16 GBのVRAMが必要なため、16 GBのGPU 1基で快適に動作します。4ビット量子化(GGUFまたはAWQ)では8 GBのGPUで快適に動作し、量子化されたGGUFビルドはllama.cppやOllamaを通じてCPUやApple Siliconでも実行できます。

はい。Qwen2.5-7B-InstructはApache 2.0ライセンスで公開されており、無料での利用、改変、再配布、ロイヤルティなしでの商用デプロイが認められています。重みはHugging Faceで公開され、ダウンロードできるため、APIを使わずにセルフホストできます。

Qwen2.5-7B-Instructは最大131,072トークン(128K)のコンテキスト長に対応し、1回の応答で最大8,192トークンを生成できます。配布時の設定では、デフォルトは32,768トークンです。128Kのコンテキスト長をすべて利用するには、vLLMなどのフレームワークがサポートするYaRNのropeスケーリングを有効にする必要があります。

このモデルは29を超える言語に対応しており、英語、中国語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などを含みます。Qwen2.5では構造化データの理解とJSON出力も改善されており、これらの改善は各対応言語にも及びます。