Qwen2.5-72B-Instruct

更新
04.10.2026
推論
コード生成
多言語
ツール利用

AlibabaのQwen2.5シリーズに属する、指示チューニング済みの72.7B LLMです。コーディング、数学、29以上の言語での多言語処理に優れています。

基本情報

  • ライセンス: Qwen license(独自ライセンス、全文はモデルリポジトリに収録)
  • パラメータ数: 合計72.7B、埋め込みを除くと70.0B
  • コンテキスト長: 131,072トークン、生成は最大8,192トークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ32 GB(Q2_K GGUF、27.3 GB)

Qwen2.5-72B-Instructとは?

Qwen2.5-72B-Instructは、AlibabaのQwen2.5シリーズにおける、指示チューニング済みの72.7Bフラッグシップモデルです。2024年9月にHugging Faceで公開されました。このシリーズには、パラメータ数が0.5Bから72Bまでのベースモデルと指示チューニング済みモデルがあり、本モデルは指示チューニング済みモデルの中で最大です。80層、グループ化クエリアテンション、131,072トークンのコンテキスト長を備えた因果言語モデルです。Qwenが最小27.3 GBの公式GGUFビルドを公開しているため、ローカルLLMとしても実用的です。

仕様Qwen2.5-72B-Instruct
総パラメータ数72.7B(埋め込みを除くと70.0B)
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたTransformer
層数80
アテンションヘッド数(GQA)Qは64、KVは8
コンテキスト長131,072トークン、生成は最大8,192トークン
対応言語中国語、英語、フランス語、ドイツ語、ロシア語、日本語、アラビア語を含む29を超える言語
リリース日2024年9月
ライセンスQwen license

長いコンテキストの利用を前提にする前に、知っておくべき点があります。配布されているconfig.jsonは32,768トークンに設定されています。131,072トークンのコンテキスト長をすべて利用するには、設定にYaRNのrope_scalingブロックを追加する必要があります。Qwenは、実際に長い入力を処理する場合にのみ追加するよう勧めています。これは、Qwenが推奨するデプロイ用スタックのvLLMが、現時点では静的なYaRNのみに対応しているためです。入力の長さに関係なくスケーリング係数が一定に保たれるため、短いテキストでの性能に影響する可能性があります。

Qwen2.5-72B-Instructが得意なこと

Qwenは詳細な評価結果をモデルカードではなくQwen2.5のブログに掲載しているため、以下は開発チーム自身によるリリース概要です。Qwen2と比較して、モデルの知識は大幅に増え、コーディングと数学の能力も大きく向上しています。チームは、これらの分野に特化した専門モデルによる成果だと説明しています。指示に従う能力に加え、パイプラインで重要となる2つの能力も向上しました。表などの構造化データを理解する能力と、特にJSONなどの構造化出力を生成する能力です。

このモデルは8Kトークンを超える長文も生成でき、多様なシステムプロンプトにもより安定して対応します。チームは、この特性がチャットボットでのロールプレイや条件設定に役立つとしています。対応言語は29を超え、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などが含まれます。

Qwen2.5-72B-Instructのハードウェア要件

確認すべきシステム要件はメモリ容量です。QwenはQwen/Qwen2.5-72B-Instruct-GGUFで公式の量子化ビルドを公開しています。各ビルドは複数のファイルに分割して配布されており、以下のサイズは各ビルドの全分割ファイルの合計です。

メモリ選択するビルドファイルサイズ
32 GBQ2_K27.3 GB
48 GBQ4_K_M44.0 GB
64 GBQ5_K_M51.7 GB
80 GBQ6_K59.9 GB
96 GB以上Q8_077.5 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。メモリ容量が上記の区分の中間に当たる場合に向けて、リポジトリには35.5 GBのQ3_K_Mと41.3 GBのQ4_0も用意されています。また、量子化されていない145.8 GBのfp16もあります。この形式に馴染みがなければ、まずGGUFとは何かを確認してください。代わりにHugging Faceのtransformersで元の重みを使って推論サービスを提供する場合、Qwenはバージョン4.37.0以降を求めています。古いバージョンではKeyError: 'qwen2'で停止します。

Atomic ChatでQwen2.5-72B-Instructを動かす方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム用のAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen2.5-72B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで動かせるQwenモデルの一覧をご覧ください。72Bがお使いのマシンの容量を超える場合は、同じシリーズの小型モデルQwen2.5-32B-Instructを選べます。

Qwen2.5-72B-Instructのライセンス

Qwen2.5-72B-InstructはQwen licenseで公開されています。Apache 2.0のような標準的なパーミッシブライセンスではなく、Alibaba独自の利用条件です。全文はモデルリポジトリ内のLICENSEファイルに収録されているため、このモデルを使って商用製品を開発する前に確認してください。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-72B-Instruct
# またはvLLMで推論を提供:
vllm serve Qwen/Qwen2.5-72B-Instruct --tensor-parallel-size 2
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-72B-Instruct",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-72B-Instruct", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-72B-Instruct")
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(out[0], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-72B-Instruct",
  messages: [{ role: "user", content: "Hello!" }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-72B-Instructは、Alibaba CloudのQwenチームが2024年9月にリリースした、パラメータ数72.7Bの指示チューニング済み大規模言語モデルです。チャット、コーディング、数学、構造化出力のタスク向けに事後学習された因果型(デコーダーのみ)のTransformerで、最大128Kトークンのコンテキスト長に対応しています。

フル精度のBF16/FP16では、72Bの重みに約145 GBのメモリが必要です。そのため、量子化せずに動かす場合は通常、複数のGPU(例:A100 80GBを2台)が必要になります。4ビット量子化では、モデルは約45-48 GBのVRAMに収まるため、48 GBのカード1枚、または24 GBのカード2枚で動かせます。128Kトークンの長いコンテキストを利用する場合は、KVキャッシュ用の追加メモリも必要です。

重みは公開されており、Hugging Faceから無料でダウンロードできます。72Bモデルは、Apache 2.0のような標準的なパーミッシブライセンスではなく、Qwen Licenseで公開されています。Qwen Licenseは商用利用を認めていますが、月間アクティブユーザー数が1億人を超える製品やサービスでは、Alibaba Cloudに別途ライセンスを申請する必要があります。

Qwen2.5-72B-Instructは29を超える言語に対応しています。中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などが含まれます。幅広い言語に対応しているため、翻訳、異なる言語間でのチャット、英語以外でのコンテンツ生成に適しています。

このモデルは最大131,072トークン(約128K)のコンテキスト長に対応し、1回の応答で最大8,192トークンを生成できます。配布されているconfig.jsonのデフォルト値は32,768トークンです。128Kのコンテキスト長をすべて利用するには、YaRNのRoPEスケーリングを有効にします。ただし、短いプロンプトでは品質が低下する可能性があるため、Qwenは長いコンテキストの入力が実際に必要な場合にのみ有効にするよう推奨しています。