Qwen2.5-14B-Instruct

更新
04.10.2026
推論
コード生成
多言語
ツール利用

AlibabaのQwen2.5シリーズに属する、14.7Bの指示チューニング済みLLMです。コーディングと数学に強く、29以上の言語に対応しています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 14.7B(埋め込みを除くと13.1B)
  • コンテキスト長: 131,072トークン、生成は最大8,192トークン
  • モダリティ: テキストの入力と出力
  • 最小ハードウェア要件: 5.8 GBのQ2_K GGUFビルドでメモリ8 GB

Qwen2.5-14B-Instructとは?

Qwen2.5-14B-Instructは、Alibaba CloudのQwenチームが開発した、14.7Bの指示チューニング済みデンスモデルです。0.5Bから72Bのパラメータ規模をそろえるQwen2.5シリーズの中規模チャットモデルとして、2024年9月16日にリリースされました。ローカルでの実行に実用的なサイズで、公式のQ4_K_M GGUFビルドは合計約9 GBです。そのため、12 GBのGPUまたは16 GBのMacで、コンテキスト用の余裕を残して実行できます。重みはApache 2.0で公開されています。

仕様Qwen2.5-14B-Instruct
総パラメータ数14.7B(埋め込みを除くと13.1B)
ベースモデルQwen2.5-14B
学習段階事前学習と事後学習
アーキテクチャRoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたデンス型Transformer
層数48
アテンションヘッド数(GQA)クエリ用40、キーとバリュー用8
コンテキスト長131,072トークン
最大生成長8,192トークン
モダリティテキストの入力と出力
リリース日2024年9月16日
ライセンスApache 2.0

長文ドキュメントを扱う前に、知っておきたい点があります。配布されているconfig.jsonでは、コンテキスト長の上限が32,768トークンに設定されています。設定にYaRNのrope_scalingブロックを追加すると、131,072トークンのコンテキスト長をすべて利用できます。ただし、静的なYaRNは短いテキストで品質を多少低下させる可能性があるため、Qwenは長い入力が実際に必要な場合にのみ追加するよう勧めています。ローカルアプリ以外で推論を提供する場合、QwenチームはvLLMを推奨しています。

Qwen2.5-14B-Instructが得意なこと

Qwenはこのモデルカードにベンチマーク表を掲載しておらず、詳細な評価結果はQwen2.5のブログ記事に掲載されています。ただし、Qwen2からの変更点はモデルカードに具体的に記載されています。知識が大幅に増え、コーディングと数学の能力が大きく向上したとされており、チームはこれを両分野で学習させた専門モデルの成果と説明しています。

モデルカードには、これらに加えて、指示追従性、8Kトークンを超える長文の生成、表などの構造化データの理解、特にJSONを中心とした構造化出力の生成も改善点として挙げられています。また、多様なシステムプロンプトに対して、より安定して対応できるようになったと説明されています。これは、ロールプレイの設定や、固定の条件に従うチャットボットで重要です。中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語を含む、29を超える言語に対応しています。

Qwen2.5-14B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。QwenはQwen/Qwen2.5-14B-Instruct-GGUFで公式のGGUFビルドを公開しています。各ビルドは最大4 GBのファイルに分割して配布されており、以下のサイズはそれらの合計です。

メモリ選択するビルドファイルサイズ
8 GBQ2_K5.8 GB
12 GBQ4_K_M9.0 GB
16 GBQ6_K12.1 GB
24 GBQ8_015.7 GB
32 GB以上FP1629.6 GB

2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。上の表の中間にあたる選択肢が必要なら、Q3_K_M(7.3 GB)とQ5_K_M(10.5 GB)があります。この形式に馴染みがなければ、まずGGUFとは何かを参照してください。同じメモリ容量で動くほかのモデルについては、16 GBのMacに最適なローカルLLMをご覧ください。

Atomic ChatでQwen2.5-14B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォームに対応するAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen2.5-14B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるQwenモデルの一覧をご覧ください。メモリに余裕があれば、Qwen2.5-32B-Instructにステップアップすることもできます。

Qwen2.5-14B-Instructのライセンス

Qwen2.5-14B-InstructはApache 2.0で公開されており、リポジトリからライセンス本文へのリンクを参照できます。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。このモデルを使った製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download Qwen/Qwen2.5-14B-Instruct
# またはvLLMで推論を提供:
vllm serve Qwen/Qwen2.5-14B-Instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-14B-Instruct",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-14B-Instruct"
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_name)
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "not-needed" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen2.5-14B-Instruct",
  messages: [{ role: "user", content: "Hello!" }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen2.5-14B-Instructは、Alibaba CloudのQwenチームが開発した指示チューニング済みの大規模言語モデルで、2024年9月にリリースされたQwen2.5シリーズの一部です。パラメータ数は14.7Bで、RoPE、SwiGLU、RMSNorm、GQAアテンションを備えた因果Transformerアーキテクチャを採用しています。チャット、指示追従、コーディング、数学向けにチューニングされています。

4ビット量子化(Q4_K_M)では、この14.7Bモデルに約9 GBのメモリが必要です。そのため、12 GBのGPUが実用上の最小構成で、16 GBあればコンテキスト用の余裕を残して快適に実行できます。ビット数の多い量子化では、さらにメモリが必要です。Q5_K_Mでは約11 GB、Q8_0では約15 GB、量子化していないFP16では約28 GBが目安です。18 GB以上のユニファイドメモリを搭載したApple Silicon Macでも実行できます。コンテキストが長い場合は、これに加えてKVキャッシュ用に数GBが必要です。

Qwen2.5-14B-Instructは最大131,072トークン(128K)のコンテキスト長に対応し、最大8,192トークンを生成できます。配布されているconfig.jsonでは、デフォルトのコンテキスト長の上限が32,768トークンに設定されています。128Kのコンテキスト長をすべて利用するには、YaRNによるRoPEスケーリングを有効にします。Qwenチームは、長い入力が実際に必要な場合にのみ有効にするよう勧めています。

はい。Qwen2.5-14B-InstructはApache 2.0ライセンスで公開されており、商用利用と私的利用、改変、再配布が無料で認められています。重みはHugging Faceから誰でもダウンロードでき、セルフホストする場合はトークンごとの料金がかかりません。

Qwen2.5-14B-Instructは、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語を含む、29を超える言語に対応しています。Qwen2.5シリーズでは、構造化データの理解とJSON出力も改善されており、多言語でのツール利用やチャットのタスクに役立ちます。