Qwen2.5-72B-Instructとは?
Qwen2.5-72B-Instructは、AlibabaのQwen2.5シリーズにおける、指示チューニング済みの72.7Bフラッグシップモデルです。2024年9月にHugging Faceで公開されました。このシリーズには、パラメータ数が0.5Bから72Bまでのベースモデルと指示チューニング済みモデルがあり、本モデルは指示チューニング済みモデルの中で最大です。80層、グループ化クエリアテンション、131,072トークンのコンテキスト長を備えた因果言語モデルです。Qwenが最小27.3 GBの公式GGUFビルドを公開しているため、ローカルLLMとしても実用的です。
| 仕様 | Qwen2.5-72B-Instruct |
|---|---|
| 総パラメータ数 | 72.7B(埋め込みを除くと70.0B) |
| アーキテクチャ | RoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたTransformer |
| 層数 | 80 |
| アテンションヘッド数(GQA) | Qは64、KVは8 |
| コンテキスト長 | 131,072トークン、生成は最大8,192トークン |
| 対応言語 | 中国語、英語、フランス語、ドイツ語、ロシア語、日本語、アラビア語を含む29を超える言語 |
| リリース日 | 2024年9月 |
| ライセンス | Qwen license |
長いコンテキストの利用を前提にする前に、知っておくべき点があります。配布されているconfig.jsonは32,768トークンに設定されています。131,072トークンのコンテキスト長をすべて利用するには、設定にYaRNのrope_scalingブロックを追加する必要があります。Qwenは、実際に長い入力を処理する場合にのみ追加するよう勧めています。これは、Qwenが推奨するデプロイ用スタックのvLLMが、現時点では静的なYaRNのみに対応しているためです。入力の長さに関係なくスケーリング係数が一定に保たれるため、短いテキストでの性能に影響する可能性があります。
Qwen2.5-72B-Instructが得意なこと
Qwenは詳細な評価結果をモデルカードではなくQwen2.5のブログに掲載しているため、以下は開発チーム自身によるリリース概要です。Qwen2と比較して、モデルの知識は大幅に増え、コーディングと数学の能力も大きく向上しています。チームは、これらの分野に特化した専門モデルによる成果だと説明しています。指示に従う能力に加え、パイプラインで重要となる2つの能力も向上しました。表などの構造化データを理解する能力と、特にJSONなどの構造化出力を生成する能力です。
このモデルは8Kトークンを超える長文も生成でき、多様なシステムプロンプトにもより安定して対応します。チームは、この特性がチャットボットでのロールプレイや条件設定に役立つとしています。対応言語は29を超え、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などが含まれます。
Qwen2.5-72B-Instructのハードウェア要件
確認すべきシステム要件はメモリ容量です。QwenはQwen/Qwen2.5-72B-Instruct-GGUFで公式の量子化ビルドを公開しています。各ビルドは複数のファイルに分割して配布されており、以下のサイズは各ビルドの全分割ファイルの合計です。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 32 GB | Q2_K | 27.3 GB |
| 48 GB | Q4_K_M | 44.0 GB |
| 64 GB | Q5_K_M | 51.7 GB |
| 80 GB | Q6_K | 59.9 GB |
| 96 GB以上 | Q8_0 | 77.5 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。メモリ容量が上記の区分の中間に当たる場合に向けて、リポジトリには35.5 GBのQ3_K_Mと41.3 GBのQ4_0も用意されています。また、量子化されていない145.8 GBのfp16もあります。この形式に馴染みがなければ、まずGGUFとは何かを確認してください。代わりにHugging Faceのtransformersで元の重みを使って推論サービスを提供する場合、Qwenはバージョン4.37.0以降を求めています。古いバージョンではKeyError: 'qwen2'で停止します。
Atomic ChatでQwen2.5-72B-Instructを動かす方法
Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム用のAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでQwen2.5-72B-Instructを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで動かせるQwenモデルの一覧をご覧ください。72Bがお使いのマシンの容量を超える場合は、同じシリーズの小型モデルQwen2.5-32B-Instructを選べます。
Qwen2.5-72B-Instructのライセンス
Qwen2.5-72B-InstructはQwen licenseで公開されています。Apache 2.0のような標準的なパーミッシブライセンスではなく、Alibaba独自の利用条件です。全文はモデルリポジトリ内のLICENSEファイルに収録されているため、このモデルを使って商用製品を開発する前に確認してください。
