Qwen2.5-7B-Instructとは
Qwen2.5-7B-Instructは、Alibaba CloudのQwen2.5シリーズに属する、指示チューニング済みの7Bモデルです。このシリーズには、パラメータ数が0.5Bから72Bまでのベースモデルと指示チューニング済みモデルが含まれます。Qwenチームが2024年9月にApache 2.0で公開し、Hugging Faceでのリポジトリのダウンロード数は11,500,000回を超えています。Qwen2と比べて知識が増え、コーディングと数学の能力が向上しています。パラメータ数は7.61Bで、Q4_K_M GGUFビルドのサイズは2つの分割ファイルを合わせて4.68 GBです。
| 仕様 | Qwen2.5-7B-Instruct |
|---|---|
| 総パラメータ数 | 7.61B |
| 埋め込み以外のパラメータ数 | 6.53B |
| アーキテクチャ | RoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたTransformerベースのデンスモデル |
| 層数 | 28 |
| アテンションヘッド数(GQA) | クエリ用が28、キー用とバリュー用がそれぞれ4 |
| コンテキスト長 | 131,072トークン(配布時の設定では32,768) |
| 最大生成トークン数 | 8,192トークン |
| 対応言語 | 英語、中国語、フランス語、スペイン語、ロシア語、日本語、アラビア語を含む29以上の言語 |
| リリース日 | 2024年9月 |
| ライセンス | Apache 2.0 |
配布時のconfig.jsonでは、コンテキスト長が32,768トークンに設定されています。これを超えて最大131,072トークンまで利用する方法として、Qwenはfactorを4.0にしたYaRNのrope_scalingブロックを設定に追加する手順を示し、デプロイにはvLLMを推奨しています。vLLMが現在サポートしているのは静的YaRNのみで、入力の長さにかかわらずスケーリング係数が一定のため、短いプロンプトでは品質が多少低下する可能性があります。Qwenは、実際に長いテキストを処理する場合にのみ有効にするよう勧めています。
Qwen2.5-7B-Instructが得意なこと
Qwenはモデルカード自体にはベンチマークの数値を掲載していません。詳しい評価結果はQwen2.5のブログ記事に掲載されています。それでも、モデルカードに記載された性能に関する主張は具体的です。Qwen2と比べて知識が大幅に増え、コーディングと数学の能力も大きく向上しているとされています。Qwenは、これらの向上は各分野向けに学習させた専門モデルによるものだと説明しています。
指示チューニングは、実用的なチャットボットの用途を対象としています。具体的には、指示追従性の向上、8Kトークンを超える長文の生成、表などの構造化データの理解、特にJSONをはじめとする構造化出力の生成です。またQwenは、多様なシステムプロンプトに対してモデルがより安定して対応できるようになったとしており、ロールプレイの設定やチャットボットの条件設定に役立ちます。対応言語は29を超え、中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語などを含みます。
Qwen2.5-7B-Instructのハードウェア要件
システム要件で確認すべきなのはメモリです。ファイルがRAMまたはVRAMに収まり、コンテキスト用の空き容量も残る必要があります。Qwenは公式GGUFビルドをQwen/Qwen2.5-7B-Instruct-GGUFで公開しています。一部は分割ファイルとして配布されており、以下のサイズはダウンロードするファイルの合計です。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 6 GB | Q3_K_M | 3.81 GB |
| 8 GB | Q4_K_M | 4.68 GB |
| 12 GB | Q6_K | 6.25 GB |
| 16 GB | Q8_0 | 8.10 GB |
| 24 GB以上 | FP16 | 15.23 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。また、7Bモデルと、同じメモリ容量で動くほかのモデルとの比較については、16 GB Macに最適なローカルLLMをご覧ください。
Atomic ChatでQwen2.5-7B-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでQwen2.5-7B-Instructを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを始めます。
このシリーズには、さらに大きなモデルもあります。次のサイズはQwen2.5-14B-Instructです。ローカルで実行できるすべてのQwenモデルは、シリーズのページに掲載されています。
Qwen2.5-7B-Instructのライセンス
Qwen2.5-7B-InstructはApache 2.0で公開されており、リポジトリにはライセンスファイルが含まれています。このライセンスでは、ロイヤルティなしでの商用利用、改変、再配布が認められています。そのため、このモデルを基に製品を開発し、利用料を払わずに自分のハードウェアで実行できます。
