Qwen2.5-Coder-7B-Instructとは?
Qwen2.5-Coder-7B-Instructは、AlibabaのQwen2.5-Coderファミリーに属する、パラメータ数7.61Bの指示チューニング済みモデルです。このファミリーは、以前はCodeQwenと呼ばれていた、コードに特化したQwenモデル群です。シリーズには0.5Bから32Bまでの6つのサイズがあり、7Bはその中間に位置します。量子化版ならメモリ8 GBのノートパソコンに収まるサイズです。重みは2024年9月にApache 2.0ライセンスでHugging Faceに公開されました。
| 仕様 | Qwen2.5-Coder-7B-Instruct |
|---|---|
| 総パラメータ数 | 7.61B(埋め込みを除くと6.53B) |
| アーキテクチャ | RoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えた因果Transformer |
| 層数 | 28 |
| アテンションヘッド数 | GQA、クエリ用28、KV用4 |
| コンテキスト長 | 131,072トークン(デフォルトは32,768、それを超える場合はYaRNを使用) |
| 学習 | 事前学習と事後学習、シリーズ全体で5.5兆トークン |
| リリース日 | 2024年9月 |
| ライセンス | Apache 2.0 |
配布時の設定では、コンテキスト長の上限は32,768トークンです。これを超える場合、Qwenは倍率4.0のYaRNによるRoPEスケーリングを使用し、最大131,072トークンまで利用できるようにします。開発チームは、実際に長い入力を渡す場合にのみrope_scalingブロックを追加するよう勧めています。サポートされている実装は静的なため、すべての入力長にスケーリングが適用され、短いプロンプトでは品質が多少低下する可能性があります。モデルの読み込みにはtransformers 4.37以降が必要で、Qwenは推論の提供にvLLMを推奨しています。
Qwen2.5-Coder-7B-Instructが得意なこと
QwenはCoderシリーズを、コード生成、コードに関する推論、コード修正という3つの用途に位置付けており、いずれもCodeQwen1.5から大幅に改善したとしています。この改善を支えるのは規模の拡大です。学習データは5.5兆トークンに増え、Qwen2.5をベースに、ソースコード、テキストとコードの対応付けデータ、合成データを組み合わせています。開発チームはコードエージェントも想定用途に挙げており、コードのために他の能力をすべて犠牲にするのではなく、Qwen2.5の数学能力と汎用的な能力を維持していると述べています。
モデルカードにはベンチマーク表が掲載されておらず、QwenはCoderファミリーに関するブログ記事で詳細な評価結果を公開しています。モデルカードにある唯一の比較に関する主張は、フラッグシップの32Bについてです。Qwenはこれを最先端のオープンソースのコードLLMと呼び、コーディング能力はGPT-4oに匹敵するとしています。7Bでは、同じ学習手法をローカルで実行できるサイズで利用できます。より大きなモデルを動かせるメモリがある場合は、Qwen2.5-Coder-32B-Instructをご覧ください。
Qwen2.5-Coder-7B-Instructのハードウェア要件
システム要件で確認すべきなのはメモリです。モデルファイルがRAMまたはVRAMに収まり、さらにコンテキスト用の空き容量が残る必要があります。Qwenは公式GGUF版をQwen/Qwen2.5-Coder-7B-Instruct-GGUFで公開しています。実際のファイルサイズは以下のとおりです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 6 GB | Q3_K_M | 3.81 GB |
| 8 GB | Q4_K_M | 4.68 GB |
| 12 GB | Q6_K | 6.25 GB |
| 16 GB | Q8_0 | 8.10 GB |
| 24 GB以上 | FP16 | 15.24 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。同じリポジトリには、上の表にある単一ファイルに加え、複数のビルドの分割版も掲載されています。fp16は連番付きの4つのファイルに、q8_0は3つのファイルに分割されています。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen2.5-Coder-7B-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォームに対応したAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen2.5-Coder-7B-Instructを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
ファミリーの他のモデルについては、ローカルで実行できるQwenモデルの一覧をご覧ください。
Qwen2.5-Coder-7B-Instructのライセンス
Qwen2.5-Coder-7B-InstructはApache 2.0ライセンスで公開されており、ライセンスファイルはリポジトリに含まれています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められているため、製品への組み込み、ファインチューニング、自分のハードウェアでの実行を利用料なしで行えます。
