Qwen2.5-Coder-32B-Instructとは
Qwen2.5-Coder-32B-Instructは、AlibabaのQwen2.5-Coderシリーズで最大のモデルです。このシリーズは、以前CodeQwenと呼ばれていた、コードに特化したQwenモデルの系統です。Qwenは、ソースコード、テキストとコードの対応付けデータ、合成データからなる5.5兆トークンでこのシリーズを学習させました。Qwenは32Bを、リリース時点で最先端のオープンソースのコード向けLLMと位置付け、コーディング能力はGPT-4oに匹敵すると報告しています。このモデルは32.5Bパラメータのデンスモデルで、提供元自身のQ4_K_Mビルドは24 GBのGPU一基に収まります。Alibabaは2024年11月6日に、Apache 2.0で重みを公開しました。
| 仕様 | Qwen2.5-Coder-32B-Instruct |
|---|---|
| 総パラメータ数 | 32.5B(埋め込みを除くと31.0B) |
| アーキテクチャ | RoPE、SwiGLU、RMSNorm、アテンションのQKVバイアスを備えたデンス型Transformer |
| 層数 | 64 |
| アテンションヘッド数 | GQA、Qは40、KVは8 |
| コンテキスト長 | 131,072トークン(YaRNなしでは32,768) |
| モダリティ | テキストのみ |
| 学習データ | 5.5兆トークン:ソースコード、テキストとコードの対応付けデータ、合成データ |
| リリース日 | 2024年11月6日 |
| ライセンス | Apache 2.0 |
仕様のうち、一点は詳しく確認する必要があります。配布されているconfig.jsonでは、コンテキスト長は32,768トークンに設定されています。最大の131,072を利用するには、RoPEのスケーリング手法であるYaRNを設定内で有効にし、係数を4.0にします。Qwenは、実際に入力が長くなる場合に限って、この設定を追加するよう勧めています。Qwenが推奨する推論サーバーのvLLMは静的YaRNにのみ対応しており、入力の長さにかかわらずスケーリング係数が一定に保たれるため、短いテキストでは品質が低下する可能性があります。日常的なコーディングには、デフォルトの32Kのコンテキスト長がより適しています。
Qwen2.5-Coder-32B-Instructが得意なこと
モデルカードでは、このシリーズがCodeQwen1.5を上回った分野として、コード生成、コードに関する推論、コード修正の三つを挙げています。32B-Instructはシリーズの六つのサイズ(0.5B、1.5B、3B、7B、14B、32Bパラメータ)の中で最も高性能で、GPT-4oとの比較対象になっているモデルです。Qwenはモデルカード自体にはスコア表を掲載していないため、このページにもベンチマーク表はありません。詳細な評価結果は、Qwen2.5-Coderファミリーのブログ記事に掲載されています。
Qwenは、このモデルをコードエージェントの基盤としても位置付けています。学習では、コードのスコアを優先して数学や汎用能力を犠牲にするのではなく、ベースとなるQwen2.5の能力を維持しました。これは、エージェントが単に差分を出力するだけでなく、タスクについて推論する必要がある場合に重要です。
Qwen2.5-Coder-32B-Instructのハードウェア要件
システム要件で確認すべきなのはメモリです。Qwenは公式のGGUF変換版をQwen/Qwen2.5-Coder-32B-Instruct-GGUFとして公開しており、以下のファイルサイズはそのリポジトリに基づいています。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 16 GB | Q2_K | 12.31 GB |
| 24 GB | Q4_K_M | 19.85 GB |
| 32 GB | Q5_K_M | 23.26 GB |
| 48 GB | Q6_K | 26.89 GB |
| 64 GB以上 | Q8_0 | 34.82 GB |
二つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。品質の向上と引き換えに必要なのは、ディスク容量だけです。GGUF形式を初めて使う方は、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen2.5-Coder-32B-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen2.5-Coder-32B-Instructを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
32Bがお使いのマシンに収まらない場合は、同じ手法を採用しながらサイズを大幅に抑えたQwen2.5-Coder-7B-Instructがあります。ローカルで実行できるすべてのQwenモデルは、ファミリーページに掲載されています。
Qwen2.5-Coder-32B-Instructのライセンス
Qwen2.5-Coder-32B-InstructはApache 2.0で公開されています。このライセンスは、ロイヤリティなしでの商用利用、改変、再配布を認めているため、モデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。
