Phi-4-mini-instructとは?
Phi-4-mini-instructは、Microsoftが開発した3.8Bパラメータのデコーダーのみで構成されるデンスモデルで、Phi-4ファミリーの小型テキストモデルです。Microsoftは、推論を多く含む資料に重点を置いた合成データとフィルタリング済みの公開ウェブデータ、計5兆トークンで学習させた後、指示に従う能力を高めるため、教師ありファインチューニングと直接選好最適化による事後学習を行いました。2025年2月にMITライセンスで公開され、ローカルで実行しやすいオープンモデルの一つです。Q4_K_Mビルドのサイズは2.49 GBです。
| 仕様 | Phi-4-mini-instruct |
|---|---|
| パラメータ数 | 3.8B (3,836,021,760) |
| アーキテクチャ | デコーダーのみのTransformerを採用したデンスモデル |
| アテンション | グループ化クエリアテンション、デフォルトでFlash Attentionを使用 |
| 埋め込み | 入力と出力の埋め込みを共有 |
| 語彙 | 200,064トークン、ファインチューニング用の予備スロットあり |
| コンテキスト長 | 128Kトークン |
| モダリティ | テキスト入力、テキスト出力 |
| 言語 | アラビア語からウクライナ語まで23言語に対応 |
| 関数呼び出し | 対応。システムプロンプト内でツールをJSONとして宣言 |
| 学習データ | 5兆トークン、カットオフは2024年6月 |
| 学習の実施 | A100-80G GPUを512基使用、21日間、2024年後半 |
| 事後学習 | 教師ありファインチューニング、直接選好最適化 |
| リリース日 | 2025年2月 |
| ライセンス | MIT |
MicrosoftがPhi-3.5-miniからのアーキテクチャ上の変更点として挙げているのは、200Kの語彙、グループ化クエリアテンション、入力と出力の埋め込みの共有の三つです。語彙の拡大は、23言語への対応を目的としています。コーパスはスクレイピングで集めたものではなく、選別されたものです。公開文書を望ましい知識レベルに合わせてフィルタリングし、推論のための容量を確保するために雑学的な情報を除いた後、ベンチマークとのn-gram照合によって評価データの混入を除去しました。Microsoftは、モデルサイズによる限界も明言しています。3.8Bモデルには事実に関する知識を多く蓄えられないため、モデルカード自体が、事実が重要な場面では検索エンジンやRAGと組み合わせることを推奨しています。
Phi-4-mini-instructのベンチマーク
Microsoftは、社内のベンチマーク基盤で実施した独自の比較結果を公開しています。比較対象は、前世代のPhi-3.5-miniを含む同程度の規模の指示応答モデルと、2倍の規模のクラスに属するQwen2.5-7Bです。
| ベンチマーク | Phi-4-mini-instruct | Phi-3.5-mini | Llama-3.2-3B | Qwen2.5-3B | Qwen2.5-7B |
|---|---|---|---|---|---|
MMLU 一般知識 | 67.3 | 65.5 | 61.8 | 65.0 | 72.6 |
MMLU-Pro 学術知識 | 52.8 | 47.4 | 39.2 | 44.7 | 56.2 |
BigBench Hard 高難度の推論 | 70.4 | 63.1 | 55.4 | 56.2 | 72.4 |
ARC Challenge 科学的推論 | 83.7 | 84.6 | 76.1 | 82.6 | 90.1 |
TruthfulQA 根拠に基づく推論 | 66.4 | 65.2 | 59.2 | 64.3 | 69.4 |
GSM8K 小学校レベルの算数 | 88.6 | 76.9 | 75.6 | 80.6 | 88.7 |
MATH 数学競技の問題 | 64.0 | 49.8 | 46.7 | 61.7 | 60.4 |
MGSM 多言語の数学 | 63.9 | 49.6 | 44.6 | 53.5 | 64.5 |
同規模のモデルとの比較では、この8項目のうち7項目で首位となり、特に数学で大きな差をつけています。GSM8Kは88.6、MATHは64.0です。唯一、ARC Challengeでは相手の84.6に対して83.7と下回ります。パラメータ数がほぼ2倍のQwen2.5-7Bが全体では優勢ですが、miniはMATHで単独首位となり、GSM8KとMGSMでも差は1ポイント以内です。
Microsoftは、全17ベンチマークの表における総合平均を63.5と報告しています。Phi-3.5-miniは60.5、Llama-3.2-3Bは56.2です。同社は、3.8Bモデルが「はるかに大きなモデルと同程度の多言語での言語理解能力と推論能力を達成している」と総括し、主な用途として、メモリと計算資源が限られた環境、レイテンシの制約がある場面、数学と論理を重視する推論の三つを挙げています。この表に含まれていない項目を見ると、Phi-3.5-miniに対して性能が低下した部分もあります。HellaSwagでは72.2に対して69.1、Winograndeでは72.2に対して67.0、Multilingual MMLUでは51.8に対して49.3です。
Phi-4-mini-instructのハードウェア要件
システム要件で確認すべきなのはメモリです。以下のGGUFビルドはunsloth/Phi-4-mini-instruct-GGUFとして公開されており、フル精度のファイルでさえ、ローカルLLMとしては小さめです。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 2 GB | Q2_K | 1.68 GB |
| 3 GB | Q3_K_M | 2.12 GB |
| 4 GB | Q4_K_M | 2.49 GB |
| 5 GB | Q5_K_M | 2.85 GB |
| 6 GB | Q6_K | 3.16 GB |
| 8 GB | Q8_0 | 4.08 GB |
| 16 GB以上 | BF16 | 7.68 GB |
量子化ビルド間のサイズ差は1 GB未満なので、二つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。これは特に小さいビルドで重要です。Q2_Kで削減できるのはQ4_K_Mに対してわずか0.81 GBで、同じリポジトリのQ2_K_Lも同じ1.68 GBです。そのため、2ビットのファイルを選ぶのは、4 GBを確保できないマシンに限ってください。
元の重みを実行する環境として、MicrosoftはvLLM 0.7.3以降とTransformers 4.49.0を挙げており、どちらもtorch 2.5.1とflash_attn 2.7.4.post1を使用します。サンプルスクリプトでは、temperature 0.0で貪欲法によるデコードを行います。Flash Attentionはデフォルトで有効になっており、新しい世代のNVIDIAカードが必要です。テスト済みなのはA100、A6000、H100で、V100以前のカードではattn_implementationをeagerに設定する必要があります。この形式に馴染みがなければ、まずGGUFとは何かを読んでください。ほかにどのモデルが同じ環境に収まるかは、16 GBのMacに最適なローカルLLMを参照してください。
Atomic ChatでPhi-4-mini-instructを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでPhi-4-mini-instructを検索し、Download Optionsを開きます。
- 利用できるメモリに収まるビルドを選び、チャットを開始します。
ファミリー内のほかのモデルについては、ローカルで実行できるすべてのPhiモデル、またはフルサイズのPhi-4を参照してください。
Phi-4-mini-instructのライセンス
Phi-4-mini-instructは、オープンモデルに採用されるライセンスの中でも特に制約が少ないMITライセンスで公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基盤に製品を開発し、自分のハードウェアで利用料なしに実行できます。Microsoftは、適用対象外となるものを別途明示しています。権利の許諾はモデルを対象とし、商標やロゴは対象に含まれないため、改変版でMicrosoftの後援があるかのように示してはいけません。
