Phi-4-mini-instruct

更新
04.10.2026
推論
コード生成
多言語
ツール利用

MicrosoftのPhi-4ファミリーに属する、3.8Bパラメータのオープンな指示応答モデルです。128Kのコンテキスト長に対応し、数学と推論に強く、関数呼び出しもサポートします。

基本情報

  • ライセンス: MIT
  • パラメータ数: 3.8B、デコーダーのみで構成されるデンスモデル
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ4 GB、Q4_K_M GGUFのファイルサイズは2.49 GB

Phi-4-mini-instructとは?

Phi-4-mini-instructは、Microsoftが開発した3.8Bパラメータのデコーダーのみで構成されるデンスモデルで、Phi-4ファミリーの小型テキストモデルです。Microsoftは、推論を多く含む資料に重点を置いた合成データとフィルタリング済みの公開ウェブデータ、計5兆トークンで学習させた後、指示に従う能力を高めるため、教師ありファインチューニングと直接選好最適化による事後学習を行いました。2025年2月にMITライセンスで公開され、ローカルで実行しやすいオープンモデルの一つです。Q4_K_Mビルドのサイズは2.49 GBです。

仕様Phi-4-mini-instruct
パラメータ数3.8B (3,836,021,760)
アーキテクチャデコーダーのみのTransformerを採用したデンスモデル
アテンショングループ化クエリアテンション、デフォルトでFlash Attentionを使用
埋め込み入力と出力の埋め込みを共有
語彙200,064トークン、ファインチューニング用の予備スロットあり
コンテキスト長128Kトークン
モダリティテキスト入力、テキスト出力
言語アラビア語からウクライナ語まで23言語に対応
関数呼び出し対応。システムプロンプト内でツールをJSONとして宣言
学習データ5兆トークン、カットオフは2024年6月
学習の実施A100-80G GPUを512基使用、21日間、2024年後半
事後学習教師ありファインチューニング、直接選好最適化
リリース日2025年2月
ライセンスMIT

MicrosoftがPhi-3.5-miniからのアーキテクチャ上の変更点として挙げているのは、200Kの語彙、グループ化クエリアテンション、入力と出力の埋め込みの共有の三つです。語彙の拡大は、23言語への対応を目的としています。コーパスはスクレイピングで集めたものではなく、選別されたものです。公開文書を望ましい知識レベルに合わせてフィルタリングし、推論のための容量を確保するために雑学的な情報を除いた後、ベンチマークとのn-gram照合によって評価データの混入を除去しました。Microsoftは、モデルサイズによる限界も明言しています。3.8Bモデルには事実に関する知識を多く蓄えられないため、モデルカード自体が、事実が重要な場面では検索エンジンやRAGと組み合わせることを推奨しています。

Phi-4-mini-instructのベンチマーク

Microsoftは、社内のベンチマーク基盤で実施した独自の比較結果を公開しています。比較対象は、前世代のPhi-3.5-miniを含む同程度の規模の指示応答モデルと、2倍の規模のクラスに属するQwen2.5-7Bです。

ベンチマークPhi-4-mini-instructPhi-3.5-miniLlama-3.2-3BQwen2.5-3BQwen2.5-7B
MMLU
一般知識
67.365.561.865.072.6
MMLU-Pro
学術知識
52.847.439.244.756.2
BigBench Hard
高難度の推論
70.463.155.456.272.4
ARC Challenge
科学的推論
83.784.676.182.690.1
TruthfulQA
根拠に基づく推論
66.465.259.264.369.4
GSM8K
小学校レベルの算数
88.676.975.680.688.7
MATH
数学競技の問題
64.049.846.761.760.4
MGSM
多言語の数学
63.949.644.653.564.5

同規模のモデルとの比較では、この8項目のうち7項目で首位となり、特に数学で大きな差をつけています。GSM8Kは88.6、MATHは64.0です。唯一、ARC Challengeでは相手の84.6に対して83.7と下回ります。パラメータ数がほぼ2倍のQwen2.5-7Bが全体では優勢ですが、miniはMATHで単独首位となり、GSM8KとMGSMでも差は1ポイント以内です。

Microsoftは、全17ベンチマークの表における総合平均を63.5と報告しています。Phi-3.5-miniは60.5、Llama-3.2-3Bは56.2です。同社は、3.8Bモデルが「はるかに大きなモデルと同程度の多言語での言語理解能力と推論能力を達成している」と総括し、主な用途として、メモリと計算資源が限られた環境、レイテンシの制約がある場面、数学と論理を重視する推論の三つを挙げています。この表に含まれていない項目を見ると、Phi-3.5-miniに対して性能が低下した部分もあります。HellaSwagでは72.2に対して69.1、Winograndeでは72.2に対して67.0、Multilingual MMLUでは51.8に対して49.3です。

Phi-4-mini-instructのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のGGUFビルドはunsloth/Phi-4-mini-instruct-GGUFとして公開されており、フル精度のファイルでさえ、ローカルLLMとしては小さめです。

メモリ選択するビルドファイルサイズ
2 GBQ2_K1.68 GB
3 GBQ3_K_M2.12 GB
4 GBQ4_K_M2.49 GB
5 GBQ5_K_M2.85 GB
6 GBQ6_K3.16 GB
8 GBQ8_04.08 GB
16 GB以上BF167.68 GB

量子化ビルド間のサイズ差は1 GB未満なので、二つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。これは特に小さいビルドで重要です。Q2_Kで削減できるのはQ4_K_Mに対してわずか0.81 GBで、同じリポジトリのQ2_K_Lも同じ1.68 GBです。そのため、2ビットのファイルを選ぶのは、4 GBを確保できないマシンに限ってください。

元の重みを実行する環境として、MicrosoftはvLLM 0.7.3以降とTransformers 4.49.0を挙げており、どちらもtorch 2.5.1とflash_attn 2.7.4.post1を使用します。サンプルスクリプトでは、temperature 0.0で貪欲法によるデコードを行います。Flash Attentionはデフォルトで有効になっており、新しい世代のNVIDIAカードが必要です。テスト済みなのはA100、A6000、H100で、V100以前のカードではattn_implementationをeagerに設定する必要があります。この形式に馴染みがなければ、まずGGUFとは何かを読んでください。ほかにどのモデルが同じ環境に収まるかは、16 GBのMacに最適なローカルLLMを参照してください。

Atomic ChatでPhi-4-mini-instructを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでPhi-4-mini-instructを検索し、Download Optionsを開きます。
  3. 利用できるメモリに収まるビルドを選び、チャットを開始します。

ファミリー内のほかのモデルについては、ローカルで実行できるすべてのPhiモデル、またはフルサイズのPhi-4を参照してください。

Phi-4-mini-instructのライセンス

Phi-4-mini-instructは、オープンモデルに採用されるライセンスの中でも特に制約が少ないMITライセンスで公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基盤に製品を開発し、自分のハードウェアで利用料なしに実行できます。Microsoftは、適用対象外となるものを別途明示しています。権利の許諾はモデルを対象とし、商標やロゴは対象に含まれないため、改変版でMicrosoftの後援があるかのように示してはいけません。

Hugging Faceからモデルをダウンロード

pip install -U transformers accelerate
huggingface-cli download microsoft/Phi-4-mini-instruct
# またはOllamaで実行:
ollama run phi4-mini
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "microsoft/Phi-4-mini-instruct",
    "messages": [{"role": "user", "content": "What is 17 * 24?"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("microsoft/Phi-4-mini-instruct", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("microsoft/Phi-4-mini-instruct")
messages = [{"role": "user", "content": "Explain gradient descent in one paragraph."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
print(tokenizer.decode(model.generate(inputs, max_new_tokens=256)[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "not-needed" });
const res = await client.chat.completions.create({
  model: "microsoft/Phi-4-mini-instruct",
  messages: [{ role: "user", content: "Write a haiku about compilers." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Phi-4-mini-instructのパラメータ数は3.8Bです。デコーダーのみのTransformerを採用したデンスモデルで、グループ化クエリアテンションと200Kトークンの語彙を使用します。これにより、控えめなスペックのハードウェアで実行できる小ささを保ちながら、推論と数学のベンチマークでは、より大きな複数のモデルに匹敵する品質を実現しています。

Phi-4-mini-instructは128Kトークンのコンテキスト長に対応しています。長い文書、複数ターンの会話、かなり大きなコードファイルを一つのプロンプトで処理できる長さで、この規模のモデルとしては珍しい特徴です。

はい。MicrosoftはPhi-4-mini-instructをMITライセンスで公開しており、商用利用と研究利用、改変、再配布が最小限の制約で認められています。重みはHugging Faceから無料でダウンロードできるほか、Azure AI Foundry、Ollama、NVIDIA NIMからも利用できます。

Phi-4-mini-instructはパラメータ数がわずか3.8Bのため、一般向けのハードウェアでも快適に動作します。4ビット量子化ビルドに必要なVRAMはおよそ3から4 GBなので、8 GBのGPUなら十分な余裕があります。フル精度モデルは約8から9 GBに収まります。llama.cppやOllamaを使えばCPUでも動作しますが、速度は遅くなります。デフォルトのビルドはFlash Attentionを使用し、Ampere世代以降のGPUを前提としている点に注意してください。古いカードでは、attn_implementationをeagerに設定して読み込んでください。

はい。関数呼び出しは、Phi-4-miniのリリースで追加された主要機能です。利用可能なツールを、モデルのツール用トークンで囲んだJSONとしてシステムプロンプト内で宣言すると、モデルは構造化された呼び出しを返します。Microsoftは、一部の関数呼び出しの場面では、モデルが存在しない関数名やURLを生成することがあると指摘しており、返された呼び出しを実行前に検証することが推奨されています。