Phi-3.5-mini-instruct

更新
04.10.2026
推論
コード生成
多言語

MicrosoftのPhi-3.5ファミリーに属する、指示チューニング済みの3.8Bのデンスモデルです。128Kのコンテキスト長を備え、多言語に対応しています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 3.8Bのデンスモデル
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ2 GB、最小のGGUFビルドは1.32 GB

Phi-3.5-mini-instructとは?

Phi-3.5-mini-instructは、Microsoftの3.8Bのデンス言語モデルです。2024年6月のPhi-3 Miniを更新するモデルとして、2024年8月にリリースされました。厳格にフィルタリングされた公開文書と、教科書のような合成データを合わせた3.4兆トークンで学習されており、コード、数学、論理といった推論分野を意図的に重視した構成になっています。Microsoftは、多言語タスク、複数ターンの会話品質、推論における大幅な改善を、追加の事後学習データによるものと説明しています。ローカルで使う利点は明快です。128Kトークンのコンテキスト長を備え、一般的な量子化ビルドは3 GB未満なので、ほぼどのマシンのメモリにも収まります。

仕様Phi-3.5-mini-instruct
パラメータ数3.8B (3,821,079,552)
アーキテクチャデコーダーのみのTransformerを採用したデンスモデル
コンテキスト長128Kトークン
アテンションデフォルトはFlash attention、V100およびそれ以前のGPUではeager実装
モダリティテキスト入力、テキスト出力
トークナイザーPhi-3 Miniと同じで、プレースホルダートークンを含む語彙数は32,064
学習データ3.4兆トークン、カットオフは2023年10月
学習の実施512基のH100-80G GPU、10日間、2024年6月から8月
事後学習教師ありファインチューニングの後にPPOとDPO
プロンプト形式system、user、assistantの各ターンを含むチャットテンプレート
対応言語アラビア語、中国語、日本語、ロシア語を含む23言語
リリース日2024年8月
ライセンスMIT

Microsoftは、このサイズに伴うトレードオフを明示しています。公開文書は、モデルカードでいう適切な水準の知識を残すようにフィルタリングされました。Premier Leagueの試合結果は最先端モデルには有用なデータですが、このモデルでは推論により多くの容量を割くために除外されています。その結果についても明確に述べられています。3.8Bでは多くの事実知識を保持できず、事実と異なる回答が返ることがあり、対処法としてRAG環境で検索エンジンによって補完することが提案されています。Microsoftは、メモリと計算資源に制約がある環境、レイテンシが制約となる用途、高い推論能力を求める用途に向けたモデルと位置づけています。モデルカードには、コードの学習データが主にPythonであることと、非常に長いセッションでは応答が反復的になる場合があることの2つの制限も記載されています。

Phi-3.5-mini-instructのベンチマーク

以下の数値は、モデルカードに掲載されたMicrosoft自身による評価結果です。すべてのモデルに同一の社内評価パイプラインを使用し、temperature 0で測定されています。比較対象の重みが公開されているモデルは、Mistral-7B-Instruct-v0.3、Mistral-Nemo-12B、Llama-3.1-8B、Gemma-2-9Bです。

ベンチマークPhi-3.5-miniMistral-7BMistral-Nemo-12BLlama-3.1-8BGemma-2-9B
MMLU
一般知識
6960.367.268.171.3
BigBench Hard CoT
高難度の推論
6933.460.263.463.5
GPQA
専門的な科学知識
30.415.628.626.329.2
GSM8K
学校数学
86.254.484.282.484.9
MATH
数学コンテスト問題
48.51931.247.650.9
HumanEval
Pythonコーディング
62.835.463.466.561
MBPP
基礎的なPython
69.650.468.169.469.3

3.8Bのモデルが、自身の2倍から3倍のサイズのモデルを相手に7項目中4項目で首位に立ち、特に推論と数学で明確な優位を示しています。知識を重視する項目ではGemma-2-9Bが首位を維持し、HumanEvalではLlama-3.1-8Bが首位です。Microsoftの完全な表にはGemini 1.5 FlashとGPT-4o-miniも含まれており、この2モデルは大半のベンチマークで上回っています。

ローカルでの利用では、提供元による別の2つの評価表も重要です。長いコンテキストからの情報検索を評価するRULERでは、4Kから128Kまでの平均が84.1で、最大の128Kでも63.6を維持しています。88.3のLlama-3.1-8B-Instructには及びませんが、平均66.2で、128Kでは19.0まで低下するMistral-Nemo-12Bを大きく上回ります。5つの言語を対象に長いコンテキストでのコード理解を評価するRepoQAでは、平均77で、Llama-3.1-8Bの71とMistral-7Bの62を上回ります。多言語評価は比較的弱く、平均55.2はMistral-7Bの47.9を上回る一方、Gemma-2-9Bの59.6には及びません。ただし、付録Bの韓国語の評価セットでは、Llama-3.1-8B-Instructの平均29.29に対して35.62です。

Phi-3.5-mini-instructのハードウェア要件

確認すべきシステム要件はメモリで、このモデルではほぼどの環境でも要件を満たします。以下のビルドは、コミュニティリポジトリbartowski/Phi-3.5-mini-instruct-GGUFのものです。

メモリ選ぶビルドファイルサイズ
2 GBIQ2_M1.32 GB
3 GBQ3_K_M1.96 GB
4 GBQ4_K_M2.39 GB
5 GBQ5_K_M2.82 GB
6 GBQ6_K3.14 GB
8 GB以上Q8_04.06 GB

隣り合うビルドのファイルサイズの差は数百メガバイトなので、両方ともメモリに収まるなら大きい方を選んでください。量子化の段階の中でも品質が最も急速に低下するIQ2付近では、これが特に重要です。128Kのコンテキスト長を使い切る予定なら、ファイルサイズに加えてメモリに余裕を持たせてください。この形式に初めて触れる場合は、まずGGUFとは何かをお読みください。一緒にメモリに収められるほかのモデルについては、16 GBのMacに最適なローカルLLMをご覧ください。

元の重みを使って実行する場合、Microsoftの参照構成はtransformers 4.43.0、torch 2.3.1、accelerate 0.31.0、flash_attn 2.5.8です。このFlash attentionの実行経路は、A100、A6000、H100でテストされています。提供元のサンプルでは、上記の評価値と同じ設定であるtemperature 0、サンプリング無効の貪欲法で生成します。

Atomic ChatでPhi-3.5-mini-instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでPhi-3.5-mini-instructを検索し、Download Optionsを開きます。
  3. 利用できるメモリに収まるビルドを選び、チャットを始めます。

同じファミリーのほかのモデルは、当サイトのPhiモデルのページに掲載しています。同じサイズ区分の後継モデルはPhi-4-mini-instructです。

Phi-3.5-mini-instructのライセンス

Phi-3.5-mini-instructは、一般的なオープンライセンスの中で最も制約の少ないMITライセンスで公開されています。ロイヤリティなしで商用利用、改変、再配布が可能です。リポジトリで別途定められている基本ルールは、Microsoftの商標およびブランドガイドラインのみです。

Hugging Faceからモデルをダウンロード

pip install -U transformers accelerate
huggingface-cli download microsoft/Phi-3.5-mini-instruct
# またはOllamaで実行:
ollama run phi3.5
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "microsoft/Phi-3.5-mini-instruct",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("microsoft/Phi-3.5-mini-instruct", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("microsoft/Phi-3.5-mini-instruct")
msgs = [{"role": "user", "content": "Explain quantum computing simply."}]
ids = tokenizer.apply_chat_template(msgs, return_tensors="pt")
out = model.generate(ids, max_new_tokens=256)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "microsoft/Phi-3.5-mini-instruct",
  messages: [{ role: "user", content: "Hello!" }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Phi-3.5-mini-instructのパラメータ数は3.8Bです。デコーダーのみのTransformerを採用したデンスモデルなので、推論時には3.8Bのパラメータすべてが使われます。3.4兆トークンで学習されています。

Phi-3.5-mini-instructは、128Kトークンのコンテキスト長に対応しています。そのため、長い文書や会議の要約、長い文書に関する質問応答、大量の入力からの情報検索など、長いコンテキストを扱うタスクに適しています。

はい。MicrosoftはPhi-3.5-mini-instructをMITライセンスで公開しており、商用および研究目的での無料の利用、改変、再配布が認められています。重みはHugging Faceで入手でき、このモデルは複数の言語での商用および研究利用を想定しています。

Phi-3.5-mini-instructは、アラビア語、中国語、チェコ語、デンマーク語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ヘブライ語、ハンガリー語、イタリア語、日本語、韓国語、ノルウェー語、ポーランド語、ポルトガル語、ロシア語、スペイン語、スウェーデン語、タイ語、トルコ語、ウクライナ語を含む23言語に対応しています。主に英語で学習されているため、英語以外では性能が低くなる場合があります。

Phi-3.5-mini-instructはパラメータ数が3.8Bと少ないため、控えめな性能のハードウェアでも動作します。4ビット量子化ビルドは、およそ3-4 GBのVRAMに収まり、大半の一般消費者向けGPUで動作します。また、llama.cppやOllamaを通じてCPUでも実行できます。FP16精度では、約8 GBのVRAMが必要です。