Mistral-7B-Instruct-v0.2

更新
04.10.2026
推論
コード生成

Mistral-7B-Instruct-v0.2は、コンテキスト長32Kの指示チューニング済み7Bモデルです。必要なハードウェア、GGUFビルド、ローカルでのセットアップ方法を紹介します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 7.24B
  • コンテキスト長: 32kトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: メモリ4 GB(Q3_K_S GGUF、ファイルサイズ3.16 GB)

Mistral-7B-Instruct-v0.2とは?

Mistral-7B-Instruct-v0.2は、Mistral AIによる7.24Bパラメータの言語モデルです。ベースモデルのMistral-7B-v0.2を、チャットでの指示に従うようファインチューニングしています。Mistralは2023年12月11日にApache 2.0の下で重みをHugging Faceに公開し、同リポジトリのダウンロード数は1,100,000回を超えています。ローカル利用での魅力は、そのサイズです。4ビットではモデル全体が4.37 GBのファイルに収まるため、一般的なノートPCで快適に動作します。

仕様Mistral-7B-Instruct-v0.2
総パラメータ数7.24B
アーキテクチャTransformer、スライディングウィンドウアテンションなし
コンテキスト長32kトークン(v0.1では8k)
RoPEのtheta値1e6
モダリティテキスト
プロンプト形式[INST] ... [/INST]、チャットテンプレートとして付属
リリース日2023年12月11日
ライセンスApache 2.0
後継モデルMistral-7B-Instruct-v0.3

ベースモデルのv0.2には、初代Mistral 7Bから3つの変更が加えられています。コンテキスト長が8kから32kトークンに拡大され、rope-thetaが1e6に変更され、スライディングウィンドウアテンションが削除されました。指示チューニング版では、プロンプトを[INST]と[/INST]のトークンで囲み、最初の指示の前にだけ文頭トークンを置く必要があります。これを手で入力することはほとんどありません。この形式はチャットテンプレートとして付属しており、トークナイザーが自動で組み立てます。Mistralは自社のmistral_commonトークナイザーを参照実装と位置づけており、transformersのトークナイザーはまだこれと完全には一致しないとモデルカードに記載しています。

Mistral-7B-Instruct-v0.2が得意なこと

Mistralはv0.2のモデルカードにベンチマークの数値を公開していないため、ここではカードに実際に書かれている内容に基づいてまとめます。このモデルは、まず指示に従うことを主眼としています。一般的なチャット、[INST]形式での複数ターンの会話、チューニング済み7Bモデルに求められる日常的なタスクが主な用途です。Mistral自身も、このリリースを控えめに位置づけ、ベースモデルを簡単にファインチューニングして魅力的な性能を引き出せることを手早く示すものと説明しています。実用面での目玉は、v0.1の8kの4倍にあたる32kのコンテキスト長です。長い文書や長い会話を一度に処理できます。

同じモデルカードには、2つの制約も示されています。このモデルにはモデレーション機構がないため、出力のフィルタリングが必要な用途では、独自のガードレールを追加する必要があります。また、これは2023年のモデルで、より新しい後継モデルがあります。Mistralは、このシリーズの現行版としてMistral-7B-Instruct-v0.3を案内しています。同程度の規模で新しいモデルを求めるなら、Llama 3.1 8B Instructが同等クラスのハードウェアで動作します。

Mistral-7B-Instruct-v0.2のハードウェア要件

システム要件として確認すべきなのはメモリです。このモデルの標準的なGGUFビルドは、TheBloke/Mistral-7B-Instruct-v0.2-GGUFで公開されています。

メモリ選ぶビルドファイルサイズ
4 GBQ3_K_S3.16 GB
6 GBQ4_K_M4.37 GB
8 GBQ5_K_M5.13 GB
12 GBQ6_K5.94 GB
16 GB以上Q8_07.70 GB

2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。7Bでは、隣接する量子化レベル間で品質を上げるために必要な追加メモリは、多くても1ギガバイト程度です。GGUF形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでMistral-7B-Instruct-v0.2を動かす方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでMistral-7B-Instruct-v0.2を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを始めます。

このファミリーのより新しいモデルについては、ローカルで動かせるMistralモデルの一覧をご覧ください。

Mistral-7B-Instruct-v0.2のライセンス

Mistral-7B-Instruct-v0.2はApache 2.0の下で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められるため、利用料を支払わずに製品に組み込んで出荷したり、自分のハードウェアで動かしたりできます。唯一の注意点は、Mistral自身が示しているものです。このモデルにはモデレーション機構が付属していないため、本番環境への導入では独自の出力フィルタリングを用意することが想定されています。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download mistralai/Mistral-7B-Instruct-v0.2
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistralai/Mistral-7B-Instruct-v0.2",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("mistralai/Mistral-7B-Instruct-v0.2")
tokenizer = AutoTokenizer.from_pretrained("mistralai/Mistral-7B-Instruct-v0.2")
messages = [{"role": "user", "content": "What is your favourite condiment?"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt")
out = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "mistralai/Mistral-7B-Instruct-v0.2",
  messages: [{ role: "user", content: "Hello!" }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Mistral-7B-Instruct-v0.2は、Mistral AIによる7Bパラメータの指示チューニング済み大規模言語モデルです。ベースモデルのMistral-7B-v0.2をファインチューニングしたもので、チャットや指示に従うタスク向けに作られています。v0.1と比べて、コンテキスト長を32Kに拡大し、rope-thetaを1e6に設定し、スライディングウィンドウアテンションを廃止しています。

量子化せずにFP16精度で動かす場合、モデルにはおよそ15 GBのVRAMが必要なため、16 GBまたは24 GBのGPUを1基用意すれば快適に動作します。4ビット量子化(llama.cppまたはOllamaでGGUFを使用)では約6 GBのVRAMで動作し、十分なシステムRAMがあれば、速度は下がりますがCPUでも動かせます。

はい。Mistral-7B-Instruct-v0.2はApache 2.0ライセンスの下で公開されており、ロイヤリティを支払わずに、無料で商用利用、改変、再配布ができます。重みはHugging Faceからダウンロードでき、モデルをセルフホストすることも、Ollama、Cloudflare Workers AI、Fireworksなどのプロバイダーを通じて利用することもできます。

Mistral-7B-Instruct-v0.2は、32Kトークンのコンテキスト長に対応しています。これはv0.1の8Kの4倍です。rope-thetaを1e6に引き上げ、スライディングウィンドウアテンションを削除することで実現されており、コンテキスト全体で標準的なデンスアテンションを使用します。

Mistral-7B-Instruct-v0.3は、v0.2に代わる新しいリリースです。v0.3での主な追加点は、語彙が32,768トークンに拡張されたことと、v3トークナイザーおよび関数呼び出しへの対応です。v0.2も同じ7Bの規模と32Kのコンテキスト長を備えていますが、v0.3にあるネイティブのツール呼び出し対応と更新された語彙はありません。