Llama-3.1-8B-Instruct

更新
05.10.2026
ツール利用
推論
コード生成
多言語

Llama-3.1-8B-Instructは、128Kのコンテキスト長とツール呼び出しに対応したMetaの8B多言語チャットモデルです。Q4_K_Mビルドのサイズは4.92 GBです。

基本情報

  • ライセンス: Llama 3.1 Community License
  • パラメータ数: 8B
  • コンテキスト長: 128Kトークン
  • モダリティ: 入力:多言語テキスト、出力:テキストとコード
  • 最小ハードウェア要件: メモリ4 GB(UD-Q2_K_XLビルド、3.39 GB)

Llama-3.1-8B-Instructとは?

Llama-3.1-8B-Instructは、MetaのLlama 3.1コレクションに含まれる3つのモデル(8B、70B、405B)のうち最小のモデルです。パラメータ数は8Bで、多言語対話向けに最適化された、指示チューニング済みのテキスト専用モデルです。Metaは教師ありファインチューニングと人間のフィードバックによる強化学習でアラインメントを行い、2024年7月23日に公開しました。ローカルでの定番となっている理由は、そのサイズです。Q4_K_Mビルドのファイルサイズは4.92 GBなので、8 GBのGPUに収まり、コンテキスト用のメモリにも余裕が残ります。

仕様Llama-3.1-8B-Instruct
パラメータ数8B(BF16の重みでは8,030,261,248)
アーキテクチャ自己回帰型の最適化されたTransformer
アテンショングループ化クエリアテンション(GQA)
コンテキスト長128Kトークン
モダリティ入力:多言語テキスト、出力:多言語テキストとコード
対応言語英語、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語
事前学習データ一般公開されているオンラインデータ、15兆トークン超
知識のカットオフ2023年12月
アラインメント教師ありファインチューニングとRLHF
ファインチューニング用データ公開指示データセットと2,500万件を超える合成サンプル
学習計算量H100-80GBで146万GPU時間
公開日2024年7月23日
ライセンスLlama 3.1 Community License

Metaは、Transformers 4.43.0以降向けと、オリジナルのllamaコードベース向けの2種類のリポジトリを提供しています。また、torch.compile()、補助生成、量子化された重みを使ってローカルで実行するための資料として、huggingface-llama-recipesコレクションを案内しています。Llama 3.1は複数のツール利用形式にも対応しており、ツール呼び出しはTransformersのチャットテンプレートに組み込まれています。Python関数をapply_chat_templateに渡し、各実行結果をtoolロールで会話に追加します。これだけで、自分のマシン上で小規模なエージェントループを動かせます。Metaは、このモデルをオフラインのデータセットで学習した静的なモデルと説明しています。

Llama-3.1-8B-Instructのベンチマーク

Metaがモデルカードで公開している数値では、指示チューニング済みの8Bモデルを、前世代のLlama 3 8B Instructおよび2つの大型Llama 3.1モデルと比較しています。

ベンチマークLlama 3.1 8B InstructLlama 3 8B InstructLlama 3.1 70B InstructLlama 3.1 405B Instruct
MMLU
一般知識
69.468.583.687.3
IFEval
指示追従
80.476.887.588.6
GPQA
専門科学知識
30.434.646.750.7
HumanEval
コード生成
72.660.480.589.0
MATH (CoT)
高難度の数学
51.929.168.073.8
API-Bank
ツールAPI
82.648.390.092.0
BFCL
関数呼び出し
76.160.384.888.5
Multilingual MGSM
多言語での数学
68.9-86.991.6

同じファミリー内では、予想どおり405Bがすべての項目で首位です。注目すべき比較対象はLlama 3 8B Instructの列です。同じサイズでも、3.1への更新でAPI-Bankは34.3ポイント、MATHは22.8ポイント、BFCLは15.8ポイント、HumanEvalは12.2ポイント向上する一方、GPQAは4.2ポイント低下しています。

Meta自身の説明は、用途を限定しています。指示チューニング済みのテキスト専用モデルは、対応する8言語でのアシスタント型チャット向けに作られており、Metaは、業界で一般的なベンチマークで「利用可能なオープンソースおよびクローズドなチャットモデルの多くを上回る」と主張しています。この主張の多言語性能に関する部分には、別の表が用意されています。言語別MMLUにおける8Bのスコアは、スペイン語が62.45、フランス語が62.34、ポルトガル語が62.12、イタリア語が61.63、ドイツ語が60.59です。一方、ヒンディー語は50.88、タイ語は50.32で、ヨーロッパの言語より約10ポイント低くなっています。Metaは、事前学習では対応する8言語以外の言語も学習したと説明していますが、独自のファインチューニングやシステム側の制御を行わずに、それらの言語で会話することは推奨していません。

Llama-3.1-8B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のビルドと実際のファイルサイズは、unsloth/Llama-3.1-8B-Instruct-GGUFに基づいています。

メモリ推奨ビルドファイルサイズ
4 GBUD-Q2_K_XL3.39 GB
6 GBQ3_K_M4.02 GB
8 GBQ4_K_M4.92 GB
10 GBQ5_K_M5.73 GB
12 GBQ6_K6.60 GB
16 GBUD-Q8_K_XL10.58 GB
24 GB以上BF1616.07 GB

隣り合うビルドのサイズ差は数百メガバイトしかないことが多いため、両方ともメモリに収まるなら、大きい方を選んでください。これは、品質が最も急速に低下する表の下部で特に重要です。リポジトリには、サイズが2.16 GBまで小さくなるUD-IQ1_Sもありますが、これほど小さいファイルは最後の手段であり、標準の選択肢ではありません。長い入力を使う予定なら、メモリに余裕を残してください。128Kのコンテキストにも、それ自体のためのメモリが必要です。この形式に初めて触れる場合は、まずGGUFとは何かをお読みください。また、ほかにどのモデルが同じ環境に収まるかは、16 GBのMacに最適なローカルLLMを参照してください。

Atomic ChatでLlama-3.1-8B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでLlama-3.1-8B-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを始めます。

同じファミリーのほかのモデルについては、ローカルで実行できるLlamaモデルの一覧、または小型の兄弟モデルであるLlama-3.2-3B-Instructをご覧ください。

Llama-3.1-8B-Instructのライセンス

Llama-3.1-8B-Instructは、Meta独自の商用ライセンスであるLlama 3.1 Community Licenseのもとで提供されています。このライセンスは、対応言語での商用利用と研究利用を認めており、合成データの生成や蒸留を含め、モデルの出力をほかのモデルの改善に使うことを明示的に許可しています。利用にあたっては、適用法とMetaの利用規定に従い、対応する8言語の範囲内にとどめる必要があります。そのため、このモデルを組み込んだ製品を出荷する前に、ライセンス本文を読んでください。

Hugging Faceからモデルをダウンロード

huggingface-cli download meta-llama/Llama-3.1-8B-Instruct
from transformers import AutoModel
model = AutoModel.from_pretrained("meta-llama/Llama-3.1-8B-Instruct")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Llama-3.1-8B-Instructは、Metaが提供するパラメータ数8Bの重みが公開された言語モデルです。Llama 3.1 8Bの指示チューニング版で、教師ありファインチューニングとRLHFによって調整され、プロンプトに従って自然に会話できるようになっています。チャット、文章作成、要約、コーディングに対応し、128Kトークンのコンテキスト長をサポートしています。

4ビット量子化ビルド(Q4_K_M)は約5 GBで、VRAMが約6 GBのGPUで動作します。RTX 3060 12GBなら余裕を持って使えます。完全な16ビットの重みには、16 GB近くのメモリが必要です。専用GPUがなくても、システムRAMが16 GB以上あれば、CPUで毎秒数トークンの速度で実行できます。

はい。重みは公開されており、商用利用と研究利用を認めるMetaのllama3.1 community licenseのもとで無料でダウンロードできます。Atomic Chatではモデルが自分のマシン上で動作するため、トークン単位の料金はかかりません。費用がかかるのは、すでに所有しているハードウェアと、その電気代だけです。

はい。一度重みをダウンロードすれば、インターネット接続なしで、モデル全体がデバイス上で動作します。Atomic Chatはモデルをローカルに読み込むため、プロンプトと応答は自分のマシン内にとどまります。そのため、飛行機の中やネットワークから物理的に隔離した環境など、データのプライバシーを守りたい場所で利用できます。

サイズの割に高性能な汎用モデルで、会話、要約、コンテンツ生成、コーディング支援を得意としています。機能タグにはツール、推論、コード、多言語テキストが含まれ、128Kのコンテキストによって長い文書を一度に処理できます。8Bというサイズにより、ノートPCやミドルレンジのGPUでもリアルタイムで使える速度を保てます。