Llama-3.2-3B-Instruct

更新
05.10.2026
ツール利用
推論
コード生成
多言語

Llama 3.2 3B Instructは、コンテキスト長128KのMetaの3.21B多言語チャットモデルです。4ビットGGUFビルドのファイルサイズは2 GBです。

基本情報

  • ライセンス: Llama 3.2 Community License
  • パラメータ数: 3.21B
  • コンテキスト長: 128Kトークン
  • モダリティ: 多言語テキストを入力し、テキストとコードを出力
  • 最小ハードウェア要件: メモリ4 GB(2.02 GBのQ4_K_Mビルド)

Llama-3.2-3B-Instructとは?

Llama-3.2-3B-Instructは、Metaが開発した3.21Bの指示チューニング済みテキストモデルです。2024年9月25日にリリースされたLlama 3.2のテキスト専用モデル2種のうち、大きい方にあたります。Metaは、1Bと3Bをモバイルデバイスなどのリソースが限られた環境で動作させることを想定し、アシスタントとしてのチャット、知識検索、要約、モバイル向け文章作成支援、クエリの書き換えを用途として挙げています。この設計目標が、ローカルでの使いやすさにつながっています。4ビットGGUFファイルは約2 GBと小さく、より大きなモデルが収まらないマシンでも利用できます。

仕様Llama-3.2-3B-Instruct
パラメータ数3.21B(3,212,749,824)、BF16
アーキテクチャ最適化された自己回帰型Transformer、テキスト入力・テキスト出力
アテンションGrouped-Query Attention、埋め込みを共有
コンテキスト長128Kトークン、Meta独自の量子化ビルドでは8K
入力モダリティ多言語テキスト
出力モダリティ多言語テキストとコード
対応言語英語、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語
学習データオンライン上の公開データ、最大9兆トークン
知識のカットオフ2023年12月
アラインメント教師ありファインチューニングとRLHF
学習計算量H100-80GBで46万GPU時間
リリース日2024年9月25日
ライセンスLlama 3.2 Community License

Metaは1Bと3Bの事前学習で、Llama 3.1 8Bと70Bのロジットをトークン単位の学習目標として使用し、枝刈り後の性能回復には知識蒸留を用いたと説明しています。事後学習はLlama 3.1と同様の手順で、教師ありファインチューニング、棄却サンプリング、直接選好最適化を複数回行っています。このファミリーのすべてのバージョンはGrouped-Query Attentionを採用しており、Metaはこれが推論のスケーラビリティ向上に寄与すると説明しています。また、テキストモデルはいずれも埋め込みを共有すると記載されています。

Llama-3.2-3B-Instructのベンチマーク

Metaのモデルカードで公開されている数値では、指示チューニング済みの3Bを、同じファミリーの1BおよびLlama 3.1 8Bと比較しています。

ベンチマークLlama-3.2-3B-InstructLlama 3.2 1BLlama 3.1 8B
MMLU
学術知識
63.449.369.4
IFEval
指示追従
77.459.580.4
GSM8K (CoT)
小学校レベルの算数
77.744.484.5
MATH (CoT)
競技数学
48.030.651.9
ARC-C
科学的推論
78.659.483.4
BFCL V2
関数呼び出し
67.025.767.1
TLDR9+
テキスト要約
19.016.817.2

Llama 3.1 8Bは、パラメータ数が倍以上あるだけに、ほぼすべての項目で上回っています。3Bは関数呼び出しではその差を1ポイント以内に抑えており、BFCL V2では67.1に対して67.0です。TLDR9+の要約では明確に上回っています。Metaは英語以外の対応言語7言語についてもMMLUの結果を報告しており、3Bのスコアはヒンディー語の43.3からスペイン語の55.1までの範囲です。

Metaは、これらの指示チューニング済みテキストモデルが、業界で一般的なベンチマークで「利用可能なオープンソースおよびクローズドのチャットモデルの多くを上回る」と主張しており、表に含まれていない評価項目からもその主張を検討できます。多言語の数学では、MGSMの思考の連鎖による評価で1Bの24.5に対して58.2と健闘しています。一方、Nexusのツール利用では8Bの38.5に対して34.3と、やや弱い結果です。最も弱いのは長いコンテキストの扱いで、NIHの複数ニードル再現率では98.8に対して84.7、InfiniteBench En.QAでは27.3に対して19.8、En.MCでは72.2に対して63.3です。128Kのコンテキスト長は、長い文書を格納するための容量と捉えてください。文書内の情報を完全に取り出せるという保証ではありません。

Llama-3.2-3B-Instructのハードウェア要件

システム要件で確認すべきなのはメモリです。以下は、コミュニティリポジトリunsloth/Llama-3.2-3B-Instruct-GGUFにある実際のファイルサイズです。

メモリ選ぶビルドファイルサイズ
2 GBUD-IQ2_M1.26 GB
3 GBQ3_K_M1.69 GB
4 GBQ4_K_M2.02 GB
5 GBQ5_K_M2.32 GB
6 GBQ6_K2.64 GB
8 GBQ8_03.42 GB
16 GB以上BF166.43 GB

フル精度のBF16ファイルでもわずか6.43 GBなので、どちらのビルドもメモリに収まるなら、大きい方を選んでください。このリポジトリにはさらに小さいビルドもあり、UD-IQ1_Sでは0.91 GBまで小さくなります。Meta自身の数値からは、公開された量子化3Bビルドで何が失われるかがわかります。BFCL V2ではBF16の67.0に対し、SpinQuantは60.1、QLoRAは63.5です。一方、GSM8Kは77.7に対して75.7と77.9で、ほとんど変わりません。IQ1とIQ2のファイルは標準の選択肢にせず、最後の手段にしてください。

Metaは元の重みを実行する方法として、バージョン4.43.0以降のTransformersパイプラインと、Meta独自のllamaコードベースの2つを挙げています。Metaの量子化ビルドは、Arm CPUバックエンドを備えたPyTorch ExecuTorchを対象としています。この環境では、Android搭載のOnePlus 12上でBF16の3Bが7.6トークン/秒、SpinQuantビルドが19.7トークン/秒でデコードします。GGUFを初めて使う方は、まずGGUFとは何かを読み、ほかにどのモデルがメモリに収まるかは16 GBのMacに最適なローカルLLMをご覧ください。

Atomic ChatでLlama-3.2-3B-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでLlama-3.2-3B-Instructを検索し、Download Optionsを開きます。
  3. 利用可能なメモリに収まるビルドを選び、チャットを始めます。

同じファミリーのほかのモデルについては、ローカルで実行できるLlamaモデルの一覧、または上の表にある、より大きなモデルLlama-3.1-8B-Instructをご覧ください。

Llama-3.2-3B-Instructのライセンス

Llama-3.2-3B-Instructの利用には、Llama 3.2 Community Licenseが適用されます。Metaはこれを独自の商用ライセンス契約と説明しています。Metaによると、このモデルは複数言語での商用利用と研究利用を想定しています。また、ライセンスとAcceptable Use Policyを遵守する限り、開発者は公式に対応する8言語以外の言語向けにもファインチューニングできます。Metaの表現では、貿易関連法令を含む適用法令や規制に違反するあらゆる利用は、想定範囲外です。

Hugging Faceからモデルをダウンロード

huggingface-cli download meta-llama/Llama-3.2-3B-Instruct
from transformers import AutoModel
model = AutoModel.from_pretrained("meta-llama/Llama-3.2-3B-Instruct")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Llama-3.2-3B-Instructは、Metaが開発した3.2Bパラメータの指示チューニング済み言語モデルです。Transformerアーキテクチャを採用したデンスモデルで、コンテキスト長は128Kトークンです。Metaは、指示追従、多言語対話、要約、ツール利用向けにチューニングしています。サイズが小さいため、Atomic Chatを通じてノートPCやコンシューマー向けGPU単体で実行するのに適しています。

フルFP16精度では、約7 GBのVRAMが必要です。4ビット量子化ビルドでは約1.8-2 GBまで減るため、6 GBのGPUで動作し、専用GPUのない最近のノートPCでも実行できます。128Kのコンテキスト長をすべて使う場合は、これらの数値に加えてメモリが必要です。

はい。重みはLlama 3.2 Community Licenseの下で公開されており、商用利用と研究利用が無料で認められています。Atomic Chatでローカル実行する場合、API料金や利用制限はありません。月間アクティブユーザー数が7億人を超える製品には、Metaから別途ライセンスを取得する必要があります。

はい。重みをダウンロードすれば、インターネット接続なしで、モデルを完全に自分のマシン上で実行できます。プロンプトやファイルがデバイスの外に出ることは一切ないため、プライバシーに配慮が必要な作業に適しています。Atomic Chatはデバイス上でモデルを読み込むので、チャットはローカルかつオフラインで完結します。

チャットアシスタント、長い文書の要約、ユーザーが提供したテキストに基づく質問応答に適しており、いずれも128Kのコンテキスト内で行えます。ツール呼び出しや多言語での会話にも対応しているため、ローカルのスクリプトに接続したり、複数の言語で利用したりできます。より負荷の高い推論や大規模なコードベースを扱う場合は、より大きなモデルの方が高い性能を発揮します。