Llama-3.3-Nemotron-Super-49B-v1.5

更新
05.10.2026
思考
推論
コード生成
ツール利用
多言語

NVIDIAの49B推論・チャットLLMです。Neural Architecture Searchを通じてLlama-3.3-70Bから蒸留され、128Kのコンテキスト長に対応しています。

基本情報

  • ライセンス: NVIDIA Open Model License + Llama 3.3 Community License
  • パラメータ数: 49Bのデンスモデル。Llama-3.3-70B-Instructから蒸留
  • コンテキスト長: 131,072トークン
  • モダリティ: テキストの入力と出力
  • 最低ハードウェア要件: 13.95 GBのUD-IQ2_XXS GGUFを使用する場合、16 GBのメモリ

Llama-3.3-Nemotron-Super-49B-v1.5とは?

Llama-3.3-Nemotron-Super-49B-v1.5は、NVIDIAの49B推論・チャットモデルです。MetaのLlama-3.3-70B-Instructから派生し、2025年7月25日にHugging Faceで公開されました。NVIDIAはNeural Architecture Search(NAS)を使って70Bの参照モデルを49Bに圧縮し、メモリ使用量を削減することで、高負荷時にも単一のGPUに収まるようにしました。推論、人間のチャット応答への好み、RAGやツール呼び出しなどのエージェントタスクに合わせた事後学習が施されており、128Kのコンテキスト長に対応しています。

仕様Llama-3.3-Nemotron-Super-49B-v1.5
総パラメータ数49.9B (BF16)
アーキテクチャデコーダーのみのTransformerを採用したデンスモデル。Llama 3.3 70BのNAS派生モデル
ベースモデルMeta Llama-3.3-70B-Instruct
コンテキスト長131,072トークン
モダリティテキスト入力、テキスト出力
推論デフォルトで有効。システムプロンプトに/no_thinkを指定すると無効になります
対応言語英語とコードに加え、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語
公開日2025年7月25日
ライセンスNVIDIA Open Model License + Llama 3.3 Community License

NAS処理によって、標準的な構造とは異なり、同じ構造を繰り返さないブロックが生成されます。一部のブロックではアテンションが完全に省略されるか、単一の線形層に置き換えられ、FFNの拡張比率もブロックごとに変わります。その後、NVIDIAはFineWeb、Buzz-V1.2、Dolmaの400億トークンを使い、参照モデルを教師としてブロック単位の蒸留を行いました。続いて、数学、コード、科学、ツール呼び出しの教師ありファインチューニング、チャット向けのRPO、推論向けのRLVR、ツール呼び出し向けの反復的なDPOという複数段階の事後学習パイプラインを実施しました。推論はデフォルトで有効です。NVIDIAは、推論を有効にする場合はtemperature 0.6とtop-p 0.95を、無効にする場合は貪欲デコーディングを推奨しています。

Llama-3.3-Nemotron-Super-49B-v1.5のベンチマーク

NVIDIAは、推論を有効にしたモードで自社評価した数値を公開しています。NeMo-Skillsを使い、シーケンス長64kで実行し、最大16回の実行結果を平均したものです。

ベンチマークLlama-3.3-Nemotron-Super-49B-v1.5
MATH500
数学問題
97.4
AIME 2025
数学コンテスト
82.71
GPQA
専門レベルの科学
71.97
LiveCodeBench
競技プログラミング
73.58
BFCL v3
関数呼び出し
71.75
IFEval
指示への追従
88.61
MMLU Pro
学術知識
79.53

これらは単一モデルのスコアであり、競合モデルの列はありません。そのため、順位ではなく性能の傾向を示すものとして捉えてください。得意分野は数学で、MATH500では97.4、AIME 2024では87.5です。科学、コーディング、関数呼び出しは70台前半で、Humanity's Last Examのテキストのみのサブセットでは7.64にとどまります。そのため、このモデルは最先端の雑学に答えるために作られたものではありません。

Llama-3.3-Nemotron-Super-49B-v1.5のハードウェア要件

システム要件で確認すべきなのはメモリです。NVIDIAは重みをBF16のsafetensors形式で提供しています。以下に実際のファイルサイズとともに示すコミュニティ製のGGUFビルドは、unsloth/Llama-3_3-Nemotron-Super-49B-v1_5-GGUFで提供されています。

メモリ選ぶビルドファイルサイズ
16 GBUD-IQ2_XXS13.95 GB
24 GBUD-IQ3_XXS19.69 GB
32 GBUD-Q3_K_XL24.81 GB
48 GBUD-Q4_K_XL30.36 GB
64 GB以上UD-Q6_K_XL43.42 GB

隣り合うビルドのサイズ差は数GBなので、両方ともメモリに収まる場合は大きい方を選んでください。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでLlama-3.3-Nemotron-Super-49B-v1.5を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでLlama-3.3-Nemotron-Super-49B-v1.5を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

NVIDIAのほかのローカル向けモデルについては、ローカルで実行できるNemotronモデルの一覧、または大幅に小さいNemotron Nano 9B v2をご覧ください。

Llama-3.3-Nemotron-Super-49B-v1.5のライセンス

利用にはNVIDIA Open Model Licenseが適用されます。また、Llamaを使って構築されたモデルのため、Llama 3.3 Community License Agreementも追加で適用されます。NVIDIAは商用利用が可能なモデルであると明記しています。両方のライセンス条件に従うことで、重みをダウンロードして自分のハードウェアで実行し、それを使った製品をリリースできます。

Hugging Faceからモデルをダウンロード

pip install -U "transformers" "vllm==0.9.2"
huggingface-cli download nvidia/Llama-3_3-Nemotron-Super-49B-v1_5
python3 -m vllm.entrypoints.openai.api_server \
  --model nvidia/Llama-3_3-Nemotron-Super-49B-v1_5 \
  --trust-remote-code --max-model-len 65536 --tensor-parallel-size 2
curl http://localhost:5000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Llama-3_3-Nemotron-Super-49B-v1_5",
    "messages": [
      {"role": "system", "content": ""},
      {"role": "user", "content": "What is 18% of 100?"}
    ],
    "temperature": 0.6,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model = AutoModelForCausalLM.from_pretrained("nvidia/Llama-3_3-Nemotron-Super-49B-v1_5", trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("nvidia/Llama-3_3-Nemotron-Super-49B-v1_5")
messages = [{"role": "system", "content": ""}, {"role": "user", "content": "Explain the NAS approach in one paragraph."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=512, temperature=0.6, top_p=0.95)
print(tokenizer.decode(out[0], skip_special_tokens=True))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:5000/v1", apiKey: "dummy" });
const res = await client.chat.completions.create({
  model: "Llama-3_3-Nemotron-Super-49B-v1_5",
  messages: [
    { role: "system", content: "" },
    { role: "user", content: "Write a function to reverse a linked list." }
  ],
  temperature: 0.6,
  top_p: 0.95
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Llama-3.3-Nemotron-Super-49B-v1.5は、MetaのLlama-3.3-70B-Instructから派生した、NVIDIAの49Bパラメータの推論・チャットモデルです。NVIDIAはNeural Architecture Searchを使って、高い精度を維持しながら70Bの参照モデルを49Bに縮小し、単一のH100またはH200 GPUに収まるようにしました。128Kトークンのコンテキスト長に対応し、数学、コード、推論、ツール呼び出し向けの事後学習が施されています。

このモデルは、高負荷時にも単一のNVIDIA H100-80GBまたはH200 GPUに収まるように最適化されています。NVIDIAがテストに使用したハードウェアは、H100-80GBを2基、またはA100-80GBを2基搭載した構成でした。フル精度での実行には約100 GBのメモリが必要です。4ビット量子化では、約48 GBのVRAMで実行できます。AmpereまたはHopper GPU上で、vLLMとTransformersを使った推論の提供に適しています。

重みはHugging Faceで一般公開されており、商用利用が可能なモデルです。利用にはNVIDIA Open Model Licenseが適用されます。また、Llamaをベースに構築されているため、Llama 3.3 Community License Agreementも追加で適用されます。これらのライセンス条件に従うことで、無料でダウンロードし、自分で実行できます。

デフォルトでは、システムプロンプトが空の場合、モデルは推論が有効なモードで応答し、思考過程を出力します。システムプロンプトに/no_thinkを追加すると、推論が無効なモードに切り替わります。NVIDIAは、推論を有効にする場合はtemperature 0.6とtop-p 0.95を、無効にする場合は貪欲デコーディングを推奨しています。

このモデルは、主に英語とプログラミング言語を対象としています。NVIDIAは、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語への対応も挙げています。事後学習では英語のシングルターンとマルチターンのチャットに重点が置かれているため、英語での性能が最も高くなっています。