NVIDIA-Nemotron-Nano-9B-v2

更新
04.10.2026
思考
推論
コード生成
ツール利用
多言語

NVIDIAの9B Mamba2-Transformerハイブリッド推論モデルです。思考のオン・オフ切り替え、128Kのコンテキスト長、ツール呼び出しに対応しています。

基本情報

  • ライセンス: NVIDIA Open Model License、商用利用可
  • パラメータ数: 8.9B
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ6 GB(IQ3_M GGUF、5.21 GB)

NVIDIA-Nemotron-Nano-9B-v2とは

NVIDIA-Nemotron-Nano-9B-v2は、NVIDIAが推論とチャットを統合するモデルとしてゼロから学習させた8.9Bの言語モデルです。まず推論過程を記述し、その後に最終回答を出力します。推論過程の出力はシステムプロンプトでオフにできます。アーキテクチャはMamba2-Transformerハイブリッドで、主にMamba-2層とMLP層で構成され、アテンション層は4層のみです。NVIDIAは2025年8月18日に、NVIDIA Open Model Licenseの下で重みをHugging Faceに公開しました。GGUFビルドは約5 GBからあり、8 GBのマシンでも扱えるサイズです。

仕様NVIDIA-Nemotron-Nano-9B-v2
総パラメータ数8.89B(BF16チェックポイント)
アーキテクチャMamba2-Transformerハイブリッド、アテンション層は4層
コンテキスト長128Kトークン
モダリティテキスト入力、テキスト出力
推論デフォルトでオン、/thinkと/no_thinkで切り替え可能、実行時の思考トークン数の上限を設定可能
対応言語英語、ドイツ語、スペイン語、フランス語、イタリア語、日本語
学習データ約20兆トークン、カットオフは2024年9月
リリース日2025年8月18日
ライセンスNVIDIA Open Model License

このモデルでは、多くのローカルLLMよりも細かく推論を制御できます。システムプロンプトに/thinkまたは/no_thinkを記述すると、推論過程の出力を切り替えられます。任意のユーザーメッセージに記述して、ターンごとに制御することもできます。NVIDIAによると、オフにすると難しいプロンプトで精度が少し低下します。さらに、実行時に思考トークン数の上限も設定できます。推論過程のトークン数に上限を設けると、モデルはその上限付近で推論を終えます。これは応答のレイテンシに目標値がある場合に重要です。NVIDIAは、推論がオンの場合はtemperatureを0.6、top_pを0.95に設定し、オフの場合は貪欲デコーディングを使うことを推奨しています。

NVIDIA-Nemotron-Nano-9B-v2のベンチマーク

NVIDIAがリリース時に公開した数値は、NeMo-Skillsを使い、推論をオンにしたモードで測定したものです(RULERのみ例外で、推論をオフにして測定しています)。このモデルをQwen3-8Bと比較しています。

ベンチマークNVIDIA-Nemotron-Nano-9B-v2Qwen3-8B
AIME25
数学競技
72.1%69.3%
MATH500
数学問題
97.8%96.3%
GPQA
専門的な科学知識
64.0%59.6%
LCB
競技プログラミング
71.1%59.5%
BFCL v3
ツール呼び出し
66.9%66.3%
IFEval
指示追従
90.3%89.4%
HLE
専門知識を問う問題
6.5%4.4%
RULER (128K)
長いコンテキスト
78.9%74.1%

9Bモデルは8項目すべてでQwen3-8Bを上回っていますが、ツール呼び出しと指示追従の差は1ポイント未満です。明確な差があるのはコーディングと長いコンテキストの処理です。LCBのスコアは59.5から71.1に上昇し、RULERでは128Kでも78.9を維持しています。

NVIDIA-Nemotron-Nano-9B-v2のハードウェア要件

システム要件で確認すべきなのはメモリです。NVIDIAはオリジナルのBF16 safetensorsを公開しています。以下のGGUFビルド一覧は、bartowski/nvidia_NVIDIA-Nemotron-Nano-9B-v2-GGUFのものです。

メモリ推奨ビルドファイルサイズ
6 GBIQ3_M5.21 GB
8 GBQ4_K_M6.53 GB
12 GBQ6_K9.14 GB
16 GBQ8_09.46 GB
24 GB以上bf1617.79 GB

この一覧では、小さいビルド同士のサイズ差が珍しいほど小さくなっています。IQ2_SからQ3_K_XLまでのすべてのビルドが4.96から5.78 GBの範囲に収まるため、2ビットのファイルは3ビットのファイルよりわずかに小さい程度です。そのため、実用的な下限としてはQ4_K_Mが妥当です。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic ChatでNVIDIA-Nemotron-Nano-9B-v2を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでNVIDIA-Nemotron-Nano-9B-v2を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを始めます。

同じファミリーのほかのモデルについては、ローカルで実行できるNemotronモデルの一覧をご覧ください。より大きなLlama-3.3-Nemotron-Super-49B-v1.5も含まれています。

NVIDIA-Nemotron-Nano-9B-v2のライセンス

NVIDIA-Nemotron-Nano-9B-v2は、NVIDIA Open Model License Agreementの下で公開されています。これはApache 2.0のような標準的なライセンスではなく、重みの公開を対象とするNVIDIA独自のライセンスです。NVIDIAは、このモデルは商用利用が可能であると説明しています。そのため、このライセンスの条件に従って、モデルを使った製品を開発したり、自社や自分のハードウェアで実行したりできます。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.48" accelerate
huggingface-cli download nvidia/NVIDIA-Nemotron-Nano-9B-v2
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/NVIDIA-Nemotron-Nano-9B-v2",
    "messages": [{"role": "user", "content": "Solve: integrate x^2 dx"}],
    "temperature": 0.6,
    "top_p": 0.95,
    "max_tokens": 1024
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("nvidia/NVIDIA-Nemotron-Nano-9B-v2", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-Nano-9B-v2")
messages = [{"role": "user", "content": "Explain the Mamba-2 layer in one paragraph."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
print(tokenizer.decode(model.generate(inputs, max_new_tokens=1024)[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "nvidia/NVIDIA-Nemotron-Nano-9B-v2",
  messages: [{ role: "user", content: "Write a Python function to check if a number is prime." }],
  temperature: 0.6,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

NVIDIA-Nemotron-Nano-9B-v2は、NVIDIAがゼロから学習させ、2025年8月に公開した、パラメータ数9Bの言語モデルです。推論とチャットを統合したモデルで、最終回答の前に明示的な思考過程を生成でき、その推論動作はシステムプロンプトで制御できます。Nemotron-Hハイブリッドアーキテクチャを採用し、Mamba-2層と少数のTransformerアテンション層を組み合わせることで、長い出力を生成する際の推論を高速化しています。

NVIDIAは、メモリ22 GiBを搭載した単一のNVIDIA A10G GPUで、bfloat16のまま128Kのコンテキスト長をすべて使って推論できるように、このモデルを蒸留しました。4ビット量子化では重みが約10-12 GBのVRAMに収まるため、RTX 3060 12 GBやRTX 4070などの一般消費者向けカードでも実行可能な範囲に入ります。Hugging Face transformers、vLLM、NVIDIA NIMで実行できます。

はい。モデルの重みはHugging Faceで公開されており、NVIDIA Open Model License Agreementが適用されます。NVIDIAは、このライセンスの下でモデルを商用利用できると説明しています。Apache 2.0やMITのような標準的なOSIライセンスで公開されているわけではありません。そのため、制限のないオープンソースライセンスではなく、NVIDIA独自のライセンスの条件に従って導入することが認められています。OpenRouterなどのホスティングサービスでも無料で試せます。

このモデルは、入力と出力の両方で最大128Kトークンのコンテキスト長に対応しています。公式の対応言語は、英語、ドイツ語、スペイン語、フランス語、イタリア語、日本語です。主に英語とコーディングのタスクを想定しており、ほかの5言語への対応は副次的な機能として位置付けられています。

NVIDIAが公開した推論オンのベンチマークでは、Nemotron-Nano-9B-v2はQwen3-8Bと同等以上のスコアを記録しています。Nemotron-Nano-9B-v2とQwen3-8Bの順に、AIME25は72.1%と69.3%、MATH500は97.8%と96.3%、GPQAは64.0%と59.6%、LiveCodeBenchは71.1%と59.5%です。精度に加えて、Mamba2-Transformerハイブリッド設計により、長い出力を伴う推論の条件下では、同等のTransformerモデルに比べて推論スループットが最大約6倍になります。