NVIDIA-Nemotron-Nano-9B-v2とは
NVIDIA-Nemotron-Nano-9B-v2は、NVIDIAが推論とチャットを統合するモデルとしてゼロから学習させた8.9Bの言語モデルです。まず推論過程を記述し、その後に最終回答を出力します。推論過程の出力はシステムプロンプトでオフにできます。アーキテクチャはMamba2-Transformerハイブリッドで、主にMamba-2層とMLP層で構成され、アテンション層は4層のみです。NVIDIAは2025年8月18日に、NVIDIA Open Model Licenseの下で重みをHugging Faceに公開しました。GGUFビルドは約5 GBからあり、8 GBのマシンでも扱えるサイズです。
| 仕様 | NVIDIA-Nemotron-Nano-9B-v2 |
|---|---|
| 総パラメータ数 | 8.89B(BF16チェックポイント) |
| アーキテクチャ | Mamba2-Transformerハイブリッド、アテンション層は4層 |
| コンテキスト長 | 128Kトークン |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | デフォルトでオン、/thinkと/no_thinkで切り替え可能、実行時の思考トークン数の上限を設定可能 |
| 対応言語 | 英語、ドイツ語、スペイン語、フランス語、イタリア語、日本語 |
| 学習データ | 約20兆トークン、カットオフは2024年9月 |
| リリース日 | 2025年8月18日 |
| ライセンス | NVIDIA Open Model License |
このモデルでは、多くのローカルLLMよりも細かく推論を制御できます。システムプロンプトに/thinkまたは/no_thinkを記述すると、推論過程の出力を切り替えられます。任意のユーザーメッセージに記述して、ターンごとに制御することもできます。NVIDIAによると、オフにすると難しいプロンプトで精度が少し低下します。さらに、実行時に思考トークン数の上限も設定できます。推論過程のトークン数に上限を設けると、モデルはその上限付近で推論を終えます。これは応答のレイテンシに目標値がある場合に重要です。NVIDIAは、推論がオンの場合はtemperatureを0.6、top_pを0.95に設定し、オフの場合は貪欲デコーディングを使うことを推奨しています。
NVIDIA-Nemotron-Nano-9B-v2のベンチマーク
NVIDIAがリリース時に公開した数値は、NeMo-Skillsを使い、推論をオンにしたモードで測定したものです(RULERのみ例外で、推論をオフにして測定しています)。このモデルをQwen3-8Bと比較しています。
| ベンチマーク | NVIDIA-Nemotron-Nano-9B-v2 | Qwen3-8B |
|---|---|---|
AIME25 数学競技 | 72.1% | 69.3% |
MATH500 数学問題 | 97.8% | 96.3% |
GPQA 専門的な科学知識 | 64.0% | 59.6% |
LCB 競技プログラミング | 71.1% | 59.5% |
BFCL v3 ツール呼び出し | 66.9% | 66.3% |
IFEval 指示追従 | 90.3% | 89.4% |
HLE 専門知識を問う問題 | 6.5% | 4.4% |
RULER (128K) 長いコンテキスト | 78.9% | 74.1% |
9Bモデルは8項目すべてでQwen3-8Bを上回っていますが、ツール呼び出しと指示追従の差は1ポイント未満です。明確な差があるのはコーディングと長いコンテキストの処理です。LCBのスコアは59.5から71.1に上昇し、RULERでは128Kでも78.9を維持しています。
NVIDIA-Nemotron-Nano-9B-v2のハードウェア要件
システム要件で確認すべきなのはメモリです。NVIDIAはオリジナルのBF16 safetensorsを公開しています。以下のGGUFビルド一覧は、bartowski/nvidia_NVIDIA-Nemotron-Nano-9B-v2-GGUFのものです。
| メモリ | 推奨ビルド | ファイルサイズ |
|---|---|---|
| 6 GB | IQ3_M | 5.21 GB |
| 8 GB | Q4_K_M | 6.53 GB |
| 12 GB | Q6_K | 9.14 GB |
| 16 GB | Q8_0 | 9.46 GB |
| 24 GB以上 | bf16 | 17.79 GB |
この一覧では、小さいビルド同士のサイズ差が珍しいほど小さくなっています。IQ2_SからQ3_K_XLまでのすべてのビルドが4.96から5.78 GBの範囲に収まるため、2ビットのファイルは3ビットのファイルよりわずかに小さい程度です。そのため、実用的な下限としてはQ4_K_Mが妥当です。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic ChatでNVIDIA-Nemotron-Nano-9B-v2を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでNVIDIA-Nemotron-Nano-9B-v2を検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを始めます。
同じファミリーのほかのモデルについては、ローカルで実行できるNemotronモデルの一覧をご覧ください。より大きなLlama-3.3-Nemotron-Super-49B-v1.5も含まれています。
NVIDIA-Nemotron-Nano-9B-v2のライセンス
NVIDIA-Nemotron-Nano-9B-v2は、NVIDIA Open Model License Agreementの下で公開されています。これはApache 2.0のような標準的なライセンスではなく、重みの公開を対象とするNVIDIA独自のライセンスです。NVIDIAは、このモデルは商用利用が可能であると説明しています。そのため、このライセンスの条件に従って、モデルを使った製品を開発したり、自社や自分のハードウェアで実行したりできます。
