NVIDIA-Nemotron-3.5-Lightning-30B-A3Bとは?
NVIDIA-Nemotron-3.5-Lightning-30B-A3Bは、NVIDIAのNemotron 3.5シリーズに属するスループット重視のモデルで、2026年8月11日に公開されました。総パラメータ数30B、トークンごとの有効パラメータ数3BのスパースMoEです。すべての層でアテンションを使うのではなく、Mamba-2ブロックとアテンションを組み合わせた層構成を採用しています。
| 仕様 | Nemotron 3.5 Lightning 30B A3B |
|---|---|
| 総パラメータ数 | 30B |
| 有効パラメータ数 | トークンごとに3B、128個のエキスパートのうち6個を使用 |
| アーキテクチャ | Mamba-2、MoE、アテンションのハイブリッド |
| 層数 | 52 |
| コンテキスト長 | 最大1Mトークン、H100 1基では256K |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | チャットテンプレートで切り替え可能 |
| 投機的デコーディング | DSpark、MTP、DFlashのヘッドも併せて公開 |
| 公開日 | 2026年8月11日 |
| ライセンス | OpenMDW 1.1 |
Mamba-2層は、トークンごとに増大するKVキャッシュの代わりに固定サイズの状態を保持します。これにより、NVIDIAは最大1Mトークンのコンテキスト長を掲げています。NVIDIAはこのモデル向けにDSpark、MTP、DFlashのドラフターヘッドも公開しているため、別途ドラフトモデルを用意せずに投機的デコーディングを利用できます。
Nemotron 3.5 Lightningのベンチマーク
BF16モデルカードに掲載されたNVIDIA自身の測定値では、現行の同規模のオープンモデルおよび前世代のNemotronと比較しています。
| ベンチマーク | Nemotron 3.5 Lightning | Qwen3.6-35B-A3B | Gemma 4 26B A4B | Nemotron 3 Super | GPT-OSS 20B |
|---|---|---|---|---|---|
MMLU Pro 学術知識 | 81.94 | 85.63 | 85.20 | 83.89 | 76.40 |
GPQA Diamond 専門的な科学知識 | 75.44 | 83.40 | 79.61 | 78.60 | 71.46 |
SWE-bench Verified ソフトウェア工学 | 51.56 | 70.12 | 57.40 | 63.08 | 52.44 |
Terminal-Bench 2.1 ターミナルエージェント | 24.58 | 44.38 | 37.22 | 39.61 | 15.17 |
PinchBench 書式の堅牢性 | 85.37 | 88.07 | 74.70 | 80.36 | 57.20 |
IFBench (loose) 指示追従 | 71.88 | 63.71 | 77.25 | 71.92 | 68.50 |
AA-LCR 長文コンテキストでの推論 | 52.00 | 61.06 | 57.56 | 58.44 | 32.88 |
精度では、同規模のモデルの中で首位ではありません。Qwen3.6-35B-A3Bが7項目中5項目で上回っており、コーディング性能の差は大きいです。Lightningが重視しているのは別の軸、つまりGPU 1基で長いコンテキストを高速に処理することで、その名前にも表れています。
Nemotron 3.5 Lightningのハードウェア要件
システム要件で確認すべきなのはメモリです。私たちはBF16の参照用重みからモデルを量子化し、各ビルドをAtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUFとして公開しました。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 24 GB | AD-IQ4_NL | 19.6 GB |
| 32 GB | Q4_K_M | 25.0 GB |
| 48 GB | Q5_K_M | 26.6 GB |
| 64 GB以上 | Q8_0 | 35.0 GB |
1Mトークンのコンテキスト長は、データセンター環境での数値です。NVIDIAは80 GBのH100 1基で256Kを検証しており、1Mに達するのはそのH100を8基使用した場合のみです。デスクトップでは、重みを読み込んだ後に残るメモリに合わせてコンテキスト長を設定し、大きな値にする前にKVキャッシュがどのように増大するかを確認してください。
Atomic ChatでNemotron 3.5 Lightningを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでNemotron-3.5-Lightningを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
Nemotronファミリーページに掲載されている、このシリーズのほかのすべてのモデルも同じ手順で実行できます。llama.cppを自分で操作したい場合は、私たちのローカルLLMの実行ガイドにコマンドを掲載しています。
NVIDIAは、Blackwellカード向けにこのモデルのNVFP4ビルドも提供しています。NVFP4とは何かでは、GGUFよりもこの形式を使う価値があるのはどのような場合かを説明しています。
NVIDIA-Nemotron-3.5-Lightning-30B-A3Bのライセンス
重みはApache 2.0やMITではなく、OpenMDW License Agreement 1.1に基づいて配布されています。NVIDIAはこのモデルを商用利用できるとしています。利用条件はOpenMDWの本文に定められているため、製品に導入する前に確認してください。
