NVIDIA-Nemotron-3.5-Lightning-30B-A3B

更新
04.10.2026
思考
ツール利用
推論
コード生成
多言語

NVIDIA Nemotron 3.5 Lightningは、総パラメータ数30B、有効パラメータ数3BのMamba-2ハイブリッドMoEで、コンテキスト長は1Mトークンに達します。

基本情報

  • ライセンス: OpenMDW 1.1
  • パラメータ数: 合計30B、トークンごとの有効パラメータ数3B
  • コンテキスト長: 最大1Mトークン、H100 1基では256K
  • 言語: 英語、スペイン語、フランス語、ドイツ語、イタリア語、日本語
  • 最小ハードウェア要件: AD-IQ4_NLで24 GBのVRAM

NVIDIA-Nemotron-3.5-Lightning-30B-A3Bとは?

NVIDIA-Nemotron-3.5-Lightning-30B-A3Bは、NVIDIAのNemotron 3.5シリーズに属するスループット重視のモデルで、2026年8月11日に公開されました。総パラメータ数30B、トークンごとの有効パラメータ数3BのスパースMoEです。すべての層でアテンションを使うのではなく、Mamba-2ブロックとアテンションを組み合わせた層構成を採用しています。

仕様Nemotron 3.5 Lightning 30B A3B
総パラメータ数30B
有効パラメータ数トークンごとに3B、128個のエキスパートのうち6個を使用
アーキテクチャMamba-2、MoE、アテンションのハイブリッド
層数52
コンテキスト長最大1Mトークン、H100 1基では256K
モダリティテキスト入力、テキスト出力
推論チャットテンプレートで切り替え可能
投機的デコーディングDSpark、MTP、DFlashのヘッドも併せて公開
公開日2026年8月11日
ライセンスOpenMDW 1.1

Mamba-2層は、トークンごとに増大するKVキャッシュの代わりに固定サイズの状態を保持します。これにより、NVIDIAは最大1Mトークンのコンテキスト長を掲げています。NVIDIAはこのモデル向けにDSpark、MTP、DFlashのドラフターヘッドも公開しているため、別途ドラフトモデルを用意せずに投機的デコーディングを利用できます。

Nemotron 3.5 Lightningのベンチマーク

BF16モデルカードに掲載されたNVIDIA自身の測定値では、現行の同規模のオープンモデルおよび前世代のNemotronと比較しています。

ベンチマークNemotron 3.5 LightningQwen3.6-35B-A3BGemma 4 26B A4BNemotron 3 SuperGPT-OSS 20B
MMLU Pro
学術知識
81.9485.6385.2083.8976.40
GPQA Diamond
専門的な科学知識
75.4483.4079.6178.6071.46
SWE-bench Verified
ソフトウェア工学
51.5670.1257.4063.0852.44
Terminal-Bench 2.1
ターミナルエージェント
24.5844.3837.2239.6115.17
PinchBench
書式の堅牢性
85.3788.0774.7080.3657.20
IFBench (loose)
指示追従
71.8863.7177.2571.9268.50
AA-LCR
長文コンテキストでの推論
52.0061.0657.5658.4432.88

精度では、同規模のモデルの中で首位ではありません。Qwen3.6-35B-A3Bが7項目中5項目で上回っており、コーディング性能の差は大きいです。Lightningが重視しているのは別の軸、つまりGPU 1基で長いコンテキストを高速に処理することで、その名前にも表れています。

Nemotron 3.5 Lightningのハードウェア要件

システム要件で確認すべきなのはメモリです。私たちはBF16の参照用重みからモデルを量子化し、各ビルドをAtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUFとして公開しました。

メモリ選ぶビルドファイルサイズ
24 GBAD-IQ4_NL19.6 GB
32 GBQ4_K_M25.0 GB
48 GBQ5_K_M26.6 GB
64 GB以上Q8_035.0 GB

1Mトークンのコンテキスト長は、データセンター環境での数値です。NVIDIAは80 GBのH100 1基で256Kを検証しており、1Mに達するのはそのH100を8基使用した場合のみです。デスクトップでは、重みを読み込んだ後に残るメモリに合わせてコンテキスト長を設定し、大きな値にする前にKVキャッシュがどのように増大するかを確認してください。

Atomic ChatでNemotron 3.5 Lightningを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでNemotron-3.5-Lightningを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

Nemotronファミリーページに掲載されている、このシリーズのほかのすべてのモデルも同じ手順で実行できます。llama.cppを自分で操作したい場合は、私たちのローカルLLMの実行ガイドにコマンドを掲載しています。

NVIDIAは、Blackwellカード向けにこのモデルのNVFP4ビルドも提供しています。NVFP4とは何かでは、GGUFよりもこの形式を使う価値があるのはどのような場合かを説明しています。

NVIDIA-Nemotron-3.5-Lightning-30B-A3Bのライセンス

重みはApache 2.0やMITではなく、OpenMDW License Agreement 1.1に基づいて配布されています。NVIDIAはこのモデルを商用利用できるとしています。利用条件はOpenMDWの本文に定められているため、製品に導入する前に確認してください。

Hugging Faceからモデルをダウンロード

huggingface-cli download nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
# Atomic ChatのGGUFビルド:
huggingface-cli download AtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF NVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.gguf
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "NVIDIA-Nemotron-3.5-Lightning-30B-A3B",
    "messages": [{"role": "user", "content": "Summarise this 200-page contract."}],
    "temperature": 1.0,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": "Extract every date from this log."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
print(tokenizer.decode(model.generate(inputs, max_new_tokens=1024)[0]))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "NVIDIA-Nemotron-3.5-Lightning-30B-A3B",
  messages: [{ role: "user", content: "Diff these two config files and explain what changed." }],
  temperature: 1.0,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

2026年8月11日に公開されたNVIDIAの30BのMoEモデルで、トークンごとに3Bのパラメータを有効化します。アーキテクチャはMamba-2ブロックとアテンションを組み合わせており、複数GPUでの運用時にはコンテキスト長が1Mトークンに達します。

私たちのAD-IQ4_NLビルドは19.6 GBなので、24 GBのカードで実行できます。25.0 GBのQ4_K_Mは32 GBのマシンに適しており、35.0 GBのQ8_0は64 GB以上の環境向けの、参照モデルに近いビルドです。

NVIDIAが検証した構成では可能です。GB200またはH100 8基で1Mトークンを扱えます。H100 1基では、それ以上はメモリが足りなくなるため、検証済みのコンテキスト長は256Kです。一般消費者向けカードで保持できる量は、それよりもはるかに少なくなります。

重みはOpenMDW License Agreement 1.1に基づいて無料でダウンロードでき、NVIDIAはこのモデルを商用利用できるとしています。OSIライセンスではないため、ご自身の用途に照らして条件を確認してください。

DSparkはNVIDIAの投機的デコーディング手法です。小型のドラフターが複数のトークンを一度に提案し、メインモデルがそれらを並列に検証することで、出力を変えずに1秒あたりのトークン数を増やします。NVIDIAはモデルと併せてドラフターを公開しています。