Llama-3.3-Nemotron-Super-49B-v1.5とは?
Llama-3.3-Nemotron-Super-49B-v1.5は、NVIDIAの49B推論・チャットモデルです。MetaのLlama-3.3-70B-Instructから派生し、2025年7月25日にHugging Faceで公開されました。NVIDIAはNeural Architecture Search(NAS)を使って70Bの参照モデルを49Bに圧縮し、メモリ使用量を削減することで、高負荷時にも単一のGPUに収まるようにしました。推論、人間のチャット応答への好み、RAGやツール呼び出しなどのエージェントタスクに合わせた事後学習が施されており、128Kのコンテキスト長に対応しています。
| 仕様 | Llama-3.3-Nemotron-Super-49B-v1.5 |
|---|---|
| 総パラメータ数 | 49.9B (BF16) |
| アーキテクチャ | デコーダーのみのTransformerを採用したデンスモデル。Llama 3.3 70BのNAS派生モデル |
| ベースモデル | Meta Llama-3.3-70B-Instruct |
| コンテキスト長 | 131,072トークン |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | デフォルトで有効。システムプロンプトに/no_thinkを指定すると無効になります |
| 対応言語 | 英語とコードに加え、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語 |
| 公開日 | 2025年7月25日 |
| ライセンス | NVIDIA Open Model License + Llama 3.3 Community License |
NAS処理によって、標準的な構造とは異なり、同じ構造を繰り返さないブロックが生成されます。一部のブロックではアテンションが完全に省略されるか、単一の線形層に置き換えられ、FFNの拡張比率もブロックごとに変わります。その後、NVIDIAはFineWeb、Buzz-V1.2、Dolmaの400億トークンを使い、参照モデルを教師としてブロック単位の蒸留を行いました。続いて、数学、コード、科学、ツール呼び出しの教師ありファインチューニング、チャット向けのRPO、推論向けのRLVR、ツール呼び出し向けの反復的なDPOという複数段階の事後学習パイプラインを実施しました。推論はデフォルトで有効です。NVIDIAは、推論を有効にする場合はtemperature 0.6とtop-p 0.95を、無効にする場合は貪欲デコーディングを推奨しています。
Llama-3.3-Nemotron-Super-49B-v1.5のベンチマーク
NVIDIAは、推論を有効にしたモードで自社評価した数値を公開しています。NeMo-Skillsを使い、シーケンス長64kで実行し、最大16回の実行結果を平均したものです。
| ベンチマーク | Llama-3.3-Nemotron-Super-49B-v1.5 |
|---|---|
MATH500 数学問題 | 97.4 |
AIME 2025 数学コンテスト | 82.71 |
GPQA 専門レベルの科学 | 71.97 |
LiveCodeBench 競技プログラミング | 73.58 |
BFCL v3 関数呼び出し | 71.75 |
IFEval 指示への追従 | 88.61 |
MMLU Pro 学術知識 | 79.53 |
これらは単一モデルのスコアであり、競合モデルの列はありません。そのため、順位ではなく性能の傾向を示すものとして捉えてください。得意分野は数学で、MATH500では97.4、AIME 2024では87.5です。科学、コーディング、関数呼び出しは70台前半で、Humanity's Last Examのテキストのみのサブセットでは7.64にとどまります。そのため、このモデルは最先端の雑学に答えるために作られたものではありません。
Llama-3.3-Nemotron-Super-49B-v1.5のハードウェア要件
システム要件で確認すべきなのはメモリです。NVIDIAは重みをBF16のsafetensors形式で提供しています。以下に実際のファイルサイズとともに示すコミュニティ製のGGUFビルドは、unsloth/Llama-3_3-Nemotron-Super-49B-v1_5-GGUFで提供されています。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 16 GB | UD-IQ2_XXS | 13.95 GB |
| 24 GB | UD-IQ3_XXS | 19.69 GB |
| 32 GB | UD-Q3_K_XL | 24.81 GB |
| 48 GB | UD-Q4_K_XL | 30.36 GB |
| 64 GB以上 | UD-Q6_K_XL | 43.42 GB |
隣り合うビルドのサイズ差は数GBなので、両方ともメモリに収まる場合は大きい方を選んでください。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでLlama-3.3-Nemotron-Super-49B-v1.5を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでLlama-3.3-Nemotron-Super-49B-v1.5を検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
NVIDIAのほかのローカル向けモデルについては、ローカルで実行できるNemotronモデルの一覧、または大幅に小さいNemotron Nano 9B v2をご覧ください。
Llama-3.3-Nemotron-Super-49B-v1.5のライセンス
利用にはNVIDIA Open Model Licenseが適用されます。また、Llamaを使って構築されたモデルのため、Llama 3.3 Community License Agreementも追加で適用されます。NVIDIAは商用利用が可能なモデルであると明記しています。両方のライセンス条件に従うことで、重みをダウンロードして自分のハードウェアで実行し、それを使った製品をリリースできます。
