この記事はデスクトップ向けRTX 5090のガイドです。RTX 5090 Laptop GPUは利用できるメモリ容量が異なるため、このランキングには含めていません。
結論
RTX 5090で汎用的に使うなら、私たちのおすすめはQwen3.8-27Bです。生成速度は79.4トークン/秒、4kプロンプトの処理速度は5,100トークン/秒でした。出力速度を最優先するなら、Nemotron 3.5 LightningがテストしたAtomicChatビルドで334.3トークン/秒に達しました。Gemma 4 26B-A4Bは速度と長文書の処理を高い水準で両立します。生成速度は248.6トークン/秒で、128kトークンの文書を入力した後の最初の質問に回答するまで24.4秒かかりました。6モデルすべてが文書に関する質問に正しく答えたため、実用上の違いは待ち時間とVRAM使用量でした。このページの数値はすべて、メモリ帯域幅からの推定ではなく、モデルを実行した実機のRTX 5090から得たものです。
RTX 5090におすすめのローカルLLM
| モデル | テストしたGGUFファイル | ファイルサイズ(GiB) | 32kでのVRAM使用量(MiB) | 4kプロンプト(tok/s) | 生成(tok/s) | 適した用途 |
|---|---|---|---|---|---|---|
| Qwen3.8-27B | Qwen3.8-27B-iMatrix-NVFP4-MTP.gguf | 15.95 | 18,048 | 5,100 | 79.4 | 汎用用途 |
| Gemma 4 31B it | gemma-4-31B-it-Q4_K_M.gguf | 17.40 | 22,372 | 3,698 | 68.5 | デンスモデルのGemmaという選択肢 |
| Gemma 4 26B-A4B it | gemma-4-26B-A4B-it-Q4_K_M.gguf | 15.64 | 17,702 | 11,829 | 248.6 | 長文書の高速処理 |
| Gemma 4 12B it | gemma-4-12b-it-Q4_K_M.gguf | 6.87 | 8,758 | 8,659 | 145.4 | 最小のVRAM使用量 |
| Muse Glimmer 30B | Muse-Glimmer-30B-AD-Q4_K_M.gguf | 17.75 | 18,392 | 4,387 | 73.9 | 推論を重視するアシスタント |
| Nemotron 3.5 Lightning 30B-A3B | NVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.gguf | 18.30 | 18,612 | 12,047 | 334.3 | 高速な出力と最初のトークンまでの短い待ち時間 |
1. Qwen3.8-27B
デスクトップ向けRTX 5090で幅広い用途に使うなら、私たちのおすすめはQwen3.8-27Bです。このデンスモデルは従来のアテンションとGated DeltaNet層を組み合わせ、ネイティブで262kトークンのコンテキスト長に対応します。コーディングベンチマークで高い性能を示しており、開発作業で使い始めるモデルとして優れた選択肢です。
| モデル情報 | 内容 |
|---|---|
| 開発元 | Qwen / Alibaba |
| リリース | 2026年8月14日 |
| パラメータ数とアーキテクチャ | 27.32B、デンスモデル、Gated DeltaNet / アテンションのハイブリッド構成で64層 |
| ネイティブのコンテキスト長 | 262,144トークン |
| ベースモデルの入力 | テキスト、画像、動画 |
| 思考 | 切り替え可能、推論の深さを調整可能 |
| テスト済みの推奨ビルド | cdiamond/Qwen3.8-27B-iMatrix-NVFP4-MTP-GGUFからQwen3.8-27B-iMatrix-NVFP4-MTP.ggufを選択、15.95 GiB |
2026年8月にリリースされた、Qwen3.8ファミリーの27Bデンスモデルです。元のモデルはテキスト、画像、動画を入力でき、思考のオンとオフを切り替えられます。私たちのGGUFテストでは、思考をオフにしてテキストを使用しました。このカードにはcdiamondのコミュニティ製ファイルをおすすめします。重みの70.8%がNVFP4で、残りはQ5_K、Q6_K、Q8_0です。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond 専門レベルの科学 | 89.2 |
SWE-bench Pro 高難度のエンジニアリング | 61.7 |
Terminal-Bench 2.1 ターミナルエージェント | 73.0 |
LiveCodeBench v6 競技プログラミング | 90.3 |
上記は元のQwenモデルの結果です。
| 測定項目 | AtomicChat AD-Q4_K_M | AtomicChat AD-Q5_K_M | cdiamond NVFP4 |
|---|---|---|---|
| 正確なファイル名 | Qwen3.8-27B-AD-Q4_K_M.gguf | Qwen3.8-27B-AD-Q5_K_M.gguf | Qwen3.8-27B-iMatrix-NVFP4-MTP.gguf |
| ファイルサイズ | 15.94 GiB | 18.84 GiB | 15.95 GiB |
| コンテキスト長32kでのGPUメモリ使用量 | 18,356 MiB | 未測定 | 18,048 MiB |
| 4kプロンプトの処理 | 3,830 tok/s | 3,540 tok/s | 5,100 tok/s |
| 128トークンの生成 | 74.2 tok/s | 69.2 tok/s | 79.4 tok/s |
評価:BlackwellでQwen3.8-27Bを使うなら、ここで指定したcdiamondのNVFP4 GGUFを選んでください。AD-Q4と同等のファイルサイズで、プロンプトをより速く処理しました。テストしたAtomicChat AD-Q4ビルドでは、128k文書を入力してから最初のトークンを生成するまで62.6秒かかり、24,773 MiBを使用しました。この長いコンテキストでの数値が、そのままcdiamondのファイルにも当てはまるとは考えないでください。
2. Gemma 4 31B it
Gemma 4 31B itは、GoogleのGemma 4で最大のデンスモデルです。Gemmaの出力スタイルを好むなら有用な選択肢ですが、長いコンテキストでは今回の6モデルで最も多くのメモリを消費します。
| モデル情報 | 内容 |
|---|---|
| 開発元 | Google DeepMind |
| リリース | 2026年4月 |
| パラメータ数とアーキテクチャ | 30.7B、デンスモデル、60層 |
| ネイティブのコンテキスト長 | 262,144トークン |
| 元のモデルの入力 | テキストと画像 |
| テストしたビルド | AtomicChat/gemma-4-31B-it-GGUFからgemma-4-31B-it-Q4_K_M.ggufを選択、17.40 GiB |
Gemma 4 31Bは、各層でローカルなスライディングウィンドウ・アテンションとグローバルアテンションを使用します。後述の26B-A4Bモデルとは異なり、各トークンの生成に言語モデルの重みをすべて使用します。以下の表はベンチマークでの性能を示しています。これらはGoogleの公式数値で、Googleは各行の思考設定を明示していません。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond 専門レベルの科学 | 84.3% |
LiveCodeBench v6 競技プログラミング | 80.0% |
MRCR v2、128kで8つの検索対象 | 66.4% |
私たちのRTX 5090テスト:
| 測定項目 | 結果 |
|---|---|
| コンテキスト長32kでのGPUメモリ使用量 | 22,372 MiB |
| 4kプロンプトの処理 | 3,698 tok/s |
| 128トークンの生成 | 68.5 tok/s |
| 128k文書の入力後、最初のトークンまでの時間 | 85.0秒 |
| 128k文書でのGPUメモリ使用量 | 30,361 MiB |
| 128kでの文書内の事実 / 要約に含めたトピック | 4/4 / 4/4 |
評価:デンスモデルのGemmaもRTX 5090で128kを処理できますが、私たちのテストではカードの32,607 MiBのうち空きは2,246 MiBしか残りませんでした。長文書への応答時間や、ほかのGPUタスクに使える余裕をより重視するなら、軽量なモデルを選んでください。また、今回の6モデルの中で、公開されている長いコンテキストのスコアが最も高く、128kのMRCR v2で66.4%を記録しています。
3. Gemma 4 26B-A4B it
推論性能を少し犠牲にしてでも生成速度を上げたい場合で、Gemmaファミリーを使い続けたいなら、Gemma 4 26B-A4B itを選んでください。Mixture-of-Experts設計により約25.2Bのパラメータを保持しますが、トークンごとに有効になるのは約4Bで、デンスモデルの31Bよりも大幅に高速な生成につながっています。
| モデル情報 | 内容 |
|---|---|
| 開発元 | Google DeepMind |
| リリース | 2026年4月 |
| パラメータ数とアーキテクチャ | 保持パラメータ数25.2B、トークンごとに約4Bが有効、30層のMoE |
| ネイティブのコンテキスト長 | 262,144トークン |
| 元のモデルの入力 | テキストと画像 |
| テストしたビルド | AtomicChat/gemma-4-26B-A4B-it-GGUFからgemma-4-26B-A4B-it-Q4_K_M.ggufを選択、15.64 GiB |
有効なパラメータ数が少ないことで、生成トークンあたりの計算量が減り、生成が高速になります。長いコンテキストでのメモリ使用量が少ない理由は別にあり、ファイルサイズの小ささと、アテンション層でのKVキャッシュの保存方法によるものです。私たちの構成では、128kでこのモデルが19,831 MiBを使用したのに対し、Gemma 4 31Bは30,361 MiBを使用しました。以下は、元のフル精度ファイルに対するGoogleの公式測定による、このモデルのベンチマーク性能です。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond 専門レベルの科学 | 82.3% |
LiveCodeBench v6 競技プログラミング | 77.1% |
MRCR v2、128kで8つの検索対象 | 44.1% |
以下の表は、私たちのRTX 5090テストでの結果です。
| 測定項目 | 結果 |
|---|---|
| コンテキスト長32kでのGPUメモリ使用量 | 17,702 MiB |
| 4kプロンプトの処理 | 11,829 tok/s |
| 128トークンの生成 | 248.6 tok/s |
| 128k文書の入力後、最初のトークンまでの時間 | 24.4秒 |
| 128k文書でのGPUメモリ使用量 | 19,831 MiB |
| 128kでの文書内の事実 / 要約に含めたトピック | 4/4 / 4/4 |
評価:RTX 5090のVRAMの大半を消費せずに、高速な生成と128k文書の処理を両立したいなら、Gemma 4 26B-A4Bを選んでください。Google自身が実施した128kのMRCR v2テストでは44.1%で、デンスモデルの31Bは66.4%でした。そのため、待ち時間より回答を重視するなら31Bを選んでください。
4. Gemma 4 12B it
Gemma 4 12B itは、今回紹介するRTX 5090におすすめのモデルの中で最小です。ファイルサイズが最も小さいため、GPUメモリを必要とするほかのアプリと並行してAIモデルを実行したい場合に最も適しています。テストしたGGUFファイルの使用量は、32kを割り当てた場合に8,758 MiB、128k文書では10,447 MiBでした。
| モデル情報 | 内容 |
|---|---|
| 開発元 | Google DeepMind |
| リリース | 2026年4月 |
| パラメータ数とアーキテクチャ | 約11.9B、デンスモデル |
| ネイティブのコンテキスト長 | 262,144トークン |
| 元のモデルの入力 | テキストと画像 |
| テストしたビルド | AtomicChat/gemma-4-12B-it-GGUFからgemma-4-12b-it-Q4_K_M.ggufを選択、6.87 GiB |
テストした2つの大型Gemmaモデルよりもはるかに軽量ですが、文書に埋め込んだ事実に関する質問をすべて完了し、128k文書の要約でも指定した4つのトピックをすべて保持しました。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond 専門レベルの科学 | 78.8% |
LiveCodeBench v6 競技プログラミング | 72.0% |
MRCR v2、128kで8つの検索対象 | 43.4% |
以下は私たちが実行したテストの結果です。
| 測定項目 | 結果 |
|---|---|
| コンテキスト長32kでのGPUメモリ使用量 | 8,758 MiB |
| 4kプロンプトの処理 | 8,659 tok/s |
| 128トークンの生成 | 145.4 tok/s |
| 128k文書の入力後、最初のトークンまでの時間 | 30.1秒 |
| 128k文書でのGPUメモリ使用量 | 10,447 MiB |
| 128kでの文書内の事実 / 要約に含めたトピック | 4/4 / 4/4 |
評価:トークンを高速に生成し、サイズに対して優れた性能を備える有能なAIモデルが必要な場合や、GPUに追加の余裕を残したい場合は、Gemma 4 12Bを選んでください。私たちのテストでは、128kでのGemma 4 12BのVRAM使用量は、QwenやGemma 4 31Bの半分未満でした。
5. Muse Glimmer 30B
Muse Glimmer 30Bは、専用の知覚エンコーダーを備えたMetaのエージェント向けモデルです。Metaはコンシューマー向けハードウェア上でのツール使用、複数段階の推論、失敗からの復旧に向けて開発し、対応するエージェント実行基盤としてOpenClawやHermes Agentを挙げています。この2つはどちらも、すでにAtomic Chatのローカルエンドポイントを利用して動作します。
| モデル情報 | 内容 |
|---|---|
| 開発元 | Meta |
| リリース | 2026年8月 |
| パラメータ数とアーキテクチャ | 知覚エンコーダーを含めて約29.6B、デンスモデル、52層 |
| ネイティブのコンテキスト長 | 131,072トークン以上 |
| 元のモデルの入力 | 知覚エンコーダーを介したテキストと画像 |
| テストしたビルド | AtomicChat/Muse-Glimmer-30B-GGUFからMuse-Glimmer-30B-AD-Q4_K_M.ggufを選択、17.75 GiB |
Muse Glimmerは、推論設定を低くしても推論トークンを使用し続けます。思考と最終回答の両方に十分な出力トークン数を確保してください。また、8k、32k、128kで4つの事実をすべて見つけました。より高密度なトークナイザーを使用しており、今回の128kクラスの文書を107,856トークンに符号化したのに対し、Gemmaモデルでは130,557トークンでした。以下はMetaによる、このモデルのベンチマーク性能です。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond (AA) | 83.5% |
HLE Text (AA) | 22.0% |
SWE-bench Pro 高難度のエンジニアリング | 51.2% |
SWE-bench Verified ソフトウェアエンジニアリング | 76.0% |
Terminal-Bench 2.1、terminus2使用 | 51.7% |
以下は、RTX 5090グラフィックスカードで実施した私たちのテスト結果です。
| 測定項目 | 結果 |
|---|---|
| コンテキスト長32kでのGPUメモリ使用量 | 18,392 MiB |
| 4kプロンプトの処理 | 4,387 tok/s |
| 128トークンの生成 | 73.9 tok/s |
| 長文書の入力後、最初のトークンまでの時間 | 31.8秒 |
| 長文書でのGPUメモリ使用量 | 19,752 MiB |
| 文書内の事実 / 要約に含めたトピック | 3つの長さすべてで4/4 / 4/4 |
評価:エージェントをローカルで実行するなら、Muse Glimmerがおすすめです。Meta自身の数値では、SWE-bench Verifiedで76.0%、Terminal-Bench 2.1で51.7%に達し、ここで紹介しているもう1つのエージェント向け候補を大きく上回っています。より高密度なトークナイザーにより、同じコンテキスト長により多くのテキストを収められます。
6. NVIDIA Nemotron 3.5 Lightning 30B-A3B
NVIDIA Nemotron 3.5 Lightning 30B-A3Bは、推論速度を重視してRTX 5090で実行する場合に優れた選択肢です。Mamba-2、アテンション、Mixture-of-Expertsを組み合わせたハイブリッドアーキテクチャは約32.9Bのパラメータを保持しますが、トークンごとに有効になるのは約3Bで、特にパラメータ数を考慮すると高速にトークンを出力できます。
| モデル情報 | 内容 |
|---|---|
| 開発元 | NVIDIA |
| リリース | 2026年8月 |
| パラメータ数とアーキテクチャ | 保持パラメータ数約32.9B、有効パラメータ数3B、Mamba-2 / アテンション / MoEのハイブリッド構成 |
| モデルのコンテキスト長上限 | 最大1Mトークン |
| 元のモデルの入力 | テキスト |
| テストしたビルド | AtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUFからNVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.ggufを選択、18.30 GiB |
このアーキテクチャは、トークンあたりの処理量を減らし、長いシーケンスに対応するよう設計されています。テストしたビルドでは334.3トークン/秒で生成し、128k文書の入力後14.9秒で最初のトークンを返しました。これらは投機的デコーディングを使わない通常の生成での数値です。以下はNVIDIAによる、このモデルのベンチマーク性能です。
| ベンチマーク | 結果 |
|---|---|
GPQA Diamond(ツールなし) | 75.44% |
SWE-bench Verified ソフトウェアエンジニアリング | 51.56% |
Terminal-Bench 2.1 ターミナルエージェント | 24.58% |
以下は私たちのRTX 5090テストの結果です。
| 測定項目 | 結果 |
|---|---|
| コンテキスト長32kでのGPUメモリ使用量 | 18,612 MiB |
| 4kプロンプトの処理 | 12,047 tok/s |
| 128トークンの生成 | 334.3 tok/s |
| 128k文書の入力後、最初のトークンまでの時間 | 14.9秒 |
| 128k文書でのGPUメモリ使用量 | 19,367 MiB |
| 128kでの文書内の事実 / 要約に含めたトピック | 4/4 / 4/4 |
評価:高速な出力と長文書への短い応答時間を求めるなら、Nemotron 3.5 Lightningを選んでください。公開されているエージェント系ベンチマークではMuse Glimmerを下回るため、タスクの成功率よりも速度を重視する場合の選択肢です。
6モデルの比較
6モデルすべてで公開されているのはGPQA Diamondだけなので、以下の表では同じベンチマークによる数値と、そうでないものを区別しています。各ベンダーはそれぞれ独自の評価ハーネスを使用しています。Qwenはコンテキスト長256kでClaude Codeのハーネスを使ってSWE-bench Proを測定し、Metaは独自の構成で測定しました。異なるベンダーの行は、直接対決の結果ではなく参考値として扱ってください。
| モデル | GPQA Diamond | LiveCodeBench v6 | SWE-bench Pro | SWE-bench Verified | Terminal-Bench 2.1 | 128kでのMRCR v2 | 出典 |
|---|---|---|---|---|---|---|---|
| Qwen3.8-27B | 89.2 | 90.3 | 61.7 | 未公表 | 73.0 | 未公表 | Qwen |
| Gemma 4 31B it | 84.3 | 80.0 | 未公表 | 未公表 | 未公表 | 66.4 | |
| Gemma 4 26B-A4B it | 82.3 | 77.1 | 未公表 | 未公表 | 未公表 | 44.1 | |
| Gemma 4 12B it | 78.8 | 72.0 | 未公表 | 未公表 | 未公表 | 43.4 | |
| Muse Glimmer 30B | 83.5 | 未公表 | 51.2 | 76.0 | 51.7 | 未公表 | Meta |
| Nemotron 3.5 Lightning | 75.44 | 未公表 | 未公表 | 51.56 | 24.58 | 未公表 | NVIDIA |
ここでの2つの比較は同条件での比較です。128kのMRCR v2では、3つのGemmaモデルは順に66.4、44.1、43.4となっており、デンスモデルの31Bは、高速な同系モデルよりも長文書内の情報を見つける能力がはるかに高いことを示しています。SWE-bench VerifiedとTerminal-Bench 2.1では、Muse Glimmerが76.0と51.7に達するのに対し、Nemotronは51.56と24.58で、2つのエージェント向け候補には大きな差があります。
パラメータ数よりコンテキスト長を優先する
RTX 5090の32 GBは、より大きなモデルにも、より長いコンテキストにも割り当てられますが、両者は同じカードのメモリを取り合います。128kでの測定結果を見ると、その配分にどれほど大きな差があるかがわかります。
| モデル | 128k文書でのVRAM使用量 | 32,607 MiBのカードでの空き容量 | 24 GBに収まるか |
|---|---|---|---|
| Gemma 4 12B it | 10,447 MiB | 22,160 MiB | はい |
| Nemotron 3.5 Lightning | 19,367 MiB | 13,240 MiB | はい |
| Muse Glimmer 30B | 19,752 MiB | 12,855 MiB | はい |
| Gemma 4 26B-A4B it | 19,831 MiB | 12,776 MiB | はい |
| Qwen3.8-27B AD-Q4 | 24,773 MiB | 7,834 MiB | いいえ |
| Gemma 4 31B it | 30,361 MiB | 2,246 MiB | いいえ |
パラメータ数を減らしてメモリの余裕を得る利点が最も明確なのは、Gemma 4 12Bです。128k文書全体を10,447 MiBに収め、これはQwen3.8-27Bが必要とした量の半分未満、Gemma 4 31Bの3分の1でありながら、埋め込んだ事実に関する4つの質問すべてに回答しました。これにより、2つ目のモデル、画像モデル、またはデスクトップ上のほかの処理に22 GBを残せます。
ただし、代償は実際にあり、Google自身の数値がそれを示しています。128kのMRCR v2では、12Bは43.4%で、デンスモデルの31Bは66.4%です。長いコンテキストを読み込めることと、モデルがその内容を的確に読み取れることは同じではありません。回答を信頼できるモデルの中で最大のものを読み込み、残りのメモリをコンテキストに割り当ててください。
Blackwellアーキテクチャにおすすめのファイル形式
RTX 5090はNVIDIAのBlackwellアーキテクチャを採用し、FP4 Tensorコアを搭載しています。私たちのllama.cppテストでは、NVFP4 GGUFファイルは同じモデルの標準GGUFビルドよりも4kプロンプトを28~58%速く処理しました。生成速度も2~10%向上しました。入力が長い場合、プロンプト処理が速くなることで生成開始までの待ち時間が短くなります。
| モデル | 通常のGGUF:4kプロンプト / 生成 | コミュニティ製NVFP4 GGUF:4kプロンプト / 生成 | 変化 |
|---|---|---|---|
| Qwen3.8-27B | 3,830 / 74.2 tok/s | 5,100 / 79.4 tok/s | プロンプト処理+33%、生成+7% |
| Gemma 4 31B | 3,698 / 68.5 tok/s | 5,826 / 69.7 tok/s | プロンプト処理+58%、生成+2% |
| Nemotron 3.5 Lightning | 12,047 / 334.3 tok/s | 15,374 / 367.2 tok/s | プロンプト処理+28%、生成+10% |
テストしたコミュニティ製NVFP4ファイルの正確な名前は、順にQwen3.8-27B-iMatrix-NVFP4-MTP.gguf、gemma-4-31B-it-NVFP4-turbo-NVFP4.gguf、Nemotron-3.5-Lightning-30B-A3B-NVFP4.ggufです。
- Qwenのファイルは重みの70.8%がNVFP4で、残りはQ5_K/Q6_K/Q8_0です。
- GemmaとNemotronのファイルでは、重みに占めるNVFP4の割合がそれぞれ95.4%と95.6%です。
これらはllama.cpp b10988で、ここに挙げた特定のファイルを測定した結果です。向上幅のうち、FP4 Tensorコアによる分と重みのサイズ縮小による分は切り分けていません。NVIDIA自身のNemotronモデルカードでも、GeForce RTX 5090の計算経路はまだ要確認とされているため、この数値は形式そのものの特性ではなく、これらのビルドが私たちのカードで示した結果として扱ってください。
モデルのテスト方法
主なスループットと文書のテストには、32,607 MiBのVRAMを搭載したデスクトップ向けRTX 5090、Ubuntu 24.04、llama.cpp b10988の公式CUDA 12.8ビルドを使用しました。全レイヤーのGPUオフロード、並列スロット数1、fp16 KVキャッシュ、Flash Attentionの自動選択を使用しました。スループットはllama-bench -p 512,4096 -n 128 -r 2で測定し、表には4kプロンプトと128トークン生成の結果を示しています。ここで使用したGemmaファイルはAtomicChatのGGUFビルドであり、以前の測定で使用したQATファイルではありません。Qwen AD-Q5の速度測定とMuseの長文書テストには、ドライバーが異なる2台目のポッドを使用したため、この2つの行はほかの結果と厳密には比較できません。
スループットの表には注意点が1つあります。6モデルすべてが同じ量子化構成で動作しているわけではありません。3つのGemmaファイルはQ4_K_M、Muse GlimmerはAD-Q4_K_M、NemotronはAD-IQ4_NLで、Qwenはcdiamondの混合NVFP4ファイルです。行ごとの性能差には、モデルではなくビルドに起因する部分もあります。
自動プレイするスネークゲームのコーディング
各モデルに、自動でプレイし、餌を食べて成長するスネークゲームを作るよう依頼しました。このテストではvLLMとNVFP4ビルドを使用しました。GemmaモデルにはAtomicChat/gemma-4-12B-it-NVFP4、AtomicChat/gemma-4-26B-A4B-it-NVFP4、AtomicChat/gemma-4-31B-it-NVFP4を、それ以外にはnvidia/Qwen3.8-27B-NVFP4、nvidia/Muse-Glimmer-30B-NVFP4、nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4を使用しました。
| モデル | 試行回数 | 合計生成時間 |
|---|---|---|
| Qwen3.8-27B | 2 | 97.5秒 |
| Gemma 4 31B | 1 | 47.9秒 |
| Gemma 4 26B-A4B | 1 | 27.1秒 |
| Gemma 4 12B | 3 | 134.0秒 |
| Muse Glimmer 30B | 2 | 169.8秒 |
| Nemotron 3.5 Lightning | 5 | 45.7秒 |
すべてのモデルが最終的にテストを完了し、ゲームの進行に伴って餌を追いかけ、成長し、スコアを増やすスネークを作成しました。
Gemma 4 26B-A4Bと31Bは1回目の試行でゲームを作成でき、26B-A4Bは27.1秒で最速でもありました。Nemotronは5回の試行を必要としましたが、合計生成時間は45.7秒でした。最初の応答で出力上限を使い切ったため、その後の修正依頼では思考をオフにしました。
跳ねる5つのボールのコーディング
各モデルには、重力と衝突の影響を受ける5つのボールを表示するページの作成も依頼しました。このテストでは、スネークのタスクと同じvLLMとNVFP4の構成を使用しました。
| モデル | 試行回数 | 合計生成時間 |
|---|---|---|
| Qwen3.8-27B | 2 | 88.5秒 |
| Gemma 4 31B | 1 | 54.5秒 |
| Gemma 4 26B-A4B | 1 | 32.9秒 |
| Gemma 4 12B | 4 | 161.7秒 |
| Muse Glimmer 30B | 2 | 142.1秒 |
| Nemotron 3.5 Lightning | 3 | 31.8秒 |
スネークのテストと同様に、1回目の試行で動作するものを作れたのはGemma 4 26B-A4Bと31Bだけでした。Nemotronは3回の試行を必要としたものの、生成時間は31.8秒で最短でした。
128kトークンの文書から事実を見つける
各モデルに、約8k、32k、128kトークンの各長さで同じ原文書を与えました。冒頭付近、中ほど、末尾付近に事実を埋め込み、さらに離れた2か所の事実を必要とする4つ目の質問をしました。
要約に指定した4つのトピックが保持されているかも確認しました。原文のテキストは同じでも、文書のトークン数はトークナイザーによって異なります。
| モデル | 8k / 32k / 128kで見つけた事実 | 128kで要約に含めたトピック | 最長の文書で処理した入力トークン数 | 最初のトークンまでの時間 | 最長の文書でのVRAM使用量 |
|---|---|---|---|---|---|
| Nemotron 3.5 Lightning | 4/4 · 4/4 · 4/4 | 4/4 | 129,628 | 14.9秒 | 19,367 MiB |
| Gemma 4 26B-A4B | 4/4 · 4/4 · 4/4 | 4/4 | 130,557 | 24.4秒 | 19,831 MiB |
| Gemma 4 12B | 4/4 · 4/4 · 4/4 | 4/4 | 130,557 | 30.1秒 | 10,447 MiB |
| Muse Glimmer 30B | 4/4 · 4/4 · 4/4 | 4/4 | 107,856 | 31.8秒 | 19,752 MiB |
| Qwen3.8-27B、AtomicChat AD-Q4 | 4/4 · 4/4 · 4/4 | 4/4 | 126,820 | 62.6秒 | 24,773 MiB |
| Gemma 4 31B | 4/4 · 4/4 · 4/4 | 4/4 | 130,557 | 85.0秒 | 30,361 MiB |
6モデルすべてが、今回の検索と要約のテストではすべての長さで合格したため、このテストで差が出るのは精度ではなく待ち時間です。長いコンテキストでの品質をより厳しく評価するには、上の比較表にある公開済みのMRCR v2スコアを参照してください。また、2つの行ではほかよりも処理量が少なくなっています。Muse Glimmerが処理したのは107,856トークンで、Gemmaモデルの130,557トークンより少なく、さらにその測定には2台目のポッドを使用しました。
この長さでは、Gemma 4 31Bが30,361 MiB、Qwen3.8-27B AD-Q4が24,773 MiBを使用しました。どちらも私たちの32,607 MiBのRTX 5090には収まりますが、RTX 4090や3090の公称24 GB(24,576 MiB)のVRAM容量を超えています。ほかの4モデルはこのテストで10,447~19,831 MiBを使用し、24 GB未満でした。これらはRTX 5090で測定したメモリ使用量であり、この表は旧世代GPUでの速度を示すものではありません。Qwenの128kでの結果はAtomicChat AD-Q4ファイルのもので、上で推奨したcdiamondのNVFP4ファイルの結果ではありません。
Atomic ChatでオフラインAIモデルを実行する方法
1. Atomic Chatをインストールします。バックエンドを選ぶ際は、GPUに合わせてFind optimal backendを選択してください。
2. 表にあるAtomicChat製モデルを使う場合は、Modelsを開き、リンク先のAtomicChatリポジトリを検索して、モデルカードのDownload Optionsから記載されている正確なファイル名のファイルを選び、ダウンロードします。
3. 推奨するQwenビルドを使う場合は、cdiamondのリポジトリからQwen3.8-27B-iMatrix-NVFP4-MTP.ggufをダウンロードします。Atomic ChatでSettings、Model Providers、llama.cpp、Importの順に進み、そのローカルGGUFファイルを選択します。
4. Use this modelを選択し、新しいチャットを開いて、まずコンテキスト長32kを割り当てて使い始めます。タスクで必要になったら、GPUメモリ使用量を確認しながらコンテキスト長を増やしてください。インポートしたNVFP4ファイルを読み込めない場合は、互換性のあるllama.cppバックエンドに更新するか、それを選択してください。
Atomic ChatのセルフホストLLMガイドでは、アプリのモデルダウンロードとインポートの操作を説明しています。
よくある質問
RTX 5090で実行するのに最適なLLMは何ですか?
速度と性能のバランスを重視するなら、RTX 5090で実行するのに最適なAIモデルはQwen3.8-27Bです。タスク完了までの時間の短さや生成速度の高さを最優先するなら、Nemotron 3.5 Lightningを選んでください。
ローカルLLMに32 GBのVRAMで足りますか?
はい。32 GBのVRAMがあれば、ほとんどの12B~33Bモデルを4ビット量子化で完全にGPU上で実行でき、長いコンテキストに使う余裕もあります。より大きなモデルや非常に長いコンテキストウィンドウでは、さらに小さくなる量子化や、一部のCPUオフロードが必要になる場合があります。
RTX 5090で70Bモデルを実行できますか?
4ビットではできません。70BのQ4ファイルは通常、コンテキスト用のメモリを加える前にRTX 5090の32 GB VRAMを超えます。ビット数を下げるか、モデルの一部をCPUで実行すれば70Bに対応できますが、どちらも品質か速度を犠牲にします。
RTX 5090に最適なコーディングLLMは何ですか?
今回のモデルの中で公開されているコーディングスコアが最も高いのはQwen3.8-27Bで、SWE-bench Proが61.7、LiveCodeBench v6が90.3です。私たちが実施した2つのコーディングタスクでは、動作する結果が得られるまでにGemmaモデルより時間がかかりました。Gemma 4 26B-A4Bはスネークとボールのページをどちらも1回目の試行で作成し、それぞれ27.1秒と32.9秒でしたが、Qwenは2回の試行で97.5秒と88.5秒でした。より難しい問題にはQwenを、動作する回答を素早く得たい場合にはGemma 4 26B-A4Bを選んでください。
RTX 5090を使う構成には、どの程度の電力とシステムRAMが必要ですか?
NVIDIAの仕様では、RTX 5090のグラフィックス総消費電力は575 W、リファレンス構成のシステム電源要件は1,000 Wとされています。必要なシステムRAMは、ファイルサイズ、コンテキスト長、モデルのレイヤーをCPUで実行するかどうかによって変わります。ベンチマークに使用したホストは117 GBのRAMを搭載していましたが、GPU上に常駐するこれらのファイルに117 GBが必要という意味ではありません。

