ブログ

/

ガイド

/

RTX 5090におすすめのローカルLLM:速度、VRAM、コンテキスト長を実測

RTX 5090におすすめのローカルLLM:速度、VRAM、コンテキスト長を実測

デスクトップ向けGeForce RTX 5090に最適なAIモデルを探している方に向けた記事です。32GBのカードで6つのローカルモデルをテストし、生成速度、GPUメモリ使用量、同じ128kトークンの文書に関する質問への回答にかかる時間を測定しました。

RTX 5090におすすめのローカルLLM:速度、VRAM、コンテキスト長を実測
Alex Shapiro
Alex Shapiro
Calendar icon

September 18, 2026

目次

この記事はデスクトップ向けRTX 5090のガイドです。RTX 5090 Laptop GPUは利用できるメモリ容量が異なるため、このランキングには含めていません。

結論

RTX 5090で汎用的に使うなら、私たちのおすすめはQwen3.8-27Bです。生成速度は79.4トークン/秒、4kプロンプトの処理速度は5,100トークン/秒でした。出力速度を最優先するなら、Nemotron 3.5 LightningがテストしたAtomicChatビルドで334.3トークン/秒に達しました。Gemma 4 26B-A4Bは速度と長文書の処理を高い水準で両立します。生成速度は248.6トークン/秒で、128kトークンの文書を入力した後の最初の質問に回答するまで24.4秒かかりました。6モデルすべてが文書に関する質問に正しく答えたため、実用上の違いは待ち時間とVRAM使用量でした。このページの数値はすべて、メモリ帯域幅からの推定ではなく、モデルを実行した実機のRTX 5090から得たものです。

RTX 5090におすすめのローカルLLM

モデルテストしたGGUFファイルファイルサイズ(GiB)32kでのVRAM使用量(MiB)4kプロンプト(tok/s)生成(tok/s)適した用途
Qwen3.8-27BQwen3.8-27B-iMatrix-NVFP4-MTP.gguf15.9518,0485,10079.4汎用用途
Gemma 4 31B itgemma-4-31B-it-Q4_K_M.gguf17.4022,3723,69868.5デンスモデルのGemmaという選択肢
Gemma 4 26B-A4B itgemma-4-26B-A4B-it-Q4_K_M.gguf15.6417,70211,829248.6長文書の高速処理
Gemma 4 12B itgemma-4-12b-it-Q4_K_M.gguf6.878,7588,659145.4最小のVRAM使用量
Muse Glimmer 30BMuse-Glimmer-30B-AD-Q4_K_M.gguf17.7518,3924,38773.9推論を重視するアシスタント
Nemotron 3.5 Lightning 30B-A3BNVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.gguf18.3018,61212,047334.3高速な出力と最初のトークンまでの短い待ち時間

1. Qwen3.8-27B

デスクトップ向けRTX 5090で幅広い用途に使うなら、私たちのおすすめはQwen3.8-27Bです。このデンスモデルは従来のアテンションとGated DeltaNet層を組み合わせ、ネイティブで262kトークンのコンテキスト長に対応します。コーディングベンチマークで高い性能を示しており、開発作業で使い始めるモデルとして優れた選択肢です。

モデル情報内容
開発元Qwen / Alibaba
リリース2026年8月14日
パラメータ数とアーキテクチャ27.32B、デンスモデル、Gated DeltaNet / アテンションのハイブリッド構成で64層
ネイティブのコンテキスト長262,144トークン
ベースモデルの入力テキスト、画像、動画
思考切り替え可能、推論の深さを調整可能
テスト済みの推奨ビルドcdiamond/Qwen3.8-27B-iMatrix-NVFP4-MTP-GGUFからQwen3.8-27B-iMatrix-NVFP4-MTP.ggufを選択、15.95 GiB

2026年8月にリリースされた、Qwen3.8ファミリーの27Bデンスモデルです。元のモデルはテキスト、画像、動画を入力でき、思考のオンとオフを切り替えられます。私たちのGGUFテストでは、思考をオフにしてテキストを使用しました。このカードにはcdiamondのコミュニティ製ファイルをおすすめします。重みの70.8%がNVFP4で、残りはQ5_K、Q6_K、Q8_0です。

ベンチマーク結果
GPQA Diamond
専門レベルの科学
89.2
SWE-bench Pro
高難度のエンジニアリング
61.7
Terminal-Bench 2.1
ターミナルエージェント
73.0
LiveCodeBench v6
競技プログラミング
90.3

上記は元のQwenモデルの結果です。

測定項目AtomicChat AD-Q4_K_MAtomicChat AD-Q5_K_Mcdiamond NVFP4
正確なファイル名Qwen3.8-27B-AD-Q4_K_M.ggufQwen3.8-27B-AD-Q5_K_M.ggufQwen3.8-27B-iMatrix-NVFP4-MTP.gguf
ファイルサイズ15.94 GiB18.84 GiB15.95 GiB
コンテキスト長32kでのGPUメモリ使用量18,356 MiB未測定18,048 MiB
4kプロンプトの処理3,830 tok/s3,540 tok/s5,100 tok/s
128トークンの生成74.2 tok/s69.2 tok/s79.4 tok/s

評価:BlackwellでQwen3.8-27Bを使うなら、ここで指定したcdiamondのNVFP4 GGUFを選んでください。AD-Q4と同等のファイルサイズで、プロンプトをより速く処理しました。テストしたAtomicChat AD-Q4ビルドでは、128k文書を入力してから最初のトークンを生成するまで62.6秒かかり、24,773 MiBを使用しました。この長いコンテキストでの数値が、そのままcdiamondのファイルにも当てはまるとは考えないでください。

2. Gemma 4 31B it

Gemma 4 31B itは、GoogleのGemma 4で最大のデンスモデルです。Gemmaの出力スタイルを好むなら有用な選択肢ですが、長いコンテキストでは今回の6モデルで最も多くのメモリを消費します。

モデル情報内容
開発元Google DeepMind
リリース2026年4月
パラメータ数とアーキテクチャ30.7B、デンスモデル、60層
ネイティブのコンテキスト長262,144トークン
元のモデルの入力テキストと画像
テストしたビルドAtomicChat/gemma-4-31B-it-GGUFからgemma-4-31B-it-Q4_K_M.ggufを選択、17.40 GiB

Gemma 4 31Bは、各層でローカルなスライディングウィンドウ・アテンションとグローバルアテンションを使用します。後述の26B-A4Bモデルとは異なり、各トークンの生成に言語モデルの重みをすべて使用します。以下の表はベンチマークでの性能を示しています。これらはGoogleの公式数値で、Googleは各行の思考設定を明示していません。

ベンチマーク結果
GPQA Diamond
専門レベルの科学
84.3%
LiveCodeBench v6
競技プログラミング
80.0%
MRCR v2、128kで8つの検索対象
66.4%

私たちのRTX 5090テスト:

測定項目結果
コンテキスト長32kでのGPUメモリ使用量22,372 MiB
4kプロンプトの処理3,698 tok/s
128トークンの生成68.5 tok/s
128k文書の入力後、最初のトークンまでの時間85.0秒
128k文書でのGPUメモリ使用量30,361 MiB
128kでの文書内の事実 / 要約に含めたトピック4/4 / 4/4

評価:デンスモデルのGemmaもRTX 5090で128kを処理できますが、私たちのテストではカードの32,607 MiBのうち空きは2,246 MiBしか残りませんでした。長文書への応答時間や、ほかのGPUタスクに使える余裕をより重視するなら、軽量なモデルを選んでください。また、今回の6モデルの中で、公開されている長いコンテキストのスコアが最も高く、128kのMRCR v2で66.4%を記録しています。

3. Gemma 4 26B-A4B it

推論性能を少し犠牲にしてでも生成速度を上げたい場合で、Gemmaファミリーを使い続けたいなら、Gemma 4 26B-A4B itを選んでください。Mixture-of-Experts設計により約25.2Bのパラメータを保持しますが、トークンごとに有効になるのは約4Bで、デンスモデルの31Bよりも大幅に高速な生成につながっています。

モデル情報内容
開発元Google DeepMind
リリース2026年4月
パラメータ数とアーキテクチャ保持パラメータ数25.2B、トークンごとに約4Bが有効、30層のMoE
ネイティブのコンテキスト長262,144トークン
元のモデルの入力テキストと画像
テストしたビルドAtomicChat/gemma-4-26B-A4B-it-GGUFからgemma-4-26B-A4B-it-Q4_K_M.ggufを選択、15.64 GiB

有効なパラメータ数が少ないことで、生成トークンあたりの計算量が減り、生成が高速になります。長いコンテキストでのメモリ使用量が少ない理由は別にあり、ファイルサイズの小ささと、アテンション層でのKVキャッシュの保存方法によるものです。私たちの構成では、128kでこのモデルが19,831 MiBを使用したのに対し、Gemma 4 31Bは30,361 MiBを使用しました。以下は、元のフル精度ファイルに対するGoogleの公式測定による、このモデルのベンチマーク性能です。

ベンチマーク結果
GPQA Diamond
専門レベルの科学
82.3%
LiveCodeBench v6
競技プログラミング
77.1%
MRCR v2、128kで8つの検索対象
44.1%

以下の表は、私たちのRTX 5090テストでの結果です。

測定項目結果
コンテキスト長32kでのGPUメモリ使用量17,702 MiB
4kプロンプトの処理11,829 tok/s
128トークンの生成248.6 tok/s
128k文書の入力後、最初のトークンまでの時間24.4秒
128k文書でのGPUメモリ使用量19,831 MiB
128kでの文書内の事実 / 要約に含めたトピック4/4 / 4/4

評価:RTX 5090のVRAMの大半を消費せずに、高速な生成と128k文書の処理を両立したいなら、Gemma 4 26B-A4Bを選んでください。Google自身が実施した128kのMRCR v2テストでは44.1%で、デンスモデルの31Bは66.4%でした。そのため、待ち時間より回答を重視するなら31Bを選んでください。

4. Gemma 4 12B it

Gemma 4 12B itは、今回紹介するRTX 5090におすすめのモデルの中で最小です。ファイルサイズが最も小さいため、GPUメモリを必要とするほかのアプリと並行してAIモデルを実行したい場合に最も適しています。テストしたGGUFファイルの使用量は、32kを割り当てた場合に8,758 MiB、128k文書では10,447 MiBでした。

モデル情報内容
開発元Google DeepMind
リリース2026年4月
パラメータ数とアーキテクチャ約11.9B、デンスモデル
ネイティブのコンテキスト長262,144トークン
元のモデルの入力テキストと画像
テストしたビルドAtomicChat/gemma-4-12B-it-GGUFからgemma-4-12b-it-Q4_K_M.ggufを選択、6.87 GiB

テストした2つの大型Gemmaモデルよりもはるかに軽量ですが、文書に埋め込んだ事実に関する質問をすべて完了し、128k文書の要約でも指定した4つのトピックをすべて保持しました。

ベンチマーク結果
GPQA Diamond
専門レベルの科学
78.8%
LiveCodeBench v6
競技プログラミング
72.0%
MRCR v2、128kで8つの検索対象
43.4%

以下は私たちが実行したテストの結果です。

測定項目結果
コンテキスト長32kでのGPUメモリ使用量8,758 MiB
4kプロンプトの処理8,659 tok/s
128トークンの生成145.4 tok/s
128k文書の入力後、最初のトークンまでの時間30.1秒
128k文書でのGPUメモリ使用量10,447 MiB
128kでの文書内の事実 / 要約に含めたトピック4/4 / 4/4

評価:トークンを高速に生成し、サイズに対して優れた性能を備える有能なAIモデルが必要な場合や、GPUに追加の余裕を残したい場合は、Gemma 4 12Bを選んでください。私たちのテストでは、128kでのGemma 4 12BのVRAM使用量は、QwenやGemma 4 31Bの半分未満でした。

5. Muse Glimmer 30B

Muse Glimmer 30Bは、専用の知覚エンコーダーを備えたMetaのエージェント向けモデルです。Metaはコンシューマー向けハードウェア上でのツール使用、複数段階の推論、失敗からの復旧に向けて開発し、対応するエージェント実行基盤としてOpenClawやHermes Agentを挙げています。この2つはどちらも、すでにAtomic Chatのローカルエンドポイントを利用して動作します。

モデル情報内容
開発元Meta
リリース2026年8月
パラメータ数とアーキテクチャ知覚エンコーダーを含めて約29.6B、デンスモデル、52層
ネイティブのコンテキスト長131,072トークン以上
元のモデルの入力知覚エンコーダーを介したテキストと画像
テストしたビルドAtomicChat/Muse-Glimmer-30B-GGUFからMuse-Glimmer-30B-AD-Q4_K_M.ggufを選択、17.75 GiB

Muse Glimmerは、推論設定を低くしても推論トークンを使用し続けます。思考と最終回答の両方に十分な出力トークン数を確保してください。また、8k、32k、128kで4つの事実をすべて見つけました。より高密度なトークナイザーを使用しており、今回の128kクラスの文書を107,856トークンに符号化したのに対し、Gemmaモデルでは130,557トークンでした。以下はMetaによる、このモデルのベンチマーク性能です。

ベンチマーク結果
GPQA Diamond (AA)
83.5%
HLE Text (AA)
22.0%
SWE-bench Pro
高難度のエンジニアリング
51.2%
SWE-bench Verified
ソフトウェアエンジニアリング
76.0%
Terminal-Bench 2.1、terminus2使用
51.7%

以下は、RTX 5090グラフィックスカードで実施した私たちのテスト結果です。

測定項目結果
コンテキスト長32kでのGPUメモリ使用量18,392 MiB
4kプロンプトの処理4,387 tok/s
128トークンの生成73.9 tok/s
長文書の入力後、最初のトークンまでの時間31.8秒
長文書でのGPUメモリ使用量19,752 MiB
文書内の事実 / 要約に含めたトピック3つの長さすべてで4/4 / 4/4

評価:エージェントをローカルで実行するなら、Muse Glimmerがおすすめです。Meta自身の数値では、SWE-bench Verifiedで76.0%、Terminal-Bench 2.1で51.7%に達し、ここで紹介しているもう1つのエージェント向け候補を大きく上回っています。より高密度なトークナイザーにより、同じコンテキスト長により多くのテキストを収められます。

6. NVIDIA Nemotron 3.5 Lightning 30B-A3B

NVIDIA Nemotron 3.5 Lightning 30B-A3Bは、推論速度を重視してRTX 5090で実行する場合に優れた選択肢です。Mamba-2、アテンション、Mixture-of-Expertsを組み合わせたハイブリッドアーキテクチャは約32.9Bのパラメータを保持しますが、トークンごとに有効になるのは約3Bで、特にパラメータ数を考慮すると高速にトークンを出力できます。

モデル情報内容
開発元NVIDIA
リリース2026年8月
パラメータ数とアーキテクチャ保持パラメータ数約32.9B、有効パラメータ数3B、Mamba-2 / アテンション / MoEのハイブリッド構成
モデルのコンテキスト長上限最大1Mトークン
元のモデルの入力テキスト
テストしたビルドAtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUFからNVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.ggufを選択、18.30 GiB

このアーキテクチャは、トークンあたりの処理量を減らし、長いシーケンスに対応するよう設計されています。テストしたビルドでは334.3トークン/秒で生成し、128k文書の入力後14.9秒で最初のトークンを返しました。これらは投機的デコーディングを使わない通常の生成での数値です。以下はNVIDIAによる、このモデルのベンチマーク性能です。

ベンチマーク結果
GPQA Diamond(ツールなし)
75.44%
SWE-bench Verified
ソフトウェアエンジニアリング
51.56%
Terminal-Bench 2.1
ターミナルエージェント
24.58%

以下は私たちのRTX 5090テストの結果です。

測定項目結果
コンテキスト長32kでのGPUメモリ使用量18,612 MiB
4kプロンプトの処理12,047 tok/s
128トークンの生成334.3 tok/s
128k文書の入力後、最初のトークンまでの時間14.9秒
128k文書でのGPUメモリ使用量19,367 MiB
128kでの文書内の事実 / 要約に含めたトピック4/4 / 4/4

評価:高速な出力と長文書への短い応答時間を求めるなら、Nemotron 3.5 Lightningを選んでください。公開されているエージェント系ベンチマークではMuse Glimmerを下回るため、タスクの成功率よりも速度を重視する場合の選択肢です。

6モデルの比較

6モデルすべてで公開されているのはGPQA Diamondだけなので、以下の表では同じベンチマークによる数値と、そうでないものを区別しています。各ベンダーはそれぞれ独自の評価ハーネスを使用しています。Qwenはコンテキスト長256kでClaude Codeのハーネスを使ってSWE-bench Proを測定し、Metaは独自の構成で測定しました。異なるベンダーの行は、直接対決の結果ではなく参考値として扱ってください。

モデルGPQA DiamondLiveCodeBench v6SWE-bench ProSWE-bench VerifiedTerminal-Bench 2.1128kでのMRCR v2出典
Qwen3.8-27B89.290.361.7未公表73.0未公表Qwen
Gemma 4 31B it84.380.0未公表未公表未公表66.4Google
Gemma 4 26B-A4B it82.377.1未公表未公表未公表44.1Google
Gemma 4 12B it78.872.0未公表未公表未公表43.4Google
Muse Glimmer 30B83.5未公表51.276.051.7未公表Meta
Nemotron 3.5 Lightning75.44未公表未公表51.5624.58未公表NVIDIA

ここでの2つの比較は同条件での比較です。128kのMRCR v2では、3つのGemmaモデルは順に66.4、44.1、43.4となっており、デンスモデルの31Bは、高速な同系モデルよりも長文書内の情報を見つける能力がはるかに高いことを示しています。SWE-bench VerifiedとTerminal-Bench 2.1では、Muse Glimmerが76.0と51.7に達するのに対し、Nemotronは51.56と24.58で、2つのエージェント向け候補には大きな差があります。

パラメータ数よりコンテキスト長を優先する

RTX 5090の32 GBは、より大きなモデルにも、より長いコンテキストにも割り当てられますが、両者は同じカードのメモリを取り合います。128kでの測定結果を見ると、その配分にどれほど大きな差があるかがわかります。

モデル128k文書でのVRAM使用量32,607 MiBのカードでの空き容量24 GBに収まるか
Gemma 4 12B it10,447 MiB22,160 MiBはい
Nemotron 3.5 Lightning19,367 MiB13,240 MiBはい
Muse Glimmer 30B19,752 MiB12,855 MiBはい
Gemma 4 26B-A4B it19,831 MiB12,776 MiBはい
Qwen3.8-27B AD-Q424,773 MiB7,834 MiBいいえ
Gemma 4 31B it30,361 MiB2,246 MiBいいえ

パラメータ数を減らしてメモリの余裕を得る利点が最も明確なのは、Gemma 4 12Bです。128k文書全体を10,447 MiBに収め、これはQwen3.8-27Bが必要とした量の半分未満、Gemma 4 31Bの3分の1でありながら、埋め込んだ事実に関する4つの質問すべてに回答しました。これにより、2つ目のモデル、画像モデル、またはデスクトップ上のほかの処理に22 GBを残せます。

ただし、代償は実際にあり、Google自身の数値がそれを示しています。128kのMRCR v2では、12Bは43.4%で、デンスモデルの31Bは66.4%です。長いコンテキストを読み込めることと、モデルがその内容を的確に読み取れることは同じではありません。回答を信頼できるモデルの中で最大のものを読み込み、残りのメモリをコンテキストに割り当ててください。

Blackwellアーキテクチャにおすすめのファイル形式

RTX 5090はNVIDIAのBlackwellアーキテクチャを採用し、FP4 Tensorコアを搭載しています。私たちのllama.cppテストでは、NVFP4 GGUFファイルは同じモデルの標準GGUFビルドよりも4kプロンプトを28~58%速く処理しました。生成速度も2~10%向上しました。入力が長い場合、プロンプト処理が速くなることで生成開始までの待ち時間が短くなります。

モデル通常のGGUF:4kプロンプト / 生成コミュニティ製NVFP4 GGUF:4kプロンプト / 生成変化
Qwen3.8-27B3,830 / 74.2 tok/s5,100 / 79.4 tok/sプロンプト処理+33%、生成+7%
Gemma 4 31B3,698 / 68.5 tok/s5,826 / 69.7 tok/sプロンプト処理+58%、生成+2%
Nemotron 3.5 Lightning12,047 / 334.3 tok/s15,374 / 367.2 tok/sプロンプト処理+28%、生成+10%

テストしたコミュニティ製NVFP4ファイルの正確な名前は、順にQwen3.8-27B-iMatrix-NVFP4-MTP.gguf、gemma-4-31B-it-NVFP4-turbo-NVFP4.gguf、Nemotron-3.5-Lightning-30B-A3B-NVFP4.ggufです。

  • Qwenのファイルは重みの70.8%がNVFP4で、残りはQ5_K/Q6_K/Q8_0です。
  • GemmaとNemotronのファイルでは、重みに占めるNVFP4の割合がそれぞれ95.4%と95.6%です。

これらはllama.cpp b10988で、ここに挙げた特定のファイルを測定した結果です。向上幅のうち、FP4 Tensorコアによる分と重みのサイズ縮小による分は切り分けていません。NVIDIA自身のNemotronモデルカードでも、GeForce RTX 5090の計算経路はまだ要確認とされているため、この数値は形式そのものの特性ではなく、これらのビルドが私たちのカードで示した結果として扱ってください。

モデルのテスト方法

主なスループットと文書のテストには、32,607 MiBのVRAMを搭載したデスクトップ向けRTX 5090、Ubuntu 24.04、llama.cpp b10988の公式CUDA 12.8ビルドを使用しました。全レイヤーのGPUオフロード、並列スロット数1、fp16 KVキャッシュ、Flash Attentionの自動選択を使用しました。スループットはllama-bench -p 512,4096 -n 128 -r 2で測定し、表には4kプロンプトと128トークン生成の結果を示しています。ここで使用したGemmaファイルはAtomicChatのGGUFビルドであり、以前の測定で使用したQATファイルではありません。Qwen AD-Q5の速度測定とMuseの長文書テストには、ドライバーが異なる2台目のポッドを使用したため、この2つの行はほかの結果と厳密には比較できません。

スループットの表には注意点が1つあります。6モデルすべてが同じ量子化構成で動作しているわけではありません。3つのGemmaファイルはQ4_K_M、Muse GlimmerはAD-Q4_K_M、NemotronはAD-IQ4_NLで、Qwenはcdiamondの混合NVFP4ファイルです。行ごとの性能差には、モデルではなくビルドに起因する部分もあります。

自動プレイするスネークゲームのコーディング

各モデルに、自動でプレイし、餌を食べて成長するスネークゲームを作るよう依頼しました。このテストではvLLMとNVFP4ビルドを使用しました。GemmaモデルにはAtomicChat/gemma-4-12B-it-NVFP4、AtomicChat/gemma-4-26B-A4B-it-NVFP4、AtomicChat/gemma-4-31B-it-NVFP4を、それ以外にはnvidia/Qwen3.8-27B-NVFP4、nvidia/Muse-Glimmer-30B-NVFP4、nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4を使用しました。

モデル試行回数合計生成時間
Qwen3.8-27B297.5秒
Gemma 4 31B147.9秒
Gemma 4 26B-A4B127.1秒
Gemma 4 12B3134.0秒
Muse Glimmer 30B2169.8秒
Nemotron 3.5 Lightning545.7秒

すべてのモデルが最終的にテストを完了し、ゲームの進行に伴って餌を追いかけ、成長し、スコアを増やすスネークを作成しました。

Gemma 4 26B-A4Bと31Bは1回目の試行でゲームを作成でき、26B-A4Bは27.1秒で最速でもありました。Nemotronは5回の試行を必要としましたが、合計生成時間は45.7秒でした。最初の応答で出力上限を使い切ったため、その後の修正依頼では思考をオフにしました。

跳ねる5つのボールのコーディング

各モデルには、重力と衝突の影響を受ける5つのボールを表示するページの作成も依頼しました。このテストでは、スネークのタスクと同じvLLMとNVFP4の構成を使用しました。

モデル試行回数合計生成時間
Qwen3.8-27B288.5秒
Gemma 4 31B154.5秒
Gemma 4 26B-A4B132.9秒
Gemma 4 12B4161.7秒
Muse Glimmer 30B2142.1秒
Nemotron 3.5 Lightning331.8秒

スネークのテストと同様に、1回目の試行で動作するものを作れたのはGemma 4 26B-A4Bと31Bだけでした。Nemotronは3回の試行を必要としたものの、生成時間は31.8秒で最短でした。

128kトークンの文書から事実を見つける

各モデルに、約8k、32k、128kトークンの各長さで同じ原文書を与えました。冒頭付近、中ほど、末尾付近に事実を埋め込み、さらに離れた2か所の事実を必要とする4つ目の質問をしました。

要約に指定した4つのトピックが保持されているかも確認しました。原文のテキストは同じでも、文書のトークン数はトークナイザーによって異なります。

モデル8k / 32k / 128kで見つけた事実128kで要約に含めたトピック最長の文書で処理した入力トークン数最初のトークンまでの時間最長の文書でのVRAM使用量
Nemotron 3.5 Lightning4/4 · 4/4 · 4/44/4129,62814.9秒19,367 MiB
Gemma 4 26B-A4B4/4 · 4/4 · 4/44/4130,55724.4秒19,831 MiB
Gemma 4 12B4/4 · 4/4 · 4/44/4130,55730.1秒10,447 MiB
Muse Glimmer 30B4/4 · 4/4 · 4/44/4107,85631.8秒19,752 MiB
Qwen3.8-27B、AtomicChat AD-Q44/4 · 4/4 · 4/44/4126,82062.6秒24,773 MiB
Gemma 4 31B4/4 · 4/4 · 4/44/4130,55785.0秒30,361 MiB

6モデルすべてが、今回の検索と要約のテストではすべての長さで合格したため、このテストで差が出るのは精度ではなく待ち時間です。長いコンテキストでの品質をより厳しく評価するには、上の比較表にある公開済みのMRCR v2スコアを参照してください。また、2つの行ではほかよりも処理量が少なくなっています。Muse Glimmerが処理したのは107,856トークンで、Gemmaモデルの130,557トークンより少なく、さらにその測定には2台目のポッドを使用しました。

この長さでは、Gemma 4 31Bが30,361 MiB、Qwen3.8-27B AD-Q4が24,773 MiBを使用しました。どちらも私たちの32,607 MiBのRTX 5090には収まりますが、RTX 4090や3090の公称24 GB(24,576 MiB)のVRAM容量を超えています。ほかの4モデルはこのテストで10,447~19,831 MiBを使用し、24 GB未満でした。これらはRTX 5090で測定したメモリ使用量であり、この表は旧世代GPUでの速度を示すものではありません。Qwenの128kでの結果はAtomicChat AD-Q4ファイルのもので、上で推奨したcdiamondのNVFP4ファイルの結果ではありません。

Atomic ChatでオフラインAIモデルを実行する方法

1. Atomic Chatをインストールします。バックエンドを選ぶ際は、GPUに合わせてFind optimal backendを選択してください。

2. 表にあるAtomicChat製モデルを使う場合は、Modelsを開き、リンク先のAtomicChatリポジトリを検索して、モデルカードのDownload Optionsから記載されている正確なファイル名のファイルを選び、ダウンロードします。

3. 推奨するQwenビルドを使う場合は、cdiamondのリポジトリからQwen3.8-27B-iMatrix-NVFP4-MTP.ggufをダウンロードします。Atomic ChatでSettings、Model Providers、llama.cpp、Importの順に進み、そのローカルGGUFファイルを選択します。

4. Use this modelを選択し、新しいチャットを開いて、まずコンテキスト長32kを割り当てて使い始めます。タスクで必要になったら、GPUメモリ使用量を確認しながらコンテキスト長を増やしてください。インポートしたNVFP4ファイルを読み込めない場合は、互換性のあるllama.cppバックエンドに更新するか、それを選択してください。

Atomic ChatのセルフホストLLMガイドでは、アプリのモデルダウンロードとインポートの操作を説明しています。

よくある質問

RTX 5090で実行するのに最適なLLMは何ですか?

速度と性能のバランスを重視するなら、RTX 5090で実行するのに最適なAIモデルはQwen3.8-27Bです。タスク完了までの時間の短さや生成速度の高さを最優先するなら、Nemotron 3.5 Lightningを選んでください。

ローカルLLMに32 GBのVRAMで足りますか?

はい。32 GBのVRAMがあれば、ほとんどの12B~33Bモデルを4ビット量子化で完全にGPU上で実行でき、長いコンテキストに使う余裕もあります。より大きなモデルや非常に長いコンテキストウィンドウでは、さらに小さくなる量子化や、一部のCPUオフロードが必要になる場合があります。

RTX 5090で70Bモデルを実行できますか?

4ビットではできません。70BのQ4ファイルは通常、コンテキスト用のメモリを加える前にRTX 5090の32 GB VRAMを超えます。ビット数を下げるか、モデルの一部をCPUで実行すれば70Bに対応できますが、どちらも品質か速度を犠牲にします。

RTX 5090に最適なコーディングLLMは何ですか?

今回のモデルの中で公開されているコーディングスコアが最も高いのはQwen3.8-27Bで、SWE-bench Proが61.7、LiveCodeBench v6が90.3です。私たちが実施した2つのコーディングタスクでは、動作する結果が得られるまでにGemmaモデルより時間がかかりました。Gemma 4 26B-A4Bはスネークとボールのページをどちらも1回目の試行で作成し、それぞれ27.1秒と32.9秒でしたが、Qwenは2回の試行で97.5秒と88.5秒でした。より難しい問題にはQwenを、動作する回答を素早く得たい場合にはGemma 4 26B-A4Bを選んでください。

RTX 5090を使う構成には、どの程度の電力とシステムRAMが必要ですか?

NVIDIAの仕様では、RTX 5090のグラフィックス総消費電力は575 W、リファレンス構成のシステム電源要件は1,000 Wとされています。必要なシステムRAMは、ファイルサイズ、コンテキスト長、モデルのレイヤーをCPUで実行するかどうかによって変わります。ベンチマークに使用したホストは117 GBのRAMを搭載していましたが、GPU上に常駐するこれらのファイルに117 GBが必要という意味ではありません。

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルAI画像生成ツールを比較し、7つのモデルをRTX 5090でベンチマーク測定しました。生成画像の例、生成速度、メモリ使用量、ライセンスの制限を確認できます。

9/25/26

14分