結論
デスクトップ版RTX 4090でテストした6つのビルドの中で、総合的な第一候補はGemma 4 12B Q4_K_Mです。生成速度は99.7 tokens/s、32k時のVRAM使用量は8,628 MiBでした。また、両方のコーディング課題を1回目の試行で完了しました。まずはgemma-4-12b-it-Q4_K_M.ggufを使い、コンテキストに32kを割り当ててください。出力速度が最も高かったのはNemotron 3.5 Lightningで、224.7 tokens/sに達しました。ただし、スネークゲームを動作させるまでに5回の試行が必要でした。Gemma 4 26B-A4Bは、長文を扱う際に選べる、より高速なGemmaです。生成速度は194.1 tokens/sで、メモリ使用量は12Bより多くなりました。
この比較の対象は、24 GBのVRAMを搭載したデスクトップ版のカードです。RTX 4090 Laptop GPUは16 GBで、メモリ容量に応じた別の計画が必要です。以下の速度はすべてllama.cppで測定した値です。Atomic Chatの性能は、選択したバックエンドと設定によって異なります。
以下の表では、実際にテストしたGGUFビルドを比較しています。32 GBのカードについては、RTX 5090のベンチマークをご覧ください。読み込めた最大コンテキスト長は、メモリの割り当てに成功したことを意味し、ウィンドウ全体で品質をテストしたことを意味しません。文書を使った検証結果は別途報告しています。
| モデル | テストした量子化 | ファイルサイズ | 32k時のVRAM使用量 | 4kプロンプト | 生成 | fp16で読み込めた最大コンテキスト長 | 適した用途 |
|---|---|---|---|---|---|---|---|
| Qwen3.8-27B | AD-Q4_K_M | 15.94 GiB | 18,222 MiB | 3,004 tok/s | 48.5 tok/s | 96k | コーディングと汎用用途 |
| Nemotron 3.5 Lightning 30B-A3B | AD-IQ4_NL | 18.30 GiB | 18,484 MiB | 9,613 tok/s | 224.7 tok/s | 192k | 高速な出力 |
| Gemma 4 26B-A4B it | Q4_K_M | 15.64 GiB | 17,572 MiB | 9,970 tok/s | 194.1 tok/s | 192k | 長文の処理と速度 |
| Gemma 4 12B it | Q4_K_M | 6.87 GiB | 8,628 MiB | 7,028 tok/s | 99.7 tok/s | 192k | テストした中で最も総合力が高いモデル |
| Muse Glimmer 30B | AD-Q4_K_M | 17.75 GiB | 18,260 MiB | 3,495 tok/s | 46.7 tok/s | テスト上限の128k | 推論重視の代替候補 |
| Gemma 4 31B it | IQ4_XS | 15.59 GiB | 20,380 MiB | 3,165 tok/s | 48.7 tok/s | 64k | デンスモデルのGemmaという代替候補 |
RTX 4090におすすめのローカルLLM
Qwen3.8-27B:高い推論性能
Qwen3.8-27Bは、コーディング、調査、日常的な支援に向けたAlibabaの27.32Bパラメータのデンスモデルです。言語モデルの64層でGated DeltaNetと従来型のアテンションを組み合わせています。大半の層は、より軽量な線形アテンション経路でシーケンスを処理し、通常のアテンション層は、プロンプト内に分散した情報をモデルが関連付けるのに役立ちます。テキスト、画像、動画を入力でき、思考のオンとオフの切り替えや推論強度の調整も可能です。今回の速度テストと文書テストでは、思考をオフにしてテキストを使用しました。以下のコーディングテストでは、異なる思考設定を使用しました。
Qwen3.8-27Bの元のチェックポイントは、GPQA Diamondで89.2、SWE-bench Proで61.7、Terminal-Bench 2.1で73.0を記録しており、質問、文書、コードを行き来する作業に役立つモデルです。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/Qwen3.8-27B-GGUF |
| 使用したGGUFの正確なファイル名 | Qwen3.8-27B-AD-Q4_K_M.gguf |
| ファイルサイズ | 15.94 GiB |
| 32k時のVRAM使用量 | 18,222 MiB |
| 4kプロンプト / 生成 | 3,004 / 48.5 tok/s |
| fp16で読み込めた最大割り当て | 96k; 22,381 MiB |
| q8_0 KV使用時の128k | 読み込み成功、21,091 MiBを割り当て |
Qwenはネイティブで262kトークンのコンテキストに対応していますが、RTX 4090のメモリではその全体を活用できません。デフォルトのfp16 KVキャッシュでは、今回のシステムで128kの割り当てを読み込めませんでしたが、両方のキャッシュ型をq8_0に設定すると、モデルファイルを変更せずに128kで動作しました。
評価:中程度のコンテキスト長でコーディングや汎用用途に使うなら、Qwenを選んでください。このGGUFは、両方のブラウザ課題を1回目の試行で完了しました。32k時の使用量は18,222 MiBで、128kにするにはq8_0 KVキャッシュが必要でした。
NVIDIA Nemotron 3.5 Lightning:最速の生成
Nemotron 3.5 Lightning 30B-A3Bは、Mamba-2層、アテンション、混合エキスパートを組み合わせています。約30Bのパラメータを保持し、トークンごとに約3Bを有効化します。高速なテキスト生成と、ツール呼び出しや構造化出力を含む長時間のエージェントワークフローを目指した設計です。画像に対応するQwen、Gemma、Museとは異なり、テキスト専用モデルです。
このNemotronのチェックポイントは最大100万トークンのコンテキストに対応していますが、今回のRTX 4090での一連のテストで最大の割り当ては192kでした。NVIDIAのBF16ベースラインは、GPQA Diamondで75.44、SWE-bench Verifiedで51.56を記録しています。
生成速度と最初のトークンまでの待ち時間を重視するなら、Nemotronを選んでください。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF |
| 使用したGGUFの正確なファイル名 | NVIDIA-Nemotron-3.5-Lightning-30B-A3B-AD-IQ4_NL.gguf |
| ファイルサイズ | 18.30 GiB |
| 32k時のVRAM使用量 | 18,484 MiB |
| 4kプロンプト / 生成 | 9,613 / 224.7 tok/s |
| 128kの文書 | 最初のトークンまで19.2秒、事実4/4、要約のトピック4/4 |
| テストで読み込めた最大割り当て | 192k; 19,603 MiB |
この速度は、追加の質問、草稿の修正、多数の短い応答を生成するエージェントの実行といった、繰り返しの多い作業で特に役立ちます。ハイブリッドアーキテクチャにより、コンテキストが長くなってもKVキャッシュを比較的小さく保てるため、192kの割り当てでもVRAMに十分な余裕を残して収まりました。
評価:高速なテキスト専用チャットや長文の処理には、Nemotronを選んでください。スネークゲームに5回の試行を要した結果は、生成速度だけでは課題に必要な修正回数を予測できないことを示しています。
Gemma 4 26B-A4B it:最もバランスがよいモデル
Gemma 4 26B-A4B itは、GoogleのGemma 4モデルファミリーに属する混合エキスパートモデルです。各トークンを128個のエキスパートのうち8個と共有エキスパートに振り分け、一度に約3.8Bのパラメータを有効化します。これにより、トークンごとの生成に必要な処理量を減らしながら、より大きなモデルの能力の多くを備えています。元のリリースではテキストと画像を入力でき、ネイティブで256kトークンのコンテキストに対応しています。Gemma 4は、ローカルなスライディングウィンドウアテンションと一定間隔のグローバルアテンションも組み合わせており、このファミリーは思考の設定、関数呼び出し、システム指示に対応しています。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/gemma-4-26B-A4B-it-GGUF |
| 使用したGGUFの正確なファイル名 | gemma-4-26B-A4B-it-Q4_K_M.gguf |
| ファイルサイズ | 15.64 GiB |
| 32k時のVRAM使用量 | 17,572 MiB |
| 4kプロンプト / 生成 | 9,970 / 194.1 tok/s |
| 128kの文書 | 最初のトークンまで24.8秒、事実4/4、要約のトピック4/4 |
| テストで読み込めた最大割り当て | 192k; 20,931 MiB |
MoEにより、このモデルは、たとえばGemma 31Bのデンスモデルよりもはるかに高速にトークンを生成できますが、その分、精度は多少低下します。
評価:大きな入力を日常的に扱い、RTX 4090のVRAMを使い切らずに高速な応答を得たいなら、Gemma 26B-A4Bを選んでください。
Gemma 4 12B it:最も総合力が高いモデル
Gemma 4 12B itは、VRAMの空き容量を重視する場合に、今回テストしたワークロードでの基本的な第一候補です。Googleの11.95Bパラメータのデンス型チェックポイントで、テキスト、画像、音声、動画を入力し、テキストを生成します。独立した知覚エンコーダーを使わずに、視覚入力と音声入力を言語モデルへ投影します。今回のGGUFベンチマークでは、テキストのみを測定しました。
12Bも、Gemma 4に共通するローカルアテンションとグローバルアテンションの組み合わせ、思考の設定、システムロールへの対応、ネイティブの256kコンテキストを備えています。元のチェックポイントは、GPQA Diamondで78.8%、LiveCodeBench v6で72.0%を記録しています。
12Bモデルは、より大きなGemmaモデルの推論能力の一部と引き換えに、必要なメモリを大幅に減らしています。そのため、GPUでほかのアプリケーションや別のモデルも動かす必要がある場合に魅力的です。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/gemma-4-12B-it-GGUF |
| 使用したGGUFの正確なファイル名 | gemma-4-12b-it-Q4_K_M.gguf |
| ファイルサイズ | 6.87 GiB |
| 32k時のVRAM使用量 | 8,628 MiB |
| 4kプロンプト / 生成 | 7,028 / 99.7 tok/s |
| 128kの文書 | 最初のトークンまで37.2秒、事実4/4、要約のトピック4/4 |
| テストで読み込めた最大割り当て | 192k; 11,347 MiB |
日常的な文章作成、文書に関する質問、軽量なローカル自動化では、12Bは一日中読み込んだままにしやすいモデルです。今回の長文検証では、すべての質問に問題なく回答しました。
評価:メモリに余裕を持たせつつ、今回の両方のコーディング課題を1回目の試行で完了したモデルが欲しいなら、まずGemma 12Bを使ってください。この2つの課題だけでは、コーディング品質の一般的な順位は確定できません。
Muse Glimmer 30B:エージェント重視の代替候補
Muse Glimmer 30Bは、より大きなMuse Sparkから蒸留された、Metaのローカルエージェントモデルです。そのデンス型言語モデルは、多段階の推論、ツールの使用、アクション失敗時の復旧に向けて学習されています。スクリーンショット、グラフ、その他の画像を扱うための独立した知覚エンコーダーを備えています。今回のGGUFの速度テストと文書テストでは、テキストのみを使用しました。
Muse Glimmerでは、推論強度をlowからxhighまで設定できるため、現在の作業の複雑さに合わせて調整できます。ベンチマーク性能も高く、元のチェックポイントはGPQA Diamondで83.5、SWE-bench Proで51.2を記録しています。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/Muse-Glimmer-30B-GGUF |
| 使用したGGUFの正確なファイル名 | Muse-Glimmer-30B-AD-Q4_K_M.gguf |
| ファイルサイズ | 17.75 GiB |
| 32k時のVRAM使用量 | 18,260 MiB |
| 4kプロンプト / 生成 | 3,495 / 46.7 tok/s |
| 長文 | 最初のトークンまで41.7秒、事実4/4、要約のトピック4/4 |
| 読み込めた最大割り当て | テスト上限の128k、19,603 MiB |
Museのトークナイザーは、特に少ないトークン数でテキストを表現できます。Gemmaでは130,557トークンを使用した同じテキストが、Museでは107,856トークンで済んだため、同じコンテキストウィンドウ内により多くの情報を収められる可能性があります。
評価:Metaのエージェント重視のモデルをローカルで評価したいなら、Muse Glimmerを試してください。両方のブラウザ課題を1回目の試行で完了しましたが、このテストでは自律的なツール使用やエージェントの信頼性は測定していません。
Gemma 4 31B it:デンスモデルのGemmaという代替候補
Gemma 4 31B itは、26B-A4Bの混合エキスパートモデルに代わる、Googleの30.7Bパラメータのデンスモデルです。ローカルなスライディングウィンドウアテンションとグローバルアテンションを交互に配置した60層を備え、ネイティブで256kのコンテキストに対応しています。テキストと画像を扱い、思考の設定に対応し、システム指示に従ったり、関数呼び出しを生成したりできます。
このGPUでは、デンス型の設計は速度よりもモデルの能力を優先します。元の31Bは、GPQA Diamondで84.3%、LiveCodeBench v6で80.0%、MRCR v2の8つのneedleを使う128kテストで66.4%を記録しています。最後の結果は26B-A4Bモデルの44.1%を大きく上回っており、出力速度よりも大きな入力からの情報取得を重視する場合、31Bは注目に値します。
| テストしたファイル | 結果 |
|---|---|
| リポジトリ | AtomicChat/gemma-4-31B-it-GGUF |
| 使用したGGUFの正確なファイル名 | gemma-4-31B-it-IQ4_XS.gguf |
| ファイルサイズ | 15.59 GiB |
| 32k時のVRAM使用量 | 20,380 MiB |
| 4kプロンプト / 生成 | 3,165 / 48.7 tok/s |
| fp16で読み込めた最大割り当て | 64k; 22,971 MiB |
| q8_0 KV使用時の128k | 読み込み成功、23,725 MiBを割り当て |
このモデルでは、RTX 4090上でコンテキストに必要なメモリ量が制約になります。fp16 KVキャッシュでは96kで読み込めませんでしたが、q8_0では同じGGUFを128kで読み込めました。ただし、この設定ではカードの空き容量が1 GiB未満になったため、32kまたは64kで動かす方が現実的です。
評価:デンスモデルのGemmaを使いたく、通常は中程度のコンテキスト長で作業するなら、Gemma 31Bを選んでください。
ベンチマークの方法
速度、メモリ、文書のテストに使用したマシンは、24,564 MiBのVRAMを搭載したデスクトップ版RTX 4090、Ubuntu 24.04.3、NVIDIAドライバー580.159.04、llama.cpp b10988の公式CUDA 12.8バイナリを使用しました。主要な結果では、全層をGPUへオフロードし、並列スロット数を1、KVキャッシュをfp16に設定しました。ベンチマークのプロンプトはすべてテキストのみです。また、このバイナリにRTX 4090向けのネイティブsm_89カーネルが含まれていることも確認しました。
長いコンテキストのテストでは、各モデルに、約8k、32k、128kトークンのそれぞれの長さで同じソース文書を入力しました。文書の冒頭付近、中央付近、末尾付近に事実を配置し、2か所の事実を必要とする質問を追加したうえで、要約に必須の4つのトピックが残るかどうかを確認しました。すべてのモデルが、このテストを問題なく完了しました。
2つのコーディング課題は、2026年9月19日と20日に、NVIDIAドライバー590.48.01を使用する別のRTX 4090ホストで実行しました。同じllama.cpp b10988のCUDA 12.8ビルドと、上記の正確なGGUFファイル名のファイルを使用し、全層をGPUへオフロード、スロット数は1、コンテキスト長は16,384トークン、推論を含む出力予算は8,192トークンに設定しました。サンプリング設定はtemperature 1.0、top-p 0.95、top-k 64、seed 42です。Nemotronを除いて思考を有効にしました。Nemotronは、以前のRTX 5090での実行時に、推論だけで出力予算を使い切っていたためです。
各課題では、最初に各モデルに回答を1つ生成させました。出力をChromeで開き、修正が必要な場合は、ブラウザで確認した具体的なフィードバックをモデルに返しました。すべての修正はモデル自身が行い、私たちはそのHTMLを編集していません。合計生成時間は、モデルの各試行の時間を合算したもので、ブラウザでのテストとフィードバックの時間は含みません。動画では、最終的に動作したバージョンを示しています。
上記のベンダーによるベンチマークスコアは、元のチェックポイントのものです。今回テストしたGGUFには異なる量子化手法が使われているため、速度とメモリ使用量の差には、モデルとファイルの両方の違いが反映されています。文書の検証と2つのブラウザ課題は、特定のワークロードを対象としており、全体的な品質の順位を確定するものではありません。
自動プレイするスネークゲームのコーディング
各モデルに、ヘビが餌を食べて成長する、自動プレイのスネークゲームを作るよう依頼しました。
| モデル | 試行回数 | 合計生成時間 |
|---|---|---|
| Qwen3.8-27B | 1 | 118.4秒 |
| Gemma 4 31B | 1 | 103.1秒 |
| Gemma 4 26B-A4B | 3 | 99.7秒 |
| Gemma 4 12B | 1 | 93.2秒 |
| Muse Glimmer 30B | 1 | 171.0秒 |
| Nemotron 3.5 Lightning | 5 | 57.5秒 |
最終的にすべてのモデルがテストを完了しました。Qwen3.8-27B、Gemma 4 31B、Gemma 4 12B、Muse Glimmerは1回目の試行で動作するゲームを作成しました。Nemotronは5回の試行を要しましたが、それでも合計生成時間は57.5秒と最短でした。
跳ねる5つのボールのコーディング
各モデルには、重力と衝突の影響を受ける5つのボールを表示するページの作成も依頼しました。
| モデル | 試行回数 | 合計生成時間 |
|---|---|---|
| Qwen3.8-27B | 1 | 84.8秒 |
| Gemma 4 31B | 1 | 84.9秒 |
| Gemma 4 26B-A4B | 1 | 23.7秒 |
| Gemma 4 12B | 1 | 60.5秒 |
| Muse Glimmer 30B | 1 | 145.8秒 |
| Nemotron 3.5 Lightning | 1 | 9.6秒 |
6つすべてのモデルが、5つのボールのシミュレーションを1回目の試行で完成させました。生成時間が最も短かったのはNemotronのわずか9.6秒で、Gemma 4 26B-A4Bが23.7秒で続きました。
これらのモデルをAtomic Chatで実行する方法
- Atomic Chatをインストールし、Find optimal backendを選択して、互換性のあるGPUランタイムを選べるようにします。
- Modelsを開き、上記で選んだモデルのカードにリンクされているリポジトリを検索します。
- Download Optionsで、そのカードに記載された正確なGGUFファイル名のファイルを選択します。ダウンロードして、Use this modelを選びます。
- まずはコンテキストに32kを割り当てて、新しいチャットを開きます。課題で必要な場合にのみコンテキストを増やし、GPUメモリ使用量を確認してください。
すでにコンピューター上にあるGGUFには、Settings → Model Providers → llama.cpp → Importを使用します。
128kのq8_0設定をllama.cppで直接再現するには、ダウンロードしたファイルを指定し、両方のKVキャッシュ型をq8_0に設定してサーバーを実行します。
llama-server -m /path/to/model.gguf -ngl 999 -c 131072 --parallel 1 \ --cache-type-k q8_0 --cache-type-v q8_0
その割り当てを前提に利用する前に、自分のマシンでメモリ使用量を確認してください。まだモデルを選んでいる段階なら、Atomic Chatをダウンロードし、似た名前の量子化ファイルではなく、表に記載された正確なGGUFから始めてください。
よくある質問
RTX 4090で実行するのに最適なLLMは何ですか?
テストした6つのビルドの中で、総合的な第一候補はGemma 4 12B Q4_K_Mです。32k時の使用量は8,628 MiB、生成速度は99.7 tokens/sで、両方のコーディング課題を1回目の試行で完了しました。コンテキスト長は32kから始めて、必要に応じて増やしてください。
ローカルLLMには24 GBのVRAMで十分ですか?
はい。この比較に含まれる6つのファイルはすべて、32kで全体をGPUに読み込めました。ほかのモデルが収まるかどうかは、正確なファイルサイズ、KVキャッシュ、コンテキストへの割り当て、ほかのアプリケーションが使用するメモリによって決まります。
RTX 4090で70Bモデルを実行できますか?
4ビットの70Bモデルでは、量子化のオーバーヘッドと実行時のメモリを含める前でも、重みだけで約35 GBが必要です。この精度では、全体を24 GBに収めることはできません。十分なシステムRAMがあれば、一部をCPUへオフロードして実行できますが、生成速度は低下します。
RTX 4090に最適なコーディング用LLMは何ですか?
Qwen3.8-27Bは、元のチェックポイントについて高いコーディング評価結果が公開されており、今回のAD-Q4_K_Mファイルも、両方のブラウザ課題を1回目の試行で完了しました。Gemma 4 12Bも、はるかに少ないVRAM使用量で、両方を1回目で成功させました。これらの小規模な課題だけでは、大規模なコードベースに最適なモデルを確定できません。
ローカルLLMでは、RTX 4090はRTX 3090より高速ですか?
デスクトップ版の両カードは、どちらも24 GBのVRAMを搭載しています。速度の差は、モデル、量子化、推論バックエンドによって異なります。この記事はRTX 4090を測定したものであり、RTX 3090に対して一定の速度優位性があることを示すものではありません。
16 GBのRTX 4090 Laptopでは何を実行できますか?
16 GBのRTX 4090 Laptop GPUでは、ほとんどの7Bから14Bのモデルを4ビット量子化で完全にVRAM内に収めて実行できます。20Bから30Bのモデルでは一般的に、より低ビットの量子化、より短いコンテキストウィンドウ、または一部のCPUへのオフロードが必要です。
RTX 4090は2026年でもローカルAIに適していますか?
はい。24 GBのVRAMは、現在の12Bから32Bの多くのモデルを4ビット量子化で動かすのに十分で、高いメモリ帯域幅によって高速なローカル推論が可能です。より新しい32 GBのカードは、大きなモデルや長いコンテキストに対してより多くの余裕を提供しますが、RTX 4090も引き続き、ローカルAI向けの有力なシングルGPUプラットフォームです。

