RAMやVRAMが8GBあれば、かなり高性能なローカルAIモデルを実行できます。8GBで動くおすすめのローカル大規模言語モデルを探しているなら、8GBのGPUにはQwen 3.5 9B、RAMまたはユニファイドメモリが8GBのシステムにはQwen 3.5 4Bを検討してください。
12GBのグラフィックカードをお持ちなら、VRAM 12GB向けのおすすめローカルLLMをご覧ください。具体的なGGUFファイル、メモリ使用量、見た目も確認できるコーディングテストを掲載しています。
記事の後半では、特定のタスクで優先したい選択肢も紹介します。用途に合うモデルを見つけてください。
これらのモデルを実行する方法については、ローカルLLMの実行ガイドをご覧ください。
8GBで動く最適なローカルLLMは?
目安として、VRAM 8GBなら量子化した7B-9Bモデルを実行できます。一方、RAMまたはユニファイドメモリの合計が8GBのコンピューターには、3B-4Bモデルのほうが適しています。
8GBのGPU向けには、4ビット量子化でおおむね6GB以下に収まり、KVキャッシュやランタイムの追加メモリを確保できるモデルを選びました。9Bを大きく超えるモデルは、特にコンテキスト長を伸ばすと、メモリの余裕が不足しがちです。
RAMまたはユニファイドメモリが8GBのシステムでは、OSと推論ソフトウェアも同じメモリを使うため、モデルをさらに小さくする必要があります。量子化後で2-3.5GB程度が現実的な目安となり、一般には3B-4Bパラメータのモデルが該当します。
条件に合うのは、次のモデルです。
| ハードウェア | モデル | ローカルでのサイズの目安 | 適した用途 | 主な制限 |
|---|---|---|---|---|
| 8GB VRAM | Qwen 3.5 9B | 5.7-6.6GB | 総合的な第一候補 | 長いコンテキストでは余裕が少ない |
| 8GB VRAM | GLM-4.6V-Flash | Q4で約6.2GB | 画像認識と短いコンテキストでの作業 | コンテキストが長くなるとシステムRAMにはみ出す可能性がある |
| 8GB VRAM | DeepSeek-R1-0528-Qwen3-8B | Q4で約5.2GB | 数学と推論 | 長い思考過程により待ち時間が増える |
| 8GB VRAM | Qwen2.5-Coder 7B | Q4で約4.7GB | コーディング専用 | Qwen 3.5より古く、汎用性が低い |
| RAM・ユニファイドメモリ8GB | Qwen 3.5 4B | 約3.4GB | 総合的な第一候補 | 9Bモデルより能力の上限が低い |
| RAM・ユニファイドメモリ8GB | Phi-4 Mini | 約2.5GB | CPUでの利用と小型モデルによる推論 | テキスト専用 |
| RAM・ユニファイドメモリ8GB | Gemma 3 4B | 約3.3GB | 画像認識と多言語での利用 | 画像の処理には追加メモリが必要 |
| RAM・ユニファイドメモリ8GB | SmolLM3 3B | Q4で約2GB | 軽量なチャットと文章作成 | 能力の上限が低い |
VRAM 8GBのシステムにおすすめのローカルLLM
VRAM 8GBに最適なLLMは、モデルの重みと使用中のコンテキストを含め、すべてをグラフィックカード上で実行できる7B-9Bモデルです。
一部の層をシステムRAMに移せば、12Bや14Bのモデルを読み込める場合もあります。ただし、生成中にPCIeバスを介してデータを転送する必要があるため、速度が大きく低下します。多くの場合、GPUに完全に収まる小さなモデルのほうが数倍速く動作し、快適に使えます。
Qwen 3.5 9B:総合的な第一候補
Qwen 3.5 9Bは、8GBのGPU向けの第一候補です。Q4_K_Mでは約5.7GBなので、コンテキストキャッシュと推論用の追加メモリを確保しながら、すべてをVRAM内に置けます。
8GBのカードにはQ4_K_Mをおすすめします。品質を重視したQ4やQ5のビルドは6-7GB近くになり、コンテキストに使えるメモリが大幅に減ります。モデル全体をGPUに載せたい場合、Q6やQ8は大きすぎて現実的ではありません。
Qwen 3.5 9Bは32層のTransformerを備え、Gated DeltaNet層と標準的なアテンション層を組み合わせたハイブリッドアーキテクチャを採用しています。公式のコンテキスト長は262,144トークンで、YaRNによるさらなる拡張にも対応しています。ただし、8GBのGPUで262Kに近い長さを使えるとは考えないでください。モデルの設計上の上限に達するよりはるかに前に、使えるVRAMによって実用的なコンテキスト長が制限されます。
画像入力にも対応しており、同規模のテキスト専用モデルに対する利点となります。Qwenは、推論、コーディング、指示追従、OCR、一般的な画像認識のベンチマークで高い成績を報告しています。
| ベンチマーク | Qwen 3.5 9B | Qwen 3.5 4B |
|---|---|---|
| MMLU-Pro | 82.5 | 79.1 |
| GPQA Diamond | 81.7 | 76.2 |
| LiveCodeBench v6 | 65.6 | 55.8 |
| IFEval | 91.5 | 89.8 |
| MMMU | 78.4 | 77.6 |
| OmniDocBench 1.5 | 87.7 | 86.2 |
| OCRBench | 89.2 | 85.0 |
Qwen 3.5 4Bとの差が最も大きいのは、難しい推論やコーディングのタスクです。たとえば、9BモデルのスコアはGPQA Diamondで81.7対76.2、LiveCodeBench v6で65.6対55.8です。画像認識のベンチマークのいくつかでは、差は小さくなっています。
これらはQwen自身が公開したベンチマーク結果です。両モデルの比較には役立ちますが、ローカルで使用する個々のGGUFビルドを独立にテストした結果ではありません。
| 仕様 | 詳細 |
|---|---|
| 開発元 | AlibabaのQwenチーム |
| パラメータ数 | 9B |
| アーキテクチャ | 画像エンコーダーを備えた32層のGated DeltaNet/アテンション混合モデル |
| ネイティブのコンテキスト長 | 262,144トークン |
| 拡張コンテキスト長 | YaRNで最大約1,010,000トークン |
| 8GB向けの推奨量子化版 | Q4_K_M |
| Q4_K_Mのサイズ | 約5.7GB |
| 入力 | テキストと画像 |
| ライセンス | Apache 2.0 |
Qwen 3.5 9Bの利点
- Q4_K_MはVRAM 8GBに完全に収まる
- 9Bモデルとして高い推論・コーディング性能
- 画像入力にネイティブ対応
- OCRと文書理解で高い成績
- 思考モードと思考なしのモードに対応
- Qwenによると201の言語と方言に対応
Qwen 3.5 9Bの制限
- 8GBのGPUで262Kのコンテキストは現実的ではない
- Q5ではコンテキスト用のVRAMがほとんど残らない
- Q6やQ8は大きすぎるため、8GBで全体をGPUに載せる構成には適さない
- 画像入力には追加メモリが必要
- 上記のベンチマーク値はベンダーが報告したもの
Qwen 3.5 9Bを選ぶ場面:8GBのGPUがあり、VRAMに完全に収まる中で最も高性能なQwen 3.5モデルを使いたい場合に選んでください。RTX 3060 Ti、RTX 3070、RTX 4060、RTX 5060、RX 7600などのカードでは、Q4_K_Mを使います。
GLM-4.6V-Flash
GLM-4.6V-Flashは、テキスト、画像、文書、動画、視覚的推論向けに開発されたZ.aiのマルチモーダルモデルです。公式のBF16重みは約20.6GBあるため、8GBのGPUではコミュニティが作成した量子化版が必要です。約6.2GBのQ4_K_Mをおすすめします。
RTX 3070では、Q4_K_Mは短いコンテキストや中程度のコンテキストでQwen 3.5 9Bと競える性能を発揮します。ただし約6.2GBあるため、コンテキストキャッシュ用のVRAMは少なくなります。長いプロンプトによって数層でもシステムRAMに移ると、性能は急速に低下します。
そのため、8GBのカードで汎用的に使うなら、おそらくQwen 3.5 9Bのほうが適しています。一方、コンテキストの余裕よりも、画像・文書の処理や視覚的推論の性能を重視する場合は、GLM-4.6V-Flashが候補になります。
| 仕様 | 詳細 |
|---|---|
| 開発元 | Z.ai |
| アーキテクチャ | 画像エンコーダーを備えたマルチモーダルTransformer |
| 公式のコンテキスト長 | 128Kトークン |
| 8GB向けの推奨量子化版 | コミュニティ製GGUF Q4_K_M |
| Q4_K_Mのサイズ | 約6.2GB |
| 入力 | テキスト、画像、動画 |
| ライセンス | MIT |
GLM-4.6V-Flashの利点
- 画像と文書の理解に優れる
- 動画入力に対応
- 視覚的推論と定量的推論に強い
- 短いコンテキストでのプロンプト処理が速い
- MITライセンス
GLM-4.6V-Flashの制限
- Q4_K_Mは約6.2GBを使うため、コンテキスト用のVRAMが限られる
- 長いプロンプトでは一部の層がCPU側に移り、生成速度が大幅に落ちる可能性がある
- 公式の重みは8GBのGPUには大きすぎる
- 8GBで実用的に使うにはコミュニティ製GGUFが必要
GLM-4.6V-Flashを選ぶ場面:8GBのGPUがあり、主に画像、PDF、スキャン文書などの視覚入力を重視する場合に選んでください。Q4_K_Mを使い、コンテキスト長を控えめに設定して、すべてのモデル層がGPU上に残っていることを確認します。
DeepSeek-R1-0528-Qwen3-8B
DeepSeek-R1-0528-Qwen3-8Bは、DeepSeek-R1-0528の能力をQwen3 8Bに蒸留した8Bの推論モデルです。DeepSeekは、大きなR1モデルの推論能力をできるだけ保ちつつ、一般向けハードウェアでローカル実行できるサイズになるよう学習させました。
8GBのGPUにはQ4_K_Mをおすすめします。サイズは約5.2GBです。Qwen 3.5 9BやGLM-4.6V-Flashよりもコンテキスト用のVRAMを確保できますが、推論中にその余裕を急速に使い切ることもあります。モデルは最終回答を出す前に数千の思考トークンを生成する場合があり、それらもKVキャッシュを使います。
主な用途は数学と難しい推論です。DeepSeekは、元のQwen3 8Bに比べてAIME 2024のスコアが大幅に向上し、論理やプログラミングのベンチマークでも高い成績を得たと報告しています。一方、通常のチャット、書き換え、短い事実確認の質問では、追加の思考によって必要以上に長く遅い応答になりやすく、向いていません。
| 仕様 | 詳細 |
|---|---|
| 開発元 | DeepSeek |
| ベースアーキテクチャ | Qwen3 8B |
| パラメータ数 | 8B |
| 一般的なローカルビルドのコンテキスト長 | 最大128K |
| 8GB向けの推奨量子化版 | GGUF Q4_K_M |
| Q4_K_Mのサイズ | 約5.2GB |
| 入力 | テキスト |
| ライセンス | MIT |
DeepSeek-R1-0528-Qwen3-8Bの利点
- 8Bモデルとして優れた数学的推論
- 論理とプログラミングで高い性能
- Q4_K_Mなら、ランタイムの追加メモリを除いて8GBのカードに約2.8GBの空きが残る
- 主要なローカル推論ランタイムで成熟したサポート
- MITライセンス
DeepSeek-R1-0528-Qwen3-8Bの制限
- 単純な回答でも思考過程が数千トークンに及ぶ場合がある
- 長い推論ではKVキャッシュ使用量が増え、実際に使えるコンテキストの余裕が減る
- テキスト専用
- 日常的なチャット、要約、文章作成では、必要以上に遅く冗長になりやすい
DeepSeek-R1-0528-Qwen3-8Bを選ぶ場面:数学、難しいデバッグ、論理問題など、応答速度より推論の質を重視するタスクに選んでください。一般的なチャットや文章作成では、Qwen 3.5 9Bのほうが標準的な選択として適しています。
Qwen2.5-Coder 7B
Qwen2.5-Coder 7B Instructは、Alibabaがプログラミング専用に開発した7Bモデルです。40を超えるプログラミング言語で、コード生成、デバッグ、説明、リファクタリング、テストに対応します。
8GBのGPUではQ4_K_MまたはQ5_K_Mを選んでください。一般的なQ4ビルドは約4.7GBで、上記の9Bモデルに比べて、コンテキスト用のVRAMをかなり多く確保できます。ランタイムとコンテキストの要件が許せば、8GBのカードでも層をシステムRAMに移さず、より高品質なQ5量子化版を実行できます。
小さいサイズは、複数のソースファイル、長い関数、コンパイラーの出力、失敗したテストの結果をモデルに渡すときに特に役立ちます。ネイティブのコンテキスト長は32Kで、YaRNによる拡張も可能ですが、実際に使える長さは量子化とVRAMの空き容量によって変わります。
| 仕様 | 詳細 |
|---|---|
| 開発元 | AlibabaのQwenチーム |
| パラメータ数 | 7B |
| ネイティブのコンテキスト長 | 32Kトークン |
| 拡張コンテキスト長 | YaRNによる拡張に対応 |
| 8GB向けの推奨量子化版 | GGUF Q4_K_MまたはQ5_K_M |
| Q4のサイズの目安 | 約4.7GB |
| 入力 | テキストとコード |
| ライセンス | Apache 2.0 |
Qwen2.5-Coder 7Bの利点
- コードの生成、修正、説明、補完に特化して学習
- Q4では、ランタイムの追加メモリを除いて8GBのカードに約3GBの空きが残る
- 多くの8GBのカードでQ5も実用的に使える
- 40を超えるプログラミング言語に対応
- ローカル推論アプリやコーディングツールが幅広く対応
Qwen2.5-Coder 7Bの制限
- Qwen 3.5世代より古い
- コーディングと一般的な推論を組み合わせる多くのタスクではQwen 3.5 9Bのほうが高性能
- テキスト専用のため、スクリーンショットや図などの視覚入力を確認できない
- 7Bモデルでは、大規模なリポジトリ全体の変更や長時間の自律的コーディングにはまだ限界がある
Qwen2.5-Coder 7Bを選ぶ場面:8GBのGPUで、ソースコードやコンテキスト用のメモリに余裕があるローカルコーディングモデルを主に求めている場合に選んでください。
コーディング向けモデルについては、コーディングにおすすめのローカルLLMのガイドで詳しく紹介しています。
RAM・ユニファイドメモリ8GBのシステムにおすすめのローカルLLM
メモリ8GBのApple Silicon Macでは、CPUとGPUが同じメモリを共有します。一方、合計メモリが同じ容量のWindowsやLinux PCでは、モデルの重みの一部をシステムRAMに移します。いずれの場合も、システムのほかの処理に余裕を残すため、量子化したモデル本体はおおむね2-3.5GBに抑えることをおすすめします。つまり、RAMまたはユニファイドメモリの合計が8GBなら、Q4の3B-4Bモデルを選んでください。7Bモデルも読み込み自体はできるかもしれませんが、OS、推論ランタイム、コンテキストに使えるメモリが不足します。このクラスでおすすめの小型LLMは、Qwen、Phi、Gemma、SmolLMの各ファミリーにあります。
Qwen 3.5 4B:総合的な第一候補
Qwen 3.5 4Bは、RAMまたはユニファイドメモリが8GBのコンピューター向けの第一候補です。Q4のビルドは約3.4GBで、OS、ランタイム、コンテキスト用に約4.5GBを残せます。
Qwen 3.5 4Bはテキストと画像に加えて、思考モード、コーディング、ツール使用、201言語に対応しています。ネイティブのコンテキスト上限は9Bモデルと同じ262Kです。
| 仕様 | 詳細 |
|---|---|
| 開発元 | AlibabaのQwenチーム |
| パラメータ数 | 4B |
| アーキテクチャ | 画像エンコーダーを備えたGated DeltaNet/アテンション混合モデル |
| ネイティブのコンテキスト長 | 262Kトークン |
| 8GB向けの推奨量子化版 | GGUF Q4 |
| ローカルでのサイズの目安 | 約3.4GB |
| 入力 | テキストと画像 |
| ライセンス | Apache 2.0 |
ベンチマークでは、4BモデルはQwen 3.5 9Bに大きく劣りません。
| ベンチマーク | Qwen 3.5 4B | Qwen 3.5 9B |
|---|---|---|
| MMLU-Pro | 79.1 | 82.5 |
| GPQA Diamond | 76.2 | 81.7 |
| IFEval | 89.8 | 91.5 |
| LiveCodeBench v6 | 55.8 | 65.6 |
| MMMU | 77.6 | 78.4 |
| OmniDocBench 1.5 | 86.2 | 87.7 |
| OCRBench | 85.0 | 89.2 |
Qwen 3.5 4Bの利点
- Q4は約3.4GB
- テキストと画像の処理に強い
- 思考モードと思考なしのモードに対応
Qwen 3.5 4Bの制限
- コーディングや難しい推論では9Bモデルに劣る
- コンテキストが長くなると、8GBのシステムでスワップが発生する場合がある
- 画像入力には追加メモリが必要
- 8GBで262Kのコンテキスト上限を使うのは現実的ではない
Qwen 3.5 4Bを選ぶ場面:RAMまたはユニファイドメモリの合計が8GBなら、まずこのモデルを試してください。スワップが頻繁に発生する場合や、何もしていない状態ですでにメモリの大半を使っている場合は、3Bモデルに下げてください。
Phi-4 Mini:CPUでの利用と小型モデルによる推論におすすめ
Phi-4 Mini Instructは、Microsoftの小型3.8Bテキストモデルです。推論を多く含む合成データ、指示追従、数学、論理、コード、関数呼び出しを重視して学習されています。Q4ビルドは約2.5GBで、8GBのシステムで特にメモリの余裕を確保しやすいモデルの一つです。
| 仕様 | 詳細 |
|---|---|
| 開発元 | Microsoft |
| パラメータ数 | 3.8B |
| 公式のコンテキスト長 | 128Kトークン |
| 実用的な形式 | GGUF Q4_K_MまたはQ5_K_M |
| ローカルでのサイズの目安 | 約2.5GB |
| 入力 | テキスト |
| ライセンス | MIT |
Phi-4 MiniはQwen 3.5 4Bより小さく古いモデルですが、学習対象を絞っているため、構造化されたテキストや推論のタスクでは競える場合があります。
| ベンチマーク | Phi-4 Mini | Qwen 3.5 4B |
|---|---|---|
| MMLU-Pro | 52.8 | 79.1 |
| GPQA | 25.2 | 76.2* |
*Qwenが報告しているのは標準のGPQAではなくGPQA Diamondなので、GPQAのスコアを直接同等に比較することはできません。
テキスト専用ですが、その分、画像エンコーダーにメモリを使うこともありません。
Phi-4 Miniの利点
- 8GBのコンピューターでメモリに大きな余裕を残せる
- サイズに対して数学、論理、指示追従に強い
- テキスト専用設計のため、画像処理用の追加メモリが不要
- Q5ビルドでも、ランタイム用のメモリを十分に残して収まる
Phi-4 Miniの制限
- 画像理解に非対応
- 対応する言語の幅はQwen 3.5やGemma 3より狭い
- カジュアルな文章作成でも堅すぎる文体になる場合がある
Phi-4 Miniを選ぶ場面:CPUのみでの推論、構造化されたQ&A、数学、論理、コードの説明に選んでください。普段使いのアプリをいくつか同時に動かす8GBのノートPCにも向いています。
Gemma 3 4B
Gemma 3 4B Instructは、Googleの軽量マルチモーダルモデルです。テキストと画像を入力でき、140を超える言語に対応し、公式の入力コンテキスト長は128Kです。一般的な量子化版は約3.3GBです。
| 仕様 | 詳細 |
|---|---|
| 開発元 | Google DeepMind |
| パラメータ数 | 4B |
| 公式のコンテキスト長 | 入力128K、出力8K |
| 実用的な形式 | GGUF Q4またはGemma QATビルド |
| ローカルでのサイズの目安 | 約3.3GB |
| 入力 | テキストと画像 |
| ライセンス | Gemma利用規約 |
Gemma 3 4Bの利点
- 多言語を幅広くカバー
- 画像、スクリーンショット、文書の理解に役立つ
- 量子化を考慮して学習した派生版を利用できる
Gemma 3 4Bの制限
- 画像入力により、8GBのマシンでコンテキストに使える余裕が減る
- Apache 2.0やMITのモデルより利用規約の制約が多い
- 複数の用途を組み合わせるならQwen 3.5 4Bのほうが標準的な選択として優れる
Gemma 3 4Bを選ぶ場面:多言語の作業や画像理解が中心の場合に使ってください。すでにGemmaに対応したワークフローがあり、公式の量子化版がある小型モデルを求める場合にも向いています。
SmolLM3 3B
SmolLM3 3Bは、Hugging Faceの小型で完全にオープンなモデルです。思考モードと思考なしのモードの両方に対応し、コンテキストウィンドウは64Kです。YaRNを使うと128Kまで拡張できます。
Q4版は約2GBなので、OSやほかのアプリのために多くの空きメモリを残したい場合、SmolLM3は有力な選択肢です。
| 仕様 | 詳細 |
|---|---|
| 開発元 | Hugging Face |
| パラメータ数 | 3B |
| アーキテクチャ | GQAとNoPEブロックを備えたデコーダー専用Transformer |
| 学習時のコンテキスト長 | 64Kトークン、YaRNで128Kまで拡張可能 |
| 実用的な形式 | GGUF Q4_K_MまたはQ5_K_M |
| ローカルでのサイズの目安 | Q4で約2GB |
| 入力 | テキスト |
| ライセンス | Apache 2.0 |
SmolLM3 3Bの利点
- メモリ使用量が非常に少なく、OSやコンテキスト用のRAMを多く残せる
- Hugging Faceはモデルの重みだけでなく、学習手順全体を公開している
- 思考モードと直接応答するモードの両方に対応
- ヨーロッパの主要言語をいくつかカバー
SmolLM3 3Bの制限
- 負荷の高い推論やコーディングのタスクではQwen 3.5 4Bに劣る
- テキスト専用
- そのまま使えるパッケージや連携はQwen、Gemma、Phiより少ない
SmolLM3 3Bを選ぶ場面:文章作成、要約、日常的な用途に使う軽量なオフラインアシスタントを求める場合です。
限られたメモリでコンテキストを管理する
メモリの少ないシステムでローカルAIを快適に使うには、コンテキスト長の管理が特に重要です。短すぎると以前の内容を保持できず、長すぎるとクラッシュします。
モデルに必要なRAMやVRAMは多くの要因によって変わりますが、特に大きいのは次の二つです。
- モデルの重み
- KVキャッシュ
モデルの重みが占めるメモリは、読み込み後はほぼ一定です。一方、KVキャッシュは会話やプロンプトが長くなるにつれて増えます。一般に、使用中のコンテキストが長いほどKVキャッシュも大きくなります。
8GBのGPUでは、モデルとKVキャッシュが使用可能なVRAMを共有します。収まらなくなると、一部のデータがシステムRAMに移る場合があります。PCIeを介してGPUとCPUの間でデータを転送する必要があるため、生成が大幅に遅くなることがあります。データの移動先もなければ、モデルがクラッシュする場合があります。
KVキャッシュのメモリ使用量を減らす
長いコンテキストで使うメモリを減らす一般的な方法は三つあります。
- 使用中のコンテキストを短くする
- KVキャッシュを量子化する
- メモリ効率のよいアテンション構造を持つモデルを使う
たとえば、私たちが開発したローカルAIアプリAtomic Chatは、モデルの実行中にKVキャッシュを圧縮するTurboQuantに対応しています。TurboQuantはGoogleが開発した仕組みで、KVの値をおよそ3ビットに縮小します。Googleの長いコンテキストを使ったテストでは、評価対象のタスクで測定可能な精度低下を起こさず、KVキャッシュのメモリを少なくとも6分の1に減らしました。
8GBのシステムでは、これによって16KトークンでKVキャッシュ用のメモリが足りなくなる状態から、同じモデルで約64Kを使える状態に変わる場合があります。4ビットのキャッシュは、同じメモリ容量で従来の16ビットのキャッシュの約4倍のトークンを保持できます。Atomic Chatの実装は3ビットと4ビットの保存に対応し、使用量を最大4.3分の1に減らします。
8GBのシステムにはおすすめしないモデル
人気モデルの中には、仕様だけを見ると魅力的でも、8GBのシステムで快適に動かすにはメモリの余裕が足りないものがあります。
VRAM 8GBでのGemma 3 12B
Gemma 3 12Bの量子化版の中には、KVキャッシュやランタイムのバッファーを加える前でも8GBのカード容量を少し超えるものがあります。試したくなりますが、おそらく一部をCPU側に移すことになり、非常に遅くなります。
Phi-4 14B
Q4なら理論上は8GBのGPUで実行できます。ただし、コンテキストやバッファーに必要なメモリを考慮すると、すぐに一部をGPUから移す必要が生じます。
IQ2でのGPT-OSS 20B
残念ながら、VRAMやRAMが8GBでは、OpenAIのオープンウェイトモデルで最小の20Bモデルさえ十分に実行できません。極端なIQ2量子化なら辛うじて動かせますが、その段階では使う価値が薄れます。それでもコンテキスト用の余裕は少なく、低ビット化による品質低下が、大きなモデルを読み込む利点を損ないます。GPT-OSS 20Bは、16GB以上で使うほうがはるかに魅力的です。
よくある質問
メモリ8GBでローカルLLMを実行する際によくある質問に、簡潔に回答します。
2026年にVRAM 8GBで使うなら、どのローカルLLMがおすすめですか?
Qwen 3.5 9B Q4です。一般的な推論、コーディング、多言語での性能、画像入力をバランスよく備え、多くの8GBのGPUに完全に収まります。
VRAM 8GBで12Bモデルを実行できますか?
はい。ただし、一部をシステムRAMに置く必要がある可能性が高いです。十分に低いビット数に量子化すれば重みは収まるかもしれませんが、KVキャッシュやランタイムのバッファーもVRAMを使います。たとえば、Atomic Chatやllama.cppはモデルをGPUとシステムメモリに分割できます。メモリ不足のエラーは避けられますが、PCIeを介したデータ転送が必要になるため、生成速度が落ちる場合もあります。
普段使いでは、GPUに完全に収まる8Bや9Bモデルのほうが、性能と使いやすさのバランスに優れることが多いです。
RAM 8GBでLlama 3.1 8Bを実行できますか?
Q4なら辛うじて可能です。システムRAMが8GBしかないマシンでは、OSが動いている状態で、モデルが使用可能なメモリの大半を占めます。コンテキストやほかの用途に使える余裕はほとんど残りません。
VRAM 8GBで使えるコンテキスト長はどのくらいですか?
たとえばQwen 3.5 9Bなら、特に量子化したKVキャッシュを使うことで、すべてをGPUに載せたまま16Kや32Kに達する場合があります。
VRAM 8GBではどの量子化版を使うべきですか?
Q4_K_Mです。8B-9Bモデルでは、品質を落としすぎずにモデル全体をGPUに収められる可能性が高い選択です。7Bモデルで大きなコンテキストを必要としないなら、Q5_K_Mも適しています。
llama.cppで9Bモデルを使うと、VRAMをどのくらい消費しますか?
9BのQ4_K_M GGUFは、通常、重みだけで約5-6GBです。llama.cppはKVキャッシュ、計算用バッファー、その他のランタイム処理にもメモリを必要とします。そのため、実行中のセッションでは、主にコンテキスト長とKVキャッシュの精度に応じて、6-7GB前後、またはそれ以上になる場合があります。GGUFのファイルサイズだけで収まるかどうかを判断せず、モデルの実行中にメモリ使用量を確認してください。
まとめ
- VRAM 8GBのグラフィックカードがあれば、Q4の7B-9BモデルをすべてGPUに載せて実行できます。このクラスではQwen 3.5 9Bを検討してください。
- システムにRAMまたはユニファイドメモリが8GBある場合、7B-9Bモデルは遅すぎるかもしれないので、3B-4Bモデルを検討してください。この範囲ではQwen 3.5 4Bがおすすめです。
- 高速なメモリに完全に収まるモデルは、CPUへのオフロードやスワップを使う大きなモデルより、一般に高い推論速度を得られます。
- モデルを選ぶ際は、重みだけでなくKVキャッシュも考慮してください。メモリ使用量はコンテキスト長とともに増えるため、容量が限られているとすぐに不足します。Atomic ChatのTurboQuantを使うと、実行中のメモリ負担を減らしてこれに対処でき、通常ならローカルで使えないほど長いコンテキストでモデルを実行できます。

