32GBのグラフィックスカードがあれば、わずか2年ほど前のプロプライエタリな最上位モデルに匹敵するローカルAIモデルを動かせるようになりました。このガイドでは、32GBの専用VRAMまたは32GBの統合メモリで動かす、現時点で特に優れたLLMを選びます。
選定基準
次の4つの条件を満たす、最近のオープンウェイトモデルを優先しました。
- 推奨ビルドが、32GBのGPUでは常時CPUオフロードを行わずに収まり、32GBの共有メモリシステムではほかのメモリ使用が比較的少ない状態ならスワップせずに収まること。
- 量子化の品質がQ4以上であること。
- 汎用用途、コーディング、ツール、長いコンテキスト、マルチモーダル処理のいずれかに明確な強みがあること。
- Atomic Chat、llama.cpp、Ollama、LM Studio、MLX、vLLM、SGLangなど、現在のローカル実行環境で動かせること。
| モデル | 32GB VRAM向けビルド | 総メモリ容量32GB / 統合メモリ32GB向けビルド | 最も適した用途 | 主な制約 |
|---|---|---|---|---|
| Qwen 3.6 35B-A3B | Q5_K_M, 24.7GB | Q4_K_M, 21.2GB | 総合的な第一候補 | 推奨GGUFはテキスト専用 |
| NVIDIA Nemotron 3.5 Lightning 30B-A3B | Q5_K_M, 26.6GB | AD-IQ4_NL, 19.7GB | 長いコンテキストを扱う高速なエージェント | テキスト専用で、新しい実行環境が必要 |
| Muse Glimmer 30B | AD-IQ4_XS + 画像処理 + DFlash、読み込み時は約24.6GB | AD-IQ4_XS + 画像処理、約19.9GB | マルチモーダルエージェント | すべてを揃えた構成には複数のファイルが必要 |
| GLM-4.7-Flash 30B-A3B | Q6_K, 24.8GB | Q5_K_M, 21.6GB | 推論とツール使用 | テキスト専用。思考が冗長になることがある |
| Gemma 4 31B | Q6_K, 25.2GB | Q5_K_M, 21.8GB | 汎用的なデンス型マルチモーダルモデル | MoEよりもトークンあたりの計算量が多い |
| Devstral Small 2 24B | Q8_0, 25.1GB | Q6_K, 19.4GB | ローカルのコーディングエージェント | 汎用的に対応できる範囲が狭い |
32GBで動かすおすすめのローカルLLM
Qwen 3.6 35B-A3B
Qwen 3.6 35B-A3Bは、パラメータ数35Bのマルチモーダルな混合エキスパートモデルで、トークンごとに約3Bのパラメータが有効になります。Gated DeltaNetの線形アテンションブロックと従来型のゲート付きアテンションブロックを組み合わせ、生成時の計算量とKVキャッシュの増加を抑えます。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | Alibaba、Qwenチーム |
| パラメータ数 | 格納されるのは35B、各トークンで使用するのは約3B |
| アーキテクチャ | Gated DeltaNet / ゲート付きアテンションのハイブリッドMoE |
| 層数 | 40 |
| エキスパート | ルーティング対象256、アクティブ8 + 共有1 |
| コンテキスト長 | 標準で262,144トークン。YaRNで1,010,000まで拡張可能 |
| 32GB VRAM向けの推奨ビルド | Q5_K_M, 24.7GB |
| 32GB共有メモリ向けの推奨ビルド | Q4_K_M, 21.2GB |
| より忠実度の高い代替ビルド | Q6_K, 28.5GB。中程度のコンテキスト長なら実用的ですが、余裕は少なくなります |
| 対応する入力 | 掲載したGGUFはテキストに対応。Qwenの元のチェックポイントは画像にも対応 |
| 思考 | 思考モードと非思考モード。ターン間で思考を保持する設定も可能 |
| 利用条件 | Apache License 2.0 |
32GBのGPUには、AtomicChat/Qwen3.6-35B-A3B-GGUFの24.7GBのQ5_K_Mビルドを推奨します。これは、Qwenの重みから直接作成した、重要度行列を用いた量子化ビルドです。統合メモリが32GBの場合は、21.2GBのQ4_K_Mを使ってください。
ベースモデルはテキストと画像に対応していますが、Atomic ChatのGGUFリポジトリは現在テキスト専用で、ビジョンプロジェクターを含みません。画像入力が必須であれば、オリジナルまたはマルチモーダル対応のビルドを使ってください。
Qwen 3.6 35B-A3Bのベンチマーク
| ベンチマーク | スコア |
|---|---|
| GPQA | 86.0 |
| MMLU-Pro | 85.2 |
| AIME 2026 | 92.7 |
| LiveCodeBench v6 | 80.4 |
| SWE-bench Verified | 73.4 |
| SWE-bench Pro | 49.5 |
| Terminal-Bench 2.0 | 51.5 |
| MCP-Atlas | 62.8 |
| MMMU | 81.7 |
上記の数値は、フル精度のベースモデルについて公開されたものです。量子化すると性能は多少低下しますが、Q5_K_Mでは実用上の差は生じません。
Qwen 3.6 35B-A3Bの長所
- 推論、コーディング、ツール、調査、多言語利用のバランスに優れる
- トークンごとに有効になるパラメータは約3Bのみ
- Q5_K_Mでは、実行環境によるメモリ確保前の公称容量で7GBを超える余裕が残る
- ハイブリッドアテンションにより、従来型の35B Transformerよりもコンテキスト用メモリを管理しやすい
- 制約の少ないApacheライセンス
Qwen 3.6 35B-A3Bの短所
- ベースモデルはマルチモーダルですが、Atomic ChatのGGUFはテキスト専用
- QwenのJinjaテンプレートを有効にしないと、会話ターンの形式が不正になる
- 思考モードでは応答が長くなり、多くのトークンを消費することがある
Qwen 3.6 35B-A3Bを選ぶ場面:文章作成、分析、コード、ツール、多言語の作業を1つのモデルでこなす必要がある場合に選んでください。
NVIDIA Nemotron 3.5 Lightning 30B-A3B
NVIDIA Nemotron 3.5 Lightning 30B-A3Bは、2026年8月に公開された、パラメータ数30BのハイブリッドMoEモデルです。生成するトークンごとに約3Bのパラメータが有効になります。52層のアーキテクチャは、23層のMamba-2、23層のMoE、6層のフルアテンションで構成されています。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | NVIDIA |
| パラメータ数 | 格納されるのは30B、トークンごとに有効になるのは約3B |
| アーキテクチャ | Mamba-2、アテンション、MoEのハイブリッド |
| 層数 | 52:Mamba-2が23層、MoEが23層、アテンションが6層 |
| エキスパート | ルーティング対象128、アクティブ6 + 共有1 |
| コンテキスト長 | ローカルのGGUF利用では262K。アーキテクチャは最大1Mに対応 |
| KVキャッシュ | llama.cppではトークンあたり約6KB |
| 32GB VRAM向けの推奨ビルド | Q5_K_M, 26.6GB |
| 32GB共有メモリ向けの推奨ビルド | AD-IQ4_NL, 19.7GB |
| 入力 | テキスト |
| 思考 | 有効・無効を設定可能 |
| ライセンス | OpenMDW 1.1 |
KVキャッシュが小さいことは、ローカル推論におけるこのモデルの特に有用な特徴の1つです。6層のアテンション層で使用するKVヘッドは2つのみで、llama.cppでのKVキャッシュ使用量はトークンあたり約6KBになります。コンテキスト長が32Kなら、実行環境のオーバーヘッドを除いて約192MBです。Mambaの状態はアテンションキャッシュとは異なり、コンテキストが長くなってもほぼ一定のサイズを保ちます。
32GBのGPUがある場合は、AtomicChat/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUFから26.6GBのQ5_K_Mビルドをダウンロードしてください。
メモリに余裕を残す必要がある場合は、19.7GBのAD-IQ4_NLビルドがより役立ちます。Atomic Chatの測定では、より大きなQ5_K_M量子化ビルドに近い乖離度だったため、忠実度の低下はごくわずかです。
Nemotron 3.5 Lightningのベンチマーク
| ベンチマーク | スコア |
|---|---|
| MMLU-Pro | 81.94 |
| GPQA Diamond | 75.44 |
| SWE-bench Verified | 51.56 |
| SWE-bench Multilingual | 39.33 |
| Terminal-Bench 2.1 | 24.58 |
| BrowseComp | 36.97 |
| IFBench (loose) | 71.88 |
| AA-LCR 長いコンテキスト | 52.00 |
Nemotron 3.5 Lightningの長所
- 30BモデルとしてはKVキャッシュの増加が非常に少ない
- 有効なパラメータが3BのみのMoEによる高速な生成
- エージェント、ツール呼び出し、構造化出力、長い範囲にわたる情報検索向けに設計されている
- 思考を無効にして素早く応答できる
- 19.7GBから28.8GBまで、測定済みの量子化ビルドを複数選べる
Nemotron 3.5 Lightningの短所
- テキスト専用
- 汎用的な推論とコーディングのスコアはQwen 3.6を下回る
nemotron_h_moeアーキテクチャに対応した新しいllama.cppビルドが必要- OpenMDWの利用条件は、なじみのある制約の少ないライセンスよりも入念な確認が必要
- 投機的デコーディングは、GPUに完全オフロードした状態では速度を低下させることがあるため、自動的に有効にするのではなく、ベンチマークで検証すべき
Nemotron 3.5 Lightningを選ぶ場面:長いコンテキストを扱うRAG、ツールを多用するアシスタント、エージェントループに選んでください。
Muse Glimmer 30B
Muse Glimmer 30Bは、MetaによるローカルAIエージェント向けモデルです。2026年8月に公開されました。30Bの因果言語モデルに、スクリーンショット、グラフ、文書、そのほかの視覚入力を処理する独立した知覚エンコーダーを組み合わせています。ツール使用や、試みた操作が失敗した場合の復旧を含め、タスクを最初から最後まで完遂することを中心に学習されています。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | Meta Superintelligence Lab |
| パラメータ数 | 30Bの言語モデル + 専用の知覚エンコーダー |
| アーキテクチャ | ゲート付きアテンションと独立したビジョンエンコーダーを備えたデンス型因果モデル |
| コンテキスト長 | 公開されたローカル用パッケージでは128K |
| 32GB VRAM向けの推奨ビルド | AD-IQ4_XS + ビジョンプロジェクター + DFlash、読み込み時は約24.6GB |
| 32GB共有メモリ向けの推奨ビルド | AD-IQ4_XS + ビジョンプロジェクター、約19.9GB |
| 生成速度の実測値 | RTX 5090でDFlashを使用し、コンテキスト長16Kで71.8トークン/秒 |
| 入力 | テキストと画像 |
| ツール使用 | 関数呼び出しと複数ステップのエージェントワークフロー |
| 推論 | システムプロンプトでlow、medium、high、xhighを指定 |
| 利用条件 | Apache License 2.0 |
32GBのGPUでは、Atomic Chatの16.0GBのAD-IQ4_XSビルドを、3.9GBのビジョンプロジェクターと5.1GBのDFlashドラフターと組み合わせて使ってください。Atomic ChatがRTX 5090で測定したところ、全構成で約24.6GBでした。
統合メモリ32GBのコンピューターでは、同じAD-IQ4_XSモデルとビジョンプロジェクターを使い、DFlashは含めないでください。これにより、コンテキストと実行環境のメモリを除いた基本的なマルチモーダル構成が約19.9GBに減り、macOSやWindows用にかなり多くの余裕が残ります。
DFlashが主に影響するのは速度です。Atomic Chatの測定では、ビジョンエンコーダーを組み合わせたモデルは毎秒39.6トークンで、投機的デコーディング用ドラフターを有効にすると毎秒71.8トークンに上昇しました。
Muse Glimmer 30Bのベンチマーク
| ベンチマーク | スコア |
|---|---|
| GPQA Diamond | 83.5 |
| AIME 2026 | 94.7 |
| SWE-bench Verified | 76.0 |
| SWE-bench Pro | 51.2 |
Muse Glimmer 30Bの長所
- ローカルの自律型エージェント向けに特化して作られた最近のモデル
- スクリーンショット、グラフ、文書の理解に標準対応
- 一般消費者向けハードウェアで動くモデルとして、コーディングと推論のスコアが高い
- モデル全体、ビジョンエンコーダー、投機的デコーディング用ドラフターが、すべて32GBのVRAMに収まる
- DFlashは、検証済みの出力を変えずに生成を大幅に高速化できる
- 制約の少ないApacheライセンス
Muse Glimmer 30Bの短所
- 最速のマルチモーダル構成には3つのファイルが必要
- Muse Glimmerに対応した、ごく新しいllama.cppビルドが必要
- 29.6GBのQ8テキストモデルでは、画像処理用に実用的な空き容量が残らない
- デフォルトの推論の深さが高く、短いリクエストでも出力トークンの上限をすべて使い切ることがある
Muse Glimmer 30Bを選ぶ場面:スクリーンショットを確認し、グラフや文書を読む必要があるオフラインエージェントが必要な場合。
GLM-4.7-Flash 30B-A3B
GLM-4.7-Flashは、推論、コーディング、ブラウジング、複数ターンにわたるツール使用向けの30B-A3B MoEモデルです。生成するトークンごとに、パラメータのうち約3Bを使用します。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | Z.ai / GLMチーム |
| パラメータ数 | 格納されるのは約30B、各トークンで選ばれるのは3B |
| アーキテクチャ | ルーティング対象のエキスパートが64あり、トークンごとに4つが有効になるMoE |
| 層数 | 47 |
| 標準のコンテキスト長 | 202,752トークン |
| 32GB VRAM向けの推奨ビルド | Q6_K, 24.83GB |
| 32GB共有メモリ向けの推奨ビルド | Q5_K_M, 21.57GB |
| 入力 | テキスト |
| 思考 | 標準モードと思考保持モード |
| ツール使用 | 関数呼び出しとエージェント型ワークフロー |
| ライセンス | MIT |
32GBの専用GPUでは、bartowski/zai-org_GLM-4.7-Flash-GGUFの24.8GBのQ6_Kビルドを使ってください。32GBに収まり、コンテキストと実行環境によるメモリ確保のために数GBを残せます。
共有メモリ32GBのコンピューターでは、Q5_K_Mが21.6GBを使用します。OS、コンテキスト、ほかのアプリケーションによるメモリ使用量を差し引く前の時点で、約10GBが残ります。Q4_K_Mビルドは18.5GBです。
GLM-4.7-Flashは、長時間のエージェントタスクで、ターンをまたいで思考トークンを保持できます。そのため、後のターンから、同じタスクの前の段階で生成された推論を参照できます。これらのトークンもコンテキストウィンドウに残るため、推論の過程が長くなるとコンテキスト使用量が増えます。通常のチャットや短いタスクに使う場合は、思考を無効化または制限することで、その追加コンテキストを引き継がずに済みます。
GLM-4.7-Flashのベンチマーク
| ベンチマーク | スコア |
|---|---|
| AIME 2025 | 91.6 |
| GPQA | 75.2 |
| LiveCodeBench v6 | 64.0 |
| HLE | 14.4 |
| SWE-bench Verified | 59.2 |
| Tau2-Bench | 79.5 |
| BrowseComp | 42.8 |
GLM-4.7-Flashの長所
- 有効なパラメータ数に対して、推論とツールの性能が高い
- Q5_K_Mなら総メモリ容量32GBでも実用的な余裕が残る
- MoEの計算量は、統合メモリやCPUへの依存度が高いシステムでも実用的
- 思考の保持が複数ターンにわたるエージェント処理に役立つ
- MITライセンス
GLM-4.7-Flashの短所
- テキスト専用
- 32GBのコンピューターで202Kのコンテキストをすべて使うのは現実的ではない
- 推論とツール呼び出しを正しく解析する必要がある
- 思考を保持すると、使用中のコンテキストが急速に増えることがある
- アーキテクチャを正しくサポートするために、新しい実行環境のビルドが必要になる場合がある
GLM-4.7-Flashを選ぶ場面:デンスモデルの計算コストをかけずに、推論、コーディング、複数ターンにわたるツール使用を行いたい場合。
Gemma 4 31B
Gemma 4 31Bは、Googleのパラメータ数30.7Bのデンス型マルチモーダルモデルです。60層で構成され、1,024トークンのスライディングウィンドウアテンションとグローバルアテンションを交互に使用します。MoEモデルとは異なり、生成時にすべてのパラメータを使用します。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | Google DeepMind |
| パラメータ数 | 30.7B |
| アーキテクチャ | スライディングウィンドウアテンションとグローバルアテンションを組み合わせたデンス型デコーダー |
| 層数 | 60 |
| 学習時の最大コンテキスト長 | 256Kトークン |
| ローカルアテンションの範囲 | グローバルアテンション層の間では1,024トークン |
| 32GB VRAM向けの推奨ビルド | Q6_K, 25.2GB |
| 32GB共有メモリ向けの推奨ビルド | Q5_K_M, 21.8GB |
| 入力 | テキストと画像 |
| ビジョンプロジェクター | Atomic ChatのGGUFリポジトリに同梱 |
| 利用条件 | Apache License 2.0 |
- 32GBの専用GPUでは、AtomicChat/gemma-4-31B-it-GGUFの25.2GBの
Q6_Kビルドを使ってください。 - 統合メモリ32GBのコンピューターでは、21.8GBの
Q5_K_Mを使ってください。
GGUFリリースには独立したビジョンプロジェクターが含まれているため、テキストだけでなく画像や文書も使用できます。
Gemma 4 31Bのベンチマーク
| ベンチマーク | スコア |
|---|---|
| MMLU-Pro | 85.2 |
| GPQA | 84.3 |
| AIME 2026 | 89.2 |
| LiveCodeBench v6 | 80.0 |
| SWE-bench Verified | 52.0 |
| Terminal-Bench 2.0 | 42.9 |
| MMMU | 80.4 |
| MMMU-Pro | 76.9 |
Gemma 4 31Bの長所
- デンスモデルとして優れた推論性能と知識性能
- 画像と文書の理解に標準対応
- Q5_K_Mは32GBの統合メモリに収まり、実用的な余裕が残る
- 元の重みから重要度行列を用いて作成したGGUF
- 制約の少ないApacheライセンス
Gemma 4 31Bの短所
- トークンごとに30.7Bすべてのパラメータが有効になる
- CPUやメモリ帯域幅が低い統合メモリシステムでは、有効なパラメータ数が3BのMoEモデルより遅い
- マルチモーダル入力とビジョンプロジェクターが追加のメモリを消費する
- 適切なGemma 4のJinjaテンプレートが必要
- このメモリ容量では、公称256Kのコンテキストウィンドウを実用的に使い切ることはできない
Gemma 4 31Bを選ぶ場面:デンスモデルを好む場合や、スクリーンショット、図、文書を日常的に扱う場合。
Devstral Small 2 24B
Devstral Small 2 24Bは、ソフトウェアエンジニアリング用エージェントに向けた、Mistral AIのパラメータ数24Bのモデルです。Mistral Small 3.1をベースに、リポジトリ全体を扱う作業向けに学習されています。
| モデルの基本情報 | 値 |
|---|---|
| 開発元 | Mistral AI |
| パラメータ数 | 24B |
| アーキテクチャ | scalable-softmaxアテンションを備えたデンス型のMistral 3モデル |
| 標準のコンテキスト長 | 262,144トークン |
| 32GB VRAM向けの推奨ビルド | Q8_0, 25.06GB |
| 32GB共有メモリ向けの推奨ビルド | Q6_K, 19.35GB |
| 入力 | テキストと画像 |
| ツール使用 | Mistralの関数呼び出しとコーディングエージェント用の実行基盤 |
| 利用条件 | Apache License 2.0 |
この言語モデルは40層で構成され、32のアテンションヘッドと8つのKVヘッドを備えています。Devstral Small 2にはビジョンエンコーダーも追加されており、エージェントがソースコードとあわせてスクリーンショットなどの視覚入力を確認できます。
主な用途は、モデルがツールにアクセスする必要のある、長時間にわたるソフトウェア開発作業です。Mistralは自社のVibe CLIでこのモデルをサポートし、互換性のあるエージェント実行基盤としてCline、Kilo Code、Claude Code、OpenHands、SWE-Agentなどを挙げています。
Mistralは、RTX 4090を1枚搭載した環境、またはメモリ32GBのMacを明確な対象としています。32GBのGPUがある場合は、bartowski/mistralai_Devstral-Small-2-24B-Instruct-2512-GGUFの25.06GBのQ8_0ビルドを使ってください。共有メモリ32GBのコンピューターでは、19.35GBのQ6_Kを使ってください。
Devstral Small 2のベンチマーク
| ベンチマーク | スコア |
|---|---|
| SWE-bench Verified | 68.0 |
| SWE-bench Multilingual | 55.7 |
| Terminal-Bench 2 | 22.5 |
Devstral Small 2の長所
- リポジトリ全体を対象とするソフトウェアエンジニアリングに特化して作られている
- 32GBのMacと一般消費者向けGPU1枚の構成を公式に対象としている
- Q6_Kなら、IDEと実用的な量のリポジトリのコンテキストに十分なメモリが残る
- ツールと画像入力に対応
- 制約の少ないApacheライセンス
Devstral Small 2の短所
- 2026年8月の最新の汎用モデルより古い
- 調査、文章作成、幅広いエージェントタスクへの汎用性が低い
- 24Bのデンスモデルの推論は、有効なパラメータ数が3BのMoEより遅くなることがある
- 最良の結果を得るには、適切なコーディングエージェントの実行基盤とシステムプロンプトが必要
Devstral Small 2を選ぶ場面:ローカル環境でのソフトウェアエンジニアリングに。
よくある質問
32GBのVRAMに最適なLLMはどれですか?
Q5_K_MのQwen 3.6 35B-A3Bが、32GBのVRAMを搭載したシステムで動かすのに最適なローカルLLMです。24.7GBなのでメモリに完全に収まり、実行環境のバッファと実用的なコンテキストに十分な余裕が残ります。
LLMには32GBのRAMで十分ですか?
はい。32GBのVRAMまたは統合メモリがあれば、高性能なローカルLLMを動かすのに十分以上です。Q4またはQ5の24B~35Bモデルは、重みファイルが19~22GB程度に収まれば快適に動かせます。
AIには32GBのRAMが必要ですか?
いいえ。小型のローカルモデルは、8GBや16GBでも、特にチャット、要約、軽いコーディングに役立ちます。32GBに増やすと、より高性能な24B~35Bモデルを実用的に使えるようになり、コンテキスト、ツール、画像処理コンポーネント、ほかのアプリケーション用にも、より多くの余裕が生まれます。
32GBのメモリで70Bモデルを動かせますか?
理論上は動かせますが、実用にはなりません。70Bのデンスモデルには、極端に低ビットな量子化、部分的なCPUオフロード、またはその両方が必要です。その場合、コンテキスト用の余裕はほとんど残らず、メモリに完全に収まる30B~35Bモデルと比べて、耐え難いほど遅くなります。
32GBではどの量子化形式を使うべきですか?
32GBのVRAMでは、30B~35BモデルをQ6~Q5で動かせ、24BモデルならQ8でも動かせます。32GBの共有メモリでは、Q5~Q4を動かせます。
結論
この記事では、32GBのシステムで動かす2026年のおすすめLLMを紹介しました。うれしいことに、このクラスのハードウェアで動く現代のAIモデルは、わずか数年前のプロプライエタリな最上位モデルと競えます。最後に、要点を簡単にまとめます。
重要なポイント:
- Q5_K_MまたはQ4のQwen 3.6 35B-A3Bが、32GBのVRAMで動かすのに最適なAIモデルです。
- コンピューターの総メモリ容量または統合メモリが32GBなら、Q5_K_MのGLM-4.7-Flashが動かすのに最適なLLMです。
- 一般に、このクラスのハードウェアでは、現代の24B~35Bモデルを動かせます。
- コンピュータービジョンが必要なら、Muse GlimmerとGemma 4を検討してください。
- 大規模なコードベースで作業する予定なら、Devstral Small 2またはNemotron 3.5 Lightningを試してください。

