クラウドAIを使っていて、こうした問題に直面したことがあるのではないでしょうか。よくあるのは、接続が不安定でChatGPTが使えなくなるケースです。あるいは、会社がサードパーティーのAIツールを禁止している場合もあります。機密情報を貼り付けると、そのデータがどこかの企業のクラウドに送られてしまうからです。また、今月のAPI料金が$400に達したのに、何に使ったのかよくわからないこともあるかもしれません。これらはクラウドAIの利用を断念する理由の一部であり、依存するほど問題が重なる可能性があります。
一方、自分のハードウェアだけで動作するため「オフラインAI」と呼べるローカルLLMもあります。API呼び出しもサブスクリプションも不要で、マシンの外に何も送られません。1年前は、オフラインLLMを動かしても出力が遅く、品質も平凡でした。今では、RAM 16GBのMacBook Air M4でGemma 4が毎秒25トークンで動作し、デモだけでなく実務にも十分な速度になっています。
AIをオフラインで実行する理由
プライバシー
従業員がチャットボットに貼り付ける内容の多くは機密情報です。ソースコード、契約書、顧客記録、社内の財務情報が、標準の動作として第三者に送られています。Samsungは2023年、この問題を実際の被害から学びました。エンジニアが半導体のソースコードや社内会議のメモを1か月足らずの間に何度もChatGPTに貼り付けたため、同社はその後、このツールを全面的に禁止しました。他の多くの組織も同様の制限を導入しており、現在ではかなりの割合の組織が生成AIを全面的に禁止するか、従業員が入力できるデータを厳しく管理しています。
ツール自体から情報が漏れることもあります。2026年2月、OpenAIは、悪意あるプロンプト1つでユーザーの会話履歴やアップロード済みファイルを気づかれずに外部へ送信できるChatGPTの脆弱性を修正しました。企業や組織もこれに対応しています。2026年4月には民主党全国委員会が職員によるChatGPTとClaudeの使用を禁止し、Bank of AmericaやGoldman Sachsを含む大手銀行も、社内開発のツールを優先して一般公開のAIツールを制限しています。
ローカルモデルなら、その懸念はなくなります。マシンの外に何も送られないため、プロバイダーのポリシーを解釈したり、再委託先の連鎖を把握したり、学習利用のオプトアウトについて交渉したりする必要がありません。
稼働時間
2026年4月6日、AnthropicのClaudeで数時間に及ぶ大規模な障害が発生し、世界中の企業の業務フローに支障が出ました。続いて4月15日にも、エラーの発生率が高まる時間帯がありました。OpenAIも4月20日に同様の問題に見舞われ、ChatGPT、Codex、APIプラットフォームで同時に一部障害が発生しました。そのため、「アプリが使えなくなったらAPIに切り替える」という対策に頼っていた人は、1回の障害で両方を失いました。代替策としてプロバイダーを切り替える方法も、両社で障害が続く週が来るまでしか役に立ちません。そして、まさにそれが起きたのです。
自分のハードウェアで動くモデルは、こうした障害の影響を受けません。これは機内、セキュリティ管理の厳しい施設内、外部API呼び出しを遮断する社内ネットワークで重要になります。
コストと速度
GPT‑5.4の標準API料金は、入力100万トークンあたり約$2.50、出力100万トークンあたり$15です。Claude Sonnet 4.6も同程度で、入力100万トークンあたり約$3、出力100万トークンあたり$15です。小規模なチームでも、要約やコードレビューのパイプラインで月に数億トークンを処理すれば、月額料金が数百ドル台の半ばに達するのは珍しくありません。この課金は止まることなく続きます。
すでに所有しているMacで同じ処理を行うなら、最初のモデルダウンロード以外に費用はかかりません。ここでは、安いからといって遅いわけではありません。MacBook Pro M5 Maxの最近のベンチマークでは、Qwen3.6 27Bのローカル推論が毎秒60トークンを余裕で超えています。これは、本来なら料金を払って使うクラウドAPIと同程度です。価格のために速度を犠牲にする必要はありません。
ローカルLLMの実行に必要なもの
ハードウェア
macOSでは、16GBのユニファイドメモリを搭載したApple Siliconが、ローカルモデルを快適に使える目安です。16GBのMacBook Air M4なら、Gemma 4を毎秒約25トークンで実行できます。文章作成、コーディング、文書に関するQ&Aで頻繁に待たされず、作業を切り替えても思考の流れを失わずに済む速度です。
8GBでもLlama 3.1 8BやMistral 7Bなどの7~8Bモデルは使えますが、上限に近い状態での運用になります。プロンプトが長くなると速度が落ち、他のアプリを開いていると余力はほとんどありません。主にローカルAIのためにハードウェアを購入するなら、16GBを最低ラインと考えるほうが現実的です。
上位構成では、RAM 64GBのMacBook Pro M5 MaxでMTPを有効にすると、Qwen3.6 27Bを毎秒100トークン超の速度で動かせます。ほとんどの人にこの構成は必要ありませんが、現在の性能の上限がどのあたりにあるかの目安になります。
Windowsでは、CPUよりもGPUの影響が大きくなります。RTX 4060以上と少なくとも8~12GBのVRAMを搭載したノートPCやデスクトップPCなら、13Bクラスのモデルを十分な速度で快適に実行できます。24GBのグラフィックスカード(RTX 4090など)があれば、27B以上のモデルも使えるようになります。内蔵グラフィックスとシステムRAM 8GBだけの場合は、エントリークラスのMacと同程度です。Q4量子化の7Bモデルは動きますが、メモリの余裕が少なく、長く複雑なプロンプトではすぐに遅くなったり不安定になったりします。
Linuxでは、ハードウェアの条件はWindowsとほぼ同じですが、NVIDIA GPUのドライバーサポートは通常やや良好で、Ollama、LM Studio、vLLMなどのツールも先に提供される傾向があります。VRAM 8~12GBのミドルレンジRTXカードで13Bモデルには十分です。20~24GBのカードなら、コンテキストとKVキャッシュ用の余裕を確保しながら27B以上のモデルを使えます。CPUだけで実行する場合は、同じくRAM 16GBが目安です。7~8Bモデルなら問題ありませんが、それより大きいモデルはすぐに厳しくなります。
| デバイス | 代表的なモデル | おおよその速度(TPS) | 適した用途 |
|---|---|---|---|
| RAM 8GBのMac | Llama 3.1 8B、Mistral 7B | 使用可能ですが、速度は低め | ローカルモデルのお試し、短いプロンプト。余力が少なく、コンテキストが長くなると速度が低下 |
| MacBook Air M4(RAM 16GB) | Gemma 4(16GBに適したバリアント) | 約25 TPS | 頻繁な待ち時間や作業の切り替えを伴わない文章作成、コーディング、文書に関するQ&A |
| MacBook Pro M5 Max(RAM 64GB) | Qwen3.6 27B | 100+ TPS(MTP使用時) | 負荷の高いモデル、処理量の多いパイプライン、現在の性能上限の実用的な把握 |
| WindowsノートPC(RTX 4060、RAM 16GB) | Llama 3.1 13B、Qwen3.6 14B | 数十TPS(GPU性能が制約) | より大きなモデルを使った日常的なローカル利用。コーディング、チャット、文書作業の組み合わせ |
| WindowsデスクトップPC(RTX 4090、RAM 32GB) | Qwen3.6 27B、Gemma 4 31B | 高いTPS(数十~100超) | 大規模モデル、長いコンテキスト、実験、小規模チームの業務フロー |
| Linuxマシン(RTX 4070/4080、RAM 32GB) | Qwen3.6 27B、DeepSeek Coder V2 | WindowsのGPU環境と同程度 | 安定した長時間の処理、充実したGPUサポートを活用する開発やセルフホストのサービス |
Atomic ChatはmacOS、Windows、Linuxで動作するため、基本的なセットアップはどのプラットフォームでも似ています。Windowsでは、ディスクリートNVIDIA GPU(RTX 4060以上など)を搭載したマシンでCUDAを使って推論を高速化できます。実際の速度はVRAMとモデルの具体的なサイズによって変わります。
代表的なモデルをQ4で量子化した場合のGGUF(ローカルモデルの標準ファイル形式)ファイルサイズは次のとおりです。
- Llama 3.1 8B Q4_K_M:約4.7GB
- Mistral 7B Q4_K_M:約4.1GB
- Qwen3.6 27B Q4_K_M:約16.8GB
- Gemma 4 31B Q4_K_M:約19GB
オフラインAIをセットアップする手順
方法1:Ollama
Ollamaは、ローカルLLMをダウンロード、管理し、REST API経由で提供するコマンドラインツールです。ローカルモデルをスクリプトから操作したり、別のアプリケーションに接続したりしたい開発者向けに作られています。そうした用途でなければ、方法3までスクロールしてください。ターミナルを使わず、簡単な操作でローカル実行する方法を紹介しています。
macOSとLinux(ターミナルでのインストール)
このスクリプトは最新版をダウンロードし、ollamaバイナリをインストールして、バックグラウンドサービスを起動します。macOSでは、ウェブサイトからGUIアプリを使ってインストールすることもできます。一度起動すると、ターミナルでollama CLIが使えるようになります。
Windows:
Ollamaのウェブサイトからインストーラーをダウンロードして実行します。インストール後、Ollamaはバックグラウンドサービスを自動的に実行し、PowerShell / コマンドプロンプトにollamaコマンドを追加します。
CLIが使えることを確認するには、次を実行します。
最初のモデルを実行する
これにより、モデル(約4.7GB)がダウンロードされ、 localhost:11434でサーバーが起動し、ターミナルでチャットが開きます。このプロンプトに直接入力してEnterを押すと、応答が返ります。 /bye と入力すると、セッションを終了できます。
ローカルAPIを確認する
Ollamaは、プログラムから利用できるシンプルなHTTP APIを公開します。実際に出力を生成する最小限のヘルスチェックは、次のようになります。
すべてが動作していれば、responseフィールドを含むJSONレスポンスが返ります。
モデルを切り替える
注意してください。ollama run ...を実行するたびに新しいセッションが始まります。セッション間で記憶を引き継ぐ機能は組み込まれていません。ターミナルを閉じるか/bye を押すと、コンテキストは破棄されます。
また、Ollamaを安全に保つため、localhostでのみ動作させるか、その手前に認証を行うプロキシを配置することを忘れないでください。
→ セキュリティチェックリストの全項目はこちら
方法2、開発者向け:Hugging Face + Transformers
カスタムサンプリング、ファインチューニング済みモデル、バッチ処理、既存のコードベースへの統合など、推論時の制御が必要な方向けです。
セットアップの負担は大きくなります。Python環境と適切なCUDAまたはMPSドライバーが必要で、少なくとも一度はバージョンの競合で半日を費やすことになるでしょう。単にチャット画面を使いたいだけなら、この方法は飛ばしてください。モデルを土台に何かを開発する人に向けた方法です。
方法3:MTPによる高速化を備えたAtomic Chat
きちんとしたインターフェースがあり、ごく簡単に始められる別の方法を探しているなら、Atomic Chatがあります。Atomic Chatは、TurboQuant量子化とMulti-Token Prediction(MTP)を備えた、パッチ適用版のllama.cppを実行します。OllamaにGUIを付け足したものではなく、別のエンジンであり、その違いは数値に表れています。MTPはトークンを1つずつ生成する代わりに、数トークン先までの候補を生成し、1回の処理で検証します。64GBのMacBook Pro M5 Maxでは、次の結果が得られています。
- Qwen3.6 27B:MTPを有効にすると毎秒51トークンから117トークンに向上(+129.4%)
- Qwen3.6 35B-A3B(MoE):毎秒218トークンから267トークンに向上(+22.5%)
- Gemma 4 26B:ドラフト受け入れ率が約90%で、速度は+40%
MoEモデルの向上幅が小さいこと(129.4%に対して22.5%)には理由があります。MoEはトークンごとに35Bすべてではなく、約3Bのアクティブなパラメータだけを読み込むため、もともと高速です。密な27Bモデルには、より大きな改善の余地がありました。ドラフト受け入れ率は80~90%で、精度の低下はゼロ、追加で必要なVRAMは約1GBです。
16GBのMacに絞って、実行する価値のあるモデルとそうでないモデルを比較したい場合は、こちらのガイドで詳しく解説しています。
Atomic Chatは推論エンジンに加えて、会話履歴、ターミナルを操作せずに行えるモデル切り替え、MCPサーバーのサポート、他のツールを接続するためのローカルAPIサーバー、企業のネットワーク環境向けのHTTPSプロキシを備えています。同じインターフェースから、1,000を超えるモデルをローカルまたはクラウド経由で利用できます。
最先端のモデルが必要なときは、同じインターフェースからOpenAI、Anthropic、Gemini、Groq、Mistral、xAI、MiniMax、OpenRouter、Hugging Faceなどのクラウドプロバイダーを利用できます。ローカルモデルは引き続きローカルで動作し、クラウドは自分の判断で使う代替手段として利用できます。
→ Atomic ChatでローカルLLMを実行する(macOs)
→ Atomic ChatでローカルLLMを実行する(Windows)
実行する価値のあるローカルAIモデル:ハードウェアと用途
モデル選びでは、ベンチマークの順位よりも、ハードウェアと用途が重要です。
| 用途 | 推奨モデル | RAM / ハードウェアに関する注意点 | 強み | 制約 |
|---|---|---|---|---|
| 汎用的な推論と文章作成(ハイエンド) | Qwen3.6 27B、Gemma 4 31B | MacBook Pro M5 Max、RAM 32GB以上 | Qwen:内容が豊かで創造的、視覚表現も充実。Gemma:より整理されたロジック、1回の指示でより速く回答 | 31BのGemmaには約20GB以上のRAMが必要。32GB以上のマシン向け |
| 汎用的な推論と文章作成(一般的な構成) | Gemma 4(16GBに適した軽量バリアント) | MacBook Air M4、RAM 16GB | 毎秒約25トークン。日常業務に適した品質と速度のバランス | より重い31Bバリアントは不向き。メモリの余裕が乏しくなる |
| 自由度の高い長文生成 | Qwen3.6 27B | 快適に使うにはRAM 32GB以上が望ましい | より深く、幅広い内容を生成。創作系のタスクに強い | 回答ごとの所要時間はやや長め。簡潔さを求める場合、必要以上に生成することがある |
| 1回の指示で完結するタスク、「答えだけが欲しい」場合 | Gemma 4 31B | RAM 32GB以上を推奨 | より整理された、直接的な解決策を1回で生成 | RAM使用量が多い。気軽な利用には過剰 |
| コーディング(全般) | Qwen3.6 27B、Qwen3.6 35B | RAM 32GB以上(または高性能GPU) | 複雑なプロンプト、物理演算を使ったゲーム、アニメーション付きHTML/Canvasに対応 | 負荷の高いモデル。8~16GBでは妥協が必要で、理想的ではない |
| コーディング(VRAMに制約がある環境 / GPU) | DeepSeek Coder V2 16B MoE | VRAM約16GB | メモリ使用量を抑えながら、複数ファイルにまたがるコーディングタスクに強い | コードに特化。一般的なチャット向けでも、汎用モデルでもない |
| RAM 8GBのノートPC | Llama 3.1 8B、Mistral 7B(Q4_K_M) | RAM 8GB(Mac/PC) | 下書き、Q&A、日常的なタスク。限られたメモリ容量に収まる | 多段階の推論や、大きなコンテキストを使う作業では性能が急速に低下 |
| 長い文書 / 拡張されたコンテキスト | Gemma 4 31B(コンテキスト長262K) | RAM 32GB以上。コンテキスト長を最大まで使うと、KVキャッシュで追加のメモリ使用量が>20GBになる場合がある | 非常に長い文書やスレッドを読み込み、その内容に基づいて推論できる | 重みの容量が大きい。慎重なメモリ計画が必要 |
汎用的な推論と文章作成向けのローカルLLMでは、Qwen3.6 27BとGemma 4が特に優れており、どちらを選ぶべきかは用途によって変わります。
MacBook Pro M5 Max上のAtomic Chatで行った直接対決のテスト(1回のプロンプトでPac-Manゲームを作成)では、Qwenは毎秒32トークンの速度で18分間に33,946トークンを生成し、より創造的で視覚表現の豊かな出力を作りました。Gemma 4 31Bは毎秒27トークンの速度で4分未満に6,209トークンを生成し、より整理されたゲームロジックを作りました。
/1 @atomic_chat_hq内で行われたローカルLLMのゲーム開発対決で、Gemma 4 31BがQwen 3.6 27Bに圧勝しました(プロンプトは下記)
— Chubby♨️ (@kimmonismus) 2026年4月30日
デバイス:MacBook Pro M5 Max、RAM 64GB
結果:
Qwen 3.6 27B:毎秒32トークン · 18分04秒 · 33,946トークン
Gemma 4 31B:毎秒27トークン · 3分51秒 · 6,209トークン
では、何が… pic.twitter.com/wqyWyjXX2u
この対決ではGemmaが勝ちましたが、総合的に優れたモデルだからではありません。Gemmaが6,000トークンで仕事を終えた一方、Qwenのより創造的な34,000トークンは、タスクに必要な範囲を超えていました。どちらが「優れている」かは、何をさせたいかで決まります。
1回の指示で完結するタスクで、使える答えをすぐに得たいなら、最適なローカルLLMはGemmaです。
自由度の高い生成では、Qwenのほうが深みがあります。16GBのMacBook Air M4では、軽量なGemma 4バリアントが毎秒25トークンで動作します。これは一般的なハードウェアでの現実的な速度です。31B版にはおよそ20GBのRAMが必要なため、32GB以上のマシン向けです。
コーディングに最適なLLMは、27Bと35BのQwen3.6です。生成を得意としています。ユーザーは、物理演算を使ったゲームやアニメーション付きHTML/Canvasの作成など、複雑なプロンプトを両モデルに与え、ローカルで問題なく実行しています。DeepSeek Coder V2も有力な選択肢です。VRAM 16GBで動作する16B MoEバリアントがあり、複数ファイルにまたがるタスクでも十分な性能を発揮します。
RAM 8GBでは、Q4_K_MのLlama 3.1 8BまたはMistral 7Bを使ってください。これらのローカルLLMは、下書き、Q&A、日常的なタスクの大半に十分対応できます。大量のコンテキストを保持する必要がある多段階の推論では対応しきれなくなるため、業務フローに組み込む前に把握しておくべきです。
長い文書には、長いコンテキストに対応したモデルが必要です。Gemma 4 31Bは262Kのコンテキストウィンドウに対応しています。ただし、コンテキスト長を最大まで使うと、モデルの重みに加えてKVキャッシュだけで20GBを超えるメモリを消費する場合があるため、それを踏まえてメモリを計画してください。
オフラインAIが適さない場合
RAM 8GB未満でローカル実行を考えているなら、事情は異なります。 Q4量子化の7Bモデルはおよそ5~6GBを使用し、他の用途に使える余裕はほとんど残りません。動作はしますが、長いプロンプトでは、ストレスを感じるほど遅くなる可能性があります。
複雑な多段階の分析は、7B~13Bモデルが対応しきれなくなり始める領域です。 80ページの契約書を読んで、すべての補償条項を見つけ、標準的な条件と比較し、通常と異なる点を指摘するよう求めると、文脈を見失い、要点を見落とし、それでも自信のある口調で答えます。27B以上のモデルはこうした作業をはるかにうまく処理しますが、相応のハードウェアが必要です。
よくある質問
オフラインAIはChatGPTと同じくらい優れていますか?
日常業務であれば、そうです。27BのローカルLLM(Qwen3.6やGemma 4など)は、文章作成、コーディング、要約、文書に関するQ&Aを、ほとんどの人がクラウドモデルと区別できない水準で処理します。差が出るのは、長い多段階の推論、幅広い世界知識、密度の高い分析作業といった、特に難しいタスクです。現実的には、日常利用の大半をローカルでカバーし、本当に難しい10%ではクラウドに優位性があると考えるのが妥当です。
機内でローカルLLMを実行できますか?
はい。機内で使えることは、ローカルLLMを導入する明確な理由の1つです。モデルファイルをダウンロードした後は、インターネットを必要とするものはありません。モデルはディスクから読み込まれ、CPUとGPUで動作するため、機内でも、セキュリティ管理の厳しい施設でも、外部APIを遮断するネットワークでも、動作は変わりません。
どのオフラインLLMから始めればよいですか?
初めてのオフラインLLMは、ハードウェアに合わせて選んでください。8GBなら、Q4_K_MのLlama 3.1 8BまたはMistral 7Bから始めましょう。16GBなら、Gemma 4のバリアントか8~12BクラスのQwen3.6で、ほとんどの作業に対応できます。32GB以上なら、Qwen3.6 27BとGemma 4 31Bが、実行できる汎用ローカルAIモデルの中で最も強力です。どの容量帯でも、最初にダウンロードする量子化形式はQ4_K_Mです。
ローカルLLMの実行には、どれくらいのRAMが必要ですか?
Apple Siliconでは、ユニファイドメモリ16GBが快適に使える目安で、高性能な汎用モデルを実行できます。8GBでもLlama 3.1 8BやMistral 7Bなどの7Bモデルは動作しますが、余裕は少なくなります。27Bクラスのモデルには32GBが望ましく、特にGemma 4 31Bでは、重みだけで約20GBの空きメモリが必要です。実際には32GB以上のマシンが必要になります。
使い始めるには
ローカルAIが自分の業務フローに合うかどうかは、お試しのプロンプトではなく、実際の仕事で20分使えばわかります。ターミナルも、手をかけて管理するセキュリティ設定も不要で、最も手早く試せるのがAtomic Chatです。ダウンロードし、内蔵ライブラリからRAM容量に合うモデルを選んで、チャットを始めてください。MTPによる高速化を備えたパッチ適用版のllama.cppエンジンで動作するため、速度はクラウド並みで、ネットワークから到達可能なAPIを保護する必要もありません。マシンの外に何も送られず、最先端のモデルを使いたい日には、クラウドプロバイダーもワンクリックで利用できます。
→ Atomic Chatをダウンロードして、普段ならクラウドに送る仕事で試してみてください。

