このガイドでは、お使いのコンピューターやMacでLLMをローカル実行する方法とモデルの選び方を解説し、わずか数ステップでAIを無料でローカル実行できるように、セットアップ手順を順番に紹介します。コマンドラインに触れずにAIをローカルで動かす方法を知りたい方に向けたガイドです。それでは始めましょう。
要点
LLMをローカルで実行するには、Atomic ChatのようなローカルAIアプリをインストールし、アプリ内のモデルブラウザーからHugging Face上のモデルの重みをハードドライブにダウンロードするだけです。これですぐにチャットを始められます。以下の動画で、セットアップの全手順を紹介しています。
プライバシーを保ちながら、オフラインで、しかも無料でAIを動かしたかったのに、ターミナルやコードが障壁になっていた方に向けた内容です。
— Alok (@analogalok) 2026年6月30日
何にでもChatGPTを使うのはやめましょう。同じ品質のモデルを、自分のノートパソコンで動かしましょう。ターミナルコマンドは一切不要で、ずっと無料です。
たった今、全編を録画しました… pic.twitter.com/zE7CHCp9tD
ローカルAIを最大限に活用するには、いくつかのポイントを理解する必要があります。たとえば、お使いのシステムに合ったモデルの選び方です。そこで、この点に加え、使い始める際に役立つほかの情報も説明します。
LLMをローカルで実行するとは?
LLMをローカルで実行するとは、モデルの重み全体を自分のシステムにダウンロードし、企業のクラウドサーバーではなく、自分のハードウェア上で直接動かすことです。
- モデルをローカルで実行すると、AIがプロンプトを受け取り、回答を生成する推論の処理が、自分のGPUまたはCPU上で直接行われます。ただし、GPUの使用を強く推奨します。
- クラウドモデルとやり取りする場合、この処理は企業のサーバー上、たとえばOpenAIのデータベース内で行われます。そのため、自分の個人データがどのように扱われるか、会話がどのように記録されるかを自分で管理できません。
明確にすると、ローカルLLMとは、ダウンロード可能なファイルにまとめられたオープンウェイトモデルのことです。
Meta、DeepSeek、Mistralといった企業に加え、OpenAIも独自のオープンウェイトモデルを公開しています。
選べるオープンソースモデルは数百種類あり、特に人気のあるモデルの一部はこちらで確認できます。
この仕組みを内部で支えているのは2つの要素です。1つ目はモデルファイルそのもので、通常はGGUFと呼ばれる形式を使います。この形式ではモデルの重みを圧縮・量子化した状態で保存するため、数十億パラメータのモデルでも一般的なドライブに収まります。2つ目は推論エンジンで、重みを読み込み、テキスト生成のための計算を行うプログラムです。Atomic Chatのようなアプリは、エンジンとファイル管理をひとまとめにしているため、ユーザーが目にするのはチャット画面だけです。
量子化は、ローカルモデルを実用的にするための工夫です。モデル内の数値をフル精度から1つあたり4または5ビットに縮小することで、品質の低下をわずかに抑えつつ、ファイルサイズとメモリ使用量をおよそ4分の3削減します。
LLMをローカルで実行する理由
LLMをローカルで実行したいと考える理由は数多くあります。特に重要なのは次の点です。
データが自分のデバイス内にとどまります。ローカルモデルがプロンプトをサーバーに送信することはありません。これが最大の利点で、オフラインLLMではプライバシーが完全に守られます。一方、クラウドAIでは、企業が会話を記録し、そのデータをモデルの学習に使うことがよくあります。この慣行は、すでに個人データの漏えいにつながっています。
ローカルLLMはずっと無料です。重みがオープンソースであり、完全な利用権が付与されているため、サブスクリプション料金や買い切り料金を一切支払わず、利用上限もなく、モデルを正式に無料で利用できます。
ローカルLLMはオフラインでも動作します。おそらく最大の利点は、自分専用のチャットボットにいつでもアクセスできることです。通勤中、飛行機の中、利用しているインターネット回線が止まったときなど、作業が必要な場所ならどこでも使えます。
ローカルLLMなら、カスタマイズの可能性が無限に広がります。誰もが必要とするわけではありませんが、ローカルモデルならタスクに合った特定のモデルを選び、さらにファインチューニングを行って、自分の作業で可能な限り効率よく使えるようにできます。
どれも魅力的に聞こえますが、ローカルAIには制約もあるのでしょうか?
何にでも代償はあり、ローカルAIの場合はモデルの性能がその代償になります。クラウドサービスで普段使っているGPT 5.5やOpus 4.8のようなモデルは非常に重く、個人のハードウェアでは実行できません。
そのため、VRAMまたはユニファイドメモリが16 GBまたは32 GBの場合は、大幅に圧縮されたモデルか、より小さなモデルを選ぶ必要があり、フラッグシップモデルと同じ性能は得られません。
ハードウェアに合ったモデルの選び方は、記事の後半で説明します。
ローカルLLMでできること
ローカルLLMで、クラウドのLLMと同じことがすべてできるのか、気になるかもしれません。答えは「はい」です。特に、テキスト生成モデルについてはそう言えます。
ローカルLLMでは、次のようなことができます。
- オフラインでAIとチャットする。最もわかりやすい用途は、オフラインでのAIチャットです。gpt-ossのようなオープンモデルを使えば、アカウントもインターネットも不要で、実質的にChatGPTをローカルで動かせます。
- 文書やローカルデータを扱う。Atomic Chatを含む多くのローカルAIアプリはRAGに対応しており、モデルがハードドライブ上のファイルを読み、その内容に基づいて質問に答えられます。ローカルLLMならプライバシーを保てるだけでなく、最小限のセットアップで利用でき、モデルは必要に応じてハードドライブや専用フォルダーから必要なファイルを読み込めるため、毎回ファイルブラウザーを開く必要もありません。
- コーディングする。特に最新世代のローカルモデルは、コーディングを得意としています。詳しくは、コーディングに最適なローカルLLMのまとめをご覧ください。
- ローカルエージェントを動かす。ローカルモデルはローカルAPIを公開しており、モデルはこれを使ってスクリプトの実行、関数の呼び出し、Model Context Protocol(MCP)を介したツールへの接続ができます。
では、ローカルモデルにはどのようなことができないのでしょうか?
- 動画や高品質な画像の生成。これには非常に高性能なハードウェアが必要です
- また、画像、動画、音声ファイルなどのメディアを理解できるローカルモデルもありますが、すべてのモデルが対応しているわけではありません
LLMをローカルで実行するには、どのようなハードウェアが必要ですか?
LLMをローカルで実行するには、高性能なGPUと、モデルの重みを保存できる十分なディスク容量が必要です。ローカルモデルの実行に最適なハードウェアは、次のとおりです。
- NVIDIAまたはAMDのGPU:モデル全体がグラフィックスカードのVRAMに収まれば、CPU上で動かす場合より何倍も高速に動作します。
- Apple Silicon搭載Mac(M1以降):CPUとGPUがユニファイドメモリを共有するため、NVIDIA以外では最適な選択肢です。
- CPUのみ:CPUでもモデルを実行できますが、小さなモデルでも動作は遅くなります。
以下の表は、一般的なマシンと、そこで実行できるモデルの対応を示しています。
| お使いのマシン | 快適に動かせるモデルサイズ |
|---|---|
| ノートパソコン、GPUなし、RAM 8 GB | 約3Bまで |
| ノートパソコンまたは8 GB GPU、RAM 16 GB | 約8Bまで |
| 16 GB GPUまたは32 GB Mac | 約14Bまで |
| 24 GB GPUまたは64 GB Mac | 約32Bまで |
目安として、モデルのファイルサイズの約2倍の空きメモリを確保するとよいでしょう。つまり、5 GBのモデルを動かすには、コンテキストウィンドウとOSの使用分を考慮すると、約10 GBのVRAMまたはユニファイドメモリが必要です。
OSや起動中のアプリもすでにシステムリソースを使用しているため、16 GBのマシンでも、モデルに16 GBすべてを割り当てられるわけではない点を覚えておいてください。
ダウンロード用のディスク容量も必要で、小さなモデルなら約2 GB、大きなモデルなら40 GB以上が目安です。
量子化を理解する
大きなモデルをより動かしやすくする方法があります。それが量子化という考え方です。
量子化は、モデルの重みを構成する数値を保存する際の精度を下げます。その結果、ファイルが小さくなり、モデルのメモリ使用量も減ります。その代わり、品質がわずかに低下します。
基本的には、RAWファイルをjpegで圧縮するようなものです。
ほとんどのモデルには複数の量子化レベルがあり、通常はQ2からQ8までのラベルが付いています。数字が小さいほど、圧縮率が高くなります。
以下の表は、同じLlama 3.1 8Bモデルでも、量子化レベルによってサイズがどう変わるかを示しています。
| 量子化 | ファイルサイズ | 品質 |
|---|---|---|
| Q2_K | 約2.6 GB | 低品質:品質の低下が目立つ |
| Q4_K_M | 約4.6 GB | バランス型:標準としてよく選ばれる設定 |
| Q5_K_M | 約5.7 GB | 高品質 |
| Q8_0 | 約7.7 GB | ほぼ劣化なし |
| FP16(非量子化) | 約15 GB | 元の品質を維持 |
量子化によってファイルサイズが変わるため、モデルを実行できるハードウェアも変わります。
| Llama 3.1 8Bのバージョン | 必要なメモリ(約2倍) | 動作するハードウェア |
|---|---|---|
| Q2_K(約2.6 GB) | 約6 GB | GPUがなくても、ほとんどのノートパソコンで動作 |
| Q4_K_M(約4.6 GB) | 約10 GB | 8 GB GPUまたは16 GB Mac |
| Q8_0(約7.7 GB) | 約16 GB | 16 GB GPUまたは32 GB Mac |
| FP16(約15 GB) | 約30 GB | ハイエンドGPUまたは32 GB以上のMac |
一般的な目安として、量子化レベルはQ4を推奨します。性能への大きな影響を避けつつ、モデルを動かしやすくなる程度までファイルを圧縮できるためです。要するに、非常に高品質な非可逆圧縮の設定です。
さらに、Atomic Chatはモデルのダウンロード時に、お使いのマシンに合った量子化レベルを自動で選択するため、そのハードウェアで動かせる最適なバージョンを自動的に入手できます。
量子化はかなり複雑なテーマで、ここではその表面に触れただけです。さらに詳しく知りたい方は、形式や量子化が速度に与える影響をより詳しく解説したGGUFとMLXの比較ガイドをご覧ください。
ローカルモデルの選び方
ローカルモデルを選ぶ際には、次の2点を意識してください。
- サイズ
- 提供元
最も重要なのはサイズです。サイズについては、常に小さめを選ぶことを推奨しています。つまり、お使いのシステムで快適に動かせるだけの余裕が残るモデルを選ぶということです。
たとえば、メモリ16 GBのM Pro搭載MacBookなら、7〜8Bモデルから始めましょう。それでは遅すぎる場合、3Bモデルを試してみることもできます。
実際、AIを使う作業では試行を繰り返すことが重要で、その繰り返しを速く行えるほど、より多くの作業をこなせます。さらに、最新世代のモデルは、小さくても十分な能力を備えています。
モデルファミリーについて見ると、オープンウェイトモデルはさまざまな提供元から公開されており、それぞれに強みがあります。
- Llama(Meta)とQwen(Alibaba)は、チャットや一般的な用途に強い万能型です。
- DeepSeek R1は、数学とコーディング向けに開発された推論モデルです。実行するには、DeepSeekをローカルで実行する方法を手順ごとに解説したガイドをご覧ください。
- gpt-ossは、使い慣れたGPTらしさを備えたOpenAIのオープンウェイトモデルファミリーです。gpt-ossをローカルで実行する方法では、20B版と120B版を紹介しています。
まずは、お使いのハードウェアに合わせて、次のいずれかのモデルを推奨します。
| お使いのハードウェア | 推奨モデル |
|---|---|
| ノートパソコン、GPUなし、RAM 8 GB | Llama 3.2 3B |
| 8 GB GPUまたは16 GB Mac | Llama 3.1 8B |
| 16 GB GPUまたは32 GB Mac | Qwen 3 14B |
| 24 GB GPUまたは64 GB Mac | Qwen 3 32B |
全カタログは、Atomic Chatのモデルページで確認できます。
Atomic ChatでLLMをローカル実行する方法
LLMをローカルで実行する最も簡単な方法は、Hugging Faceの全カタログを閲覧し、モデルのダウンロードから利用開始まで自動で行えるオフラインAIアプリを使うことです。Hugging Faceは、1000種類を超える選択肢がある、ローカルAIモデルの最大のハブです。
私たちはまさにこの目的で、無料のオープンソースアプリであるAtomic Chatを開発しました。誰でもセットアップなしでローカルLLMを動かせます。
Atomic ChatでLLMをローカル実行する手順は、次のとおりです。
- atomic.chatからAtomic Chatをダウンロードして、インストールします。その後、アプリを開きます。

- 左サイドバーのModelsタブに移動します。ここでHugging Faceのモデルライブラリ全体を閲覧・検索できます。

- モデルを検索してダウンロードします。Atomic Chatでは、各モデルのサイズとワンクリックで使えるDownloadボタンが表示され、お使いのハードウェアに収まるモデルには目印が付きます。

- チャットを始めます。ダウンロードが完了するとモデルが読み込まれ、完全にオフラインの状態で、アプリ内からモデルとの会話を始められます。

先ほども触れたとおり、Atomic Chatはお使いのマシンに合った量子化も自動で選びます。
開発者や、Claude Code、Codex、Cursorでエージェントを使いたい方に向けて、Atomic Chatはhttp://localhost:1337/v1でOpenAI互換APIも公開しています。エージェントの実行環境の接続先を簡単にこのAPIに設定し、オフラインAIを十分な機能を備えたエージェントとして使えます。
LLMをローカルで実行するのに最適なアプリ
Atomic Chatは、モデルをローカルで実行するための複数あるツールの1つです。自分の環境に最適なローカルLLMアプリや、特定のマシンでローカル実行するのに最適なLLMを探しているなら、次の注目すべき選択肢も知っておくと役立ちます。
- Ollama:開発者に人気のツールで、コマンドラインからモデルを実行し、ローカルAPIを公開します。現在はデスクトップアプリもあります。比較については、OllamaとLM Studioの比較をご覧ください。
- LM Studio:モデルブラウザーを内蔵した洗練されたデスクトップアプリで、GUIを使いたい初心者に人気です。
- Jan:プライバシーを重視したオープンソースのデスクトップアプリで、デフォルトではテレメトリーを収集しません。
- llama.cpp:これらのアプリの多くを支える基盤エンジンで、自分でコンパイルや調整を行いたい方向けです。
それぞれの詳しい解説は、2026年のおすすめローカルLLMアプリのガイドをご覧ください。
よくある質問
LLMはローカルで実行できますか?
はい、現在の一般的なコンピューターなら、どれでもLLMをローカルで実行できます。多くのモデルは重みが公開されているため、ファイルを無料でダウンロードし、Atomic Chatのようなアプリを通じて自分のマシン上で動かせます。一般的なノートパソコンでは小さなモデルを実行し、大きなモデルには大容量メモリを搭載したマシンが必要です。
LLMをローカルで実行するにはGPUが必要ですか?
いいえ、LLMをローカルで実行するためにGPUは必須ではありません。モデルはCPUだけでも動かせます。ただし、GPUの有無は速度に大きく影響するため、グラフィックスカードのVRAMに収まるモデルは、CPUで動くモデルよりもはるかに速く回答します。
LLMをローカルで実行するには、どれくらいのRAMが必要ですか?
モデルのファイルサイズの約2倍の空きメモリを見込んでください。7〜8Bモデル(約5 GB)は、システムRAM 16 GBまたはGPUのVRAM 8 GBで快適に動作します。実用上の最低ラインはRAM 8 GBで、その場合は3B程度の小さなモデルに限られます。
LLMのローカル実行は無料ですか?
はい。オープンウェイトモデルと、Atomic Chat、Ollama、LM Studioのようなアプリはすべて無料で、モデルをダウンロードした後に利用料金はかかりません。必要なコストは、すでに所有しているハードウェアと、重みを保存するためのディスク容量だけです。
LLMをローカルで実行すると、プライバシーは守られますか?
LLMのローカル実行では、ソフトウェアで実現できる限りのプライバシーを確保できます。ダウンロード後のモデルは完全に自分のデバイス上で動作し、プロンプトが誰かのサーバーに送信されることはありません。これが、クラウドのチャットボットよりもローカル環境を選ぶ主な理由です。
まとめ
2026年現在、LLMは比較的簡単にローカルで実行でき、ローカルAIモデルの性能も十分に高まっています。今では6-8Bという小さなモデルでさえ、わずか1年前のフラッグシップに匹敵する性能を発揮し、このサイズのQwenやGemmaファミリーのモデルは、コーディング、推論、知識労働でGPT-4oに並びます。ローカルLLMの世界に足を踏み入れるには、楽しみな時期です。

