ローカルLLMの利用をためらう主な理由として、ユーザーがよく挙げるのは「時間がかかる難しいセットアップ」です。しかし、セットアップは以前より簡単になり、すべての工程を任せる方法もあります(本文の後半で紹介します)。
そのため今では、LLMをセルフホストする理由は明確に思えます。プライバシーを守れてオフラインで動作し、ある意味では無料でもあります。魅力的に聞こえますが、十分な情報をもとにクラウドから離れる決断をするには、まだ説得力が足りません。
では、なぜLLMをセルフホストすべきなのでしょうか。そして、セルフホストするなら、どのモデルを動かせばよいのでしょうか。私たちのお気に入りのモデルを選び、答えを探るためにいくつかのテストを実施しました。
セルフホスト型LLMの仕組み
まず、セルフホスト型LLMとは何かを簡単に振り返ります。仕組みをすでに理解している方は、この段落を飛ばしてモデルとテスト結果に進んでください。
ChatGPTやClaudeを使うと、メッセージはデバイスを離れてリモートサーバーに送られ、そこで処理された後、応答が返ってきます。モデル、コンピューター、そしてあなたのデータは、すべて他者のインフラ上にあります。
セルフホスト型LLMでは、そのすべてが自分のマシン上で行われます。
- メッセージを入力します
- 自分のCPUまたはGPUが処理します
- 応答を受け取ります
デバイスの外には何も送信されず、モデルはほかのアプリケーションと同じようにローカルプロセスとして動作します。
ソフトウェアの構成は次のとおりです。ディスク上にモデルファイル(通常はGGUF形式)があり、推論エンジン(最もよく使われるのはllama.cppやOllama)がそれをRAMまたはVRAMに読み込んで実行します。Ollamaはlocalhost:11434,でOpenAI互換APIを公開するため、OpenAI APIに対応している既存のツール(LangChain、n8n、Open WebUI、自作スクリプト)は、設定を1か所変更するだけで接続先をローカルモデルに切り替えられます。
主な制約はハードウェアです。モデルはメモリに収まる必要があり、今度は自分のデバイスのメモリを使います。推論速度は、ハードウェアがどれだけ速くデータを転送できるかによって決まります。‘
LLMをセルフホストする価値はある?
セルフホストが適している場合
プライバシーとコスト
最もわかりやすいのは、顧客との契約書、医療記録、社内コードなど、外部に送信できないデータを扱う場合です。モデルはローカルプロセスとして動作し、マシンから外部へネットワークリクエストを送信しません。
2つ目は利用量です。利用規模が大きくなると、トークン単位のAPI料金は急速に膨らみます。
| モデル | 100万トークンあたりの出力料金 |
|---|---|
| GPT-5.5 | $30.00 |
| Claude Opus 4.8 | $25.00 |
| Claude Sonnet 4.6 | $15.00 |
| Gemini Flash | $0.40 |
| Qwen 3.6 35B(Apple Silicon) | ~$0.025 |
ほかにも、あまり目立たない理由がいくつかあります。
モデルのバージョンを固定できること
クラウドAPIでは、予告なくモデルが更新されます。3月には機能していたプロンプトが、6月には違う挙動を示すことがあります。Opus 4.8の公開前に、Opus 4.7の不安定さをめぐってX.comで激しい議論が起きたのも、このためです。
セルフホストならバージョンを固定でき、自分で変更しない限り変わりません。本番運用に関わる用途では、知らないうちに挙動が変化することは現実的な問題です。
レート制限はプロダクトの問題になる
APIを利用したプロダクトを開発していて、ユーザーが利用上限に達すると、そのプロダクトは停止します。ローカルモデルには、ハードウェアの限界以外にレート制限はありません。
ファインチューニング。クラウドAPIでは重みを変更できません。システムプロンプトではなく、モデル自体に専門分野の用語や出力形式を学習させる必要がある場合、セルフホストが唯一の方法です。
検閲のない動作。セキュリティ研究、法的文書の分析、レッドチーミングなど、安全性フィルターのないモデルを必要とする用途もあります。重みが公開されたモデルは、制限なしで実行できます。
セルフホストが適さない場合
ローカルの30BモデルはGPT-5.5やClaude Opus 4.8と同等ではなく、大規模で難しいタスクでは差が表れます。
- 不慣れな大規模コードベース全体にまたがる、原因のわかりにくい並行処理の問題をデバッグする。
- 修正を繰り返すことなく、10通りのエッジケースすべてに対応できるプロンプトを書く。
あるいは、3回試しても、最初のメッセージで指定した制約を依然として守れないタスク。
技術的には、最先端モデルに近い品質のモデルをローカルで動かすことは可能です。DeepSeek R1(フル版)は671Bパラメータを持ち、推論ベンチマークでも十分に競争力があります。ただし、Q4でも約390GBあるため、192GB RAMを搭載したM4 Ultraか、複数のマシンを組み合わせた構成が必要です。これは一般ユーザーにとって手軽な選択肢ではありません。それほどのリソースを持つ人も、ローカルAIのためだけに揃えたいと思う人も、ほとんどいません。
セルフホストが不利になる、ほかの2つの状況:
- 素早く進めたい初期段階のプロトタイピングでは、単純にAPIを使うほうが速い場合。
- モデルの更新、量子化形式の変更、推論エンジンのアップグレードといった保守を引き受ける人がチームにいない場合。
macOSで必要なハードウェアの現実
ローカルLLMは、多くの人が考えるほどハードウェアの制約を受けません。ハードウェアのクラスごとに、現実的にできることを示します。
| モデルサイズ | 最小RAM | 快適に使えるRAM | ハードウェアの例 | 適した用途 |
|---|---|---|---|---|
| 7B | 8GB | 16GB | M2 MacBook Air | 簡単なQ&A、短い要約:複数段階のタスクでは限界が目立ちます |
| 14B | 16GB | 24GB | M2 Pro MacBook Pro | 日常的なタスク:短いコード、文書に関するQ&A、要約 |
| 27–31B | 32GB | 64GB | M3 Max, M4 Pro | 実務的なコーディング、長文作成、文書分析。日常業務に最適です |
| 35B | 48GB | 64GB | M3 Max, M5 Max | 用途は27–31Bと同じですが、より高速です。RAMに余裕があれば、汎用用途に最適なクラスです |
| 70B | 64GB | 80GB+ | M3 Ultra, M4 Max | 複雑な推論、長大なコードベース、ローカルで得られる最高の品質 |
覚えておきたい点:
ハードウェアが重要な根本的な理由:ローカルモデルは1トークンずつ生成し、エンジンは各トークンの生成時にモデル全体をメモリから読み込む必要があります。そのため、速度を決めるのは単純な演算性能ではなく、ハードウェアがどれだけ速くデータを転送できるかです。
16 GBのRAMまたはVRAMがあれば、無理なく始められます。14BのデンスモデルやQwen 3.6-35B-A3BのようなMoEモデルを動かせるため、次の用途には十分です。
- 一般的なチャットとQ&A。
- 文章作成と編集。
- コードの生成とレビュー。
- 中程度の長さのファイルを対象にした文書処理。
24 GB以上あれば、32Bクラスのモデルが視野に入り、より強い推論能力を必要とするタスクにも対応できるようになります。
- 複雑な複数段階の分析。
- 性能を落とさずに、より長いコンテキストを扱うこと(1回のリクエストに多くのテキストを含めることと、モデルがそのコンテキストをどう記憶するか)。
- マルチモーダル入力(スクリーンショットや画像の送信)。
- 会話履歴とともに大きな文書チャンクをアップロードする、より負荷の高いRAGパイプライン。
macOSでセルフホストするおすすめモデル:2026年6月
| モデル | ディスク容量(Q4_K_M) | 速度 | RAM | 商用利用 | 最適な用途 |
|---|---|---|---|---|---|
| Gemma 4 31B | 約19GB | 27 tok/sec | 32GB | 可 | 1回の指示でのコード生成、構造の決まったタスク |
| Qwen 3.6 27B | 約16GB | 16–32 tok/sec | 32GB | 可 | 文章作成、Q&A、長文コンテンツ |
| Qwen 3.6 35B | 約22GB | 72 tok/sec | 48GB | 可 | 日常的な汎用用途、速度が重要な作業 |
| Gemma 4 12B | 約18GB | 約70 tok/sec | 16GB | 可(Apache 2.0) | マルチモーダルのタスク、16GBのマシン |
| Llama 4 Scout | 約55GB | 約32 tok/sec | 64GB | 可* | 長いコンテキストでの推論、エージェント型ワークフロー |
Qwen 3.6 27B
求めた以上の内容を生成しますが、それこそが必要な場合もあります。文章作成、Q&A、解説など、内容が足りないより多すぎるほうがよいタスクに適しています。
- ハードウェア要件:最小32GB。Gemma 4 31Bと同じクラスなので、どちらを選ぶかはハードウェアではなくタスクによって決まります。
- 最適な用途:文章作成、要約、詳しいQ&A、創作。コンテンツの下書き、ナレッジベースの構築、モデルによる詳しい説明が必要なら、Qwen 27Bを基本の選択肢にするほうがよいでしょう。
- 不向きな用途:トークン数が正確さに影響する、構造の決まったコーディングタスク。出力量が多いからといって品質が高いわけではありません。私たちのテストでは、同じプロンプトに対してGemmaの5倍のコードを生成しましたが、ゲームのロジックは破綻しました。
Qwen 3.6 35B
27Bより大きいにもかかわらず、私たちのテストでは72 tok/secと最速でした。MoEアーキテクチャではトークンごとにパラメータの一部だけを有効にするため、推論の各ステップで転送するデータ量は27Bのデンスモデルより少なくなります。車のゲームを作るプロンプトでは、27Bが5分12秒かかったのに対し、1分52秒で完了しました。
- ハードウェア要件:最小48GB(M3 Max 48GB、M5 Max 64GB)。32GBから48GBへの増設は、実質的に高速なモデルクラスを使えるようになる唯一のRAMアップグレードです。
- 最適な用途:速度が重要な日常的な汎用用途。72 tok/secなら、進捗バーを眺めて待つ必要はありません。RAMが足りていれば、ほとんどのタスクで27Bより優れています。
- 不向きな用途:MoEのルーティングによるオーバーヘッドが目立つ、ごく短いタスク。また、32GBのマシンでは使う価値がありません(そもそもモデルを読み込めません)。
Qwen 3.6 27BとQwen 3.6 35Bの違い
以下の2つのモデルは、ほぼ同じです。どちらもAlibaba製で、同じQwen 3.6シリーズに属し、Apache 2.0を採用していて、Apple Siliconで快適に動きます。27Bはトークンごとにすべてのパラメータを有効にし、35Bはその一部だけを有効にします。そのため35Bのほうが高速ですが、27Bなら捉えられる手順を飛ばしてしまいます。
その違いがどのような場面で重要になるのか、直接対決で確かめました。
タスク:HTMLで波を描画する。プロンプトは1回、MacBook Pro M5 Max 64GBを使用し、両モデルでTurboQuantを有効にしました。
Google TurboQuantを使い、同じ条件でQwen3.6 35Bと27Bを比較しました
— atomic.chat (@atomic_chat_hq) 2026年4月22日
デバイス:MacBook Pro M5Max 64GB RAM
出力の特徴:
Qwen3.6 35B:6672トークン、2分10秒、65 tok/s
Qwen3.6 27B:7344トークン、5分22秒、24 tok/s
結論:両モデルに、次のものを使って波を描くよう依頼しました… pic.twitter.com/RMXhR4EUFj
結果:
35Bは65 tok/secで2分10秒で完了したのに対し、27Bは24 tok/secで5分22秒かかりました。
35Bは高速でしたが、出力は粗く、波の縁のギザギザやアニメーションの揺れが全体の仕上がりを損ねていました。一方、27Bの出力はより整っていて、一貫性がありました。
MoEはトークンごとに重みの一部を有効にして素早く出力を確定する一方、27Bのデンスモデルは生成前により綿密に推論します。視覚的または構造的なロジックを伴うタスク(レイアウト、アニメーション、計画を必要とするもの全般)では、その違いが出力に表れます。
出力が構造に従うこと、見た目の一貫性を保つこと、複数段階の計画を進めることが必要なら、27Bを選んでください。モデルが思考の流れを保ちながら何度か修正を繰り返せる、素早い応答が必要なら、35Bを選んでください。
Gemma 4 12B
2026年6月3日に公開された、Googleの最新小型モデルです。このリストで、テキスト、画像、音声、動画をネイティブに扱える唯一のモデルです。Googleによると、メモリ使用量は半分未満でありながら、Gemma 4 27Bに近いベンチマークスコアを達成しています。
- ハードウェア要件:16GB RAM。標準構成のMacBook Airで実用的に使える唯一の選択肢です。Q4では約7GBのVRAMに収まるため、旧世代のNVIDIAカード(RTX 3080以上)でも動作します。
- 最適な用途:30B以上のモデルを動かせないマシン。短いコード、文書に関するQ&A、マルチモーダルのタスク(画像分析、音声文字起こし)。Gemma 4 12Bを動かす16GBのMacは、何も動かしていない16GBのMacより役に立ちます。
- 不向きな用途:複数段階の推論や、数百行にわたって一貫性を維持する必要がある作業。タスクが複雑になると、30B以上のモデルとの差が目立ちます。30Bモデルを動かせるなら、そちらを使うべきです。
RTX 4090上で、難度の高いプロンプトを使ってテストしました。ライブラリを使わず、実際の物理法則に従う自己完結型のHTML5 canvasアニメーションを作成し、ゴルトンボード、壁にぶつかる2つのブロック、三重振り子の3つのシーンを含めるというものです。9GBのVRAMを使用し、80 tok/sで8,900トークンを生成しました。3つのシーンはすべて描画されました。9GBのVRAMで動く12Bモデルとしては、優れた結果です。
新しいGoogle Gemma 4 12Bは26Bに近い性能をうたっています。両方をテストしました!
— atomic.chat (@atomic_chat_hq) 2026年6月3日
1枚のRTX 4090で両モデルをローカル実行し、同じタスクを与えました。ライブラリを使わず、実際の物理法則に従う自己完結型のHTML5 canvasアニメーションを1つのファイルに書くというものです。3つのシーンは、ゴルトンボード、2つのブロック… pic.twitter.com/Zy04PD12GR
マシンのRAMまたはVRAMの上限が16GBなら、12Bが適切な選択肢です。サイズから想像する以上のタスクをこなせます。
Gemma 4 31B
このモデルは、言うことが尽きたときではなく、必要な内容を出力し終えた時点で止まります。私たちのPac-Manテストでは、6,209トークンを使い、3分51秒で動作するゲームロジックを生成しました。Qwenは同じプロンプトに18分と33,946トークンを費やしましたが、出力は正常に動作しませんでした。
- ハードウェア要件:最小32GB(M3 Max、M4 Pro、M5 Max)。32GBでも動作しますが、ほかのアプリを同時に動かすなら、64GBあると余裕が生まれます。
- 最適な用途:1回の指示でのコード生成、構造化された出力、長さより正確さが重要なタスク。壁との衝突処理、クリックハンドラー、APIレスポンスの解析。「最初の実行で動くこと」が基準になる作業全般です。
- 不向きな用途:長文作成や、詳しい説明が必要な作業。コードでは強みになる簡潔さが、説明では内容の薄さにつながります。2,000語の記事を依頼しても、800語しか返ってきません。
Llama 4 Scout
総パラメータ数は109Bで、トークンごとに17Bが有効になります。MoE設計により、推論速度は17Bのデンスモデルに近くなりますが、はるかに大きなエキスパートの重みの集合を利用できることが品質面の利点につながります。コンテキスト長は1,000万トークンです。
- ハードウェア要件:最小64GB RAM(Q4_K_Mでのディスク容量は約55GB)。64GBのMacでは余裕が少ないものの、動作します。80GB以上を搭載したM3 UltraやM4 Maxなら快適です。
- 最適な用途:30Bモデルが文脈を見失うような、複雑な推論、長い文書、エージェント型ワークフロー。Qwen 35BやGemma 4 31Bが複数段階のタスクで繰り返し破綻するなら、次に進む先はScoutです。
- 不向きな用途:32GBまたは48GBのマシンでは、読み込めません。また、Gemma 4 31BやQwen 3.6 35Bがはるかに少ないRAMで同じ仕事をこなせる、単純なコーディングや文章作成にも不要です。
ローカルLLMはどれくらい速い? 私たちのテスト
ベンチマークのランキングでは通常、選択式問題、短い関数の補完、正解がわかっている要約など、固定のテストセットでモデルを採点します。速度は評価指標に含まれず、数百トークンを超えて計画の一貫性を保つ必要があるタスクも、ほとんどありません。
私たちはAtomic Chatで、実際の利用に近いタスクをテストしました。追加の指示も修正も行わず、1回のプロンプトで動作するコードを生成させました。ゲームを作るプロンプトでは、モデルに次のことが求められるためです。
- 仕様全体を理解すること。
- 数百行にわたってロジックの整合性を保つこと。
- 実際に動作するコードを生成すること。
これらは、スクリプト、コンポーネント、動作する機能など、どのような実務的なタスクでも必要になることです。
テスト1:1回の指示でPac-Manゲームを作成
/1 @atomic_chat_hq内で行ったローカルLLMのゲーム開発対決で、Gemma 4 31BがQwen 3.6 27Bに圧勝しました(プロンプトは下にあります)
— Chubby♨️ (@kimmonismus) 2026年4月30日
デバイス:MacBook Pro M5 Max、64GB RAM
結果:
Qwen 3.6 27B:32 tokens/sec · 18分04秒 · 33,946トークン
Gemma 4 31B:27 tokens/sec · 3分51秒 · 6,209トークン
では、何が… pic.twitter.com/wqyWyjXX2u
ハードウェア:MacBook M5 Max、64GB RAM。
タスク:1回のプロンプトで、実際にプレイできる完全なPac-Manゲームを書くこと。
測定項目:生成速度、総トークン数、出力が実際に動作したかどうか。
| モデル | 速度 | 時間 | トークン数 |
|---|---|---|---|
| Qwen 3.6 27B | 32 tok/sec | 18分04秒 | 33,946 |
| Gemma 4 31B | 27 tok/sec | 3分51秒 | 6,209 |
Gemmaは4分未満で完了しました。Qwenは18分かかりました。出力品質でもGemmaが勝りました。詳細は後述します。
テスト2:物理演算と視差スクロールを備えたHTML/Canvasの車のゲーム
驚きました。MacBookで35Bモデルをローカル実行して、ここまで速いとは思いませんでした 🤯
— Charly Wargnier (@DataChaz) 2026年4月28日
週末は@atomic_chat_hqを使い、自分のマシン上でQwen 35BとQwen 27Bを比較していました。
全体にアニメーションを備えたHTML/Canvasの車のミニゲームを生成させました(デモは下にあります)。
...そして両モデルとも難なくこなしました… pic.twitter.com/WXboJCSDZn
ハードウェア:MacBook(Apple Silicon)。
タスク:1回のプロンプトで、車両の物理演算と背景の視差スクロールを含み、全体にアニメーションを備えたHTML/Canvasの車のミニゲームを生成すること。
測定項目:より大きなMoEモデルに、追加で必要になるRAMに見合う価値があるかどうか。
| モデル | 速度 | 時間 | トークン数 |
|---|---|---|---|
| Qwen 3.6 27B | 16 tok/sec | 5分12秒 | 5,623 |
| Qwen 3.6 35B | 72 tok/sec | 1分52秒 | 8,070 |
35Bは72 tok/sec、27Bは16 tok/secで動作しました。 総パラメータ数が多いにもかかわらず、4.5倍の速さです。これがMoEアーキテクチャの特徴で、トークンごとに重みの一部だけが有効になります。Atomic Chatは内部でTurboQuantも使用し、Apple Silicon向けにKVキャッシュを圧縮します。
Atomic Chatと標準のllama.cppの比較(MacBook M5 Max、Gemma 4 26B)
LLaMA.cpp向けのMulti-Token Prediction(MTP)!
— atomic.chat (@atomic_chat_hq) 2026年5月7日
ローカルモデルのGemma4が1.5倍高速に動作します。
LLaMA.cppにパッチを適用しました。Gemma 4のアシスタントモデルを量子化し、GGUF形式にしました。MacBook Pro M5Maxでテストを実施しました。MTPを使ったGemma 26Bでは、ドラフトトークンの生成が40%高速になります。ベンチマーク、ソースコード、モデルはこちら 👇 pic.twitter.com/hHH1cu1jLi
上記の2つのテストは、パッチ未適用のllama.cppではなく、Atomic Chatで実行しました。MTPを動作させるために、Atomic Chatはllama.cppに直接パッチを適用し、Gemma 4のアシスタントモデルを量子化してGGUF形式にしました。単一のフィボナッチ生成タスクでは、Gemma 26Bの速度が73 tok/sec(パッチ未適用)から121 tok/secに向上しました。M5 Maxでより長い生成タスクを実行した結果は、次のとおりです。
Multi-Token Predictionにより、同じハードウェアで速度が40-62%向上します。
1秒あたりのトークン数と出力品質:どちらが重要?
テスト1では、Gemma 4 31BはQwen 27Bより遅く(27対32 tok/sec)、生成したトークンも大幅に少なかった(6,209対33,946)にもかかわらず、勝利しました。壁との衝突処理が機能し、ゴーストとの相互作用は正しく、クリックへの応答も滑らかでした。一方、Qwenは約5倍の出力を生成し、創造性が高く見た目にも意欲的でしたが、ゲームのロジックは破綻しました。
トークン/秒はモデルの動作速度を測る指標ですが、品質を確実に判断することはできません。
コーディングで重要なのは、出力が最初の実行で動くかどうかです。私たちのテストでは、6,000トークンの正しいコードが、34,000トークンの動かないコードに勝りました。
セルフホスト型LLMで何ができる?
最もわかりやすい用途は、コード生成と文書分析です。32GBのMacで動くGemma 4 31Bは、1回のプロンプトから動作するゲームコードを生成しました。反復も手直しも不要でした。
文書を扱う作業、たとえば契約書、社内文書、PDFには、Qwen 3.6 27Bを使ってください。長文のQ&Aを得意としています。また、Llama 4 Scoutは1,000万トークンのコンテキスト長を持つため、文書一式をチャンクに分割せずに読み込めます。どちらの場合も、マシンの外に何も送信されません。バッチ処理(数百のファイルに対して同じ抽出や要約タスクを実行する作業)なら、30B以上のどのモデルでも、レート制限に達したりトークン料金が積み上がったりすることなく、Mac Miniで一晩中動かせます。
RAGパイプラインも適した用途です。48GBのマシンでQwen 3.6 35Bを使ってローカルのナレッジベースに問い合わせれば、APIを介さず、自分のデータから回答を得られます。
最先端モデルのAPIが依然として優位な3つのケース:
- モデルの学習データの収集期限より後の情報を必要とするタスク。
- 自分が書いていない大規模なコードベースのロジックを追う作業。
- 推論の連鎖が長くなり、30Bモデルが数ステップ前に確立した内容を見失う場合。
タスクが反復的である場合、データが機密性の高いものである場合、またはテストして出力が十分な品質だと確認できた場合に、セルフホストは有効です。
セルフホスト型LLMの始め方:ターミナルなしで複数モデルを使う
1つのモデルを動かすだけなら10分で済みます。今ではOllamaにも独自のCLIがあります。しかし、コードにはGemma、文章作成にはQwen、手早く済ませたいタスクにはGemma 4 12Bというように複数のモデルを管理する場合(これが最適な戦略です)、Ollamaやllama.cppを使って手作業で行うと、管理の手間が積み重なります。
Atomic Chatは、モデルの切り替え、管理、量子化の設定を引き受けます。Mac上でネイティブに動作し、TurboQuantとMTPで推論を高速化し、CLIのセットアップなしで1,000以上のモデルを利用できます。上記の両テストはAtomic Chatで実行しました。手動の量子化設定は不要で、完全にオフラインで動作し、APIの利用制限もありません。
Macで実行してiPhone(またはAndroid)に接続すれば、クラウドを一切介さないプライベートなAIアシスタントが使えます。
→ Atomic Chatで、1つのアプリから複数のモデルを使ってみる
よくある質問
セルフホスト型LLMを動かすには、どれくらいのRAMが必要ですか?
8GBあれば7Bモデルを動かせます。実用的な用途(27Bから35Bの範囲)には、32-48GBが必要です。Apple Siliconは統合メモリを採用しているため、GPU用のVRAMを別に考える必要はありません。
セルフホスト型LLMは本当にプライバシーを守れますか?
最初にモデルをダウンロードした後は、マシンの外に何も送信されません。API呼び出しも、提供元によるログ記録も、学習へのデータ利用もありません。ローカルプロセスとして動作します。
LLMのセルフホストは無料ですか?
モデルは無料で、費用がかかるのはハードウェアと電気です。すでに所有しているMシリーズのMacを使う場合、追加費用は電気代で、使用量に応じて月額およそ$5-20です。初期費用はマシン本体の購入費です。
スマートフォンでセルフホスト型LLMを使えますか?
はい、Macでモデルが動作していれば使えます。Atomic Chatでは、ローカルネットワーク経由でスマートフォンをモデルに接続できます。推論はMac上で行われ、スマートフォンはその接続を通じてテキストを送受信します。両方のデバイスを同じネットワークに接続する必要があります。
デスクトップでAtomic Chatを試す:
→ macOS 向け
モデルをスマートフォンにも接続しましょう:
→ Android
→ iOS
今、最もおすすめのセルフホスト型LLMはどれですか?
コーディングにはGemma 4 31B。文章作成と汎用用途には、48GB RAMがあるならQwen 3.6 35B、なければQwen 3.6 27B。16GBのマシンにはGemma 4 12B。64GBでローカルの最高品質を求めるならLlama 4 Scoutです。すべてに最適な単一のモデルはなく、タスクによって異なります。
2026年のコーディング向けおすすめLLMについて、クラウドとローカルの両方を詳しく解説した記事をご覧ください。
大きいモデルのほうが速いことはありますか?
はい。私たちのテストでは、Qwen 3.6 35Bが72 tok/secで動作したのに対し、Qwen 3.6 27Bは16 tok/secでした。35BはMixture of Expertsアーキテクチャを採用し、トークンごとに有効にするパラメータ数を少なくしています。サイズと速度は比例しません。
コーディングにはGemma 4 31B。文章作成と汎用用途には、48GB RAMがあるならQwen 3.6 35B、なければQwen 3.6 27B。16GBのマシンにはGemma 4 12B。64GBでローカルの最高品質を求めるならLlama 4 Scoutです。すべてに最適な単一のモデルはありません。タスクによって異なります。
結論
16GBのApple Siliconマシンがあれば、日常的なコーディングやデータ作業をセルフホスト型LLMに任せるには十分です。セットアップはわずか10分で、月間5,000万トークンを利用するだけでも、100万トークンあたり$30のGPT-5.5と比べて、3か月未満でハードウェア代を回収できるなら、なおさらです。機密データを扱う場合、いずれにせよクラウドは選択肢に入りません。
難しいのはモデル選びであり、テストによってその判断はさらに単純ではなくなりました。私たちのテストが示したように、速度から出力品質を予測することはできません。また、最新情報を扱う場合、推論の連鎖が長い場合、そして環境を保守する人がいなくなった場合には、依然としてうまくいかなくなります。

