ローカルで動かすオープンソースモデルの選び方
このカタログのモデルは、すべて自分のハードウェアだけで動きます。APIキーも、トークン単位の課金も、マシンの外に出るデータもありません。そのためローカルモデルは、外に出せないデータを扱う作業、オフライン環境、そして従量課金のクラウドAPIではコストがかさむ大量処理に向いています。一方で、ハードウェアを用意するのは自分です。最適なモデルは、タスクと同じくらい手元のマシンによって決まります。
いちばん効いてくる数値はパラメータ数と必要VRAMの2つです。パラメータ数は実力をおおまかに示す目安で、大きいモデルほど思考力も文章力も上がりますが、その分メモリを使い、動作は遅くなります。必要VRAMは、そのモデルがそもそもGPUに載るかどうかを示します。量子化したビルドならこの数値は下がり、品質の低下はわずかです。ほかを比べる前に、まずサイドバーのフィルターで、自分のマシンで実際に動くモデルまで絞り込んでください。
タスクに合わせてモデルを選ぶ
コード補完向けにチューニングしたモデルは、同じサイズでもチャットや画像向けのモデルとは挙動が変わります。タスクフィルターは、テキスト生成、画像からテキスト、テキストから画像など、学習した目的ごとにモデルをまとめています。まずはここから入り、そのうえでタスク内をサイズや重みの更新の新しさで並べ替えてください。
汎用チャットと推論に強いモデル
ここで挙げる汎用モデルは、回答の品質とハードウェアのコストのバランスが取れています。どれも最近のノートPCやミドルレンジのGPUで快適に動きます。
| Model | Parameters | VRAM required | Best for |
|---|---|---|---|
Qwen 3 8B | 8B | ~8 GB | Everyday chat on a laptop |
Llama 3.1 8B | 8B | ~8 GB | Balanced reasoning and writing |
Mistral Small 24B | 24B | ~16 GB | Stronger reasoning, mid-range GPU |
Qwen 3 32B | 32B | ~24 GB | Highest quality, desktop GPU |
非力なハードウェアに向くモデル
CPUだけのマシンや、メモリの少ないGPUで作業しているなら、こうした小型モデルや量子化モデルが向いています。ディスクリートGPUがなくても軽快に応答します。
| Model | Parameters | VRAM required | Best for |
|---|---|---|---|
Qwen 3 1.7B | 1.7B | CPU only | Fast replies on any laptop |
Llama 3.2 3B | 3B | < 8 GB | Lightweight assistant tasks |
Mistral 7B (Q4) | 7B | ~6 GB | Quantized build for older GPUs |
ここで挙げたのはランキングではなく、あくまで出発点です。最適なモデルとは、目的のタスクで手元のハードウェアがスムーズに動かせる、いちばん大きいモデルです。上のフィルターから、カタログ全体を見てみてください。


































