Qwen logo
Qwen3.6 27B MTP
27B
モデルが見つかりません
新着順パラメータ数
推論
コード生成
多言語
ウェブ検索
画像認識
思考
ツール利用
音声
画像生成
埋め込み
K2 Horizon 375B-A23B

IFMのK2 Horizon 375B-A23B:512Kのコンテキスト長、スパースな重み、サーバー構成。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
K2 Horizon MoVA-36B-A4B

IFMのK2 Horizon MoVA-36B-A4B:512Kのコンテキスト長、疎な重み、サーバー構成を解説します。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
K2 Horizon 32B

IFMのK2 Horizon 32B:512Kのコンテキスト長、Stage 1のデンスモデルの重み、サーバーのセットアップ。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
K2 Horizon 7B

IFMのK2 Horizon 7B:512Kのコンテキスト長、デンスモデルの重み、サーバーのセットアップ。Atomic Chatでの対応は未確認です。

思考
ツール利用
推論
コード生成
K2 Horizon 3.7B

IFMのK2 Horizon 3.7B:512Kのコンテキスト長、デンスモデルの重み、サーバー設定。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
K2 Horizon 0.9B

IFMのK2 Horizon 0.9Bの128Kコンテキスト長、デンスモデルの重み、サーバー設定を紹介します。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
Atria Dawn Preview

Atria Dawn Previewは、Shanghai AI Labのコンテキスト長256K、テキスト専用のエージェントモデルです。重みとサーバーへのデプロイを比較します。Atomic Chatでの対応はまだ確認されていません。

思考
ツール利用
推論
コード生成
GLM-5.3-Flash

GLM-5.3-Flashは、総パラメータ数320B、アクティブパラメータ数18BのMoEです。GLM-5シリーズ初のネイティブなマルチモーダルモデルで、MITライセンスで公開されています。

思考
ツール利用
画像認識
推論
コード生成
Qwen3.8-Flash-Next

Qwen3.8-Flash-Nextは125Bのパラメータを持ち、そのうち6Bがアクティブになります。さらに51Bのn-gram埋め込みを備えています。Qwen4アーキテクチャの実験的なプレビューです。

思考
ツール利用
画像認識
推論
コード生成
Ornith-1.5-35B-A3B

Ornith-1.5-35B-A3Bは、トークンごとに約3Bのパラメータを有効化する36BのMoEモデルで、コーディングでは規模が10倍のモデルを上回ります。

思考
ツール利用
画像認識
推論
コード生成
Ornith-1.5-9B

Ornith-1.5-9Bは、256Kのコンテキスト長を備え、8 GBで動作する9Bのエージェント型コーディングモデルです。GGUFビルドは私たち自身で量子化しました。

思考
ツール利用
画像認識
推論
コード生成
Qwen3.8-27B

Qwen3.8-27Bは、コンテキスト長256Kのマルチモーダルな27.8Bデンスモデルです。4-bit量子化なら24 GBのGPUに収まります。Atomic Chatでローカル実行できます。

思考
ツール利用
画像認識
推論
コード生成
NVIDIA-Nemotron-3.5-Lightning-30B-A3B

NVIDIA Nemotron 3.5 Lightningは、総パラメータ数30B、有効パラメータ数3BのMamba-2ハイブリッドMoEで、コンテキスト長は1Mトークンに達します。

思考
ツール利用
推論
コード生成
多言語
Muse-Glimmer-30B

Muse Glimmer 30Bは、一般向けハードウェア用に開発されたMetaのエージェントモデルです。視覚エンコーダーを備えた30Bのデンスモデルで、24 GBのカードに収まるように量子化されています。

思考
ツール利用
画像認識
推論
コード生成
Ling-3.0-flash

Ling-3.0-flashは、トークンごとに有効になるパラメータがわずか5.1Bの、124Bのハイブリッド線形MoEです。ソフトウェアエンジニアリングでは、はるかに大規模なモデルに匹敵します。

思考
ツール利用
推論
コード生成
多言語
DeepSeek-V4-Flash-0731

DeepSeek V4 Flash 0731はV4 Flashの正式リリース版です。総パラメータ数284B、アクティブパラメータ数13BのMoEで、コンテキスト長は1M、重みはMITライセンスで公開されています。

思考
ツール利用
推論
コード生成
多言語
Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95Bは、Qwen 3.8 Maxのダウンロード可能なバージョンです。総パラメータ数2.4T、アクティブパラメータ数95BのMoEで、コンテキスト長は256Kです。

思考
ツール利用
推論
コード生成
多言語
OpenELM-1_1B-Instruct

Appleの1.1Bの指示チューニング済みOpenELMモデルです。層ごとのスケーリングを採用し、デバイス上で効率よく英語テキストを生成できるように設計されています。

推論
SmolLM2-135M-Instruct

Hugging FaceのSmolLM2ファミリーに属する、135Mパラメータの指示チューニング済みLLMです。CPUやデバイス上で動作する小ささです。

推論
MiniMax-M2.5

MiniMaxが開発した、エージェントによるコーディング、ツール利用、検索向けのMoEモデルです。パラメータ数は229B(アクティブパラメータ数は10B)で、コンテキスト長は200Kです。

思考
ツール利用
推論
コード生成
ウェブ検索
Granite-4.0-H-Small

IBMの32B(アクティブパラメータ9B)のハイブリッドMamba-2/MoE指示チューニング済みモデルです。コンテキスト長128K、高いツール呼び出し性能、多言語対応を備え、Apache 2.0で公開されています。

推論
コード生成
多言語
ツール利用
NVIDIA-Nemotron-Nano-9B-v2

NVIDIAの9B Mamba2-Transformerハイブリッド推論モデルです。思考のオン・オフ切り替え、128Kのコンテキスト長、ツール呼び出しに対応しています。

思考
推論
コード生成
ツール利用
多言語
SmolLM3-3B

Hugging Faceによる完全にオープンな3B推論モデル。2つの思考モード、6言語のネイティブ対応、ツール呼び出し、128Kのコンテキスト長を備えています。

推論
多言語
ツール利用
思考
Kimi-K2-Instruct

Moonshot AIの総パラメータ数1T、アクティブパラメータ数32BのMoEチャットモデルです。エージェントによるツール利用と高いコーディング性能を目指して開発されました。

ツール利用
コード生成
推論
多言語
Phi-4-mini-instruct

MicrosoftのPhi-4ファミリーに属する、3.8Bパラメータのオープンな指示応答モデルです。128Kのコンテキスト長に対応し、数学と推論に強く、関数呼び出しもサポートします。

推論
コード生成
多言語
ツール利用
Llama-3.3-Nemotron-Super-49B-v1.5

NVIDIAの49B推論・チャットLLMです。Neural Architecture Searchを通じてLlama-3.3-70Bから蒸留され、128Kのコンテキスト長に対応しています。

思考
推論
コード生成
ツール利用
多言語
DeepSeek-R1-0528

DeepSeekの671BパラメータのMoE推論モデルです。アクティブパラメータは37Bで、MITライセンスで公開されています。数学、コード、長い思考連鎖を得意とします。

思考
推論
コード生成
ツール利用
Qwen3-30B-A3B-Instruct-2507

AlibabaのQwen3シリーズに属する、総パラメータ数30.5B(アクティブパラメータ数3.3B)の指示チューニング済みMoEモデルです。256Kのコンテキスト長に対応し、推論、コーディング、ツール利用に優れています。

推論
コード生成
多言語
ツール利用
Phi-4

Microsoft Researchが数学、推論、コード向けに調整した14Bのオープンモデルです。はるかに大きなLLMにも匹敵する性能を備えています。

推論
コード生成
DeepSeek-Coder-V2-Lite-Instruct

DeepSeek AIが開発した16BのMixture-of-Expertsコードモデルです。有効パラメータ数は2.4B、コンテキスト長は128Kで、338のプログラミング言語に対応しています。

コード生成
推論
ツール利用
Mistral-7B-Instruct-v0.2

Mistral-7B-Instruct-v0.2は、コンテキスト長32Kの指示チューニング済み7Bモデルです。必要なハードウェア、GGUFビルド、ローカルでのセットアップ方法を紹介します。

推論
コード生成
DeepSeek-V3-0324

DeepSeek-AIの671BパラメータのMixture-of-Experts型ローカルLLMです。アクティブパラメータは37B、コンテキスト長は128Kで、優れたコーディング能力と改善された関数呼び出しを備えます。

推論
コード生成
多言語
ツール利用
Qwen3-4B-Thinking-2507

AlibabaのQwen3シリーズに属する、常に段階的に思考する4Bの推論重視LLMです。256Kのコンテキスト長に対応し、数学、コーディング、エージェントタスクで高いスコアを示します。

思考
推論
コード生成
ツール利用
多言語
Phi-3.5-mini-instruct

MicrosoftのPhi-3.5ファミリーに属する、指示チューニング済みの3.8Bのデンスモデルです。128Kのコンテキスト長を備え、多言語に対応しています。

推論
コード生成
多言語
Qwen2.5-72B-Instruct

AlibabaのQwen2.5シリーズに属する、指示チューニング済みの72.7B LLMです。コーディング、数学、29以上の言語での多言語処理に優れています。

推論
コード生成
多言語
ツール利用
Qwen3-8B

AlibabaのQwen3シリーズに属する8.2Bのデンスモデルです。思考モードの切り替えに対応し、高い推論能力とコーディング能力を備え、100以上の言語をサポートします。

思考
ツール利用
推論
コード生成
多言語
Qwen3-235B-A22B

AlibabaのQwen3シリーズに属する235Bの混合エキスパート型LLMです。22Bのパラメータを有効化し、思考モードと非思考モードを切り替えられます。

思考
推論
コード生成
多言語
ツール利用
Qwen2.5-Coder-7B-Instruct

AlibabaのQwen2.5-Coderシリーズに属する7.6Bのコード特化型LLMです。コード生成、推論、修正向けに調整されています。

コード生成
推論
ツール利用
Qwen2.5-32B-Instruct

AlibabaのQwen2.5シリーズに属する、32.5Bの指示チューニング済みLLMです。コーディングと数学に強く、29以上の言語に対応します。

推論
コード生成
多言語
ツール利用
Qwen2.5-14B-Instruct

AlibabaのQwen2.5シリーズに属する、14.7Bの指示チューニング済みLLMです。コーディングと数学に強く、29以上の言語に対応しています。

推論
コード生成
多言語
ツール利用
Qwen2.5-7B-Instruct

AlibabaのQwen2.5シリーズに属する、指示チューニング済みの7.61B LLMです。コーディング、数学、29以上の言語での多言語処理に優れています。

推論
コード生成
多言語
ツール利用
Qwen2.5-Coder-32B-Instruct

AlibabaのQwen2.5-Coderシリーズに属する、コードに特化した32.5BパラメータのLLMです。オープンモデルで最高水準のコーディング能力と128Kのコンテキスト長を備えています。

コード生成
推論
ツール利用
多言語
Kimi-K2-Instruct-0905

1TパラメータのMoEモデル、Kimi-K2-Instruct-0905をAtomic Chatでローカル実行できます。プライバシーを保ちながら、オフラインでエージェントによるツール利用が可能です。APIキーもクラウドも不要です。無料で使えます。

ツール利用
推論
コード生成
GLM-4.7-Flash

GLM-4.7-Flashは、MITライセンスで公開されたZ.aiの30B-A3B MoEモデルです。総パラメータ数は31.2Bで、トークンあたり約3Bが有効になり、2ビットのGGUFビルドは12 GBに収まります。

ツール利用
思考
推論
コード生成
MiniMax-M2.7

229BのMoEモデル、MiniMax-M2.7をAtomic Chatでローカル実行。プライバシーを保ちながら、オフラインで推論とコーディングを行えます。APIキー不要、クラウド不要、制限なし。無料です。

思考
ツール利用
推論
コード生成
gpt-oss-120b

gpt-oss-120bは、OpenAIのオープンウェイトMoEです。総パラメータ数は117B、アクティブパラメータ数は5.1Bで、単一の80 GB GPUに収まる規模です。Atomic Chatで無料でローカル実行できます。

ツール利用
思考
推論
コード生成
gpt-oss-20b

gpt-oss-20bは、総パラメータ数21B、アクティブパラメータ数3.6BのOpenAIのオープンウェイトMoEモデルです。16 GB以内のメモリで動作するよう、MoEの重みはMXFP4で事後学習されています。

ツール利用
思考
推論
コード生成
gemma-3-270m

Gemma 3 270Mは、Gemma 3で最小のモデルです。パラメータ数は268M、コンテキスト長は32Kで、6兆トークンのデータで学習されています。Q8_0 GGUFのファイルサイズは0.29 GBです。

推論
多言語
gemma-3-1b-it

Gemma 3 1Bは、GoogleのGemma 3で最小のモデルです。パラメータ数は1B、コンテキスト長は32Kで、学習には2兆トークンを使用しています。Q4_K_MのGGUFビルドは0.81 GBです。

推論
コード生成
多言語
DeepSeek-V3.2

685BのMoEモデル、DeepSeek-V3.2をAtomic Chatでローカル実行。プライバシーを保ちながら、オフラインで推論とコーディングができます。APIキーもクラウドも不要、利用制限もありません。無料です。

思考
ツール利用
推論
コード生成
多言語
DeepSeek-R1

671Bの推論モデルDeepSeek-R1を、Atomic Chatでローカル実行できます。プライバシーを保ちながら、クラウドも制限もなく、オフラインで思考過程を生成できます。無料です。

思考
推論
コード生成
多言語
Llama-3.2-3B-Instruct

Llama 3.2 3B Instructは、コンテキスト長128KのMetaの3.21B多言語チャットモデルです。4ビットGGUFビルドのファイルサイズは2 GBです。

ツール利用
推論
コード生成
多言語
Llama-3.1-8B-Instruct

Llama-3.1-8B-Instructは、128Kのコンテキスト長とツール呼び出しに対応したMetaの8B多言語チャットモデルです。Q4_K_Mビルドのサイズは4.92 GBです。

ツール利用
推論
コード生成
多言語
Qwen3-Coder-30B-A3B-Instruct

Qwen3-Coder-30B-A3B-Instructは、エージェント型コーディング向けのQwenのMoEモデルです。総パラメータ数は30.5B、トークンあたりのアクティブパラメータ数は3.3B、ネイティブのコンテキスト長は262Kです。ライセンスはApache 2.0です。

ツール利用
推論
コード生成
多言語
Qwen3-30B-A3B

Qwen3-30B-A3Bは、トークンごとに3.3Bのパラメータを有効化する30.5BのMoEモデルです。思考モードを切り替えられ、100以上の言語に対応しています。

ツール利用
思考
推論
コード生成
多言語
Qwen3-14B

Qwen3-14Bは、Qwenチームが開発した14.8Bパラメータのデンスモデルです。切り替え可能な思考モードと、YaRNによる131Kのコンテキスト長を備えています。Q4_K_Mビルドのサイズは9.00 GBです。

ツール利用
思考
推論
コード生成
多言語
Qwen3-32B

Qwen3-32Bは、AlibabaのQwenチームが開発した、パラメータ数32.8BのApache 2.0モデルです。思考モードを切り替えられ、100以上の言語に対応しています。Q4_K_Mは24 GBのGPUに収まります。

ツール利用
思考
推論
コード生成
多言語
Nex-N2-mini

Nex-N2-miniは、Nex-AGIがQwen3.5-35B-A3B-Baseをコーディングとツール使用向けに事後学習した35.1Bのエージェントモデルです。ライセンスはApache 2.0で、GGUFビルドは9.78 GBから提供されています。

ツール利用
思考
画像認識
推論
コード生成
LocateAnything-3B

LocateAnything-3BはNVIDIAの視覚グラウンディングモデルです。画像と自然言語の指示から、物体、GUI要素、文字の位置をバウンディングボックスや点で出力します。

思考
画像認識
推論
コード生成
diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4Bは、Google DeepMindのテキスト拡散モデルです。Gemma 4のMoEを採用し、256トークンのブロックを並列にノイズ除去して、1パスあたり15-20トークンを生成します。

思考
画像認識
音声
推論
コード生成
GLM-5.1

GLM-5.1は、Z.aiがエージェント型エンジニアリング向けに開発した、753.9BパラメータのMITライセンスのフラッグシップモデルです。SWE-Bench Proでは58.4で首位を獲得しています。Atomic Chatでローカル実行できます。

ツール利用
思考
推論
コード生成
gemma-4-E2B-it

Gemma 4 E2Bは、Google DeepMindのGemma 4で最小のモデルです。実効パラメータ数は2.3Bで、テキスト、画像、音声の入力と128Kのコンテキスト長に対応します。

思考
埋め込み
画像認識
音声
推論
gemma-4-12B-it

Gemma 4 12Bは、Google DeepMindのエンコーダーを使わないマルチモーダルモデルです。テキスト、画像、音声、動画の入力に対応し、コンテキスト長は256K、ライセンスはApache 2.0です。

思考
埋め込み
画像認識
音声
推論
FastContext-1.0-4B-RL

コンパクトな長文コンテキスト対応モデルFastContext-1.0-4B-RLを、Atomic Chatでローカル実行できます。オフラインでプライバシーを保ち、APIキーも不要です。無料で利用できます。

ツール利用
コード生成
多言語
VibeThinker-3B

VibeThinker-3BはWeiboAIの3.1B推論モデルです。IMO-AnswerBenchでは671Bから1Tのモデルに並ぶ範囲の76.4を記録し、未見のLeetCodeコンテストでは96.1%を達成しています。

思考
推論
コード生成
Nex-N2-Pro

Nex-N2-Proは、Qwen3.5-397B-A17Bに事後学習を施した、Nex-AGIの396.8Bパラメータの混合エキスパート型エージェントモデルです。ライセンスはApache 2.0で、GGUFビルドは82 GBから用意されています。

ツール利用
思考
画像認識
推論
コード生成
North-Mini-Code-1.0

North-Mini-Code-1.0は、エージェントによるコーディングとターミナル作業向けに開発されたCohereの30B-A3B MoEモデルです。コンテキスト長は256Kで、ライセンスはApache 2.0です。

ツール利用
思考
埋め込み
推論
コード生成
MiMo-V2.5-Pro

MiMo-V2.5-Proは、総パラメータ数1.02T、アクティブパラメータ数42B、コンテキスト長1MトークンのXiaomi製MoEモデルです。MITライセンスで公開されています。最小のGGUFビルドは304 GBです。

ツール利用
思考
推論
コード生成
多言語
GLM-5.2

GLM-5.2は、Z.aiの753.3Bパラメータのフラッグシップモデルです。安定して使える1Mトークンのコンテキスト長を備え、地域制限のないMITライセンスで公開されています。

思考
推論
コード生成
MiniMax-M3

427BのMoEモデル、MiniMax-M3をAtomic Chatでローカル実行。プライバシーを守りながら、オフラインで長いコンテキストを使った推論ができます。APIキー不要、制限なし。無料です。

思考
画像認識
推論
コード生成
Kimi-K2.7-Code

1TパラメータのコーディングモデルKimi-K2.7-Codeを、Atomic Chatでローカル実行できます。オフラインでエージェント型コーディングができ、プライバシーも完全に守られます。無料でダウンロードできます。

ツール利用
思考
画像認識
推論
コード生成
DeepSeek-V4-Flash

DeepSeek-V4-Flashは、総パラメータ数284B、アクティブパラメータ数13B、コンテキスト長1MトークンのMoEモデルです。DeepSeekがMITライセンスで公開しています。

思考
推論
コード生成
多言語
Qwen3.6-35B-A3B

Qwen3.6-35B-A3Bは、QwenのオープンなMoE視覚モデルです。総パラメータ数は35B、アクティブパラメータ数は3B、コンテキスト長は262Kで、ライセンスはApache 2.0です。低ビットのGGUFビルドは12 GBに収まります。

ツール利用
思考
埋め込み
画像認識
推論
Qwen3.6-27B

Qwen3.6-27Bは、262Kのコンテキスト長を備え、思考モードがデフォルトで有効な27.8Bのデンス型視覚言語モデルです。GGUFビルドは最小9.39 GBで、12 GBのマシンで動作します。

ツール利用
思考
埋め込み
画像認識
推論
gemma-4-31B-it

Gemma 4 31Bは、Google DeepMindの、パラメータ数30.7Bのオープンなデンスモデルです。テキストと画像の入力、256Kトークンのコンテキスト長に対応し、Apache 2.0ライセンスで公開されています。

思考
埋め込み
画像認識
音声
推論
gemma-4-26B-A4B-it

GoogleのGemma 4 MoE。総パラメータ数は25.2B、アクティブパラメータ数は3.8Bで、256Kのコンテキスト長と画像入力に対応します。ライセンスはApache 2.0です。4Bに近い規模のモデルと同等の速度で動作します。

思考
埋め込み
画像認識
音声
推論
WebWorld-8B

WebWorld-8Bは、現在の状態とアクションから次のウェブページの状態を予測する、テキスト専用のQwenの世界モデルです。ライセンスはApache 2.0です。

思考
推論
ウェブ検索
DeepSeek-V4-Pro

DeepSeek-V4-Proは、総パラメータ数1.6T、トークンごとに49Bのパラメータを有効化するMoEモデルです。コンテキスト長は1Mトークンで、MITライセンスで提供されています。Atomic Chatで無料でローカル実行できます。

思考
推論
コード生成
多言語
Qwen3.6-27B-MTP

Qwen3.6-27B-MTPは、Multi-Token Predictionヘッドを有効にして動作するQwen3.6-27Bです。モデルが各ステップで複数のトークン候補を生成し、ローカルでの生成を高速化します。

思考
ツール利用
画像認識
Supertonic-3

Supertonic 3は、Supertoneが開発した99Mパラメータのオンデバイス音声合成(TTS)システムです。31言語に対応し、CPUで高速に動作します。ONNXアセットのサイズは約400 MBです。

音声
多言語
Sulphur-2-base

Sulphur 2 baseは、LTX 2.3をベースにした検閲なしの動画生成モデルです。テキストからの動画生成と画像からの動画生成にネイティブ対応し、ComfyUIワークフローも付属しています。

画像生成
Dramabox

Dramaboxは、LTX-2.3の音声ブランチを基盤とするResemble AIの表現力豊かな音声合成モデルです。プロンプトで声、感情、話し方を制御でき、10秒の参照音声で声をクローンできます。

音声
MiniCPM-V 4.6

MiniCPM-V 4.6は、OpenBMBが開発した1.3Bの視覚言語モデルです。デバイス上で画像や動画を読み取り、開発元が提供するGGUFビルドは最小0.5 GBです。

画像認識
Anima

Animaは、CircleStone LabsとComfy Orgによる2Bパラメータのテキストから画像を生成するモデルです。イラストや芸術作品の制作向けに、数百万枚のアニメ画像で学習されています。

画像生成

検索条件に一致するモデルはありません。フィルターを外すか、パラメータ数の範囲を広げてみてください。

ローカルで動かすオープンソースモデルの選び方

このカタログのモデルは、すべて自分のハードウェアだけで動きます。APIキーも、トークン単位の課金も、マシンの外に出るデータもありません。そのためローカルモデルは、外に出せないデータを扱う作業、オフライン環境、そして従量課金のクラウドAPIではコストがかさむ大量処理に向いています。一方で、ハードウェアを用意するのは自分です。最適なモデルは、タスクと同じくらい手元のマシンによって決まります。

いちばん効いてくる数値はパラメータ数と必要VRAMの2つです。パラメータ数は実力をおおまかに示す目安で、大きいモデルほど思考力も文章力も上がりますが、その分メモリを使い、動作は遅くなります。必要VRAMは、そのモデルがそもそもGPUに載るかどうかを示します。量子化したビルドならこの数値は下がり、品質の低下はわずかです。ほかを比べる前に、まずサイドバーのフィルターで、自分のマシンで実際に動くモデルまで絞り込んでください。

タスクに合わせてモデルを選ぶ

コード補完向けにチューニングしたモデルは、同じサイズでもチャットや画像向けのモデルとは挙動が変わります。タスクフィルターは、テキスト生成、画像からテキスト、テキストから画像など、学習した目的ごとにモデルをまとめています。まずはここから入り、そのうえでタスク内をサイズや重みの更新の新しさで並べ替えてください。

汎用チャットと推論に強いモデル

ここで挙げる汎用モデルは、回答の品質とハードウェアのコストのバランスが取れています。どれも最近のノートPCやミドルレンジのGPUで快適に動きます。

ModelParametersVRAM requiredBest for
Qwen 3 8B
8B~8 GBEveryday chat on a laptop
Llama 3.1 8B
8B~8 GBBalanced reasoning and writing
Mistral Small 24B
24B~16 GBStronger reasoning, mid-range GPU
Qwen 3 32B
32B~24 GBHighest quality, desktop GPU

非力なハードウェアに向くモデル

CPUだけのマシンや、メモリの少ないGPUで作業しているなら、こうした小型モデルや量子化モデルが向いています。ディスクリートGPUがなくても軽快に応答します。

ModelParametersVRAM requiredBest for
Qwen 3 1.7B
1.7BCPU onlyFast replies on any laptop
Llama 3.2 3B
3B< 8 GBLightweight assistant tasks
Mistral 7B (Q4)
7B~6 GBQuantized build for older GPUs

ここで挙げたのはランキングではなく、あくまで出発点です。最適なモデルとは、目的のタスクで手元のハードウェアがスムーズに動かせる、いちばん大きいモデルです。上のフィルターから、カタログ全体を見てみてください。

よくある質問

ローカルモデルは自分のハードウェアで動くため、APIキーも利用制限もなく、第三者にデータが送られることもありません。クラウドAPIはスケールさせやすい一方で、トークン単位の課金とインターネット接続が必要です。ローカルモデルは、その手軽さと引き換えにプライバシーと見通せるコストを手に入れます。

GPUメモリと「必要VRAM」の値を見比べるか、その値でカタログを絞り込んでください。モデルがGPUに収まらない場合でも、量子化したビルドやCPUだけで動くモデルなら動きます。ただし速度は落ちます。

パラメータとは、モデル内部の学習済みの重みのことです。パラメータが多いほど、一般に思考力と文章力は上がりますが、その分メモリを使い、生成も遅くなります。実力をおおまかに示す目安であって、正確なスコアではありません。

モデルごとのライセンス次第です。多くはApache 2.0のような寛容なライセンスで公開されていますが、商用利用を制限しているものもあります。製品に組み込む前に、必ずモデルページに記載のライセンスを確認してください。

はい。重みをダウンロードしてしまえば、ローカルモデルはネットワーク接続なしで動きます。閉域環境での運用や、機密データをデバイス上にとどめたい場合に役立ちます。