ブログ

/

LLM最新情報

/

オープンウェイトLLMおすすめ10選|性能・ライセンス比較【2026年】

オープンウェイトLLMおすすめ10選|性能・ライセンス比較【2026年】

2026年、オープンソースLLMはクローズドモデルの最先端に追いつきました。ノートPCで動く小型モデルから、パラメータ数が兆単位のフラッグシップまで、おすすめのオープンウェイトモデル10選をランキング化し、ベンチマーク、ライセンス条件、各モデルに必要な具体的なハードウェアをまとめました。

オープンウェイトLLMおすすめ10選|性能・ライセンス比較【2026年】
Andrew Dyuzhov
Andrew Dyuzhov

目次

この記事では、小型のローカルモデルから、ClaudeやOpenAIが提供する最高性能のモデルと互角に渡り合う最先端レベルのAIまで、2026年に実行できるおすすめのオープンソースLLMを比較します。おすすめのオープンソースモデルと、自分のマシンでローカル実行する方法を紹介します。

オープンソースモデルとオープンウェイトモデルの違い

おすすめのオープンソースモデルを紹介する前に、ひとつだけ確認しておきましょう。厳密には、オープンソースモデルとは、重み、学習コード、データを含め、そのモデルを再現するために必要なものすべてを、商用利用も含めて自由に使えるライセンスで開発元が公開したモデルのことです。これを実践している開発元はごくわずかです。

その代わりに、開発元はモデルをオープンウェイトとして公開しています。これは、開発元が完成した重みだけを公開するモデルです。ただし、実用上は重みを自由にダウンロードしてローカルで実行でき、多くの場合は商用利用もできます。

オープンソースライセンスを理解する

また、オープンウェイトモデルにはさまざまなライセンスが適用されます。大半のライセンスはダウンロード、実行、商用利用を認めているため、ほとんどのユーザーにとって、モデルがどのライセンスで公開されているかは問題になりません。ただし、いくつかの細かな違いは把握しておく必要があります。もっとも、モデルを非常に成功した商用プロジェクトで使わない限り、こうした違いが問題になることはありません。広く使われているモデルのライセンスは次のとおりです。

  • MITとApache 2.0では、許可を得ずにモデルを商用利用し、改変し、製品に組み込んで提供できます。GLM-5.2、DeepSeek-V4、Qwen3.6、Gemma 4、Hunyuan Hy3は、これらのライセンスで公開されています。
  • Modified MITには、製品の売上高またはユーザー数が一定の基準を超えた場合にクレジットを表記するという、軽い条件が加わります。MoonshotのKimiモデルは、このライセンスで公開されています。
  • コミュニティライセンスは商用利用を認めていますが、クレジットの表記が必要で、年間売上高が$20Mを超える場合はベンダーの書面による許可も必要です。MiniMax-M3モデルは、このライセンスで公開されています。
  • 研究専用ライセンスと非商用ライセンスでは、重みのダウンロード以外は認められていません。MiniMax-M2.7は2026年3月にこのライセンスで公開されましたが、コミュニティの反発を受けて、MiniMaxは後継のM3で、より利用しやすいコミュニティライセンスに移行しました。

2026年のおすすめオープンソースLLMは?

最適なモデルの定義は、多くの場合「自分の用途に最適なモデルは何か」に行き着きます。そこで、サイズや設計が異なるモデルを取り上げ、自分で実行しやすい順に並べました。一般消費者向けハードウェアに収まるモデルを先に、データセンター規模のフラッグシップを後に配置しています。各モデルをこのリストに選んだ理由は、以下で詳しく説明します。

モデル開発元パラメータ数コンテキスト長ライセンス最適な用途
Qwen3.6Alibaba27Bのデンスモデル262KApache 2.0自分の環境での実行
Gemma 4Google2B~31B256KApache 2.0小型モデルの利用とノートPCでの実行
gpt-oss-120bOpenAI117B(アクティブ5.1B)128KApache 2.0OpenAIのオープンモデルという選択肢
Hunyuan Hy3Tencent295B(アクティブ21B)256KApache 2.0ギガバイトあたりの性能
Command A+Cohere218B(アクティブ25B)128KApache 2.0企業向けRAG
GLM-5.2Z.ai753B(アクティブ40B)1MMIT総合的な最良の選択肢
DeepSeek-V4-ProDeepSeek1.6T(アクティブ49B)1MMIT大規模な長文コンテキスト処理
Kimi K3Moonshot AI2.8T1MModified MIT最先端レベルのエージェント処理
MiniMax-M3MiniMax428B(アクティブ23B)1Mコミュニティマルチモーダル+1Mコンテキスト長
Nemotron 3 UltraNVIDIA550B(アクティブ55B)1MOpenMDW-1.1最も包括的なオープン公開

‍

2026年のおすすめオープンソースLLM 10選の比較表。各モデルの開発元、パラメータ数、コンテキスト長、ライセンス、最適な用途を掲載。

2026年のおすすめオープンソースLLM 10選を比較

まずは、オープンソースLLMのランキングを見てみましょう。最もよく引用される3つのベンチマークで、おすすめのオープンソースLLMを比較します。

モデルSWE-bench VerifiedGPQA DiamondMMLU-Pro
Qwen3.6-27B77.287.886.2
Gemma 4 31B——85.2
gpt-oss-120b62.4——
Hunyuan Hy3———
Command A+———
GLM-5.2—91.2—
DeepSeek-V4-Pro80.6—87.5
Kimi K3———
MiniMax-M380.593.0—
Nemotron 3 Ultra70.7—86.8

注:Kimi K3、Hunyuan Hy3、Command A+の行は空欄です。それぞれ独自のベンチマークセットで結果を報告しており、直接比較できないためです。

1. Qwen3.6

2026年4月に公開されたQwen3.6は、Alibabaのオープンウェイトモデルです。一般消費者向けハードウェアで動くため、ローカルでの導入に最も人気のあるLLMのひとつです。

Qwen3.6ファミリーには多くのバリエーションがありますが、まずはデンスモデルの27B版を検討することをおすすめします。

仕様:

仕様Qwen3.6
バリエーション27Bデンスモデル、35B-A3B MoE
コンテキスト長ネイティブで262K、YaRN使用時は約1M
入力テキストと画像
公開時期2026年4月
ライセンスApache 2.0

ベンチマーク:

ベンチマーク27B35B-A3B
SWE-bench Verified77.273.4
GPQA Diamond87.886.0
MMLU-Pro86.285.2
LiveCodeBench v683.9—
Terminal-Bench 2.059.3—
AIME 202694.1—
SWE-bench Pro53.5—
VideoMMU—83.7

ご覧のとおり、27Bのデンスモデルは、より大きな35BのMoEモデルをも上回っています。そのため、システムで実行できるのであれば、このバリエーションから始めることをおすすめします。

また、このモデルのSWE-bench Verifiedのスコアは77.2で、DeepSeek-V4-Proとほぼ同じです。DeepSeek-V4-Proはこの記事の後半で紹介する別の人気オープンウェイトモデルですが、パラメータ数ではDeepSeekのほうが59倍大きいにもかかわらず、この結果となっています。

27Bに必要なハードウェア:

量子化サイズハードウェア
BF16約54GBRTX PRO 6000 96GBまたは2× RTX 5090
8ビット約28GBRTX 5090 32GB
4ビット約15GBRTX 5080 16GBまたはRTX 4090 24GB

最適な用途:セルフホスティングと、オフラインのローカルAIエージェントの実行。27Bは24GB GPU 1基で実行できます。

2. Gemma 4

Gemma 4も、ローカルで実行できる小型のオープンウェイトモデルです。Google DeepMindが開発し、2026年4月に公開されました。

特に、このファミリーにはマルチモーダル入力をネイティブでサポートする2B版と4B版があり、動画や画像に加えて、最大30秒の発話の音声処理にも対応しています。こうした小型のバリエーションは最近のスマートフォンでも動くため、オンデバイスAIに最適ですが、控えめなハードウェアでローカルモデルを実行するユーザーにも役立ちます。

そのため、Gemma 4が2026年に最も多くダウンロードされたオープンモデルファミリーとなったのも不思議ではありません。執筆時点でHugging Faceで最も人気のあるバリエーションは31BとE4Bで、ダウンロード数は1,400万回を超えていました。

仕様:

仕様Gemma 4
バリエーションE2B、E4B、12B、26B-A4B MoE、31Bデンスモデル
コンテキスト長サイズに応じて128K~256K
入力テキスト、画像、動画、音声
公開時期2026年4月
ライセンスApache 2.0

Gemma 4は、このファミリーで初めて、制約の少ないApacheライセンスで公開されました。以前のGemmaでは、Googleが独自に変更を加えた、制限付きの利用規約が使われていました。

ベンチマーク:

バリエーションMMLU-Pro
E2B60.0
E4B69.4
12B77.2
26B-A4B82.6
31B85.2

Gemma 4 31Bの性能はQwen3.6 35Bとほぼ同水準です。ローカルでの導入に適したオープンウェイトモデルの中でも、最も知的能力の高いモデルのひとつです。

必要なハードウェア:

バリエーション4ビットでのサイズハードウェア
E4B約3GB最近のノートPCまたはスマートフォンならどれでも
12B約7GBRTX 5060 8GB
26B-A4B約14GBRTX 5080 16GB
31B約18GBRTX 4090 24GBまたはRTX 5090

最適な用途:控えめなハードウェアでの高度なローカルAIの実行。

3. gpt-oss-120b

gpt-oss-120bは、GPT-2以降に登場したOpenAIの最新オープンウェイトモデルです。OpenAIは、社名に文字どおりopenが入っているにもかかわらず、オープンモデルをあまり公開しません。そのため、現在ではやや古くなっているとはいえ、たとえばコンテキスト長がわずか128Kトークンと小さいものの、ChatGPTのような体験をローカルで再現するうえで、私たちが利用できる最良のモデルです。

もはや最高のオープンウェイトモデルではありませんが、GPT OSSファミリーはツールのサポートが充実しており、アクティブパラメータ数がわずか5.1Bと小さいため、総パラメータ数の割に実行しやすいのが特徴です。

仕様:

仕様gpt-oss-120b
総パラメータ数117B
アクティブパラメータ数5.1B
コンテキスト長128Kトークン
公開時期2025年8月
ライセンスApache 2.0

ベンチマーク:

ベンチマークスコア評価環境
SWE-bench Verified62.4OpenAI社内のエージェント実行フレームワーク
SWE-bench Verified26.0swebench.comのbash専用エージェント

ベンチマークの結果は評価環境によって大きく変わり、このモデルではOpenAI自身が報告した数値が独立した評価の数値を大きく上回っている点に注意してください。判断の際に考慮しておきたい点です。

必要なハードウェア:

量子化サイズハードウェア
MXFP4約61GBH100 80GB、RTX PRO 6000、または64GBのMac

gpt-oss-120bを実行するハードウェアがない場合は、gpt-oss-20bを検討してください。必要なメモリは約13GBで、RTX 5060 Ti 16GB以上で動きます。

最適な用途:OpenAIらしい振る舞いをするLLMのセルフホスティング。

4. Hunyuan Hy3

Hunyuan Hy3は、Tencentが2026年7月6日に公開したオープンモデルです。パラメータ数は295Bですが、FP8では300GB未満、公式の4ビット量子化では100GB未満に収まりながら、兆単位のパラメータを持つモデルと競合する位置づけです。128GBを超えるVRAMまたは統合メモリがあれば、ローカルで実行できます。

仕様:

仕様Hunyuan Hy3
総パラメータ数295B
アクティブパラメータ数21B
コンテキスト長256Kトークン
公開時期2026年7月
ライセンスApache 2.0

このモデルを商用利用する場合は、ライセンスを読んでください。4月の公開時には、プレビュー版にEU、英国、韓国を対象外とする地理的制限がありましたが、7月のライセンス変更で撤廃されました。把握しておきたい点です。

必要なハードウェア:

量子化サイズハードウェア
FP8約295GB4× H200
4ビットGGUF約100GB128GBのMac Studioまたは2× RTX PRO 6000
1ビットGGUF約45GBRTX PRO 6000 96GBまたは64GBのMac

4ビットと1ビットのGGUFは、Tencentによる公式リリースです。これは珍しいことで、ほとんどの研究機関は、大幅にビット数を削減する量子化をコミュニティに任せています。

最適な用途:128GBのワークステーションやMac Studioのような大容量メモリ搭載マシン1台で、フラッグシップに近い品質を得ること。

5. Command A+

Command A+は、Cohereが2026年5月に公開したオープンウェイトモデルです。他のモデルと異なる特徴は、引用生成機能がモデルの重みに直接組み込まれていることです。たとえばPerplexityのように、モデルが返すすべての回答に出典の引用が付きます。この独自機能により、詳細な調査を行うアプリケーションや、モデルが提供する情報の出所について透明性が必要な場面で、有力な候補となります。

仕様:

仕様Command A+
総パラメータ数218B
アクティブパラメータ数25B
コンテキスト長128Kトークン
言語48
公開時期2026年5月
ライセンスApache 2.0

ベンチマーク:

ベンチマークスコア
τ²-Bench Telecom85.0
Terminal-Bench Hard25.0
MMMU-Pro63.0

注:これは情報検索モデルのため、SWE-benchやGPQAの数値は公開されていません。

必要なハードウェア:

量子化サイズハードウェア
BF16約436GB8× H100
FP8約218GB4× H100
W4A4約110GB2× H100または128GBのMac Studio

最適な用途:社内検索、文書に関するQ&Aなどの企業向けRAGや、回答に出典の引用が必須となるあらゆる導入環境。

6. GLM-5.2

GLM-5.2は、Z.aiが2026年6月に公開した、753Bパラメータの混合エキスパートモデルです。非常に高性能なオープンウェイトAIモデルです。Interconnectsはこれを「オープンモデルにとっての飛躍的な進歩」と評しました。エージェントワークフローでClaude Opus級のLLMを置き換えられる、初のオープンリリースです。

仕様:

仕様GLM-5.2
総パラメータ数753B
アクティブパラメータ数約40B
コンテキスト長1Mトークン
推論推論に割く計算量を2段階から選択可能
公開時期2026年6月
ライセンスMIT

ベンチマーク:

ベンチマークスコア
GPQA Diamond91.2
SWE-bench Pro62.1
Terminal-Bench 2.182.7
Humanity's Last Exam40.5
Humanity's Last Exam、ツール使用54.7

注:Z.aiはSWE-bench VerifiedとLiveCodeBenchの結果を報告していないため、ここではそれらの数値を省略しています。

必要なハードウェア:

量子化サイズハードウェア
FP8約750GB8× B200または複数ノードのH100クラスター
4ビット約380GB8× H100または512GBのMac Studio
2ビット約200GB4× H100または256GBのMac Studio

最適な用途:最も高性能なオープンモデルを必要とするユーザー。ただし、パラメータ数は753Bあるため、実行にはクラウドか本格的なマルチGPUクラスターが必要です。

7. DeepSeek-V4-Pro

2026年4月に公開されたDeepSeek-V4-Proは、DeepSeekのフラッグシップモデルです。長文コンテキストを低コストで処理できるようにしたことで、V4-Proは公開から1か月以内に、本番環境で最も多く導入されたオープンLLMとなりました。1Mトークンのコンテキストを処理する際の計算量はDeepSeekの前世代の約4分の1、メモリ使用量は約10分の1で、これがAPI料金では入力100万トークンあたり$0.43、出力100万トークンあたり$0.87という価格につながっています。

DeepSeek-V4-Proは、低コストで運用できるだけでなく、フラッグシップ級の仕様を備えた、幅広い用途で高性能なモデルです。

仕様:

仕様DeepSeek-V4-Pro
総パラメータ数1.6T
アクティブパラメータ数49B
コンテキスト長1Mトークン
公開時期2026年4月
ライセンスMIT

ベンチマーク:

ベンチマークスコア
SWE-bench Verified80.6
LiveCodeBench93.5
MMLU-Pro87.5
Codeforcesレーティング3206
1Mコンテキスト長でのMRCR83.5

ハードウェアの観点では、このモデルもクラウドまたはデータセンターでの導入に最も適しています。

必要なハードウェア:

量子化サイズハードウェア
6ビット以下約1.2TB複数ノードのデータセンタークラスター
4ビット約800GB8× B200または16× H100
2ビット約400GB8× H100または4× H200

最適な用途:APIコストが決め手となる長文コンテキスト処理。DeepSeek-V4-ProモデルのAPI料金は、GPT、Claude、Geminiファミリーの同等モデルの10~30分の1だからです。

8. Kimi K3

Kimi K3は、2026年7月16日に公開された、Moonshot AIの2.8兆パラメータのフラッグシップモデルです。執筆時点では最も高性能なオープンウェイトモデルで、Artificial Analysisの知能指数ではClaude Fable 5とGPT-5.6 Solに次ぐ第3位に位置しています。

仕様:

仕様Kimi K3
総パラメータ数約2.8T
コンテキスト長1Mトークン
ネイティブ形式MXFP4、量子化を考慮した学習を実施
重みのサイズ約1.4TB
公開日2026年7月16日
重みの公開日2026年7月27日
ライセンスModified MIT

ベンチマーク:

ベンチマークスコア出典
Terminal-Bench 2.188.3Moonshot
Terminal-Bench 2.180.9Vals AI、独立評価
BrowseComp90.4Moonshot
DeepSWE67.3Moonshot

出典によって性能の数値には多少のばらつきがあり、よくあることですが、社内評価の数値のほうが少し高くなっています。ただし、おおむね同じ水準です。

必要なハードウェア:

量子化サイズハードウェア
MXFP4約1.4TB複数ノードのデータセンタークラスター

gpt-ossと同様に、K3は量子化を考慮して学習されているため、ビルドは1種類しかありません。大幅にビット数を削減した2ビット量子化でも約700GBになるため、このモデルのローカルでの導入は現実的ではありませんが、クラウド上のオープンウェイトモデルとして利用できます。

Kimiは、コーディングに特化した1TパラメータのKimi K2.7-Codeも公開しました。これは、GitHub Copilot内で提供された初のオープンウェイトモデルとなりました。4ビットビルド(約510GB)は8× H100で動くため、K3よりも実行しやすいモデルです。それでも、自宅で使うためのモデルではありません。

最適な用途:最先端レベルのエージェント処理。

9. MiniMax-M3

MiniMax-M3は、上海に拠点を置くMiniMaxが開発したフラッグシップモデルです。

MiniMax-M3は、テキスト、画像、動画の入力をサポートするオープンソースのマルチモーダルLLMで、1Mトークンのコンテキスト長と23Bのアクティブパラメータを備えています。

仕様:

仕様MiniMax-M3
総パラメータ数428B
アクティブパラメータ数23B
コンテキスト長1Mトークン
入力テキスト、画像、動画
公開時期2026年6月
ライセンスMiniMax Community License

商用利用する場合、ライセンス上は認められていますが、「Built with MiniMax M3」というクレジットを追加する必要があります。

また、スパースアテンション設計により、コンテキストを上限まで使用した場合のプロンプト処理はMiniMax自身の前世代モデルの9倍、生成は15倍高速です。そのため、コンテキストを使い切るような長期にわたるタスクで非常に効率的です。

ベンチマーク:

ベンチマークスコア
SWE-bench Verified80.5
SWE-bench Pro59.0
Terminal-Bench 2.166.0
Video-MME v285.4
AA Intelligence Index55

ハードウェアの観点では、NVFP4なら、非常にハイエンドな家庭用システムでもこのモデルを何とか実行できます。

必要なハードウェア:

量子化サイズハードウェア
MXFP8約430GB8× H100または4× B200
NVFP4約215GB4× H100または256GBのMac Studio
3ビット約160GB192GBのMac Studio

最適な用途:マルチモーダルエージェントと、コンテキストを上限まで使用する長期にわたるタスク。

10. Nemotron 3 Ultra

Nemotron 3 Ultraは、NVIDIAのフラッグシップモデルです。中国以外で開発されたオープンウェイトモデルの中で、最も高度なモデルです。また、フラッグシップ級モデルの中で最も真のオープンソースに近いモデルでもあります。NVIDIAは重みだけでなく、次のものも一般公開しているためです。

  • 学習データセット(合計3Tトークン超)
  • 事後学習の手順とRL環境
  • スコアの算出に使用した評価ハーネス

仕様:

仕様Nemotron 3 Ultra
総パラメータ数550B
アクティブパラメータ数55B
アーキテクチャハイブリッドMamba-Transformer MoE
コンテキスト長1Mトークン
公開時期2026年6月
ライセンスOpenMDW-1.1

純粋な性能では、中国のオープンウェイトモデルにすぐ次ぐ位置にあります。

ベンチマーク:

ベンチマークスコア
SWE-bench Verified70.7
LiveCodeBench89.0
MMLU-Pro86.8
1Mコンテキスト長でのRULER95.0
AA Intelligence Index47.7

必要なハードウェア:

量子化サイズハードウェア
BF16約1.1TB8× B200または16× H100
FP8約550GB8× H100
NVFP4約275GB4× H200

最適な用途:監査可能な学習データと、米国由来のサプライチェーンを必要とするチーム。

ローカルで実行するのに最適なオープンソースLLMは?

自分のハードウェアでオープンソースモデルを実行する方法や、マシンに合ったモデルサイズと量子化レベルの選び方を知りたい場合は、LLMをローカルで実行する方法のガイドをお読みください。

ローカルでの導入に最適なオープンソースLLMを知りたい方に、答えを簡潔にまとめます。

8GBグラフィックカードに最適なLLM

4ビット量子化のGemma 4 12Bは、8GBに収まる最良のモデルです。短いコンテキストであれば、VRAM使用量は約7GBです。

長い会話のために余裕を確保したい場合は、ひとつ小さいGemma 4 E4Bを選んでください。まさにこのクラスのハードウェア向けに作られています。

24GBグラフィックカードに最適なLLM

RTX 3090、4090、5090をお持ちなら、4ビットのQwen3.6-27Bが最良のローカルLLMです。重みには約15GBが必要なため、コンテキスト用の余裕を確保できます。このモデルは、同規模のモデルの中で最高のコーディング性能も備えています。

僅差の第二候補は4ビットのGemma 4 31Bですが、ベンチマークではやや劣ります。

開発者向けのおすすめローカルモデルについて詳しく知りたい場合は、コーディングに最適なローカルLLMを詳しく紹介したガイドをご覧ください。

96GB以上のグラフィックカードに最適なLLM

RTX 6000 Blackwell、80GBのH100、または128GBの統合メモリを搭載したMacをお持ちなら、実行できる最良のモデルはTencent公式の4ビットビルドのHunyuan Hy3です。約100GBを必要とし、フラッグシップに近い品質を実現します。

オープンソースLLMを実行するためのツール

モデルを選んだら、それを実行するソフトウェアが必要です。シンプルなデスクトップアプリから本番環境向けの推論サーバーまで、オープンソースLLMをローカルで実行するための主なツールを紹介します。

Atomic Chat

Atomic Chatは、Mac、Windows、Linux、iPhone、Android向けの無料ローカルAIチャットアプリです。上で紹介したモデルを含め、Hugging Faceの1,000以上のオープンモデルを選んで実行できます。Atomic Chatはデバイス上でローカルに推論を実行するため、入力した内容がマシンの外に出ることはなく、レート制限もメッセージ数の上限もありません。GoogleのTurboQuant圧縮を搭載しており、精度を一切低下させずにモデルを3ビットまで縮小し、KVキャッシュを少なくとも6分の1に圧縮します。これにより、このリストにある大型モデルも一般消費者向けのメモリ容量に収まります。TurboQuantは、標準的な32ビットモデルと比べてアテンション計算も最大8倍高速化し、Hermes、OpenClaw、Clineなどのワンクリックで使えるエージェントも、そのまま動作します。

‍

MacとiPhoneでローカルモデルを実行しているAtomic Chatのデスクトップアプリとモバイルアプリ。

Ollama

Ollamaは、LLMをローカルで実行するためのオープンソースツールです。単一のコマンド(ollama run qwen3.6)で独自のレジストリからモデルをダウンロードして実行し、localhost上にOpenAI互換APIを公開することで、他のアプリケーションがローカルモデルのバックエンドとして利用できるようにします。

ollamaコマンドは、チャット、コードの記述、ウェブ検索ができる対話型エージェントも起動します。また、OllamaはClaude Code、Codex、OpenCode、OpenClawなどのコーディングエージェントと連携します。

‍

オープンモデルをローカルで実行するための1行のインストールコマンドを表示しているOllamaのウェブサイト。

LM Studio

LM Studioは、グラフィカルインターフェースを通じてHugging Faceのモデルをダウンロードし、チャットできる、無料のクローズドソースデスクトップアプリです。すべてのプラットフォームで動くllama.cppと、MシリーズMacで動くAppleのMLXという2つの推論エンジンを使用します。LM Studioによると、MシリーズMacでは、MLXバックエンドが同じハードウェア上のllama.cppより30~50%高速に動作します。

lmsコマンドラインツールと、ローカルのOpenAI互換サーバーも含まれており、他のアプリケーションがバックエンドとして利用できます。最近のMLXアップデートでは、視覚モデル向けのプロンプトキャッシュと、長時間のセッション向けのKVキャッシュのチェックポイント機能が追加されました。

‍

gpt-oss-20bをローカルで実行し、コード生成のチャットを行っているLM Studioのデスクトップアプリ。

llama.cpp

llama.cppは、Georgi Gerganovが2023年に開発を始めた、オープンソースのC++推論エンジンです。OllamaとLM Studioはいずれもこれを基盤としており、ローカル向けツールで広く使われるGGUFモデル形式も、このプロジェクトから生まれました。CUDA、Apple Metal、Vulkan、AMD ROCm、CPUで動作します。

コマンドラインから実行し、1~2ビットまでの量子化と、レイヤー単位のGPUオフロードをサポートしています。一部のレイヤーをシステムRAMに保持することで、利用可能なVRAMより大きなモデルも実行できます。新しいモデルアーキテクチャへの対応は、通常、GUIツールよりも先にここで実装されます。

vLLM

vLLMは、サーバー向けハードウェア上でLLMを実行するためのオープンソース推論サーバーです。1人でのローカル利用よりも、多数のリクエストを同時に処理する用途に最適化されており、PagedAttentionと連続バッチ処理を使って、高負荷時もGPUの稼働率を維持します。商用の推論プロバイダーの大半がvLLMを運用しています。

FP8、NVFP4、MXFP4、INT4、GGUFの量子化に対応しているほか、マルチGPUでのテンソル並列化とパイプライン並列化もサポートしています。これらの並列化は、このリストで最大規模のモデルを複数のGPUにまたがって実行するために必要です。

よくある質問

2026年のオープンソースLLMの選び方と実行方法について、よくある質問をまとめました。

現在、最良のオープンソースLLMは何ですか?

2026年7月時点で、最良のオープンソースLLMはGLM-5.2です。独自の追加条件がないMITライセンスで提供され、GPQA Diamond(91.2)とエージェント系ベンチマークでオープンモデルをリードしています。自分のハードウェアで実行するなら、Qwen3.6-27Bのほうが適しています。GLM-5.2はパラメータ数が753Bあり、ローカルで扱える規模を超えるためです。

ChatGPTはオープンソースですか?

いいえ。ChatGPTと、その基盤となるGPT-5.xモデルはプロプライエタリです。OpenAIがオープンウェイトとして提供しているのは、Apache 2.0で公開された、別系統のgpt-ossファミリー(120Bと20B)です。高性能なモデルですが、ChatGPTのフラッグシップには大きく及びません。

オープンソースLLMはGPT-5やClaudeに匹敵しますか?

コーディングと推論のベンチマークでは、差は数ポイントにまで縮まりました。MiniMax-M2.5はOpenHandsのコーディング指数でClaude Sonnetを上回り、GLM-5.2もクローズドのフラッグシップに近いスコアを記録しています。Epoch AIは、オープンモデルがクローズドモデルの最先端から約4か月遅れていると推定しています。また、完成度と長期にわたるエージェント処理の信頼性では、ベンチマーク表が示す以上に差があります。

オープンソースLLMは商用利用できますか?

このリストの大半は可能です。MITまたはApache 2.0のモデル(GLM-5.2、DeepSeek-V4、Qwen3.6、Gemma 4、Hunyuan Hy3、Command A+、gpt-oss)には、商用利用の制限がありません。MiniMax-M3のようなコミュニティライセンスのモデルには、クレジットの表記義務や売上高の基準が加わるため、製品を出荷する前にLICENSEファイルを読んでください。

最大のオープンソースLLMは何ですか?

重みが公開されているモデルでは、総パラメータ数が1.6兆のDeepSeek-V4-Proが最大です。2026年7月27日に重みが公開されると、2.8兆パラメータのKimi K3が最大となります。

LM Studioはオープンソースですか?

いいえ。LM Studioは無料ですが、クローズドソースのデスクトップアプリです。基盤となるエンジンのllama.cppはMITライセンスのオープンソースであり、Ollamaも完全にオープンソースです。

コーディングに最適なオープンソースLLMは何ですか?

ホスト型サービスでのエージェントによるコーディングにはKimi K2.7-Code、自分で実行する用途全般にはQwen3.6-27Bです。ローカルで使える選択肢については、コーディングに最適なローカルLLMで詳しく紹介しています。

まとめ

この記事では、2026年に実行できるおすすめのオープンソースAIモデルを紹介しました。主なポイントは次のとおりです。

  • 総合的に最良のオープンモデルはKimi K3です。ノートPC、Mac、PCで実行するのに最良のローカルモデルはQwen3.6-27Bです。
  • オープンソースと呼ばれるモデルの大半は、実際にはオープンウェイトです。これは、重みは公開されている一方で、学習コードとデータは公開されていないという意味です。モデルの実行や導入、さらには商用利用においても、これによる影響はありません。単なる技術的な区別です。
  • 2026年のオープンモデルは非常に高性能です。たとえば、GLM-5.2とKimi K3は、ほとんどのベンチマークでGPT-5.6やClaude Fable 5と数ポイント以内のスコアを記録しています。
  • 最高性能のオープンウェイトモデルの大多数は、中国の研究機関から登場しています。たとえば、このリストの10モデルのうち8モデルは、Z.ai、DeepSeek、Alibaba、Moonshot、Tencent、MiniMaxという中国の研究機関によるものです。中国以外で開発された最良のオープンモデルは、NVIDIAのNemotron 3 Ultraです。

オープンウェイトモデルをローカルで実行する最も手早い方法は、Atomic Chatを試すことです。ハードウェアに適した量子化を自動で選び、デバイス上で無料でモデルを実行します。

2026年版:おすすめMCPコネクタ38選

2026年版:おすすめMCPコネクタ38選

2026年のおすすめMCPコネクタ38選。開発、ドキュメント、データベース、ウェブ調査、クラウド、自動化に加え、Atomic Chatでローカルモデルと組み合わせて使う方法も紹介します。

8/17/26

20分

SGLangとvLLMの比較:性能と使い分け

SGLangとvLLMの比較:性能と使い分け

SGLangとvLLMの推論性能を比較。RadixAttentionとPagedAttentionの違い、共通のプロンプトが多い場合と少ない場合のベンチマークから、用途に合う推論エンジンの選び方を解説します。

8/4/26

9分

OllamaとvLLMを比較|推論サーバーの性能と使い分け

OllamaとvLLMを比較|推論サーバーの性能と使い分け

OllamaとvLLMの導入手順、対応モデル形式、同時リクエスト処理、ベンチマークを比較。ローカルLLMをAPIとして提供する際の使い分けを解説します。

8/2/26

12分

LM Studioの代替ツール8選:ローカルAI比較【2026年】

LM Studioの代替ツール8選:ローカルAI比較【2026年】

2026年のおすすめLM Studio代替ツール:Atomic ChatやOllamaからllama.cppまで、モデルをオフラインで実行できる8つのローカルAIアプリを機能と用途で比較します。

7/25/26

12分