gpt-oss-20bとは?
gpt-oss-20bは、OpenAIのオープンウェイトの混合エキスパートモデルで、gpt-ossとしてリリースされた2つのモデルのうち小さい方です。総パラメータ数は21Bで、アクティブパラメータ数は3.6Bです。OpenAIは、低レイテンシやローカルでの利用、特定用途に向けたモデルと位置づけています。一方、大きい方のgpt-oss-120bは総パラメータ数117B、アクティブパラメータ数5.1Bで、NVIDIA H100やAMD MI300Xなどの80 GB GPU 1基での本番運用を想定しています。MoEの重みはMXFP4量子化を用いて事後学習されているため、配布された状態のモデル全体が16 GB以内のメモリで動作します。OpenAIは2025年8月4日に、Apache 2.0の下で重みを公開しました。
| 仕様 | gpt-oss-20b |
|---|---|
| 総パラメータ数 | 21B |
| アクティブパラメータ数 | 3.6B |
| チェックポイントのテンソル | safetensors内のパラメータ数は20,914,757,184 |
| アーキテクチャ | 混合エキスパート、MoEの重みはMXFP4で事後学習済み |
| モダリティ | テキスト |
| 推論 | 推論強度をlow、medium、highから選択可能。システムプロンプトで設定 |
| 応答形式 | harmony、正しい出力に必須 |
| 組み込みのツール利用機能 | 関数呼び出し、ウェブ閲覧、Python実行、Structured Outputs |
| ファインチューニング | 対応。20Bは一般消費者向けハードウェアでも可能 |
| リリース日 | 2025年8月4日 |
| ライセンス | Apache 2.0 |
実際に利用するうえで重要な点が2つあります。両方のgpt-ossモデルはOpenAIのharmony応答形式で学習されており、この形式なしでは正しく動作しません。Transformersのチャットテンプレートはこの形式を自動で適用するため、通常のチャット設定で適切に処理されます。また、OpenAIの評価はすべて同じMXFP4量子化で実施されています。つまり、OpenAIが配布するMXFP4チェックポイントは、評価したモデルそのものであり、そのモデルを圧縮したコピーではありません。
gpt-oss-20bが得意なこと
OpenAIは、推論とエージェントタスク向けにgpt-ossシリーズを開発しました。推論強度は、システムプロンプトから直接3段階で設定できます。lowは一般的な対話での素早い応答、mediumは速度と詳しさのバランス、highは深く詳細な分析に向いています。"Reasoning: high"のような1行を指定するだけです。また、このモデルは思考の連鎖をすべて公開します。OpenAIは、これをエンドユーザーに見せるためではなく、デバッグや出力の信頼性の確認に利用することを推奨しています。
エージェント機能にはネイティブに対応しています。定義済みスキーマに基づく関数呼び出し、組み込みの閲覧ツールによるウェブ閲覧、Pythonコードの実行、Structured Outputsを利用できます。OpenAIは、これらのモデルが特に得意なタスクとして、ウェブ閲覧、定義済みスキーマに基づく関数呼び出し、エージェントによるブラウザ操作を挙げています。また、20Bは一般消費者向けハードウェアでファインチューニングできるgpt-ossモデルであると明示しており、120Bは単一のH100ノードでファインチューニングできるとしています。両モデルの公開モデルカードはarXiv 2508.10925です。
gpt-oss-20bのハードウェア要件
確認すべきシステム要件はメモリ容量です。OpenAIは、自社のMXFP4チェックポイントが16 GB以内のメモリで動作するとしています。サードパーティ製のGGUFビルドについては言及していないため、以下の容量別の構成では、KVキャッシュとシステムのその他の処理に使うメモリに余裕を持たせています。ファイルサイズは、Hugging Faceのunsloth/gpt-oss-20b-GGUFリポジトリにある実際のサイズです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 16 GB | Q4_K_M | 11.62 GB |
| 24 GB | UD-Q8_K_XL | 13.20 GB |
| 24 GB | F16 | 13.79 GB |
MoEの重みがすでにMXFP4で配布されているため、量子化レベルによるファイルサイズの差は例外的に小さくなっています。リポジトリ内の最小ファイルであるQ3_K_Sは11.46 GB、Q2_Kは11.47 GB、Q8_0は12.11 GB、フル精度のF16は13.79 GBで、全体の差は約2.3 GBです。ここではQ4より下げても得られるものはほとんどありません。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。
OpenAIは、重みを直接実行するためにサポートするソフトウェア構成を挙げています。OpenAI互換のウェブサーバーを提供するtransformers serveを含むTransformers、vllm serve openai/gpt-oss-20bでモデルをダウンロードしてサーバーを起動するvLLM、一般消費者向けハードウェアでollama pull gpt-oss:20bを使うOllama、lms get openai/gpt-oss-20bを使うLM Studio、そしてgpt-ossリポジトリ内のPyTorchとTritonのリファレンス実装です。GGUF形式に初めて触れる方は、まずGGUFとは何かをお読みください。16 GBのマシンでこの規模のモデルを扱う方法については、16 GB Macに最適なローカルLLMをご覧ください。
Atomic Chatでgpt-oss-20bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでgpt-oss-20bを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
より大きい同系列のモデルについてはgpt-oss-120bをご覧ください。また、ローカルで実行できるすべてのgpt-ossモデルも確認できます。
gpt-oss-20bのライセンス
gpt-oss-20bはApache 2.0の下で公開されています。OpenAIはこれを許容的なライセンスと呼び、コピーレフトの制約や特許リスクなしに自由に開発できるという意図を明示しています。また、実験、カスタマイズ、商用展開に最適だと説明しています。ファインチューニングにも同じ条件が適用され、OpenAIは20Bを一般消費者向けハードウェアでファインチューニングできるとしています。
