gpt-oss-20b

更新
04.10.2026
ツール利用
思考
推論
コード生成

gpt-oss-20bは、総パラメータ数21B、アクティブパラメータ数3.6BのOpenAIのオープンウェイトMoEモデルです。16 GB以内のメモリで動作するよう、MoEの重みはMXFP4で事後学習されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計21B、アクティブ3.6B
  • コンテキスト長: OpenAIのモデルカードには記載なし
  • モダリティ: テキスト
  • 最小ハードウェア要件: メモリ16 GB(MXFP4ビルド)

gpt-oss-20bとは?

gpt-oss-20bは、OpenAIのオープンウェイトの混合エキスパートモデルで、gpt-ossとしてリリースされた2つのモデルのうち小さい方です。総パラメータ数は21Bで、アクティブパラメータ数は3.6Bです。OpenAIは、低レイテンシやローカルでの利用、特定用途に向けたモデルと位置づけています。一方、大きい方のgpt-oss-120bは総パラメータ数117B、アクティブパラメータ数5.1Bで、NVIDIA H100やAMD MI300Xなどの80 GB GPU 1基での本番運用を想定しています。MoEの重みはMXFP4量子化を用いて事後学習されているため、配布された状態のモデル全体が16 GB以内のメモリで動作します。OpenAIは2025年8月4日に、Apache 2.0の下で重みを公開しました。

仕様gpt-oss-20b
総パラメータ数21B
アクティブパラメータ数3.6B
チェックポイントのテンソルsafetensors内のパラメータ数は20,914,757,184
アーキテクチャ混合エキスパート、MoEの重みはMXFP4で事後学習済み
モダリティテキスト
推論推論強度をlow、medium、highから選択可能。システムプロンプトで設定
応答形式harmony、正しい出力に必須
組み込みのツール利用機能関数呼び出し、ウェブ閲覧、Python実行、Structured Outputs
ファインチューニング対応。20Bは一般消費者向けハードウェアでも可能
リリース日2025年8月4日
ライセンスApache 2.0

実際に利用するうえで重要な点が2つあります。両方のgpt-ossモデルはOpenAIのharmony応答形式で学習されており、この形式なしでは正しく動作しません。Transformersのチャットテンプレートはこの形式を自動で適用するため、通常のチャット設定で適切に処理されます。また、OpenAIの評価はすべて同じMXFP4量子化で実施されています。つまり、OpenAIが配布するMXFP4チェックポイントは、評価したモデルそのものであり、そのモデルを圧縮したコピーではありません。

gpt-oss-20bが得意なこと

OpenAIは、推論とエージェントタスク向けにgpt-ossシリーズを開発しました。推論強度は、システムプロンプトから直接3段階で設定できます。lowは一般的な対話での素早い応答、mediumは速度と詳しさのバランス、highは深く詳細な分析に向いています。"Reasoning: high"のような1行を指定するだけです。また、このモデルは思考の連鎖をすべて公開します。OpenAIは、これをエンドユーザーに見せるためではなく、デバッグや出力の信頼性の確認に利用することを推奨しています。

エージェント機能にはネイティブに対応しています。定義済みスキーマに基づく関数呼び出し、組み込みの閲覧ツールによるウェブ閲覧、Pythonコードの実行、Structured Outputsを利用できます。OpenAIは、これらのモデルが特に得意なタスクとして、ウェブ閲覧、定義済みスキーマに基づく関数呼び出し、エージェントによるブラウザ操作を挙げています。また、20Bは一般消費者向けハードウェアでファインチューニングできるgpt-ossモデルであると明示しており、120Bは単一のH100ノードでファインチューニングできるとしています。両モデルの公開モデルカードはarXiv 2508.10925です。

gpt-oss-20bのハードウェア要件

確認すべきシステム要件はメモリ容量です。OpenAIは、自社のMXFP4チェックポイントが16 GB以内のメモリで動作するとしています。サードパーティ製のGGUFビルドについては言及していないため、以下の容量別の構成では、KVキャッシュとシステムのその他の処理に使うメモリに余裕を持たせています。ファイルサイズは、Hugging Faceのunsloth/gpt-oss-20b-GGUFリポジトリにある実際のサイズです。

メモリ選ぶビルドファイルサイズ
16 GBQ4_K_M11.62 GB
24 GBUD-Q8_K_XL13.20 GB
24 GBF1613.79 GB

MoEの重みがすでにMXFP4で配布されているため、量子化レベルによるファイルサイズの差は例外的に小さくなっています。リポジトリ内の最小ファイルであるQ3_K_Sは11.46 GB、Q2_Kは11.47 GB、Q8_0は12.11 GB、フル精度のF16は13.79 GBで、全体の差は約2.3 GBです。ここではQ4より下げても得られるものはほとんどありません。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。

OpenAIは、重みを直接実行するためにサポートするソフトウェア構成を挙げています。OpenAI互換のウェブサーバーを提供するtransformers serveを含むTransformers、vllm serve openai/gpt-oss-20bでモデルをダウンロードしてサーバーを起動するvLLM、一般消費者向けハードウェアでollama pull gpt-oss:20bを使うOllama、lms get openai/gpt-oss-20bを使うLM Studio、そしてgpt-ossリポジトリ内のPyTorchとTritonのリファレンス実装です。GGUF形式に初めて触れる方は、まずGGUFとは何かをお読みください。16 GBのマシンでこの規模のモデルを扱う方法については、16 GB Macに最適なローカルLLMをご覧ください。

Atomic Chatでgpt-oss-20bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでgpt-oss-20bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

より大きい同系列のモデルについてはgpt-oss-120bをご覧ください。また、ローカルで実行できるすべてのgpt-ossモデルも確認できます。

gpt-oss-20bのライセンス

gpt-oss-20bはApache 2.0の下で公開されています。OpenAIはこれを許容的なライセンスと呼び、コピーレフトの制約や特許リスクなしに自由に開発できるという意図を明示しています。また、実験、カスタマイズ、商用展開に最適だと説明しています。ファインチューニングにも同じ条件が適用され、OpenAIは20Bを一般消費者向けハードウェアでファインチューニングできるとしています。

Hugging Faceからモデルをダウンロード

huggingface-cli download openai/gpt-oss-20b
from transformers import AutoModel
model = AutoModel.from_pretrained("openai/gpt-oss-20b")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

gpt-oss-20bは、OpenAIが2025年に公開したオープンウェイトの言語モデルです。混合エキスパートのアーキテクチャを採用し、総パラメータ数は約21.5B(トークンあたりのアクティブパラメータ数は約3.6B)、コンテキスト長は128Kトークンです。ローカルのデバイス上での利用向けに設計されており、推論、ツール呼び出し、コード生成に対応しています。

gpt-oss-20bは組み込みの4ビットMXFP4量子化により、約16GBのメモリに収まります。RTX 5080のような16GBのカードが実用上の最小構成で、RTX 4090のような24GBのGPUなら、より長いコンテキストを扱う余裕が生まれます。適切なGPUがない場合でも、約24GBのシステムRAMがあればCPUで実行できますが、速度は遅くなります。

はい。gpt-oss-20bはApache 2.0ライセンスの下で公開されているため、重みを無料でダウンロードし、実行、改変、商用利用できます。Atomic Chatを通じてローカルで実行すれば、API利用料やトークン単位の課金はありません。

はい。重みをダウンロードすれば、gpt-oss-20bは自分のマシン上だけで動作し、インターネット接続は不要です。プロンプトと出力はデバイス内にとどまるため、データのプライバシーを保てます。Atomic Chatはモデルをローカルで読み込むため、ネットワークを切断しても動作し続けます。

思考の連鎖による推論、ツールや関数の呼び出し、コードの作成やデバッグを得意としています。OpenAIによると、一般消費者向けハードウェアで扱えるサイズを維持しながら、一般的なベンチマークでo3-miniに近い性能を発揮します。また、128Kのコンテキスト長により、長い文書や大規模なコードベースを1回のセッションで扱えます。