gpt-oss-120bとは?
gpt-oss-120bは、OpenAIのオープンウェイトのgpt-ossモデル2種のうち、大きい方のモデルです。混合エキスパート構造を採用し、総パラメータ数は117B、トークンあたりのアクティブパラメータ数は5.1Bです。OpenAIは、本番環境、汎用用途、高度な推論に向けたモデルと位置づけており、NVIDIA H100やAMD MI300Xなど、単一の80 GB GPUに収まる規模です。重みは2025年8月4日にApache 2.0の下でHugging Faceに公開されました。同時に公開された小型のgpt-oss-20bは、OpenAIが低レイテンシとローカルでの利用を想定しているモデルです。
| 仕様 | gpt-oss-120b |
|---|---|
| 総パラメータ数 | 117B |
| アクティブパラメータ数 | トークンあたり5.1B |
| アーキテクチャ | 混合エキスパート |
| ネイティブ量子化 | 事後学習でMoEの重みにMXFP4を適用 |
| 推論 | 推論強度を設定可能:システムプロンプトでlow、medium、highを指定 |
| 思考過程 | 完全に開示されますが、エンドユーザー向けではありません |
| チャット形式 | harmony応答形式が必須 |
| モダリティ | テキスト入力、テキスト出力 |
| リリース日 | 2025年8月4日 |
| ライセンス | Apache 2.0 |
このリリースが、重みを公開している大半のモデルと異なる点は2つあります。まず、MoEの重みは4ビット形式のMXFP4量子化を用いて事後学習されており、これによって117Bモデルが80 GBに収まります。OpenAIはすべての評価を同じMXFP4ビルドで実施しているため、量子化モデルは元のモデルを劣化させたコピーではなく、モデルそのものです。次に、両方のgpt-ossモデルはharmony応答形式で学習されており、OpenAIの説明によれば、この形式なしでは正しく動作しません。チャットテンプレートを適用するランタイムを使えば、harmonyの処理は自動で行われます。モデルを直接呼び出す場合は、チャットテンプレートまたはOpenAIのopenai-harmonyパッケージを通じて、自分でこの形式を適用する必要があります。
gpt-oss-120bが得意なこと
OpenAIはモデルカードにベンチマーク表を掲載していないため、ここでは明記されている機能を列挙するのが正確です。このモデルはエージェント処理向けに設計されており、定義済みスキーマを使った関数呼び出し、組み込みのブラウジングツールによるウェブ閲覧、Pythonコードの実行、Structured Outputsに対応しています。OpenAIは、これらのモデルが想定するエージェント処理の例として、特にブラウザを使うタスクを挙げています。
推論強度は別のモデルではなく、設定項目です。システムプロンプトに"Reasoning: high"のような行を入れ、3段階から選びます。lowは一般的な対話での高速な応答、mediumは速度と詳細さのバランス、highは深く詳細な分析に向いています。思考過程は隠されず、完全に開示されます。OpenAIはこれを、モデルをデバッグし、その出力を信頼するための手段と位置づけていますが、エンドユーザーに表示することは想定していません。このモデルはファインチューニングも可能です。OpenAIによると、gpt-oss-120bは単一のH100ノードでファインチューニングでき、20Bモデルは一般消費者向けハードウェアに収まります。
gpt-oss-120bのハードウェア要件
システム要件で確認すべきなのはメモリです。OpenAIが挙げている数値は、単一の80 GB GPUで、具体例はNVIDIA H100またはAMD MI300Xです。コミュニティによるGGUFビルドはunsloth/gpt-oss-120b-GGUFで公開されており、F16は単一ファイル、量子化版はすべて2つのファイルに分割されています。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 80 GB | F16 | 65.37 GB |
このリポジトリではビルド間のサイズ差が非常に小さいため、表は1行で足ります。最小のビルドであるQ3_K_Sは2つのファイルを合わせて62.56 GB、最大の量子化版であるUD-Q8_K_XLは64.47 GBです。そのため、単一ファイルで65.37 GBのF16と最小ビルドとの差は3 GB未満です。エキスパートの重みはすでに4ビットのMXFP4で提供されており、低ビットの量子化版でもほとんど縮小する余地がありません。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。OpenAIが挙げる80 GBには、ここにあるすべてのビルドが収まります。この形式に馴染みがなければ、まずGGUFとは何かをお読みください。
Atomic Chatでgpt-oss-120bを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでgpt-oss-120bを検索し、Download Optionsを開きます。
- お使いのマシンのメモリに収まるビルドを選び、チャットを開始します。
65 GBの重みがお使いのマシンに収まらない場合は、小型のgpt-oss-20bが16 GB以内のメモリで動作します。ほかのラインアップは、当社のgpt-ossページに掲載しています。
gpt-oss-120bのライセンス
gpt-oss-120bはApache 2.0の下で公開されています。OpenAIはモデルカードで、コピーレフトの制約も特許リスクもなく、自由に開発に利用できる寛容なライセンスと説明し、実験、カスタマイズ、商用展開を想定用途として挙げています。
