gpt-oss-120b

更新
04.10.2026
ツール利用
思考
推論
コード生成

gpt-oss-120bは、OpenAIのオープンウェイトMoEです。総パラメータ数は117B、アクティブパラメータ数は5.1Bで、単一の80 GB GPUに収まる規模です。Atomic Chatで無料でローカル実行できます。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 総数117B、アクティブ5.1B
  • コンテキスト長: 提供元のモデルカードに記載なし
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: 単一の80 GB GPU(H100またはMI300Xクラス)

gpt-oss-120bとは?

gpt-oss-120bは、OpenAIのオープンウェイトのgpt-ossモデル2種のうち、大きい方のモデルです。混合エキスパート構造を採用し、総パラメータ数は117B、トークンあたりのアクティブパラメータ数は5.1Bです。OpenAIは、本番環境、汎用用途、高度な推論に向けたモデルと位置づけており、NVIDIA H100やAMD MI300Xなど、単一の80 GB GPUに収まる規模です。重みは2025年8月4日にApache 2.0の下でHugging Faceに公開されました。同時に公開された小型のgpt-oss-20bは、OpenAIが低レイテンシとローカルでの利用を想定しているモデルです。

仕様gpt-oss-120b
総パラメータ数117B
アクティブパラメータ数トークンあたり5.1B
アーキテクチャ混合エキスパート
ネイティブ量子化事後学習でMoEの重みにMXFP4を適用
推論推論強度を設定可能:システムプロンプトでlow、medium、highを指定
思考過程完全に開示されますが、エンドユーザー向けではありません
チャット形式harmony応答形式が必須
モダリティテキスト入力、テキスト出力
リリース日2025年8月4日
ライセンスApache 2.0

このリリースが、重みを公開している大半のモデルと異なる点は2つあります。まず、MoEの重みは4ビット形式のMXFP4量子化を用いて事後学習されており、これによって117Bモデルが80 GBに収まります。OpenAIはすべての評価を同じMXFP4ビルドで実施しているため、量子化モデルは元のモデルを劣化させたコピーではなく、モデルそのものです。次に、両方のgpt-ossモデルはharmony応答形式で学習されており、OpenAIの説明によれば、この形式なしでは正しく動作しません。チャットテンプレートを適用するランタイムを使えば、harmonyの処理は自動で行われます。モデルを直接呼び出す場合は、チャットテンプレートまたはOpenAIのopenai-harmonyパッケージを通じて、自分でこの形式を適用する必要があります。

gpt-oss-120bが得意なこと

OpenAIはモデルカードにベンチマーク表を掲載していないため、ここでは明記されている機能を列挙するのが正確です。このモデルはエージェント処理向けに設計されており、定義済みスキーマを使った関数呼び出し、組み込みのブラウジングツールによるウェブ閲覧、Pythonコードの実行、Structured Outputsに対応しています。OpenAIは、これらのモデルが想定するエージェント処理の例として、特にブラウザを使うタスクを挙げています。

推論強度は別のモデルではなく、設定項目です。システムプロンプトに"Reasoning: high"のような行を入れ、3段階から選びます。lowは一般的な対話での高速な応答、mediumは速度と詳細さのバランス、highは深く詳細な分析に向いています。思考過程は隠されず、完全に開示されます。OpenAIはこれを、モデルをデバッグし、その出力を信頼するための手段と位置づけていますが、エンドユーザーに表示することは想定していません。このモデルはファインチューニングも可能です。OpenAIによると、gpt-oss-120bは単一のH100ノードでファインチューニングでき、20Bモデルは一般消費者向けハードウェアに収まります。

gpt-oss-120bのハードウェア要件

システム要件で確認すべきなのはメモリです。OpenAIが挙げている数値は、単一の80 GB GPUで、具体例はNVIDIA H100またはAMD MI300Xです。コミュニティによるGGUFビルドはunsloth/gpt-oss-120b-GGUFで公開されており、F16は単一ファイル、量子化版はすべて2つのファイルに分割されています。

メモリ選ぶビルドファイルサイズ
80 GBF1665.37 GB

このリポジトリではビルド間のサイズ差が非常に小さいため、表は1行で足ります。最小のビルドであるQ3_K_Sは2つのファイルを合わせて62.56 GB、最大の量子化版であるUD-Q8_K_XLは64.47 GBです。そのため、単一ファイルで65.37 GBのF16と最小ビルドとの差は3 GB未満です。エキスパートの重みはすでに4ビットのMXFP4で提供されており、低ビットの量子化版でもほとんど縮小する余地がありません。2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。OpenAIが挙げる80 GBには、ここにあるすべてのビルドが収まります。この形式に馴染みがなければ、まずGGUFとは何かをお読みください。

Atomic Chatでgpt-oss-120bを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでgpt-oss-120bを検索し、Download Optionsを開きます。
  3. お使いのマシンのメモリに収まるビルドを選び、チャットを開始します。

65 GBの重みがお使いのマシンに収まらない場合は、小型のgpt-oss-20bが16 GB以内のメモリで動作します。ほかのラインアップは、当社のgpt-ossページに掲載しています。

gpt-oss-120bのライセンス

gpt-oss-120bはApache 2.0の下で公開されています。OpenAIはモデルカードで、コピーレフトの制約も特許リスクもなく、自由に開発に利用できる寛容なライセンスと説明し、実験、カスタマイズ、商用展開を想定用途として挙げています。

Hugging Faceからモデルをダウンロード

huggingface-cli download openai/gpt-oss-120b
from transformers import AutoModel
model = AutoModel.from_pretrained("openai/gpt-oss-120b")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

gpt-oss-120bは、混合エキスパート構造を採用したOpenAIのオープンウェイト言語モデルです。総パラメータ数は約120B、トークンあたりのアクティブパラメータ数は約5Bです。推論、ツール利用、コード向けに調整されており、128Kのコンテキスト長に対応しています。Apache-2.0ライセンスの下で公開されているため、誰でもダウンロードして実行できます。

OpenAIはこのモデルを約61 GiBのMXFP4形式で提供しているため、実用上の目安は、NVIDIA H100など、80 GBのVRAMを搭載した単一のGPUです。レイヤーをシステムRAMにオフロードすれば、より少ないVRAMでも実行できますが、生成速度は低下すると考えてください。長いコンテキストを扱うため、システムメモリも十分に確保してください。

はい。重みはApache-2.0ライセンスの下で公開されているため、モデルのダウンロード、実行、商用利用も無料です。Atomic Chatでローカル実行する場合、APIキーは不要で、トークンごとの料金もかかりません。

はい。重みをお使いのマシンにダウンロードすれば、gpt-oss-120bは完全にデバイス上で動作し、インターネット接続は不要です。プロンプトとデータはローカルにとどまります。これが、ホスト型APIではなくAtomic Chatで実行する意義です。

最も得意なのは、推論、エージェントによるツール利用、コーディングです。OpenAIは、主要な推論ベンチマークでo4-miniとほぼ同等の性能に達すると報告しています。また、ネイティブの関数呼び出し機能で外部ツールを操作できます。128Kのコンテキスト長は、長い文書や大きなコードファイルを扱う際にも役立ちます。