GLM-5.2

更新
04.10.2026
思考
推論
コード生成

GLM-5.2は、Z.aiの753.3Bパラメータのフラッグシップモデルです。安定して使える1Mトークンのコンテキスト長を備え、地域制限のないMITライセンスで公開されています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 753.3B
  • コンテキスト長: 1Mトークン
  • モダリティ: テキスト(英語と中国語)
  • 最小ハードウェア要件: メモリ256 GB(最小のGGUFビルドであるUD-IQ1_Sは216.7 GB)

GLM-5.2とは?

GLM-5.2は、Z.ai(Hugging Faceではzai-org)のフラッグシップモデルです。数時間にわたる作業でもモデルが一貫性を保つ必要がある、長時間のエージェント実行などの長期タスク向けに開発されています。パラメータ数は753.3Bです。Z.aiは今回初めて、安定して使える1Mトークンのコンテキスト長で長期タスクへの対応力を提供します。同社によると、このコンテキストウィンドウは、使用量が増えても性能が低下せず、長期タスクを安定して支えます。重みは2026年6月16日にMITライセンスで公開され、リポジトリのダウンロード数は2,500,000回を超えています。

仕様GLM-5.2
開発元Z.ai(Hugging Faceではzai-org)
総パラメータ数753.3B
コンテキスト長1Mトークン
アテンションIndexShareを用いたスパースアテンション。四層ごとに1つのインデクサーを共有します
コンテキスト長1MでのトークンあたりのFLOPsIndexShareにより2.9分の1に削減
複数トークン予測MTP層を改良し、受理されるトークン列の長さが最大20%増加
コーディング性能とレイテンシのバランスを調整できる複数段階の推論強度
タスクテキスト生成
モダリティテキストの入力と出力
言語英語と中国語
推論提供フレームワークSGLang, vLLM, Transformers, KTransformers, Unsloth
技術レポートGLM-5, arXiv 2602.15763
リリース日2026年6月16日
ライセンスMIT

アーキテクチャの改良の大半は、この1Mのコンテキストウィンドウを対象としています。IndexShareは、スパースアテンションの四層ごとに同じインデクサーを再利用することで、コンテキスト長1MでのトークンあたりのFLOPsを2.9分の1に削減します。Z.aiはこれを独立した論文(arXiv 2603.12201)として公開しています。また、Z.aiは投機的デコーディング用の候補トークンを生成するMTP層を改良し、受理されるトークン列の長さを最大20%増やしました。コーディングでは、性能とレイテンシのバランスを調整できる複数段階の推論強度を利用できます。

GLM-5.2のベンチマーク

モデルカードに記載されたZ.aiのリリース時の数値では、GLM-5.2を前世代のGLM-5.1、DeepSeek-V4-Pro、Claude Opus 4.8、GPT-5.5と比較しています(開発元の表にはQwen3.7-Max、MiniMax M3、Gemini 3.1 Proも含まれています)。

ベンチマークGLM-5.2GLM-5.1DeepSeek-V4-ProClaude Opus 4.8GPT-5.5
AIME 2026
数学競技
99.295.394.695.798.3
IMOAnswerBench
数学オリンピック
91.083.889.883.5-
SWE-bench Pro
高難度のソフトウェア開発
62.158.455.469.258.6
Terminal Bench 2.1
ターミナル操作エージェント
81.063.5648584
DeepSWE
エージェントによるコーディング
46.21885870
FrontierSWE
最先端のソフトウェア開発
74.430.529.075.172.6
MCP-Atlas
MCPツール
76.871.873.677.875.3

GLM-5.2は数学の両項目で首位となり、前世代からの伸びはエージェント関連で最も大きくなっています。GLM-5.1と比べて、Terminal Benchは63.5から81.0、DeepSWEは18から46.2、FrontierSWEは30.5から74.4に上昇しています。SWE-bench Pro、Terminal Bench、FrontierSWE、MCP-AtlasではClaude Opus 4.8が首位で、DeepSWEではGPT-5.5が大きくリードしています。

Z.aiは今回のリリースについて、GLM-5.1から長期タスクへの対応力が大幅に向上したとしています。同社の表のほかの項目もその傾向を示しており、SWE-Marathonは1.0から13.0、PostTrainBenchは20.1から34.3、NL2Repoは42.7から48.9に上昇しています。上の表にはHumanity's Last Examを含めていません。Z.aiは原則としてテキストのみのサブセットの結果を報告し、全セットの結果にはアスタリスクを付けているため、その行の競合モデルのスコアは、GLM-5.2の40.5と同じ評価条件ではないからです。また、長期タスクの各項目はZ.ai自身が実行した評価ではありません。FrontierSWEはProximalが、SWE-MarathonはAbundant AIが採点しており、いずれもコンテキスト長1M、推論強度は最大、最大出力トークン数は128Kという条件です。

GLM-5.2のハードウェア要件

確認すべきシステム要件はメモリで、この規模では数百ギガバイト単位になります。量子化ビルドはUnslothのunsloth/GLM-5.2-GGUFで提供されています。各ビルドは複数のファイルに分割して配布されており、以下のサイズは全ファイルの合計です。

メモリ選択するビルドファイルサイズ
256 GBUD-Q2_K_XL253.9 GB
320 GBUD-IQ3_S308.7 GB
384 GBUD-IQ4_NL372.7 GB
448 GBUD-Q4_K_S436.4 GB
512 GBUD-Q4_K_XL467.3 GB
640 GBUD-Q6_K625.9 GB
768 GBUD-Q6_K_XL684.4 GB
1 TB以上UD-Q8_K_XL819.7 GB

各行には、併記されたメモリ容量に収まる、そのリポジトリ内で最大のビルドを示しています。両方のビルドが収まる場合は、大きい方を選びます。提供されている最小のビルドであるUD-IQ1_Sでも、ダウンロードサイズは217 GBあります。そのため、これはワークステーションやサーバー向けであり、ノートPC向けのモデルではありません。サイズはダウンロード容量の合計なので、コンテキスト用にそれを上回るメモリの余裕を確保してください。同じリポジトリにある非量子化のBF16変換版は、33ファイルで合計1.5 TBです。量子化を使わない場合は、この容量を基準にディスク容量を計画してください。

元のsafetensors形式の重みについて、Z.aiは対応する推論提供ソフトウェアとしてSGLang v0.5.13.post1+、vLLM v0.23.0+、Transformers v0.5.12+、KTransformers v0.5.12+、Unsloth v0.1.47-beta+を挙げています。さらに、Ascend NPUハードウェア向けにはvLLM-Ascend、xLLM、SGLangを挙げています。Z.aiは、temperatureを1.0、top_pを0.95、生成長を最大163,840トークンに設定して推論能力を評価しました。自身のサンプリング設定を決める際にも、妥当な出発点になります。GGUF形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでGLM-5.2を実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでGLM-5.2を検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるGLMモデルの一覧をご覧ください。

GLM-5.2のライセンス

GLM-5.2はMITライセンスで提供され、Hugging Faceのモデルカードにはlicense: mitというタグが付いています。Z.aiはこれを、MITのオープンソースライセンスを採用し、地域制限がなく、国境を越えて技術にアクセスできる、完全にオープンなモデルと位置づけています。自分でダウンロードして実行する重みについて、モデルカードに記載されているライセンス条件はこれだけです。

Hugging Faceからモデルをダウンロード

huggingface-cli download zai-org/GLM-5.2
from transformers import AutoModel
model = AutoModel.from_pretrained("zai-org/GLM-5.2")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GLM-5.2は、zai-org(Z.ai)が開発した753.3Bパラメータの重み公開モデルです。Mixture-of-Expertsアーキテクチャを採用し、MITライセンスで公開されています。コーディング、推論、エージェントタスクを対象とし、英語と中国語に対応しています。コンテキスト長は1,048,576トークンです。重みはHugging Faceで公開されているため、ホスト型APIを経由せず、自分で実行できます。

BF16の全重みには数百ギガバイトのメモリが必要なため、ほとんどの人は量子化ビルドを使います。2ビットの動的量子化版は約241 GBで、ユニファイドメモリ256 GBのMacに収まります。また、MoEオフロードを使えば、24 GBのGPUを1基とシステムRAM 256 GBを組み合わせた構成にも収まります。一般消費者向けハードウェアで低ビット量子化版を使う場合、速度の目安は毎秒約3から9トークンです。

はい。GLM-5.2はMITライセンスで公開されているため、重みのダウンロード、実行、改変、商用利用を無料で行えます。Atomic Chatを使ってローカルで実行する場合、モデルは自分のマシン上で動作するため、トークンごとの料金はかかりません。費用はハードウェアと電力のみです。

はい。重みをダウンロードすれば、GLM-5.2はインターネット接続を必要とせず、すべての処理をお使いのデバイス上で実行します。外部サーバーには何も送信されないため、プロンプトとコードはローカルにとどまります。Atomic Chatは、このようにプライバシーを保ってオフラインで利用できるよう、モデルをデバイス上に読み込みます。

最も得意な分野はコーディングとエージェントによるソフトウェア開発で、SWE-bench ProやTerminal-Benchなどのベンチマークでは、重み公開モデルの中で上位に位置しています。また、1,048,576トークンのコンテキスト長により、コードベース全体や長い技術文書を対象とした推論にも適しています。思考能力を備えているため、回答する前に論理を順に検討する必要がある、多段階の問題にも向いています。