GLM-5.2とは?
GLM-5.2は、Z.ai(Hugging Faceではzai-org)のフラッグシップモデルです。数時間にわたる作業でもモデルが一貫性を保つ必要がある、長時間のエージェント実行などの長期タスク向けに開発されています。パラメータ数は753.3Bです。Z.aiは今回初めて、安定して使える1Mトークンのコンテキスト長で長期タスクへの対応力を提供します。同社によると、このコンテキストウィンドウは、使用量が増えても性能が低下せず、長期タスクを安定して支えます。重みは2026年6月16日にMITライセンスで公開され、リポジトリのダウンロード数は2,500,000回を超えています。
| 仕様 | GLM-5.2 |
|---|---|
| 開発元 | Z.ai(Hugging Faceではzai-org) |
| 総パラメータ数 | 753.3B |
| コンテキスト長 | 1Mトークン |
| アテンション | IndexShareを用いたスパースアテンション。四層ごとに1つのインデクサーを共有します |
| コンテキスト長1MでのトークンあたりのFLOPs | IndexShareにより2.9分の1に削減 |
| 複数トークン予測 | MTP層を改良し、受理されるトークン列の長さが最大20%増加 |
| コーディング | 性能とレイテンシのバランスを調整できる複数段階の推論強度 |
| タスク | テキスト生成 |
| モダリティ | テキストの入力と出力 |
| 言語 | 英語と中国語 |
| 推論提供フレームワーク | SGLang, vLLM, Transformers, KTransformers, Unsloth |
| 技術レポート | GLM-5, arXiv 2602.15763 |
| リリース日 | 2026年6月16日 |
| ライセンス | MIT |
アーキテクチャの改良の大半は、この1Mのコンテキストウィンドウを対象としています。IndexShareは、スパースアテンションの四層ごとに同じインデクサーを再利用することで、コンテキスト長1MでのトークンあたりのFLOPsを2.9分の1に削減します。Z.aiはこれを独立した論文(arXiv 2603.12201)として公開しています。また、Z.aiは投機的デコーディング用の候補トークンを生成するMTP層を改良し、受理されるトークン列の長さを最大20%増やしました。コーディングでは、性能とレイテンシのバランスを調整できる複数段階の推論強度を利用できます。
GLM-5.2のベンチマーク
モデルカードに記載されたZ.aiのリリース時の数値では、GLM-5.2を前世代のGLM-5.1、DeepSeek-V4-Pro、Claude Opus 4.8、GPT-5.5と比較しています(開発元の表にはQwen3.7-Max、MiniMax M3、Gemini 3.1 Proも含まれています)。
| ベンチマーク | GLM-5.2 | GLM-5.1 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
AIME 2026 数学競技 | 99.2 | 95.3 | 94.6 | 95.7 | 98.3 |
IMOAnswerBench 数学オリンピック | 91.0 | 83.8 | 89.8 | 83.5 | - |
SWE-bench Pro 高難度のソフトウェア開発 | 62.1 | 58.4 | 55.4 | 69.2 | 58.6 |
Terminal Bench 2.1 ターミナル操作エージェント | 81.0 | 63.5 | 64 | 85 | 84 |
DeepSWE エージェントによるコーディング | 46.2 | 18 | 8 | 58 | 70 |
FrontierSWE 最先端のソフトウェア開発 | 74.4 | 30.5 | 29.0 | 75.1 | 72.6 |
MCP-Atlas MCPツール | 76.8 | 71.8 | 73.6 | 77.8 | 75.3 |
GLM-5.2は数学の両項目で首位となり、前世代からの伸びはエージェント関連で最も大きくなっています。GLM-5.1と比べて、Terminal Benchは63.5から81.0、DeepSWEは18から46.2、FrontierSWEは30.5から74.4に上昇しています。SWE-bench Pro、Terminal Bench、FrontierSWE、MCP-AtlasではClaude Opus 4.8が首位で、DeepSWEではGPT-5.5が大きくリードしています。
Z.aiは今回のリリースについて、GLM-5.1から長期タスクへの対応力が大幅に向上したとしています。同社の表のほかの項目もその傾向を示しており、SWE-Marathonは1.0から13.0、PostTrainBenchは20.1から34.3、NL2Repoは42.7から48.9に上昇しています。上の表にはHumanity's Last Examを含めていません。Z.aiは原則としてテキストのみのサブセットの結果を報告し、全セットの結果にはアスタリスクを付けているため、その行の競合モデルのスコアは、GLM-5.2の40.5と同じ評価条件ではないからです。また、長期タスクの各項目はZ.ai自身が実行した評価ではありません。FrontierSWEはProximalが、SWE-MarathonはAbundant AIが採点しており、いずれもコンテキスト長1M、推論強度は最大、最大出力トークン数は128Kという条件です。
GLM-5.2のハードウェア要件
確認すべきシステム要件はメモリで、この規模では数百ギガバイト単位になります。量子化ビルドはUnslothのunsloth/GLM-5.2-GGUFで提供されています。各ビルドは複数のファイルに分割して配布されており、以下のサイズは全ファイルの合計です。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 256 GB | UD-Q2_K_XL | 253.9 GB |
| 320 GB | UD-IQ3_S | 308.7 GB |
| 384 GB | UD-IQ4_NL | 372.7 GB |
| 448 GB | UD-Q4_K_S | 436.4 GB |
| 512 GB | UD-Q4_K_XL | 467.3 GB |
| 640 GB | UD-Q6_K | 625.9 GB |
| 768 GB | UD-Q6_K_XL | 684.4 GB |
| 1 TB以上 | UD-Q8_K_XL | 819.7 GB |
各行には、併記されたメモリ容量に収まる、そのリポジトリ内で最大のビルドを示しています。両方のビルドが収まる場合は、大きい方を選びます。提供されている最小のビルドであるUD-IQ1_Sでも、ダウンロードサイズは217 GBあります。そのため、これはワークステーションやサーバー向けであり、ノートPC向けのモデルではありません。サイズはダウンロード容量の合計なので、コンテキスト用にそれを上回るメモリの余裕を確保してください。同じリポジトリにある非量子化のBF16変換版は、33ファイルで合計1.5 TBです。量子化を使わない場合は、この容量を基準にディスク容量を計画してください。
元のsafetensors形式の重みについて、Z.aiは対応する推論提供ソフトウェアとしてSGLang v0.5.13.post1+、vLLM v0.23.0+、Transformers v0.5.12+、KTransformers v0.5.12+、Unsloth v0.1.47-beta+を挙げています。さらに、Ascend NPUハードウェア向けにはvLLM-Ascend、xLLM、SGLangを挙げています。Z.aiは、temperatureを1.0、top_pを0.95、生成長を最大163,840トークンに設定して推論能力を評価しました。自身のサンプリング設定を決める際にも、妥当な出発点になります。GGUF形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでGLM-5.2を実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでGLM-5.2を検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで実行できるGLMモデルの一覧をご覧ください。
GLM-5.2のライセンス
GLM-5.2はMITライセンスで提供され、Hugging Faceのモデルカードにはlicense: mitというタグが付いています。Z.aiはこれを、MITのオープンソースライセンスを採用し、地域制限がなく、国境を越えて技術にアクセスできる、完全にオープンなモデルと位置づけています。自分でダウンロードして実行する重みについて、モデルカードに記載されているライセンス条件はこれだけです。
