GLM-5.1とは?
GLM-5.1は、Z.ai(Hugging Faceではzai-org)が開発した753.9Bパラメータのモデルです。GLM-5の後継であり、エージェント型エンジニアリング向けに構築された、このファミリーのフラッグシップモデルです。訴求点は初回の回答よりも持続力にあります。問題を分解し、実験を行い、結果を読み取り、数百ラウンドと数千回のツール呼び出しにわたって戦略を修正するように設計されています。Z.aiは2026年4月3日に、MITライセンスで重みをHugging Faceに公開しました。
| 仕様 | GLM-5.1 |
|---|---|
| 総パラメータ数 | 753.9B (753,864,139,008) |
| Transformers連携 | glm_moe_dsaモデルのドキュメント |
| 前世代モデル | GLM-5 |
| 重点分野 | エージェント型エンジニアリングとコーディング |
| 言語 | 英語と中国語 |
| モダリティ | テキスト生成 |
| 重みの形式 | safetensors |
| ローカルでの推論提供 | SGLang, vLLM, xLLM, Transformers, KTransformers |
| ホステッドサービスでの利用 | Z.ai API Platform |
| 技術レポート | GLM-5: Vibe Codingからエージェント型エンジニアリングへ (arXiv 2602.15763) |
| 公開日 | 2026年4月3日 |
| ライセンス | MIT |
注目すべき主張は、最初の1時間を過ぎた後の挙動です。Z.aiによると、GLM-5を含む従来のモデルは、既知の手法を適用して序盤に素早く成果を上げるものの、その後は頭打ちになり、時間を追加しても改善しません。一方、GLM-5.1は曖昧な問題に対してより適切に判断し、進行を妨げる要因を的確に特定し、実行時間が長くなるほど改善を続けるとしています。公開時の数値では、これがSWE-Bench Proでの最高水準の成績と、NL2Repo(リポジトリ生成)およびTerminal-Bench 2.0(実環境のターミナルタスク)でのGLM-5に対する大幅なリードとして表れています。重みはsafetensors形式で提供されており、提供元のモデルカードにはコンテキスト長の記載がありません。
GLM-5.1のベンチマーク
モデルカードに掲載されたZ.aiの公開時の比較表では、GLM-5.1をQwen3.6-Plus、MiniMax M2.7、DeepSeek-V3.2、Kimi K2.5など、ほかの8モデルと比較しています。ここでは、前世代のGLM-5と、クローズドな最先端モデル3種であるClaude Opus 4.6、Gemini 3.1 Pro、GPT-5.4との比較を示します。
| ベンチマーク | GLM-5.1 | GLM-5 | Claude Opus 4.6 | Gemini 3.1 Pro | GPT-5.4 |
|---|---|---|---|---|---|
SWE-Bench Pro より難しいエンジニアリング課題 | 58.4 | 55.1 | 57.3 | 54.2 | 57.7 |
CyberGym セキュリティ推論 | 68.7 | 48.3 | 66.6 | 38.8 | 66.3 |
BrowseComp Web調査 | 68.0 | 62.0 | - | - | - |
NL2Repo リポジトリ単位のコーディング | 42.7 | 35.9 | 49.8 | 33.4 | 41.3 |
Terminal-Bench 2.0 ターミナル操作エージェント | 63.5 | 56.2 | 65.4 | 68.5 | - |
τ³-Bench ツール利用エージェント | 70.6 | 69.2 | 72.4 | 67.1 | 72.9 |
HLE 専門的な質問 | 31.0 | 30.5 | 36.7 | 45.0 | 39.8 |
GLM-5.1はSWE-Bench Pro、CyberGym、BrowseCompで単独首位を獲得し、掲載したすべての項目でGLM-5を上回っています。NL2Repo、ターミナルでの実行、ツール利用、HLEではクローズドモデルが首位を維持しているため、エージェント型コーディングで肩を並べたという結果であり、全項目を制したわけではありません。
同じ表では、通常の実行とツールを併用した実行が分けられており、両者の列には大きな差があります。HLEはツールの利用を許可すると31.0から52.3に、BrowseCompはコンテキスト管理を加えると68.0から79.3に上がります。ただし、BrowseCompの後者の列ではGemini 3.1 Proが85.9で首位です。Terminal-Bench 2.0では、Claude Codeを動作させた場合の自己申告の最高値が69.0で、同じ評価ハーネスを使ったGLM-5の56.2、Codexを使ったGPT-5.4の75.1と比較されています。ツール関連の項目では中位に位置します。MCP-Atlas (Public Set)は71.8で、Qwen3.6-Plusが74.1で首位、Tool-Decathlonは40.7で、GPT-5.4が54.6で首位です。数学と知識の項目では差は小さく、AIME 2026は95.3、GPQA-Diamondは86.2で、いずれもGLM-5との差は1ポイントの数分の1程度です。Vending Bench 2での獲得額は$5,634.41で、この項目の首位であるClaude Opus 4.6の$8,017.59と比較されています。
GLM-5.1のハードウェア要件
システム要件で確認すべきなのはメモリです。753.9Bパラメータのモデルでは、実用可能な最小のビルドでも200 GBを超えます。Z.aiはsafetensors形式で提供し、推論提供用の5つのスタックと、それぞれの最低バージョンを挙げています。SGLang v0.5.10、vLLM v0.19.0、xLLM v0.8.0、およびTransformersまたはKTransformers v0.5.3です。Transformersを使う方法はglm_moe_dsaモデルのドキュメントに記載されています。以下のGGUFビルドはunsloth/GLM-5.1-GGUFによるものです。ここでは、205.5 GBのUD-IQ1_Mから810.6 GBのUD-Q8_K_XLまで22種類の量子化版に加え、量子化していない1.5 TBのBF16変換版が提供されています。各サイズは、そのフォルダ内の分割ファイルを合計したものです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 256 GB | UD-IQ2_XXS | 220.6 GB |
| 320 GB | UD-IQ3_S | 279.6 GB |
| 384 GB | UD-Q3_K_XL | 340.1 GB |
| 512 GB | UD-Q4_K_XL | 466.0 GB |
| 640 GB | UD-Q5_K_XL | 560.1 GB |
| 768 GB | UD-Q6_K_XL | 684.3 GB |
| 1 TB以上 | UD-Q8_K_XL | 810.6 GB |
最小は205.5 GBのUD-IQ1_Mですが、UD-IQ2_XXSよりわずか15 GB小さいだけなので、ほかのビルドを載せられないマシンでのみ選んでください。2つのビルドがどちらも収まる場合は大きい方を選び、ファイルサイズに加えてKVキャッシュ用の余裕を確保してください。この形式に馴染みがなければ、まずGGUFとは何かを参照してください。
Atomic ChatでGLM-5.1を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでGLM-5.1を検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを開始します。
ファミリーのほかのモデルについては、ローカル実行できるGLMモデルの一覧、または同じファミリーのGLM-5.2を参照してください。
GLM-5.1のライセンス
GLM-5.1は、最も制約の少ないライセンスの1つであるMITライセンスで公開されています。商用利用、改変、ファインチューニング、再配布が認められており、ロイヤリティは不要で、著作権表示の保持以外にはほとんど条件がありません。そのため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。
