GLM-5.1

更新
04.10.2026
ツール利用
思考
推論
コード生成

GLM-5.1は、Z.aiがエージェント型エンジニアリング向けに開発した、753.9BパラメータのMITライセンスのフラッグシップモデルです。SWE-Bench Proでは58.4で首位を獲得しています。Atomic Chatでローカル実行できます。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計753.9B (753,864,139,008)
  • コンテキスト長: 提供元のモデルカードに記載なし
  • モダリティ: テキスト入力、テキスト出力(英語と中国語)
  • 最低ハードウェア要件: メモリ256 GB。最小のGGUFビルドは205.5 GB

GLM-5.1とは?

GLM-5.1は、Z.ai(Hugging Faceではzai-org)が開発した753.9Bパラメータのモデルです。GLM-5の後継であり、エージェント型エンジニアリング向けに構築された、このファミリーのフラッグシップモデルです。訴求点は初回の回答よりも持続力にあります。問題を分解し、実験を行い、結果を読み取り、数百ラウンドと数千回のツール呼び出しにわたって戦略を修正するように設計されています。Z.aiは2026年4月3日に、MITライセンスで重みをHugging Faceに公開しました。

仕様GLM-5.1
総パラメータ数753.9B (753,864,139,008)
Transformers連携glm_moe_dsaモデルのドキュメント
前世代モデルGLM-5
重点分野エージェント型エンジニアリングとコーディング
言語英語と中国語
モダリティテキスト生成
重みの形式safetensors
ローカルでの推論提供SGLang, vLLM, xLLM, Transformers, KTransformers
ホステッドサービスでの利用Z.ai API Platform
技術レポートGLM-5: Vibe Codingからエージェント型エンジニアリングへ (arXiv 2602.15763)
公開日2026年4月3日
ライセンスMIT

注目すべき主張は、最初の1時間を過ぎた後の挙動です。Z.aiによると、GLM-5を含む従来のモデルは、既知の手法を適用して序盤に素早く成果を上げるものの、その後は頭打ちになり、時間を追加しても改善しません。一方、GLM-5.1は曖昧な問題に対してより適切に判断し、進行を妨げる要因を的確に特定し、実行時間が長くなるほど改善を続けるとしています。公開時の数値では、これがSWE-Bench Proでの最高水準の成績と、NL2Repo(リポジトリ生成)およびTerminal-Bench 2.0(実環境のターミナルタスク)でのGLM-5に対する大幅なリードとして表れています。重みはsafetensors形式で提供されており、提供元のモデルカードにはコンテキスト長の記載がありません。

GLM-5.1のベンチマーク

モデルカードに掲載されたZ.aiの公開時の比較表では、GLM-5.1をQwen3.6-Plus、MiniMax M2.7、DeepSeek-V3.2、Kimi K2.5など、ほかの8モデルと比較しています。ここでは、前世代のGLM-5と、クローズドな最先端モデル3種であるClaude Opus 4.6、Gemini 3.1 Pro、GPT-5.4との比較を示します。

ベンチマークGLM-5.1GLM-5Claude Opus 4.6Gemini 3.1 ProGPT-5.4
SWE-Bench Pro
より難しいエンジニアリング課題
58.455.157.354.257.7
CyberGym
セキュリティ推論
68.748.366.638.866.3
BrowseComp
Web調査
68.062.0---
NL2Repo
リポジトリ単位のコーディング
42.735.949.833.441.3
Terminal-Bench 2.0
ターミナル操作エージェント
63.556.265.468.5-
τ³-Bench
ツール利用エージェント
70.669.272.467.172.9
HLE
専門的な質問
31.030.536.745.039.8

GLM-5.1はSWE-Bench Pro、CyberGym、BrowseCompで単独首位を獲得し、掲載したすべての項目でGLM-5を上回っています。NL2Repo、ターミナルでの実行、ツール利用、HLEではクローズドモデルが首位を維持しているため、エージェント型コーディングで肩を並べたという結果であり、全項目を制したわけではありません。

同じ表では、通常の実行とツールを併用した実行が分けられており、両者の列には大きな差があります。HLEはツールの利用を許可すると31.0から52.3に、BrowseCompはコンテキスト管理を加えると68.0から79.3に上がります。ただし、BrowseCompの後者の列ではGemini 3.1 Proが85.9で首位です。Terminal-Bench 2.0では、Claude Codeを動作させた場合の自己申告の最高値が69.0で、同じ評価ハーネスを使ったGLM-5の56.2、Codexを使ったGPT-5.4の75.1と比較されています。ツール関連の項目では中位に位置します。MCP-Atlas (Public Set)は71.8で、Qwen3.6-Plusが74.1で首位、Tool-Decathlonは40.7で、GPT-5.4が54.6で首位です。数学と知識の項目では差は小さく、AIME 2026は95.3、GPQA-Diamondは86.2で、いずれもGLM-5との差は1ポイントの数分の1程度です。Vending Bench 2での獲得額は$5,634.41で、この項目の首位であるClaude Opus 4.6の$8,017.59と比較されています。

GLM-5.1のハードウェア要件

システム要件で確認すべきなのはメモリです。753.9Bパラメータのモデルでは、実用可能な最小のビルドでも200 GBを超えます。Z.aiはsafetensors形式で提供し、推論提供用の5つのスタックと、それぞれの最低バージョンを挙げています。SGLang v0.5.10、vLLM v0.19.0、xLLM v0.8.0、およびTransformersまたはKTransformers v0.5.3です。Transformersを使う方法はglm_moe_dsaモデルのドキュメントに記載されています。以下のGGUFビルドはunsloth/GLM-5.1-GGUFによるものです。ここでは、205.5 GBのUD-IQ1_Mから810.6 GBのUD-Q8_K_XLまで22種類の量子化版に加え、量子化していない1.5 TBのBF16変換版が提供されています。各サイズは、そのフォルダ内の分割ファイルを合計したものです。

メモリ選ぶビルドファイルサイズ
256 GBUD-IQ2_XXS220.6 GB
320 GBUD-IQ3_S279.6 GB
384 GBUD-Q3_K_XL340.1 GB
512 GBUD-Q4_K_XL466.0 GB
640 GBUD-Q5_K_XL560.1 GB
768 GBUD-Q6_K_XL684.3 GB
1 TB以上UD-Q8_K_XL810.6 GB

最小は205.5 GBのUD-IQ1_Mですが、UD-IQ2_XXSよりわずか15 GB小さいだけなので、ほかのビルドを載せられないマシンでのみ選んでください。2つのビルドがどちらも収まる場合は大きい方を選び、ファイルサイズに加えてKVキャッシュ用の余裕を確保してください。この形式に馴染みがなければ、まずGGUFとは何かを参照してください。

Atomic ChatでGLM-5.1を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでGLM-5.1を検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを開始します。

ファミリーのほかのモデルについては、ローカル実行できるGLMモデルの一覧、または同じファミリーのGLM-5.2を参照してください。

GLM-5.1のライセンス

GLM-5.1は、最も制約の少ないライセンスの1つであるMITライセンスで公開されています。商用利用、改変、ファインチューニング、再配布が認められており、ロイヤリティは不要で、著作権表示の保持以外にはほとんど条件がありません。そのため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download zai-org/GLM-5.1
from transformers import AutoModel
model = AutoModel.from_pretrained("zai-org/GLM-5.1")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GLM-5.1は、zai-org(Z.AI)が開発した、重みが公開されている大規模言語モデルです。753.9BパラメータのMixture-of-Expertsとして構築されており、トークンごとに約40Bのパラメータがアクティブになります。エージェント型コーディングと長期にわたる推論に向けて調整されており、SWE-Bench Proでは58.4を記録しています。重みはMITライセンスでHugging Faceに公開されているため、Atomic Chatなどのアプリでローカル実行できます。

FP8の完全なチェックポイントには約860GBのメモリが必要で、フル精度では1.5TBを超えるため、複数GPUを搭載したマシンかクラスターが必要です。量子化されたGGUFビルドでは、これを大幅に減らせます。4ビット版は約476GBで、2ビットの動的量子化版は約240GBに収まり、256GBのMac Studioや複数のGPUカードを搭載したワークステーションで実行できます。一般消費者向けハードウェアでは、毎秒数トークン程度を見込んでください。

はい。GLM-5.1はMITライセンスで公開されているため、無料でダウンロード、ファインチューニング、デプロイができます。ライセンスでは、ロイヤリティや用途の制限なしで商用利用することも認められています。実際にかかる費用は、この規模のモデルを実行するために必要なハードウェアの費用だけです。

はい。重みをダウンロードした後は、インターネット接続なしで、モデルを完全に自分のマシン上で実行できます。Atomic Chatで読み込むと、すべてのプロンプトと応答がデバイス内に保持されるため、外部サーバーには何も送信されません。主な制約は、モデルまたは十分に量子化されたバージョンを収められるメモリがあるかどうかです。

最も得意なのはエージェント型コーディングです。リポジトリ全体にわたる作業、ツールの呼び出し、実験の実行、複数ステップの問題解決に強く、その能力はSWE-Bench Proのスコアにも表れています。ツール呼び出しのネイティブ対応と198Kのコンテキスト長により、大規模なコードベースや文書群を対象とした長いコンテキストでの推論にも適しています。これらのタスクでは、思考モードがデフォルトで有効になっています。