最終更新:2026年8月28日。 GLM-5.3-Flashはリリースから3日目で、ローカル実行への対応はまだ進行中です。私たちは独自のimatrixを使ったGGUF量子化版を作成しており、準備ができ次第、Atomic Chatでの操作手順、量子化品質の実測結果、スループットの数値をこのガイドに追加します。以下は、本日時点の状況です。
この記事でわかること:
- GLM-5.3-Flashの概要と、GLM-5.2およびGLM-4.7-Flashとの違い
- 実行に必要なハードウェア
- 現時点で実際に動作する実行方法と、まだアップストリームでの対応を待っている方法
ノートPCに収まる小型のGLMモデルを探している場合は、GLMモデルをローカルで動かすためのガイドをご覧ください。この記事ではGLM-5.3-Flashのみを扱います。
ローカル実行への対応状況
GLM-5.3-Flashは、mHCを備え、線形アテンションとスパースアテンションを組み合わせた新しいアーキテクチャ、Glm5NextForConditionalGenerationを採用しています。推論エンジンのメインラインでは、まだこのアーキテクチャへの対応が追加されていません。そのため、現状は次のとおりです。
- メインラインのllama.cppでは、まだこのモデルを読み込めません。 未マージのプルリクエストが3件あります。#27752、#27754、#27773で、いずれも8月26日に作成されました。
- 現時点でGGUFを実行できる唯一のビルドはフォーク版です。 Unslothは、独自のllama.cpp PRのブランチ
glm5next/upstreamで動作する量子化版を提供しています。 - llama.cppに依存するすべての下流プロジェクトが対応待ちです。 Atomic Chat、LM Studio、Ollamaのローカル実行エンジンも含まれます。
私たちの独自の量子化版は、Z.aiの元の重みと独自の重要度行列を使って作成中で、完成後にAtomicChat/GLM-5.3-Flash-GGUFで公開します。ビルドに使用するキャリブレーション用コーパスは、すでに公開しています。
GLM-5.3-Flashとは?
GLM-5.3-Flashは、Z.aiが2026年8月25日にMITライセンスでHugging Faceに公開した、重みが公開されているMixture-of-Expertsモデルです。約10分の1の価格で、ベンチマークと実際のワークロード全般においてGLM-5.2を上回り、コーディングやエージェント型タスクではClaude Opus 4.8に迫る性能を発揮します。
GLM-5.3-Flashの主な仕様:
| 仕様 | GLM-5.3-Flash |
|---|---|
| 総パラメータ数 / アクティブパラメータ数 | 総数320B、アクティブ18B |
| アーキテクチャ | MoE、線形アテンションとスパースアテンションのハイブリッド、Manifold-Constrained Hyper-Connections (mHC) |
| 層数 | 45層:線形アテンション34層、スパースアテンション11層 |
| エキスパート | ルーティング対象288個 + 共有1個、トークンあたりルーティング対象のエキスパート8個がアクティブ |
| コンテキスト長 | 1,048,576トークン |
| モダリティ | テキストと画像の入力に対応。設定には動画トークンも定義されています |
| 推論 | reasoning_effortはlow、high、maxに設定可能。デフォルトはmax |
| 事前学習 | 30Tトークンのマルチモーダルコーパス |
| リリース日 | 2026年8月25日 |
| ライセンス | MIT |
出典:公式モデルカードおよびzai-org/GLM-5.3-Flash内のconfig.json。
このモデルは、ローカル推論にとって重要な2つのアーキテクチャ上の設計を導入しています。
まず、45層のうち34層は線形アテンションを使用し、そのメモリ使用量は会話の長さにかかわらず一定です。一方、残りの11層はスパースアテンションを使用し、トークンごとに増加する従来型のKVキャッシュを持ちます。これにより「長いコンテキストでの推論提供コストを大幅に削減」でき、この規模のTransformerでも100万トークンのコンテキスト長を利用できます。
次に、このモデルは各トークンを288個のエキスパートのうち8個と1個の共有エキスパートにルーティングし、総数320Bのパラメータのうちトークンあたり18Bをアクティブにするため、トークン間で使われていないエキスパートの重みはシステムRAMへのオフロードに適しており、アテンション層をGPUに残すことで、320Bモデルをワークステーションで実行できます。
GLM-5.3-Flash、GLM-5.2、GLM-4.7-Flashの比較
GLM-5.3-Flashは、GLMシリーズの新世代モデルです。
- GLM-5.2は前世代のフラッグシップモデルです。GLM-5.3-Flashは、Z.aiが公開したすべてのベンチマークでこれを上回り、エージェント型コーディングでは大きくリードしています。
- GLM-4.7-Flashは、個人向けハードウェアに最適化されたGLMファミリーの中でも最小クラスのモデルです。4ビットGGUFのサイズはわずか17.1 GBで、24 GBのGPUや32 GBのMacに適しています。また、GLM-5.3-Flashとは異なり、現時点でメインラインのllama.cppで動作します。
GLM-5.3-Flashのベンチマーク
Z.aiは、GLM-5.3-Flashを前世代モデルおよび4つの最先端モデルと比較しました。
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 | DeepSeek-V4-Vision-Exp | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 83.9 | 85.0 | 87.4 | 85.8 |
| DeepSWE v1.1 | 63.4 | 46.2 | 59.3 | 58.0 | 69.6 | 65.3 |
| Agents' Last Exam | 26.3 | 20.4 | 27.3 | 27.0 | 28.0 | — |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 38.8 | 41.0 | 37.2 | 52.3 |
| HLE w/ Tools | 55.3 | 54.7 | 55.1 | 57.9 | — | — |
| GDPVal-AA v2 | 1773 | 1504 | 1675 | 1582 | 1571 | 1527 |
これらの測定は、Z.aiが独自の評価環境を使って社内で実施したものです。ダッシュは、その組み合わせの結果をZ.aiが公開していないことを示します。
特にClaude Opus 4.8との比較では、GLM-5.3-FlashはTerminal Bench(84.3対85.0)とHLE(55.3対57.9)ではわずかに下回るだけですが、DeepSWE(63.4対58.0)、AutomationBench(48.8対41.0)、GDPVal-AA(1773対1582)では明確にリードしています。
エージェント型タスクのベンチマークでも前世代のフラッグシップを上回っています。AutomationBenchは26.2から48.8へとほぼ倍増し、DeepSWEは46.2から63.4へと向上しています。
留意すべき点が1つあります。上記の数値はすべて元の重みで測定されたものです。量子化によって品質は低下し、その程度はビルドによって異なります。私たちの独自の量子化版をリリースする際には、KLダイバージェンスとtop-1一致率の実測値を公開し、各ファイルで何がどの程度失われるかを正確に確認できるようにします。
GLM-5.3-FlashのGGUF対応の現状
Atomic Chatでは現在、Z.aiの元の重みと独自の重要度行列を使い、独自に量子化したビルドを作成しています。キャリブレーション用コーパスはAtomicChat/calib-corporaで公開しています。IQ2_MからQ8_0までを揃える予定で、Q4_K_Mを推奨のデフォルトとし、UD-Q4_K_XLでは埋め込みと出力をQ8_0に保つことで、Q4相当のメモリ使用量でより高い品質を目指します。まだ公開していません。
執筆時点では、すでに完成しているunslothのビルドをダウンロードできます。サイズは全シャードの合計で、10進数のGB表記です。
| ビルド | サイズ |
|---|---|
| UD-IQ1_S | 93.1 GB |
| UD-IQ1_M | 97.6 GB |
| UD-Q2_K_XL | 108.7 GB |
| UD-IQ3_XXS | 120.4 GB |
| UD-Q3_K_XL | 147.5 GB |
| UD-IQ4_XS | 156.8 GB |
| UD-Q4_K_XL | 199.7 GB |
このサイズのGGUFを単一ファイルとしてホストしたりダウンロードしたりするのは現実的でないため、すべてのビルドは複数のシャードに分割して提供されます。アプリとllama.cppはいずれも、これらを自動でまとめて扱います。また、Atomic ChatのDownload Optionsに表示される数値は2進数のGB表記なので、同じファイルでも上の表より数パーセント小さく表示されます。
GLM-5.3-Flashのハードウェア要件
ローカルLLMの推論で最も重要なハードウェア仕様は、VRAMとシステムRAM、またはApple Siliconの統合メモリです。GLM-5.3-Flashは、最も強く量子化した1ビットのビルドでも90 GBを超えるため、ローカルで実行するには次のいずれかの構成が必要です。
- 大容量RAMを搭載したワークステーション。 エキスパートの重みはシステムRAMに、アテンション層はGPUにオフロードします。低ビットのビルドには128 GB、4ビットのビルドにはいずれも256 GBを推奨します。
- 大容量メモリを搭載したMac。 128 GBまたは256 GBのMac Studioなら、低ビットのビルドを統合メモリに収められます。macOSはデフォルトでGPUがアクセスできるメモリを統合メモリの約75パーセントに制限するため、それを踏まえてメモリ容量を見積もってください。
- レンタルGPU。 専用GPUを借り、VPS経由でLLMを提供できます。詳しい手順はこちらのガイドをご覧ください。
これらのビルドを実際に動作させたUnslothは、RAMの最低容量を1ビット量子化版では100 GB、3ビットでは128 GBとし、代表的な128 GBマシンとしてMacやNVIDIA DGX Sparkを挙げています。これは上記のファイルサイズと整合しています。64 GB未満では、どの量子化版でもこのモデルを実行する方法はありません。
コンテキスト長によってメモリはどれだけ増える?
上記のファイルサイズは重みのみのサイズです。推論エンジンはそれに加えて、会話のトークンが増えるたびに大きくなるKVキャッシュを割り当てます。
ただし、45層のうち従来型のKVキャッシュを保持するのは11層だけで、残りの34層は固定サイズの状態を持つ線形アテンションを使うハイブリッドアテンション機構により、このモデルのトークンあたりのKVキャッシュ使用量は、従来型の45層Transformerの約4分の1です。
設定から推定するのではなく、私たち独自の評価環境でモデルが動作するようになり次第、トークンあたりのキャッシュ使用量の実測値を公開します。
現時点でGLM-5.3-Flashを動かす方法
対応がアップストリームにマージされるまで、GLM-5.3-Flashをローカルで動かす方法は3つあります。
自分のハードウェアでUnslothのフォークを使う
現時点で動作するローカルGGUFの実行方法はこれだけです。メインラインのビルドではなく、Unslothのllama.cpp PR(ブランチglm5next/upstream)が必要で、セットアップ方法は同社のドキュメントに記載されています。実際に使えるメモリ容量に合わせて、上のサイズ表から量子化版を選んでください。
サーバー向けのソフトウェア構成で実行する
モデルカードには、対応するデプロイ方法としてSGLang、vLLM、TokenSpeed、Transformers、KTransformersが挙げられており、これらはllama.cppにまったく依存しません。ノートPCでモデルとチャットするのではなく、チーム向けにモデルを提供する場合、現時点ではこれが成熟した方法です。フレームワークごとの手順は公式モデルカードをご覧ください。
ローカルのハードウェアを使わずに利用する
Z.aiは、自社のAPIプラットフォームでGLM-5.3-Flashを提供しています。Ollamaにもglm-5.3-flashが掲載されていますが、取得する前にタグを確認してください。公開されているタグはglm-5.3-flash:cloudだけで、これは自分のマシンではなくOllamaのサーバー上でモデルを実行します。このタグからローカル用の重みをダウンロードすることはできません。
Atomic ChatでGLM-5.3-Flashを動かす方法
Atomic Chatは、私たちが開発した無料のオープンソースのローカルAIアプリです。Hugging Faceのモデルブラウザーを備え、シャードで提供されるモデルでは特に重要な分割GGUFのダウンロードを管理し、llama.cppを手動でビルドすることなく使えるチャットインターフェースを提供します。
推論エンジンが対応し次第、Atomic ChatでGLM-5.3-Flashを実行できるようになります。今のうちにAtomic Chatをインストールしておけば、対応後すぐにこのモデルを使い始められます。
atomic.chatからAtomic Chatをダウンロードし、使用しているプラットフォーム向けのビルドをインストールしてください。
- macOS:ユニバーサル版の
.dmg、macOS 13.6以降 - Windows:x64向けの
.exeインストーラー - Linux:root権限が不要な、x86_64向けの自己完結型
.AppImage

Linuxでは、chmod +xでAppImageに実行権限を付与し、直接実行してください。初回起動時にアプリがFUSEについて確認してきた場合は、DebianまたはUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールしてください。
Atomic Chatでは、モデルをGPUとシステムRAMに分散して配置できます。これにより、320Bモデルを一般的なハードウェアで実行できます。
Keep all Experts in CPUは、Mixture-of-Expertsの重みをシステムRAMに配置し、アテンションをGPUに残します。320Bのパラメータのうちトークンあたりアクティブになるのは18Bだけなので、エキスパートの重みはトークン間で使われず、より低速なメモリでも動作できます。その代わり、生成速度は低下します。
Number of MoE weights in the CPUは、同じ処理を部分的に行います。先頭N層のエキスパートをRAMに配置し、残りはGPUに保持します。すべてを移すか、まったく移さないかの二択にするのではなく、この設定でVRAMをちょうど使い切るように調整してください。
Context Sizeで指定した分のメモリは、モデルの読み込み時に確保されます。チャットでは8,192トークン、コードやドキュメントでは32,768トークンから始め、そこから増やしてください。
サンプリングには、Z.ai自身の評価設定であるtemperature 1.0とtop_p 0.95を使用してください。思考時の推論強度はデフォルトでmaxで、reasoning_effortのほかの2つのレベルはlowとhighです。
よくある質問
自分のハードウェアでGLM-5.3-Flashを動かす際によくある質問です。
GLM-5.3-Flashは今すぐローカルで実行できますか?
はい。ただし、Unslothのllama.cppフォークを使い、必要なメモリを確保できる場合に限ります。メインラインのllama.cppでは、このアーキテクチャに対応するプルリクエストが3件ありますが、いずれもマージされていません。そのため、これを基盤とするAtomic Chat、LM Studio、Ollamaのローカル実行エンジンでは、まだモデルを読み込めません。
GLM-5.3-Flashにはどれだけのメモリが必要ですか?
コンテキスト用の余裕を含める前の段階で、最小の1ビットビルドには約93 GB、4ビットビルドには200 GBが必要です。実際には、128 GB以上のRAMを搭載したワークステーション、大容量メモリのMac、またはレンタルGPUが必要になります。64 GB未満では実行する方法はありません。
MacでGLM-5.3-Flashを実行できますか?
128 GBまたは256 GBのMac Studioなら、統合メモリで低ビットのビルドを実行できます。ただし、macOSはデフォルトでGPUがアクセスできるメモリを全体の約75パーセントに制限する点に注意してください。MacBookでは要件を満たせません。代わりにGLM-4.7-Flashを使ってください。
「Keep all Experts in CPU」は何をする設定ですか?
Mixture-of-Expertsの重みをシステムRAMに保持し、アテンション層をGPUに残します。モデルの320Bのパラメータのうちトークンあたりアクティブになるのは18Bだけなので、エキスパートの重みの大半はトークン間で使われず、より低速なメモリでも動作できます。生成速度と引き換えに、通常のGPUを搭載したマシンで320Bモデルを実行可能にする設定です。
GLM-5.3-Flashは商用利用も無料ですか?
はい。GLM-5.3-Flashは、商用利用、改変、再配布を認めるMITライセンスで提供されています。
GLM-5.3-Flashのコンテキスト長はどれくらいですか?
1,048,576トークンです。
GLM-5.3-Flashはローカルで画像認識に対応していますか?
はい。このモデルはネイティブにマルチモーダルに対応しています。ただし、ローカルで画像を入力するには、量子化版に加えてビジョンプロジェクターのファイルが必要です。
GLM-5.3-FlashはGLM-5.2と比べてどうですか?
GLM-5.3-Flashは、Z.aiが公開した6つのベンチマークすべてでGLM-5.2を上回っており、最も大きく向上しているのはエージェント型コーディングです。AutomationBenchは48.8対26.2、DeepSWEは63.4対46.2、GDPVal-AAは1773対1504です。また、Z.aiによると、推論の提供価格はGLM-5.2の約10分の1です。
Atomic ChatはいつGLM-5.3-Flashに対応しますか?
llama.cppにこのアーキテクチャが組み込まれ、私たちの量子化版のアップロードが完了し次第、対応します。その日のうちに、詳しい操作手順、量子化品質の実測結果、スループットの数値をこのガイドに追加します。
まとめ
GLM-5.3-Flashは、一般消費者向けのハードウェアでローカル実行できる初めてのGLM-5モデルですが、ハイエンドのPCまたはMacの構成と、低ビットの量子化版が必要です。それでも、元のビルドがClaude Opus 4.8並みの性能を発揮するモデルとしては、非常に印象的です。これを可能にしているのは、総数320Bのパラメータのうち、どのトークンでもアクティブになるのは18Bだけというスパース性の仕組みであり、エキスパートの重みをシステムRAMにオフロードできます。
リリースから3日目の時点での障害は、ハードウェアではなくツールの対応です。重みはMITライセンスで公開され、量子化版も存在し、メモリ容量の計算上は実行可能ですが、メインラインのllama.cppにはまだこのアーキテクチャがマージされていないため、現時点でローカル実行する唯一の方法はフォークを使うことです。
要点:
- GLM-5.3-Flashは、総パラメータ数320B、アクティブパラメータ数18BのMoEで、2026年8月25日にMITライセンスでリリースされました。
- 45層のうち34層が固定サイズの状態を持つ線形アテンションを使うハイブリッドアーキテクチャを採用しており、1Mのコンテキスト長に必要なメモリは、同規模の従来型Transformerより大幅に少なくなっています。
- 公開された6つのベンチマークすべてでGLM-5.2を上回り、そのうち3つではClaude Opus 4.8をリードしています。
- 最小のビルドでも90 GBを超えるため、このモデルの実行にはワークステーション、ハイエンドのMac、またはレンタルGPUが必要です。ほとんどのノートPCでは実行できません。
- メインラインのllama.cppへの対応はまだマージされていません。現時点でローカルGGUFを実行する唯一の方法はUnslothのフォークです。
- 対応がリリースされ次第、私たち独自のimatrix量子化版とAtomic Chatでの詳しい操作手順をこのガイドに追加します。

