GLM-5.3-Flashとは?
GLM-5.3-Flashは、Z.ai(zai-org)が開発したパラメータ数320BのMixture-of-Expertsモデルで、GLM-5シリーズ初のネイティブなマルチモーダルモデルです。トークンあたりでアクティブになるパラメータは18Bのみなので、重み全体は非常に大きいままですが、各トークンの処理に必要な計算量は小規模モデルに近くなります。Z.aiは2026年8月25日にMITライセンスで公開しました。
| 仕様 | GLM-5.3-Flash |
|---|---|
| 総パラメータ数 | 320B(リポジトリのメタデータでは、重み全体で約321Bと報告されています) |
| アクティブパラメータ数 | トークンあたり18B |
| アーキテクチャ | glm5_next、スパースアテンションと線形アテンションを組み合わせたハイブリッド構成のスパースMoE |
| 層数 | 45 |
| エキスパート | ルーティング対象は288個、トークンあたり8個がアクティブ |
| 隠れ層の次元数 | 4096 |
| コンテキスト長 | 1,048,576トークン(1M)、config.jsonに基づく |
| モダリティ | テキストと画像の入力。設定には画像と動画のトークンIDを含みます |
| 事前学習コーパス | マルチモーダルデータ30兆トークン |
| 標準の重み | FP8 |
| 公開日 | 2026年8月25日 |
| ライセンス | MIT |
アーキテクチャはglm5_nextとして登録されています。スパースアテンションと線形アテンションを単一のハイブリッド構成に組み合わせています。Z.aiは、これはGLMシリーズ初の構成であり、長いコンテキストを正確に処理する能力を維持しながら、長いコンテキストでの推論提供コストを大幅に削減すると説明しています。また、スケーリング効率を高めるためにManifold-Constrained Hyper-Connections(mHC)を採用しています。45層で各トークンを288個のエキスパートのうち8個にルーティングします。config.jsonには、画像と動画の専用トークンIDに加えてtext_configとvision_configの両方が含まれているため、視覚処理経路は後付けのアダプターではなく、ベースモデルの一部です。注意して読むべき数値があります。1Mというコンテキスト長は、config.jsonのmax_position_embeddingsに基づきます。README自体にはコンテキスト長の記載がありません。
GLM-5.3-Flashが得意なこと
ここには掲載できるベンチマーク表がありません。これは当サイトの掲載漏れではなく、リリース内容によるものです。Z.aiはこのモデルの結果をモデルカード内の画像として公開し、テキストではスコアを記載していないため、転載したり確認したりできる数値がありません。モデルカードに文章で書かれているのは、性能に関する主張そのものです。Z.aiによると、GLM-5.3-Flashは「価格をGLM-5.2の十分の一に抑えながら、ベンチマークと実際のワークロードでGLM-5.2を上回り、コーディングとエージェント関連のベンチマークではClaude Opus 4.8に迫る」とされています。この主張の前半も後半も、ベンダー自身が測定したGLM-5.2との比較について、ベンダー自身が示した評価です。
脚注には、実施したベンチマークとして、ツール使用ありのHLE、NL2Repo、DeepSWE、Terminal-Bench 2.1、Agent's Last Exam、Toolathlon Verified、AutomationBench v1.0.6、GDPval-AA v2、BabyVisionが挙げられています。Z.aiは、これらがそれぞれ何を測定するかを説明していないため、名前だけで内容を判断しないでください。脚注には評価ハーネスの設定も記載されており、確認する価値があります。DeepSWEはmini-swe-agentハーネスでコンテキスト長400K、タイムアウト6時間、NL2Repoはコンテキスト長1M、新規生成64kトークン、ツール使用ありのHLEはコンテキスト長300Kでコンテキスト管理戦略を使用し、GPT-5.6-lunaを評価役として実行されています。Terminal-Bench 2.1はClaude Code 2.1.207内で実行されています。Toolathlon Verifiedは公式評価サービスで実行した3回のpass@1の平均で、GDPval-AA v2はArtificial Analysisが採点しています。自分のハードウェアでいずれかを再現する場合は、これらの設定を合わせる必要があります。
GLM-5.3-Flashのハードウェア要件
確認すべきシステム要件はメモリです。ただし、このリリースで示されている数値はファイルサイズだけです。GGUFビルドはまだ公開されていないため、現時点でダウンロードできる重みは、2つのsafetensorsリポジトリにあるものです。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 328.3 GB以上 | zai-org/GLM-5.3-Flash、FP8、62シャード | 328.3 GB |
| 642.7 GB以上 | zai-org/GLM-5.3-Flash-BF16、120シャード | 642.7 GB |
両方ともメモリに収まる場合は、FP8リポジトリを選んでください。Z.aiが標準で提供している形式で、ダウンロード容量は半分です。これらの重みで推論を提供するためのソフトウェア構成として、モデルカードにはSGLang、vLLM、TokenSpeed、KTransformersの4つが挙げられており、それぞれに手順ページがあります。量子化ビルドは上の表のどちらよりも小さくなります。この方法に初めて触れる場合は、まずGGUFとは何かをお読みください。
Atomic ChatでGLM-5.3-Flashを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでGLM-5.3-Flashを検索し、Download Optionsを開きます。
- 使用できるメモリに収まるビルドを選び、チャットを開始します。
3番目の手順には注意点があります。Atomic Chatは、このモデルのGGUFビルドをAtomicChat/GLM-5.3-Flash-GGUFとして公開する予定ですが、そのリポジトリにはまだ.ggufファイルがないため、追加されるまでは選択できるビルドがありません。ほかのラインナップについては、ローカルで実行できるGLMモデルの一覧をご覧ください。
GLM-5.3-Flashのライセンス
GLM-5.3-FlashはMITライセンスで公開されています。これはオープンウェイトのライセンスとしては最も制約が少ない部類です。商用利用、改変、再配布、非公開のフォークがすべて認められており、収益額による制限も、許容される利用に関する付則もなく、著作権表示を保持する以外の義務はありません。このライセンスにより、誰でも事前に許可を求めることなく、これらの重みを再量子化して再公開できます。
