GLM-5.3-Flash

更新
04.10.2026
思考
ツール利用
画像認識
推論
コード生成
多言語

GLM-5.3-Flashは、総パラメータ数320B、アクティブパラメータ数18BのMoEです。GLM-5シリーズ初のネイティブなマルチモーダルモデルで、MITライセンスで公開されています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 総数320B、トークンあたり18Bがアクティブ
  • コンテキスト長: 1,048,576トークン(1M)、config.jsonに基づく
  • モダリティ: テキストと画像の入力
  • 最小ハードウェア要件: FP8の重みは328.3 GB、BF16は642.7 GB

GLM-5.3-Flashとは?

GLM-5.3-Flashは、Z.ai(zai-org)が開発したパラメータ数320BのMixture-of-Expertsモデルで、GLM-5シリーズ初のネイティブなマルチモーダルモデルです。トークンあたりでアクティブになるパラメータは18Bのみなので、重み全体は非常に大きいままですが、各トークンの処理に必要な計算量は小規模モデルに近くなります。Z.aiは2026年8月25日にMITライセンスで公開しました。

仕様GLM-5.3-Flash
総パラメータ数320B(リポジトリのメタデータでは、重み全体で約321Bと報告されています)
アクティブパラメータ数トークンあたり18B
アーキテクチャglm5_next、スパースアテンションと線形アテンションを組み合わせたハイブリッド構成のスパースMoE
層数45
エキスパートルーティング対象は288個、トークンあたり8個がアクティブ
隠れ層の次元数4096
コンテキスト長1,048,576トークン(1M)、config.jsonに基づく
モダリティテキストと画像の入力。設定には画像と動画のトークンIDを含みます
事前学習コーパスマルチモーダルデータ30兆トークン
標準の重みFP8
公開日2026年8月25日
ライセンスMIT

アーキテクチャはglm5_nextとして登録されています。スパースアテンションと線形アテンションを単一のハイブリッド構成に組み合わせています。Z.aiは、これはGLMシリーズ初の構成であり、長いコンテキストを正確に処理する能力を維持しながら、長いコンテキストでの推論提供コストを大幅に削減すると説明しています。また、スケーリング効率を高めるためにManifold-Constrained Hyper-Connections(mHC)を採用しています。45層で各トークンを288個のエキスパートのうち8個にルーティングします。config.jsonには、画像と動画の専用トークンIDに加えてtext_configとvision_configの両方が含まれているため、視覚処理経路は後付けのアダプターではなく、ベースモデルの一部です。注意して読むべき数値があります。1Mというコンテキスト長は、config.jsonのmax_position_embeddingsに基づきます。README自体にはコンテキスト長の記載がありません。

GLM-5.3-Flashが得意なこと

ここには掲載できるベンチマーク表がありません。これは当サイトの掲載漏れではなく、リリース内容によるものです。Z.aiはこのモデルの結果をモデルカード内の画像として公開し、テキストではスコアを記載していないため、転載したり確認したりできる数値がありません。モデルカードに文章で書かれているのは、性能に関する主張そのものです。Z.aiによると、GLM-5.3-Flashは「価格をGLM-5.2の十分の一に抑えながら、ベンチマークと実際のワークロードでGLM-5.2を上回り、コーディングとエージェント関連のベンチマークではClaude Opus 4.8に迫る」とされています。この主張の前半も後半も、ベンダー自身が測定したGLM-5.2との比較について、ベンダー自身が示した評価です。

脚注には、実施したベンチマークとして、ツール使用ありのHLE、NL2Repo、DeepSWE、Terminal-Bench 2.1、Agent's Last Exam、Toolathlon Verified、AutomationBench v1.0.6、GDPval-AA v2、BabyVisionが挙げられています。Z.aiは、これらがそれぞれ何を測定するかを説明していないため、名前だけで内容を判断しないでください。脚注には評価ハーネスの設定も記載されており、確認する価値があります。DeepSWEはmini-swe-agentハーネスでコンテキスト長400K、タイムアウト6時間、NL2Repoはコンテキスト長1M、新規生成64kトークン、ツール使用ありのHLEはコンテキスト長300Kでコンテキスト管理戦略を使用し、GPT-5.6-lunaを評価役として実行されています。Terminal-Bench 2.1はClaude Code 2.1.207内で実行されています。Toolathlon Verifiedは公式評価サービスで実行した3回のpass@1の平均で、GDPval-AA v2はArtificial Analysisが採点しています。自分のハードウェアでいずれかを再現する場合は、これらの設定を合わせる必要があります。

GLM-5.3-Flashのハードウェア要件

確認すべきシステム要件はメモリです。ただし、このリリースで示されている数値はファイルサイズだけです。GGUFビルドはまだ公開されていないため、現時点でダウンロードできる重みは、2つのsafetensorsリポジトリにあるものです。

メモリ選択するビルドファイルサイズ
328.3 GB以上zai-org/GLM-5.3-Flash、FP8、62シャード328.3 GB
642.7 GB以上zai-org/GLM-5.3-Flash-BF16、120シャード642.7 GB

両方ともメモリに収まる場合は、FP8リポジトリを選んでください。Z.aiが標準で提供している形式で、ダウンロード容量は半分です。これらの重みで推論を提供するためのソフトウェア構成として、モデルカードにはSGLang、vLLM、TokenSpeed、KTransformersの4つが挙げられており、それぞれに手順ページがあります。量子化ビルドは上の表のどちらよりも小さくなります。この方法に初めて触れる場合は、まずGGUFとは何かをお読みください。

Atomic ChatでGLM-5.3-Flashを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでGLM-5.3-Flashを検索し、Download Optionsを開きます。
  3. 使用できるメモリに収まるビルドを選び、チャットを開始します。

3番目の手順には注意点があります。Atomic Chatは、このモデルのGGUFビルドをAtomicChat/GLM-5.3-Flash-GGUFとして公開する予定ですが、そのリポジトリにはまだ.ggufファイルがないため、追加されるまでは選択できるビルドがありません。ほかのラインナップについては、ローカルで実行できるGLMモデルの一覧をご覧ください。

GLM-5.3-Flashのライセンス

GLM-5.3-FlashはMITライセンスで公開されています。これはオープンウェイトのライセンスとしては最も制約が少ない部類です。商用利用、改変、再配布、非公開のフォークがすべて認められており、収益額による制限も、許容される利用に関する付則もなく、著作権表示を保持する以外の義務はありません。このライセンスにより、誰でも事前に許可を求めることなく、これらの重みを再量子化して再公開できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download zai-org/GLM-5.3-Flash
# フル精度の重み。328.3 GBではなく642.7 GBです。
huggingface-cli download zai-org/GLM-5.3-Flash-BF16
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "Refactor this module and explain the change."}]
  }'
# Z.aiは元の重みで推論を提供するためのツールとしてSGLang、vLLM、TokenSpeed、KTransformersを挙げています。
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
res = client.chat.completions.create(
    model="zai-org/GLM-5.3-Flash",
    messages=[{"role": "user", "content": "Summarise this repository layout."}],
)
print(res.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "zai-org/GLM-5.3-Flash",
  messages: [{ role: "user", content: "Write a Python function that parses a GGUF header." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GLM-5.3-Flashは、Z.aiが2026年8月25日にMITライセンスで公開したオープンウェイトのMixture-of-Expertsモデルです。Z.aiは、GLM-5シリーズ初のネイティブなマルチモーダルモデルで、総パラメータ数は320B、トークンあたりのアクティブパラメータ数は18Bと説明しています。リポジトリのメタデータでは、重み全体で約321Bと報告されています。アーキテクチャはglm5_nextとして登録されており、設定にはテキストと視覚の両方のセクションと、画像および動画のトークンIDが含まれています。

Z.aiは対象ハードウェアを明示していないため、公開されている重みのサイズが目安になります。標準リポジトリでは、62個のsafetensorsシャードに分割された328.3 GBのFP8の重みが提供されています。別途用意されたBF16リポジトリは、120シャードで642.7 GBです。これらはKVキャッシュを一切含まない重みだけの数値なので、ワークステーション向けのモデルというより、複数GPUを搭載したサーバーで扱う規模です。

はい。重みは、オープンソースで最も制約が少ないライセンスの一つであるMITライセンスで公開されています。ライセンス表示を保持する限り、ロイヤルティなしで商用利用、改変、再配布が認められます。大規模なオープンウェイトモデルは独自のコミュニティライセンスで公開されることが多いため、この規模のモデルでは珍しいことです。

Z.aiは、スパースアテンションと線形アテンションを単一のハイブリッド構成に組み合わせています。同社はこれをGLMシリーズ初の構成とし、長いコンテキストを正確に処理する能力を維持しながら、長いコンテキストでの推論提供コストを大幅に削減できると説明しています。また、スケーリング効率を高めるためにManifold-Constrained Hyper-Connectionsを採用しています。構造としては、45層、ルーティング対象のエキスパート288個で構成され、トークンあたり8個がアクティブになります。隠れ層の次元数は4096です。事前学習には、30兆トークンのマルチモーダルコーパスが使用されました。

設定ファイルではmax_position_embeddingsが1,048,576トークン、つまり1Mに設定されています。モデルカード自体には、コンテキスト長がどこにも記載されていない点に注意が必要です。この数値は、重みとともに提供される設定に基づきます。Z.aiは、スパースアテンションと線形アテンションのハイブリッド設計について、長いコンテキストでの精度を維持しながら、推論提供コストを削減するためのものだと説明しています。