GLM-4.7-Flash

更新
04.10.2026
ツール利用
思考
推論
コード生成

GLM-4.7-Flashは、MITライセンスで公開されたZ.aiの30B-A3B MoEモデルです。総パラメータ数は31.2Bで、トークンあたり約3Bが有効になり、2ビットのGGUFビルドは12 GBに収まります。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計31.2B、トークンあたり約3Bが有効(30B-A3B MoE)
  • 最大新規生成トークン数(提供元の評価時): 131,072
  • モダリティ: テキストの入出力、英語と中国語
  • 最小ハードウェア要件: 2ビットのGGUFビルドで12 GBのRAMまたはVRAM

GLM-4.7-Flashとは?

GLM-4.7-Flashは、Z.aiの混合エキスパートモデルです。総パラメータ数は31.2Bですが、トークンあたり有効になるのは約3Bのみで、30B-A3Bという表記はこのことを意味します。Z.aiはこれを30Bクラスで最も強力なモデルと呼び、性能と効率を両立する軽量なデプロイの新たな選択肢として紹介しています。重みは2026年1月19日にMITライセンスでHugging Faceに公開されました。モデルカードには、ローカルでの推論実行に使うvLLMとSGLangが挙げられており、重みを直接実行するためのtransformersのサンプルも掲載されています。

仕様GLM-4.7-Flash
総パラメータ数31.2B(正確には31,221,488,576)
有効パラメータ数トークンあたり約3B(30B-A3B)
アーキテクチャ混合エキスパート(MoE)
タスクテキスト生成、テキストの入出力
言語英語と中国語
推論思考モード。複数ターンのエージェントタスクではPreserved Thinkingを推奨
投機的デコーディング提供元の推論サーバー設定ではMTP(vLLM)とEAGLE(SGLang)を使用
提供元のサンプリング既定値温度1.0、top-p 0.95
最大新規生成トークン数(提供元の評価時)131,072
推論用のソフトウェア構成vLLMとSGLang(mainブランチのみ)、およびTransformers
パーサーツール呼び出し用パーサーglm47、推論用パーサーglm45
リリース日2026年1月19日
ライセンスMIT

Z.ai自身が提供する推論サーバー起動コマンドでは、投機的デコーディングが有効になっています。vLLMでは投機トークン数を1つにしたMTP、SGLangでは投機ステップ数を3、ドラフトトークン数を4にしたEAGLEを使用します。この仕組みについては、投機的デコーディングのガイドで解説しています。両方のコマンドで、ツール呼び出し用のglm47と推論用のglm45という同じ2つのパーサーも指定されています。vLLMのコマンドでは、ツールの自動選択も有効にしています。Z.aiが複数ターンのエージェントタスクとして挙げているτ²-BenchとTerminal Bench 2については、モデルカードでPreserved Thinkingモードを有効にするよう案内しています。

GLM-4.7-Flashのベンチマーク

モデルカードに掲載されたZ.aiのリリース時の数値では、GLM-4.7-FlashをQwen3-30B-A3B-Thinking-2507およびGPT-OSS-20Bと比較しています。

ベンチマークGLM-4.7-FlashQwen3-30B-A3B-Thinking-2507GPT-OSS-20B
AIME 25
数学競技
91.685.091.7
GPQA
専門科学
75.273.471.5
LCB v6
競技プログラミング
64.066.061.0
HLE
専門知識を問う問題
14.49.810.9
SWE-bench Verified
ソフトウェア工学
59.222.034.0
τ²-Bench
エージェントのツール利用
79.549.047.7
BrowseComp
ウェブ閲覧
42.82.2928.3

GLM-4.7-Flashは7項目中5項目で首位となり、特にSWE-bench Verified、τ²-Bench、BrowseCompで大きな差をつけています。AIME 25ではGPT-OSS-20Bに0.1ポイント、LCB v6ではQwenモデルに2ポイント及びません。

Z.aiは、すべての項目を同じ設定で評価したわけではありません。Terminal BenchとSWE-bench Verifiedは温度0.7、top-p 1.0、生成上限16,384トークンで評価され、τ²-Benchは温度0で同じ生成上限を使用しています。上の表にある既定値とは異なります。τ²-Benchでは、ユーザーが誤った方法で対話を終了することによる失敗を避けるため、RetailとTelecomのユーザーとの対話にプロンプトを追加し、Claude Opus 4.5のリリースレポートにあるAirlineドメインの修正も適用しています。Z.aiは、τ²-BenchとTerminal Bench 2をPreserved Thinkingを有効にして実行するようにも案内しています。そのため、これらのエージェントタスクのスコアは、通常のチャットではなく、特定の設定での結果を示しています。

GLM-4.7-Flashのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のGGUFビルドはコミュニティのリポジトリunsloth/GLM-4.7-Flash-GGUFのもので、サイズはその一覧に記載された実際のファイルサイズです。

メモリ選ぶビルドファイルサイズ
10 GBUD-TQ1_08.33 GB
12 GBUD-IQ2_M10.99 GB
16 GBUD-Q3_K_XL13.78 GB
20 GBIQ4_XS16.27 GB
24 GBQ4_K_M18.31 GB
32 GBQ6_K24.69 GB
48 GB以上Q8_031.84 GB

隣り合うファイルのサイズ差は1 GBか2 GBなので、2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。一覧には表よりもさらに下の選択肢として、9.25 GBのUD-IQ1_Sと9.81 GBのUD-IQ1_Mもあります。こうした1ビットのビルドを選ぶのは、ほかにメモリに収まるものがない場合だけにしてください。量子化されていないBF16の重みもあり、2ファイルで合計59.91 GBです。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

量子化していない重みでGPU上で推論を実行する方法もあります。Z.aiの参考コマンドでは、vLLMとSGLangのどちらもテンソル並列数を4に設定しており、両フレームワークともmainブランチでのみこのモデルに対応しています。Blackwellカードでは、SGLangのコマンドにtritonのアテンションバックエンドも必要です。

Atomic ChatでGLM-4.7-Flashを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでGLM-4.7-Flashを検索し、Download Optionsを開きます。
  3. 使用できるメモリに収まるビルドを選び、チャットを始めます。

ほとんどのタスクでは、サンプラーをZ.aiの既定値である温度1.0、top-p 0.95のままにし、思考に十分な余裕を持たせてください。提供元の評価では、回答ごとに最大131,072トークンの新規生成を許可しています。同じファミリーのほかのモデルについては、ローカルで実行できるGLMモデルの一覧をご覧ください。

GLM-4.7-Flashのライセンス

GLM-4.7-FlashはMITライセンスで公開されています。著作権表示とライセンス表示をソフトウェアに添付することを条件に、商用利用、改変、再配布が認められます。重みが公開されているモデルに適用できるライセンスの中でも、最も制約の少ないものの1つです。

Hugging Faceからモデルをダウンロード

huggingface-cli download zai-org/GLM-4.7-Flash
from transformers import AutoModel
model = AutoModel.from_pretrained("zai-org/GLM-4.7-Flash")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GLM-4.7-Flashは、zai-org(Z.ai)が重みを公開している31.2Bパラメータの言語モデルで、GLM-4.7ファミリーの中で最小のモデルです。軽量な混合エキスパートアーキテクチャを採用し、128Kトークンのコンテキスト長に対応しています。コード、推論、ツール呼び出しの能力と、思考モードを備えています。単一GPUで動作し、コーディングやエージェントによる作業を高速に処理する選択肢として位置づけられています。

4ビット量子化版は約16GBのVRAMで動作するため、RTX 3090や4090などのカード、または十分なユニファイドメモリを搭載したMシリーズMacで実行できます。量子化せずにBF16精度で実行するには、約64GBが必要です。MoE設計により、システムRAMにオフロードし、速度と引き換えにVRAM使用量を減らすこともできます。

はい。重みはMITライセンスで公開されているため、無料でダウンロードして実行できます。Atomic Chatでモデルをローカル実行する場合、API料金やトークン単位の課金はなく、費用は自分のハードウェアと電気代のみです。

はい。重みをダウンロードすれば、GLM-4.7-Flashはインターネット接続なしで、すべての処理をデバイス上で実行できます。プロンプト、コード、ファイルがマシンの外に出ることは一切ないため、機密性が求められる作業や、外部ネットワークから隔離された環境での作業に適しています。

コーディング、推論、エージェントタスク向けに設計されています。コード処理能力は複数ファイルにまたがるコードの作成やデバッグに適しており、ツール利用機能によって、ローカルのエージェント環境で関数を呼び出せます。また、思考モードと128Kのコンテキスト長により、長い入力に対する複数ステップの推論に対応します。一般消費者向けGPUでのスループットは、毎秒約60-100トークンと報告されています。