GLM-4.7-Flashとは?
GLM-4.7-Flashは、Z.aiの混合エキスパートモデルです。総パラメータ数は31.2Bですが、トークンあたり有効になるのは約3Bのみで、30B-A3Bという表記はこのことを意味します。Z.aiはこれを30Bクラスで最も強力なモデルと呼び、性能と効率を両立する軽量なデプロイの新たな選択肢として紹介しています。重みは2026年1月19日にMITライセンスでHugging Faceに公開されました。モデルカードには、ローカルでの推論実行に使うvLLMとSGLangが挙げられており、重みを直接実行するためのtransformersのサンプルも掲載されています。
| 仕様 | GLM-4.7-Flash |
|---|---|
| 総パラメータ数 | 31.2B(正確には31,221,488,576) |
| 有効パラメータ数 | トークンあたり約3B(30B-A3B) |
| アーキテクチャ | 混合エキスパート(MoE) |
| タスク | テキスト生成、テキストの入出力 |
| 言語 | 英語と中国語 |
| 推論 | 思考モード。複数ターンのエージェントタスクではPreserved Thinkingを推奨 |
| 投機的デコーディング | 提供元の推論サーバー設定ではMTP(vLLM)とEAGLE(SGLang)を使用 |
| 提供元のサンプリング既定値 | 温度1.0、top-p 0.95 |
| 最大新規生成トークン数(提供元の評価時) | 131,072 |
| 推論用のソフトウェア構成 | vLLMとSGLang(mainブランチのみ)、およびTransformers |
| パーサー | ツール呼び出し用パーサーglm47、推論用パーサーglm45 |
| リリース日 | 2026年1月19日 |
| ライセンス | MIT |
Z.ai自身が提供する推論サーバー起動コマンドでは、投機的デコーディングが有効になっています。vLLMでは投機トークン数を1つにしたMTP、SGLangでは投機ステップ数を3、ドラフトトークン数を4にしたEAGLEを使用します。この仕組みについては、投機的デコーディングのガイドで解説しています。両方のコマンドで、ツール呼び出し用のglm47と推論用のglm45という同じ2つのパーサーも指定されています。vLLMのコマンドでは、ツールの自動選択も有効にしています。Z.aiが複数ターンのエージェントタスクとして挙げているτ²-BenchとTerminal Bench 2については、モデルカードでPreserved Thinkingモードを有効にするよう案内しています。
GLM-4.7-Flashのベンチマーク
モデルカードに掲載されたZ.aiのリリース時の数値では、GLM-4.7-FlashをQwen3-30B-A3B-Thinking-2507およびGPT-OSS-20Bと比較しています。
| ベンチマーク | GLM-4.7-Flash | Qwen3-30B-A3B-Thinking-2507 | GPT-OSS-20B |
|---|---|---|---|
AIME 25 数学競技 | 91.6 | 85.0 | 91.7 |
GPQA 専門科学 | 75.2 | 73.4 | 71.5 |
LCB v6 競技プログラミング | 64.0 | 66.0 | 61.0 |
HLE 専門知識を問う問題 | 14.4 | 9.8 | 10.9 |
SWE-bench Verified ソフトウェア工学 | 59.2 | 22.0 | 34.0 |
τ²-Bench エージェントのツール利用 | 79.5 | 49.0 | 47.7 |
BrowseComp ウェブ閲覧 | 42.8 | 2.29 | 28.3 |
GLM-4.7-Flashは7項目中5項目で首位となり、特にSWE-bench Verified、τ²-Bench、BrowseCompで大きな差をつけています。AIME 25ではGPT-OSS-20Bに0.1ポイント、LCB v6ではQwenモデルに2ポイント及びません。
Z.aiは、すべての項目を同じ設定で評価したわけではありません。Terminal BenchとSWE-bench Verifiedは温度0.7、top-p 1.0、生成上限16,384トークンで評価され、τ²-Benchは温度0で同じ生成上限を使用しています。上の表にある既定値とは異なります。τ²-Benchでは、ユーザーが誤った方法で対話を終了することによる失敗を避けるため、RetailとTelecomのユーザーとの対話にプロンプトを追加し、Claude Opus 4.5のリリースレポートにあるAirlineドメインの修正も適用しています。Z.aiは、τ²-BenchとTerminal Bench 2をPreserved Thinkingを有効にして実行するようにも案内しています。そのため、これらのエージェントタスクのスコアは、通常のチャットではなく、特定の設定での結果を示しています。
GLM-4.7-Flashのハードウェア要件
システム要件で確認すべきなのはメモリです。以下のGGUFビルドはコミュニティのリポジトリunsloth/GLM-4.7-Flash-GGUFのもので、サイズはその一覧に記載された実際のファイルサイズです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 10 GB | UD-TQ1_0 | 8.33 GB |
| 12 GB | UD-IQ2_M | 10.99 GB |
| 16 GB | UD-Q3_K_XL | 13.78 GB |
| 20 GB | IQ4_XS | 16.27 GB |
| 24 GB | Q4_K_M | 18.31 GB |
| 32 GB | Q6_K | 24.69 GB |
| 48 GB以上 | Q8_0 | 31.84 GB |
隣り合うファイルのサイズ差は1 GBか2 GBなので、2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。一覧には表よりもさらに下の選択肢として、9.25 GBのUD-IQ1_Sと9.81 GBのUD-IQ1_Mもあります。こうした1ビットのビルドを選ぶのは、ほかにメモリに収まるものがない場合だけにしてください。量子化されていないBF16の重みもあり、2ファイルで合計59.91 GBです。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
量子化していない重みでGPU上で推論を実行する方法もあります。Z.aiの参考コマンドでは、vLLMとSGLangのどちらもテンソル並列数を4に設定しており、両フレームワークともmainブランチでのみこのモデルに対応しています。Blackwellカードでは、SGLangのコマンドにtritonのアテンションバックエンドも必要です。
Atomic ChatでGLM-4.7-Flashを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでGLM-4.7-Flashを検索し、Download Optionsを開きます。
- 使用できるメモリに収まるビルドを選び、チャットを始めます。
ほとんどのタスクでは、サンプラーをZ.aiの既定値である温度1.0、top-p 0.95のままにし、思考に十分な余裕を持たせてください。提供元の評価では、回答ごとに最大131,072トークンの新規生成を許可しています。同じファミリーのほかのモデルについては、ローカルで実行できるGLMモデルの一覧をご覧ください。
GLM-4.7-Flashのライセンス
GLM-4.7-FlashはMITライセンスで公開されています。著作権表示とライセンス表示をソフトウェアに添付することを条件に、商用利用、改変、再配布が認められます。重みが公開されているモデルに適用できるライセンスの中でも、最も制約の少ないものの1つです。
