ブログ

/

ガイド

/

GLMをローカルで動かす方法|GGUFの選び方と導入手順

GLMをローカルで動かす方法|GGUFの選び方と導入手順

Z.aiのGLMは、自分のマシンで実行できる特に高性能なオープンウェイト言語モデルの一つです。このガイドでは、ハードウェアに合うGLMモデルの選び方、ローカルAIアプリのインストール、GLMを完全オフラインで実行する方法を紹介します。

GLMをローカルで動かす方法|GGUFの選び方と導入手順
Alex Shapiro
Alex Shapiro
Calendar icon

August 3, 2026

目次

Z.aiのGLMは、ローカルで実行できる特に高性能なオープンウェイト言語モデルの一つです。このガイドでは、次の内容を解説します。

  • ハードウェアに合うGLMモデルの選び方
  • GLMを実行するローカルAIアプリのインストール方法
  • GLMモデルをオフラインで実行する方法

GLMとは?

GLMはGeneral Language Modelの略で、北京のAI研究機関Z.ai(旧称Zhipu AI)が開発したモデルファミリーです。特に高性能なオープンソースモデルを開発することで知られています。最新のGLMリリースはHugging Faceで確認できます。

現在のオープンウェイトGLMのラインアップ:

モデルアーキテクチャコンテキスト主な用途
GLM-4.7-FlashMoE、総数30B / アクティブ約3.6B200K一般向けハードウェアでのコーディングとエージェントのタスク
GLM-4.7MoE、総数355B / アクティブ32B200Kワークステーションでの高度なコーディングと推論
GLM-5.1MoE、総数753.9B / アクティブ約40B198K最先端クラスのエージェント型コーディング
GLM-5.2MoE、総数753.3B / アクティブ約40B1M最先端クラスの推論とコーディング

GLMはMixture-of-Experts(MoE)アーキテクチャを採用し、クエリごとにパラメータの一部だけを有効にします。たとえばGLM-4.7-Flashは約300億パラメータを含みますが、生成するトークンごとに使うのは約36億だけです。推論時の計算量を減らすことで、大きなGLMモデルも動かしやすくなります。また、ハードウェアの節で説明するように、GLMはCPUへのオフロードにも特に適しています。

GLMは、次の特徴でも知られています。

  • 高性能な推論(「思考」)モード
  • 確かなツール呼び出し対応。Z.aiはコーディングエージェント向けに特化した学習を行っています。

GLMのベンチマーク

下の表は、さまざまなモデルを共通の採点方式で評価するArtificial AnalysisのIntelligence IndexにおけるGLMのスコアです。

比較の参考として、プロプライエタリなクラウドモデルのGemini 3.6 Flashと、これを上回る唯一のオープンウェイトモデルであるKimi K3も掲載しました。スコアはIntelligence Index v4.1です。GLM-4.7-Flashの値は完全な評価実行の結果ではなく、Artificial Analysisによる推定です。

モデルIntelligence Index
Kimi K357
GLM-5.2(推論あり)51
Gemini 3.6 Flash50
GLM-4.7(推論あり)34
GLM-5.2(推論なし)34
GLM-4.7-Flash(推論あり)23

Z.aiは、GLM-5.2の性能がOpus 4.8に近いことを示す評価結果も公開しています。

ベンチマークGLM-5.2GLM-5.1GLM-4.7Claude Opus 4.8
AIME 202699.295.3——
GPQA-Diamond91.286.285.793.6
Terminal-Bench 2.181.063.5—85.0
FrontierSWE74.430.5—75.1
SWE-bench Pro62.158.4—69.2
HLE(ツール使用あり)54.752.342.857.9

GLMをローカルで実行する方法

GLMに限らず、AIモデルをローカルで動かすには、モデルファイルをダウンロードし、マシン上で実行する推論アプリが必要です。

このガイドでは、私たちが開発した無料のオープンソースのローカルAIアプリAtomic Chatを例にしますが、Ollama、LM Studio、その他のAI推論プロバイダーも同じように使えます。

GLMはGGUFファイルから実行します。GGUFは、OllamaやLM Studioなど、主要な推論エンジンやアプリが対応する標準形式です。

1. Atomic Chatをインストールする

Atomic Chatで手順を進める場合のインストール方法です。atomic.chatにアクセスし、プラットフォームに合うビルドを選びます。

  • macOS:IntelとApple Siliconに対応するユニバーサル.dmg。macOS 13.6以降が必要です。
  • Windows:x64向けの.exeインストーラー。
  • Linux:root権限が不要なx86_64向け単体.AppImage。
  • iOS:App Storeから入手。
  • Android:Google Playから入手。

‍

全プラットフォーム向けのAtomic Chatダウンロード選択肢

Linuxでは、chmod +xでAppImageに実行権限を付け、直接実行します。初回起動時にFUSEが必要と表示された場合は、DebianやUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールしてください。

2. GLMモデルを探す

Atomic Chatをインストールしたら、アプリを開いてModelsへ進みます。Modelsカタログには、Hugging Faceで公開されている実行可能なオープンウェイトモデルがすべて表示され、ローカルLLMを探し、ダウンロードし、管理できます。

GLMを検索するには、検索欄をクリックしてglmと入力します。利用できるGLMモデルが表示されます。

‍

Atomic ChatのモデルカタログでGLMを検索

モデルカードには、次の情報が表示されます。

  • パラメータ数:モデルのサイズ。GLM-4.7-Flashなら29.9Bなどです。
  • コンテキスト長:モデルが対応するコンテキストウィンドウの最大値。
  • タグ:GGUF(モデル形式)やVision(マルチモーダル処理への対応)などのメタデータ。
  • ダウンロードサイズ:選んだモデルファイルのディスク上のサイズ。

デフォルトでは、新しいリリース順に並びます。Downloadedフィルターを有効にすると、マシン上ですでに利用できるモデルだけを表示できます。

3. GLMモデルをダウンロードする

推奨される版をダウンロードするには、Downloadをクリックします。

特定の量子化版を選びたい場合は、Download Optionsを選択すると、利用できるGGUFリリースがすべて表示されます。

‍

Atomic Chatに表示されたGLM-4.7-Flashの量子化版

一つのモデルには通常、複数の量子化版があります。たとえばGLM-4.7-Flashには、次のような版があります。

  • Q2_K
  • Q3_K_M
  • Q4_K_M
  • IQ4_XS

これらは量子化レベルで、モデルの重みをどのように圧縮したかを表します。Q2のような小さい量子化版はストレージやメモリをあまり使わず、Q8やQ16のような大きい版は一般に元のモデルの精度をより多く保持します。詳しくは、GGUFと量子化の仕組みをご覧ください。

システムに合う量子化版の選び方は、記事の後半で説明します。

4. GLMとチャットを始める

ダウンロードが終わると、Atomic Chatがモデルを自動で読み込み、内蔵のチャット画面で開きます。

‍

Atomic ChatでGLM-4.7-Flashとチャット

これで準備は完了です。

GLMのハードウェア要件

代表的な量子化レベルでGLMを実行するために必要なメモリは次のとおりです。KVキャッシュやシステム用の余裕を含めた、推奨される合計容量です。

モデル2ビット4ビット8ビットBF16
GLM-4.7-Flash約16 GB約24 GB約36 GB約64 GB
GLM-4.7約128 GB約210 GB約400 GB約750 GB
GLM-5.1約245 GB約490 GB約880 GB(FP8)>1.5 TB
GLM-5.2約245 GB約490 GB約880 GB(FP8)>1.5 TB

たとえば、GLM-4.7-Flashの4ビット版は約17 GBのファイルです。表の約24 GBには、重みとは別にKVキャッシュやシステムが通常使う3-4 GBを加えています。

ほかのGLMは基本的にワークステーション級以上のモデルですが、レンタルGPUでも実行できます。手順はレンタルのグラフィックカードでKimi K3を実行する方法で説明しています。

自分のシステムやレンタルGPUでGLMを動かす際の、ハードウェア別の推奨構成です。

ハードウェアモデル量子化
MacBook Air M2/M3 (16 GB)GLM-4.7-FlashIQ2 / Q3
MacBook Pro M4 Pro (24 GB)GLM-4.7-FlashQ4
RTX 3090 / RTX 4090 (24 GB VRAM)GLM-4.7-FlashQ4
MacBook Pro M4/M5 Max(36-48 GB)GLM-4.7-FlashQ4またはQ8
Mac Studio / ワークステーション(64 GB以上)GLM-4.7-FlashQ8またはBF16
MacBook Pro / Mac Studio (128 GB)GLM-4.72ビット動的量子化
Mac Studio M3 Ultra (256 GB+)GLM-5.22ビット動的量子化
24 GBのGPU + 256 GBのシステムRAMGLM-5.22ビット動的量子化

前述のとおり、GLMはMixture-of-Experts(MoE)アーキテクチャを使うため、デンスモデルよりもGPUへのオフロードを実用的に行えます。たとえばGLM-5.2が1トークンに使うのは、753Bパラメータのうち約40Bです。そのため、推論エンジンはアテンション層と共有の重みをGPUに残し、エキスパート層をシステムRAMに移せます。24 GBのGPUと256 GBのRAMがある構成なら、この方法でGLM-5.2を実行できますが、性能には限界があります。速度の目安は毎秒3-9トークンです。

一方、GLM-4.7-FlashはVRAMに完全に収まり、同程度のハードウェアで毎秒60-100トークンほどに達します。

GLMの大型MoEモデルは、小型のデンスモデルに比べて強い量子化にも耐えやすい性質があります。小型モデルでは2ビット量子化で品質が大きく損なわれる場合がありますが、最先端規模のMoEモデルには十分なパラメータの冗長性があり、低いビット数でも実用性を保てます。その点で、特に使い道の多いGLMビルドとして、Unslothの動的GGUFリリースがあります。

  • GLM-5.2 UD 2-bit:238 GBで、BF16の1.51 TBに比べて小さくなっています。Unslothのテストによると、フル精度の約82%の精度を保ち、RAMとVRAMの合計、またはユニファイドメモリとして約245 GBが必要です。
  • GLM-5.2 UD 1-bit:217 GB。メモリ使用量が最小で、精度は約76%です。コンテキスト用にさらに余裕が必要な256 GBのシステムに向いています。
  • GLM-5.2 UD-Q4_K_XL / UD-Q5_K_XL:品質の劣化がほとんどない版で、500 GB以上のメモリを持つ複数GPUのシステム向けです。
  • GLM-4.7 2ビット動的量子化:約120 GBで、355Bモデルをユニファイドメモリ128 GBのMacで実行できます。

よくある質問

GLMをローカル実行する際によくある質問です。

GLMのローカル実行に必要なRAMやVRAMはどのくらいですか?

GLM-4.7-Flashを4ビット量子化で実行するには、RAM、VRAM、またはユニファイドメモリが約24 GB必要です。ほかのGLMモデルのハードウェア要件は次のとおりです。

  • GLM-4.7:4ビット量子化で約210 GBを推奨
  • GLM-5.1とGLM-5.2:2ビット動的量子化で約245 GBを推奨

これらは、GPU推論に必要なVRAM、またはApple Silicon Macのユニファイドメモリの容量を示します。

GLM-5.2をローカルで実行できますか?

理論上は可能ですが、GLM-5.2をローカル実行するにはワークステーション級のグラフィックカードが必要です。たとえば、UnslothのGLM-5.2の2ビット動的GGUF版には、KVキャッシュを除いても、ユニファイドメモリ256 GBのMac Studio、または24 GBのGPUと256 GBのシステムRAMをMoEオフロードで組み合わせたLinuxマシンが必要です。24 GBのGPU1枚で動くGLM-4.7-Flashが、ローカル実行には最も適したGLMモデルです。

GLM 5.2は無料ですか?

はい。GLM-5.2はMITライセンスで公開されているため、ダウンロードもローカル実行も無料で、費用は電気代だけです。GLMを動かすアプリの多くも無料です。Ollama、LM Studio、当社のローカルAIアプリAtomic Chatもこれに含まれます。

どのGLMモデルを使うべきですか?

一般向けハードウェアでローカル実行するなら、GLM-4.7-Flashの4ビット量子化版をおすすめします。同クラスで特に高性能なモデルの一つであり、24 GBのGPU1枚、または同容量のユニファイドメモリを搭載したMacで実行できます。

GLMはオフラインで動きますか?

はい。モデルのダウンロード後は完全にオフラインで実行できます。ローカル推論アプリを使う場合、プロンプトと応答は自分のデバイス上で処理されます。

GLMは無料で商用利用できますか?

はい。GLMのオープンウェイトモデルは、特に制約の少ないライセンスの一つであるMITライセンスで公開されています。次のことが認められています。

  • 商用利用
  • 改変
  • 再配布

まとめ

GLMは、現在利用できる特に高性能なオープンウェイトのモデルファミリーの一つです。十分なメモリがあればフラッグシップのGLM-5.2もローカル実行できますが、一般向けハードウェアにはGLM-4.7-Flashが最も適しています。モデルを選んだら、Atomic Chat、LM Studio、Ollamaなどのローカル推論エンジンを用意します。GGUFビルドをダウンロードし、好みのアプリで読み込めば、GLMを完全オフラインで使えます。

関連ガイド

ローカルAIモデルを比較している場合や、初めてローカルLLMを設定する場合は、次のガイドも参考になります。

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルAI画像生成ツールを比較し、7つのモデルをRTX 5090でベンチマーク測定しました。生成画像の例、生成速度、メモリ使用量、ライセンスの制限を確認できます。

9/25/26

14分