diffusiongemma-26B-A4B-it

更新
04.10.2026
思考
画像認識
音声
推論
コード生成
多言語

DiffusionGemma 26B A4Bは、Google DeepMindのテキスト拡散モデルです。Gemma 4のMoEを採用し、256トークンのブロックを並列にノイズ除去して、1パスあたり15-20トークンを生成します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計25.2B、有効3.8B
  • コンテキスト長: 最大256Kトークン
  • モダリティ: テキスト・画像・動画入力、テキスト出力
  • 最小ハードウェア要件: Q4_K_Mビルド(16.81 GB)には24 GBのメモリ

diffusiongemma-26B-A4B-itとは?

diffusiongemma-26B-A4B-it、略称DiffusionGemmaは、Google DeepMindが重みを公開しているモデルです。1トークンずつ生成する自己回帰方式ではなく、離散拡散でテキストを生成します。26B A4BのMixture-of-Experts型Gemma 4アーキテクチャを基盤とし、テキスト、画像、動画を入力として受け取り、256トークンのブロック全体を並列にノイズ除去します。フォワードパス1回あたり15-20トークンを生成し、Googleの測定では、H100上でFP8を使用した小さいバッチサイズで、ユーザーあたり毎秒1100トークンを超えました。総パラメータ数25.2Bのうち3.8Bが有効になり、単一アクセラレータでの低レイテンシかつ小規模バッチの推論を目指して調整されているため、まさにローカルマシンの条件に合わせた設計です。Googleは2026年6月に、Apache 2.0の下でHugging Faceに重みを公開しました。

仕様diffusiongemma-26B-A4B-it
総パラメータ数25.2B
有効パラメータ数3.8B
アーキテクチャGemma 4 MoE、エンコーダ・デコーダ構成、離散拡散デコーディング
エキスパート128個のうち8個が有効、加えて共有エキスパート1個
層数30
コンテキスト長最大256Kトークン
キャンバス長256トークン
モダリティテキスト・画像・動画入力、テキスト出力
思考設定可能。<|think|>制御トークンで有効化
リリース日2026年6月9日
ライセンスApache 2.0

特徴的なのはデコードループです。自己回帰型エンコーダがプロンプトを処理してKVキャッシュに格納した後、双方向アテンションを備えたデコーダが、確信度の高いトークンを保持し、残りに再びノイズを加えながら、最大48ステップで256トークンのキャンバスをノイズ除去します。キャンバスが収束するとキャッシュに追加され、次のキャンバスの処理が始まります。これは投機的デコーディングと同じ逐次処理のボトルネックに対処するもので、ステップ数はタスクに応じて変わります。コードのような構造化出力ではノイズ除去のステップ数が少なくて済むため、単純なプロンプトほど高速にストリーミングされます。

diffusiongemma-26B-A4B-itのベンチマーク

モデルカードに掲載されたGoogleのリリース時の数値は、推奨のEntropy Boundサンプラーを使用し、この拡散モデルと、その基盤となった自己回帰型のGemma 4 26B A4Bを比較したものです。両モデルとも指示チューニング済みです。

ベンチマークDiffusionGemma 26B A4BGemma 4 26B A4B
MMLU Pro
学術知識
77.682.6
AIME 2026 (ツールなし)
数学競技
69.188.3
LiveCodeBench v6
競技プログラミング
69.177.1
GPQA Diamond
専門的な科学知識
73.282.3
HLE (ツールなし)
専門的な設問
11.08.7
MMMU Pro
マルチモーダル知識
54.373.8

Googleの表は結果を率直に示しています。視覚や長いコンテキストを含む他のすべての項目でもGemma 4 26B A4Bが上回っており、DiffusionGemmaが勝っているのはツールなしのHumanity's Last Examだけです。ベンチマークのスコアと引き換えにデコード速度を得るモデルであり、その速度こそが狙いです。

diffusiongemma-26B-A4B-itのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のビルドは元の重みから量子化され、unsloth/diffusiongemma-26B-A4B-it-GGUFとして公開されています。

メモリ推奨ビルドファイルサイズ
24 GBQ4_K_M16.81 GB
32 GBQ5_K_M19.15 GB
48 GB以上Q8_026.88 GB

リポジトリには、22.65 GBのQ6_Kと、完全なBF16版の50.54 GBもあります。2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。25.2Bのパラメータのうち、トークンごとに有効になるのは3.8Bだけであり、これがこのようなハードウェアでも26Bクラスのモデルを実用的に使える理由です。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic Chatでdiffusiongemma-26B-A4B-itを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザでdiffusiongemma-26B-A4B-itを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーの他のモデルについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。

diffusiongemma-26B-A4B-itのライセンス

diffusiongemma-26B-A4B-itはApache 2.0の下で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が許可されているため、モデルを基盤とした製品を開発し、利用料を支払わずに自分のハードウェアで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download google/diffusiongemma-26B-A4B-it
from transformers import AutoModel
model = AutoModel.from_pretrained("google/diffusiongemma-26B-A4B-it")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Gemma 4アーキテクチャを基盤とする、Google DeepMindの重みが公開されたテキスト拡散モデルです。1トークンずつ書き出す代わりに、最大256トークンのブロックを並列にノイズ除去するため、コードの穴埋めやインライン編集に適しています。総パラメータ数は25.8Bで、1パスあたり約3.8Bが有効になるMixture-of-Expertsモデルです。

26B-A4Bクラスの4ビット量子化版には約18GBのVRAMが必要なため、RTX 4090や5090のような24GBのコンシューマー向けGPUなら余裕を持って実行できます。MoE設計により、25.8Bのパラメータのうち1パスあたり有効になるのは約3.8Bだけなので、モデル規模に対してメモリ使用量が抑えられます。コンテキストが長くなるほど増えるKVキャッシュのために、メモリに余裕を残してください。

はい。商用利用、改変、再配布を無償で認めるapache-2.0ライセンスの下で公開されています。利用料を支払わずに、重みをダウンロードして自分のハードウェアで実行し、モデルをファインチューニングできます。

はい。重みをダウンロードすれば、インターネット接続なしで、すべての処理を自分のデバイス上で実行できます。Atomic Chat内では、すべてのプロンプトと応答がローカルに保持されるため、サーバーには何も送信されず、機内やファイアウォールの内側でもモデルを利用できます。

双方向のノイズ除去を並列に行うため、コードファイルの途中にある欠落部分を埋めたり、既存のテキストをすばやくインライン編集したりするような、前後の文脈を把握する必要があるタスクで優位性があります。括弧やタグなどの構造化出力も得意です。純粋なベンチマーク性能では標準のGemma 4に及ばないため、実際の強みは速度と、こうした特定の編集タスクにあります。