diffusiongemma-26B-A4B-itとは?
diffusiongemma-26B-A4B-it、略称DiffusionGemmaは、Google DeepMindが重みを公開しているモデルです。1トークンずつ生成する自己回帰方式ではなく、離散拡散でテキストを生成します。26B A4BのMixture-of-Experts型Gemma 4アーキテクチャを基盤とし、テキスト、画像、動画を入力として受け取り、256トークンのブロック全体を並列にノイズ除去します。フォワードパス1回あたり15-20トークンを生成し、Googleの測定では、H100上でFP8を使用した小さいバッチサイズで、ユーザーあたり毎秒1100トークンを超えました。総パラメータ数25.2Bのうち3.8Bが有効になり、単一アクセラレータでの低レイテンシかつ小規模バッチの推論を目指して調整されているため、まさにローカルマシンの条件に合わせた設計です。Googleは2026年6月に、Apache 2.0の下でHugging Faceに重みを公開しました。
| 仕様 | diffusiongemma-26B-A4B-it |
|---|---|
| 総パラメータ数 | 25.2B |
| 有効パラメータ数 | 3.8B |
| アーキテクチャ | Gemma 4 MoE、エンコーダ・デコーダ構成、離散拡散デコーディング |
| エキスパート | 128個のうち8個が有効、加えて共有エキスパート1個 |
| 層数 | 30 |
| コンテキスト長 | 最大256Kトークン |
| キャンバス長 | 256トークン |
| モダリティ | テキスト・画像・動画入力、テキスト出力 |
| 思考 | 設定可能。<|think|>制御トークンで有効化 |
| リリース日 | 2026年6月9日 |
| ライセンス | Apache 2.0 |
特徴的なのはデコードループです。自己回帰型エンコーダがプロンプトを処理してKVキャッシュに格納した後、双方向アテンションを備えたデコーダが、確信度の高いトークンを保持し、残りに再びノイズを加えながら、最大48ステップで256トークンのキャンバスをノイズ除去します。キャンバスが収束するとキャッシュに追加され、次のキャンバスの処理が始まります。これは投機的デコーディングと同じ逐次処理のボトルネックに対処するもので、ステップ数はタスクに応じて変わります。コードのような構造化出力ではノイズ除去のステップ数が少なくて済むため、単純なプロンプトほど高速にストリーミングされます。
diffusiongemma-26B-A4B-itのベンチマーク
モデルカードに掲載されたGoogleのリリース時の数値は、推奨のEntropy Boundサンプラーを使用し、この拡散モデルと、その基盤となった自己回帰型のGemma 4 26B A4Bを比較したものです。両モデルとも指示チューニング済みです。
| ベンチマーク | DiffusionGemma 26B A4B | Gemma 4 26B A4B |
|---|---|---|
MMLU Pro 学術知識 | 77.6 | 82.6 |
AIME 2026 (ツールなし) 数学競技 | 69.1 | 88.3 |
LiveCodeBench v6 競技プログラミング | 69.1 | 77.1 |
GPQA Diamond 専門的な科学知識 | 73.2 | 82.3 |
HLE (ツールなし) 専門的な設問 | 11.0 | 8.7 |
MMMU Pro マルチモーダル知識 | 54.3 | 73.8 |
Googleの表は結果を率直に示しています。視覚や長いコンテキストを含む他のすべての項目でもGemma 4 26B A4Bが上回っており、DiffusionGemmaが勝っているのはツールなしのHumanity's Last Examだけです。ベンチマークのスコアと引き換えにデコード速度を得るモデルであり、その速度こそが狙いです。
diffusiongemma-26B-A4B-itのハードウェア要件
システム要件で確認すべきなのはメモリです。以下のビルドは元の重みから量子化され、unsloth/diffusiongemma-26B-A4B-it-GGUFとして公開されています。
| メモリ | 推奨ビルド | ファイルサイズ |
|---|---|---|
| 24 GB | Q4_K_M | 16.81 GB |
| 32 GB | Q5_K_M | 19.15 GB |
| 48 GB以上 | Q8_0 | 26.88 GB |
リポジトリには、22.65 GBのQ6_Kと、完全なBF16版の50.54 GBもあります。2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。25.2Bのパラメータのうち、トークンごとに有効になるのは3.8Bだけであり、これがこのようなハードウェアでも26Bクラスのモデルを実用的に使える理由です。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic Chatでdiffusiongemma-26B-A4B-itを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザでdiffusiongemma-26B-A4B-itを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
同じファミリーの他のモデルについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。
diffusiongemma-26B-A4B-itのライセンス
diffusiongemma-26B-A4B-itはApache 2.0の下で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が許可されているため、モデルを基盤とした製品を開発し、利用料を支払わずに自分のハードウェアで実行できます。
