gemma-4-26B-A4B-it

更新
04.10.2026
思考
埋め込み
画像認識
音声
推論
コード生成
多言語

GoogleのGemma 4 MoE。総パラメータ数は25.2B、アクティブパラメータ数は3.8Bで、256Kのコンテキスト長と画像入力に対応します。ライセンスはApache 2.0です。4Bに近い規模のモデルと同等の速度で動作します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計25.2B、アクティブ3.8B
  • コンテキスト長: 256Kトークン
  • モダリティ: テキストと画像の入力、テキストの出力
  • 最小ハードウェア要件: 12 GBのRAMまたはVRAM(最小のGGUFは9.92 GB)

Gemma 4 26B A4Bとは

Gemma 4 26B A4Bは、Google DeepMindのGemma 4ファミリーに属するMixture-of-Expertsモデルで、指示チューニング済みのgemma-4-26B-A4B-itとして公開されています。総パラメータ数は25.2Bですが、各トークンで有効になるのは3.8Bのみです。そのためGoogleは、デンスモデルの31Bに近いスコアを、4Bに近い規模のモデルのデコード速度で実現する高速な選択肢として位置づけています。重みは2026年3月11日に、Apache 2.0のもとでHugging Faceに公開されました。

仕様Gemma 4 26B A4B
総パラメータ数25.2B
アクティブパラメータ数3.8B
エキスパート128個のうち8個が有効、加えて共有エキスパートが1個
層数30
アテンションローカルスライディングウィンドウ(1024トークン)と、コンテキスト全体を参照するグローバル層を交互に配置
コンテキスト長256Kトークン
モダリティテキストと画像の入力、テキストの出力
視覚エンコーダー約550Mパラメータ
言語標準で35以上の言語に対応、140以上の言語で事前学習
推論システムプロンプト内のトークンで切り替える思考モード
関数呼び出しネイティブ対応
公開日2026年3月11日
ライセンスApache 2.0

長いコンテキストでメモリ使用量を抑えるのは、アテンションの配置です。大半の層は1024トークンのスライディングウィンドウ内だけを参照します。その間にコンテキスト全体を参照するグローバル層が挟まれ、最終層は常にグローバル層です。グローバル層ではキーとバリューを統合しています。Gemma 4はsystemロールにもネイティブ対応し、ファミリー全体が段階的に思考するよう学習されています。この思考モードはリクエストごとにオンとオフを切り替えられます。この規模のモデルで把握しておきたい制限は2つあります。音声入力に対応するのはE2B、E4B、12Bモデルのみで、出力はテキストに限られます。

Gemma 4 26B A4Bのベンチマーク

モデルカードに記載されたGoogleの公開時の数値では、26B A4Bを、同じファミリーのデンスモデルであるGemma 4 31BとGemma 4 12B Unified、および思考モードを使わずに実行した前世代のGemma 3 27Bと比較しています。

ベンチマークGemma 4 26B A4BGemma 4 31BGemma 4 12B UnifiedGemma 3 27B(思考モードなし)
MMLU Pro
学術知識
82.6%85.2%77.2%67.6%
AIME 2026(ツール不使用)
数学競技
88.3%89.2%77.5%20.8%
LiveCodeBench v6
競技プログラミング
77.1%80.0%72.0%29.1%
GPQA Diamond
専門的な科学知識
82.3%84.3%78.8%42.4%
Tau2(3項目の平均)
ツール使用
68.2%76.9%69.0%16.2%
MMMU Pro
マルチモーダル推論
73.8%76.9%69.1%49.7%

デンスモデルの31Bがすべての項目で首位ですが、知識、数学、コード、科学では、26B A4Bは有効にするパラメータ数がその一部にとどまりながら、スコア差を1〜3ポイントに収めています。また、すべての項目でGemma 3 27Bを大幅に上回っています。唯一の弱点はTau2で、ここでは12B Unifiedにもわずかに及びません。

Gemma 4 26B A4Bのハードウェア要件

確認すべきシステム要件はメモリです。モデルファイルをRAMまたはVRAMに収めたうえで、コンテキスト用の空き容量を確保する必要があります。以下のビルドは、unsloth/gemma-4-26B-A4B-it-GGUFで提供されているUnslothの動的量子化版です。

メモリ選ぶビルドファイルサイズ
12 GBUD-Q2_K_XL10.55 GB
16 GBUD-IQ4_NL13.61 GB
24 GBUD-Q4_K_XL17.01 GB
32 GBUD-Q5_K_XL21.22 GB
48 GB以上UD-Q8_K_XL27.64 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。各トークンで有効になるパラメータは3.8Bのみなので、ここで最大のファイルでも、そのサイズに対してデコードは高速です。この形式になじみがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでGemma 4 26B A4Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでGemma 4 26B A4Bを検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを開始します。

ファミリーのほかのモデルについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。

Gemma 4 26B A4Bのライセンス

Gemma 4 26B A4BはApache 2.0のもとで公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download google/gemma-4-26B-A4B-it
from transformers import AutoModel
model = AutoModel.from_pretrained("google/gemma-4-26B-A4B-it")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GoogleのGemma 4ファミリーに属する、指示チューニング済みのMixture-of-Expertsモデルです。総パラメータ数は26.5Bですが、128個のエキスパートから上位8個を選ぶルーティングにより、各トークンで有効になるのは約4Bのみで、4Bモデルとほぼ同じ速度で動作します。マルチモーダルモデルで、262144トークンのコンテキスト長に対応し、コード、推論、視覚タスクを処理します。

gemma-4-26B-A4B-itの4ビット(Q4_K_M)ビルドには約18GBのVRAMが必要で、24GBの一般消費者向けGPU 1枚に収まります。十分なユニファイドメモリを搭載したApple Silicon Macでも実行できます。長いチャットでは、長いコンテキストに伴ってKVキャッシュが大きくなるため、メモリに余裕を持たせてください。

はい。重みはapache-2.0ライセンスで公開されており、個人利用、商用利用、改変、再配布を無料で行えます。このモデルを実行できるアプリ、atomic.chatのAtomic Chatも、無料かつオープンソースです。

はい。重みを一度ダウンロードすれば、gemma-4-26B-A4B-itはすべてお使いのマシン上で動作し、インターネット接続は不要です。プロンプト、文書、画像がデバイスの外に出ることはありません。それがAtomic Chatでローカル実行する意義です。

特に得意なのは、コーディング、多段階の推論、エージェントとしてのツール使用です。回答前に推論する、設定可能な思考モードも備えています。視覚機能により画像や短い動画を分析でき、262144トークンのコンテキスト長は、長い文書や大規模なコードベースの処理に役立ちます。