Gemma 4 26B A4Bとは
Gemma 4 26B A4Bは、Google DeepMindのGemma 4ファミリーに属するMixture-of-Expertsモデルで、指示チューニング済みのgemma-4-26B-A4B-itとして公開されています。総パラメータ数は25.2Bですが、各トークンで有効になるのは3.8Bのみです。そのためGoogleは、デンスモデルの31Bに近いスコアを、4Bに近い規模のモデルのデコード速度で実現する高速な選択肢として位置づけています。重みは2026年3月11日に、Apache 2.0のもとでHugging Faceに公開されました。
| 仕様 | Gemma 4 26B A4B |
|---|---|
| 総パラメータ数 | 25.2B |
| アクティブパラメータ数 | 3.8B |
| エキスパート | 128個のうち8個が有効、加えて共有エキスパートが1個 |
| 層数 | 30 |
| アテンション | ローカルスライディングウィンドウ(1024トークン)と、コンテキスト全体を参照するグローバル層を交互に配置 |
| コンテキスト長 | 256Kトークン |
| モダリティ | テキストと画像の入力、テキストの出力 |
| 視覚エンコーダー | 約550Mパラメータ |
| 言語 | 標準で35以上の言語に対応、140以上の言語で事前学習 |
| 推論 | システムプロンプト内のトークンで切り替える思考モード |
| 関数呼び出し | ネイティブ対応 |
| 公開日 | 2026年3月11日 |
| ライセンス | Apache 2.0 |
長いコンテキストでメモリ使用量を抑えるのは、アテンションの配置です。大半の層は1024トークンのスライディングウィンドウ内だけを参照します。その間にコンテキスト全体を参照するグローバル層が挟まれ、最終層は常にグローバル層です。グローバル層ではキーとバリューを統合しています。Gemma 4はsystemロールにもネイティブ対応し、ファミリー全体が段階的に思考するよう学習されています。この思考モードはリクエストごとにオンとオフを切り替えられます。この規模のモデルで把握しておきたい制限は2つあります。音声入力に対応するのはE2B、E4B、12Bモデルのみで、出力はテキストに限られます。
Gemma 4 26B A4Bのベンチマーク
モデルカードに記載されたGoogleの公開時の数値では、26B A4Bを、同じファミリーのデンスモデルであるGemma 4 31BとGemma 4 12B Unified、および思考モードを使わずに実行した前世代のGemma 3 27Bと比較しています。
| ベンチマーク | Gemma 4 26B A4B | Gemma 4 31B | Gemma 4 12B Unified | Gemma 3 27B(思考モードなし) |
|---|---|---|---|---|
MMLU Pro 学術知識 | 82.6% | 85.2% | 77.2% | 67.6% |
AIME 2026(ツール不使用) 数学競技 | 88.3% | 89.2% | 77.5% | 20.8% |
LiveCodeBench v6 競技プログラミング | 77.1% | 80.0% | 72.0% | 29.1% |
GPQA Diamond 専門的な科学知識 | 82.3% | 84.3% | 78.8% | 42.4% |
Tau2(3項目の平均) ツール使用 | 68.2% | 76.9% | 69.0% | 16.2% |
MMMU Pro マルチモーダル推論 | 73.8% | 76.9% | 69.1% | 49.7% |
デンスモデルの31Bがすべての項目で首位ですが、知識、数学、コード、科学では、26B A4Bは有効にするパラメータ数がその一部にとどまりながら、スコア差を1〜3ポイントに収めています。また、すべての項目でGemma 3 27Bを大幅に上回っています。唯一の弱点はTau2で、ここでは12B Unifiedにもわずかに及びません。
Gemma 4 26B A4Bのハードウェア要件
確認すべきシステム要件はメモリです。モデルファイルをRAMまたはVRAMに収めたうえで、コンテキスト用の空き容量を確保する必要があります。以下のビルドは、unsloth/gemma-4-26B-A4B-it-GGUFで提供されているUnslothの動的量子化版です。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 12 GB | UD-Q2_K_XL | 10.55 GB |
| 16 GB | UD-IQ4_NL | 13.61 GB |
| 24 GB | UD-Q4_K_XL | 17.01 GB |
| 32 GB | UD-Q5_K_XL | 21.22 GB |
| 48 GB以上 | UD-Q8_K_XL | 27.64 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。各トークンで有効になるパラメータは3.8Bのみなので、ここで最大のファイルでも、そのサイズに対してデコードは高速です。この形式になじみがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでGemma 4 26B A4Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでGemma 4 26B A4Bを検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを開始します。
ファミリーのほかのモデルについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。
Gemma 4 26B A4Bのライセンス
Gemma 4 26B A4BはApache 2.0のもとで公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。
