gemma-4-E2B-it

更新
04.10.2026
思考
埋め込み
画像認識
音声
推論
コード生成
多言語

Gemma 4 E2Bは、Google DeepMindのGemma 4で最小のモデルです。実効パラメータ数は2.3Bで、テキスト、画像、音声の入力と128Kのコンテキスト長に対応します。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 実効2.3B、合計5.1B
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト、画像、音声の入力
  • 最小ハードウェア要件: 4 GBのRAM

gemma-4-E2B-itとは?

gemma-4-E2B-itは、Google DeepMindのGemma 4ファミリーで最小の指示チューニング済みモデルで、2026年3月にApache 2.0ライセンスでHugging Face上に公開されました。Eは実効パラメータを意味します。計算に使うパラメータは2.3Bですが、保存するパラメータは合計5.1Bです。これは、Per-Layer Embeddingsによって、各デコーダー層がトークンごとの小さな埋め込みテーブルを個別に持つためです。これらのテーブルは容量が大きいものの、高速な参照にしか使われないため、スマートフォンで扱える程度の計算コストに抑えられます。また、音声入力にネイティブ対応するGemma 4の3モデルのうちの1つで、完全にオフラインで音声の文字起こしと翻訳ができます。

仕様gemma-4-E2B-it
実効パラメータ数2.3B(埋め込みを含めた合計は5.1B)
アーキテクチャデンスモデル、ハイブリッドアテンション:ローカルなスライディングウィンドウと全域を参照するグローバル層の組み合わせ
層数35
スライディングウィンドウ512トークン
コンテキスト長128Kトークン
語彙数262K
モダリティテキスト、画像、音声の入力、テキストの出力
エンコーダー視覚用は約150M、音声用は約300M
推論システムプロンプト内のトークンで有効にする思考モード
リリース日2026年3月2日
ライセンスApache 2.0

アテンションの層構成では、ローカルなスライディングウィンドウ層と全域を参照するグローバル層が交互に配置され、最終層は常にグローバル層です。E2Bのスライディングウィンドウ幅は512トークンです。グローバル層では、統合されたキーとバリューに加えてProportional RoPEを使い、長いコンテキストでのメモリ使用量を抑えます。マルチモーダル機能では、さまざまなアスペクト比や解像度の画像を入力でき、視覚トークンの割り当て量を70から1120トークンの範囲で設定できます。音声クリップは最大30秒に対応し、動画は毎秒1フレーム、最大60秒までフレームとして処理されます。Googleによると、標準で35以上の言語に対応し、事前学習には140を超える言語が使われています。

gemma-4-E2B-itのベンチマーク

Google DeepMindは、Gemma 4のモデルカードでこれらの数値を公開しています。E2Bの隣の列は、同じファミリーの上位モデルGemma 4 E4Bと、思考モードなしで実行した前世代のGemma 3 27Bです。

ベンチマークgemma-4-E2B-itGemma 4 E4BGemma 3 27B(思考モードなし)
MMLU Pro
学術知識
60.0%69.4%67.6%
AIME 2026
数学競技
37.5%42.5%20.8%
LiveCodeBench v6
競技プログラミング
44.0%52.0%29.1%
GPQA Diamond
専門的な科学知識
43.4%58.6%42.4%
MMMU Pro
マルチモーダル理解
44.2%52.6%49.7%
MMMLU
多言語知識
67.4%76.6%70.7%
CoVoST
音声翻訳
33.4735.54-

E4Bはすべての項目で上回るため、マシンに十分なメモリがあればE4Bを使ってください。E2Bの強みが際立つのは前世代との比較です。Gemma 3 27Bよりもはるかに小さいサイズで、数学競技、コーディング、専門的な科学知識の性能を上回り、音声入力に対応するGemma 4の中で最小のモデルでもあります。

gemma-4-E2B-itのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のビルドはunsloth/gemma-4-E2B-it-GGUFのもので、ファイルサイズはリポジトリの一覧に記載された実際の値です。

メモリ選ぶビルドファイルサイズ
4 GBUD-Q2_K_XL2.40 GB
6 GBQ4_K_M3.11 GB
8 GBQ6_K4.50 GB
12 GBQ8_05.05 GB
16 GB以上BF169.31 GB

隣り合うビルドのサイズ差は半ギガバイトほどなので、どちらもメモリに収まる場合は大きい方を選んでください。画像と音声を入力するには、同じリポジトリのmmprojファイルを追加します。メインのビルドとは別に0.99 GBが必要です。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic Chatでgemma-4-E2B-itを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵し、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでgemma-4-E2B-itを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるすべてのGemmaモデルをご覧ください。または、高速なMoEの上位モデルGemma 4 26B A4Bへの移行も選択肢です。

gemma-4-E2B-itのライセンス

gemma-4-E2B-itはApache 2.0ライセンスで公開されています。商用利用、改変、再配布がロイヤリティなしで認められているため、自社製品に組み込んで提供したり、自分のハードウェア上で利用料金なしで実行したりできます。

Hugging Faceからモデルをダウンロード

huggingface-cli download google/gemma-4-E2B-it
from transformers import AutoModel
model = AutoModel.from_pretrained("google/gemma-4-E2B-it")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

GoogleのGemma 4ファミリーに属する、指示チューニング済みモデルです。E2Bは、実効パラメータ数が約2.3B(埋め込みを含めると5.1B)、コンテキスト長が125Kトークンのコンパクトなマルチモーダルモデルです。テキスト、画像、音声を扱い、エッジデバイスや一般消費者向けハードウェアで動作するように設計されています。

gemma-4-E2B-itの4ビット量子化ビルドは約5GBのRAMを使用し、Googleは読み込みに必要な空きRAMの最小容量を約4GBとしています。CPUで動作するため専用GPUは必須ではありませんが、GPUがあれば生成が速くなります。このモデルは、Jetson Orin Nanoのようなボードを含め、オフラインで使うモバイルデバイスやIoTデバイス向けに設計されています。

はい。重みはapache-2.0ライセンスで公開されており、無料でダウンロードしてローカルで実行できます。サブスクリプション料金やトークン単位の課金はありません。このライセンスは商用利用、改変、再配布も認めています。

はい。重みをダウンロードすれば、gemma-4-E2B-itはネットワーク接続なしで完全にオフラインで動作します。Atomic Chatで実行すると、すべてのプロンプトとファイルが自分のデバイス内に保持され、データがサーバーに送信されることはありません。

画像や音声の読み取り、内蔵の思考モードによる段階的な推論、コードの作成と説明、多言語チャットなど、プライバシーを保ちながらデバイス上で行うタスクに適しています。必要なリソースが少ないため、大きなモデルが収まらないノートパソコン、スマートフォン、小型エッジデバイスでも実用的に使えます。