gemma-4-E2B-itとは?
gemma-4-E2B-itは、Google DeepMindのGemma 4ファミリーで最小の指示チューニング済みモデルで、2026年3月にApache 2.0ライセンスでHugging Face上に公開されました。Eは実効パラメータを意味します。計算に使うパラメータは2.3Bですが、保存するパラメータは合計5.1Bです。これは、Per-Layer Embeddingsによって、各デコーダー層がトークンごとの小さな埋め込みテーブルを個別に持つためです。これらのテーブルは容量が大きいものの、高速な参照にしか使われないため、スマートフォンで扱える程度の計算コストに抑えられます。また、音声入力にネイティブ対応するGemma 4の3モデルのうちの1つで、完全にオフラインで音声の文字起こしと翻訳ができます。
| 仕様 | gemma-4-E2B-it |
|---|---|
| 実効パラメータ数 | 2.3B(埋め込みを含めた合計は5.1B) |
| アーキテクチャ | デンスモデル、ハイブリッドアテンション:ローカルなスライディングウィンドウと全域を参照するグローバル層の組み合わせ |
| 層数 | 35 |
| スライディングウィンドウ | 512トークン |
| コンテキスト長 | 128Kトークン |
| 語彙数 | 262K |
| モダリティ | テキスト、画像、音声の入力、テキストの出力 |
| エンコーダー | 視覚用は約150M、音声用は約300M |
| 推論 | システムプロンプト内のトークンで有効にする思考モード |
| リリース日 | 2026年3月2日 |
| ライセンス | Apache 2.0 |
アテンションの層構成では、ローカルなスライディングウィンドウ層と全域を参照するグローバル層が交互に配置され、最終層は常にグローバル層です。E2Bのスライディングウィンドウ幅は512トークンです。グローバル層では、統合されたキーとバリューに加えてProportional RoPEを使い、長いコンテキストでのメモリ使用量を抑えます。マルチモーダル機能では、さまざまなアスペクト比や解像度の画像を入力でき、視覚トークンの割り当て量を70から1120トークンの範囲で設定できます。音声クリップは最大30秒に対応し、動画は毎秒1フレーム、最大60秒までフレームとして処理されます。Googleによると、標準で35以上の言語に対応し、事前学習には140を超える言語が使われています。
gemma-4-E2B-itのベンチマーク
Google DeepMindは、Gemma 4のモデルカードでこれらの数値を公開しています。E2Bの隣の列は、同じファミリーの上位モデルGemma 4 E4Bと、思考モードなしで実行した前世代のGemma 3 27Bです。
| ベンチマーク | gemma-4-E2B-it | Gemma 4 E4B | Gemma 3 27B(思考モードなし) |
|---|---|---|---|
MMLU Pro 学術知識 | 60.0% | 69.4% | 67.6% |
AIME 2026 数学競技 | 37.5% | 42.5% | 20.8% |
LiveCodeBench v6 競技プログラミング | 44.0% | 52.0% | 29.1% |
GPQA Diamond 専門的な科学知識 | 43.4% | 58.6% | 42.4% |
MMMU Pro マルチモーダル理解 | 44.2% | 52.6% | 49.7% |
MMMLU 多言語知識 | 67.4% | 76.6% | 70.7% |
CoVoST 音声翻訳 | 33.47 | 35.54 | - |
E4Bはすべての項目で上回るため、マシンに十分なメモリがあればE4Bを使ってください。E2Bの強みが際立つのは前世代との比較です。Gemma 3 27Bよりもはるかに小さいサイズで、数学競技、コーディング、専門的な科学知識の性能を上回り、音声入力に対応するGemma 4の中で最小のモデルでもあります。
gemma-4-E2B-itのハードウェア要件
システム要件で確認すべきなのはメモリです。以下のビルドはunsloth/gemma-4-E2B-it-GGUFのもので、ファイルサイズはリポジトリの一覧に記載された実際の値です。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 4 GB | UD-Q2_K_XL | 2.40 GB |
| 6 GB | Q4_K_M | 3.11 GB |
| 8 GB | Q6_K | 4.50 GB |
| 12 GB | Q8_0 | 5.05 GB |
| 16 GB以上 | BF16 | 9.31 GB |
隣り合うビルドのサイズ差は半ギガバイトほどなので、どちらもメモリに収まる場合は大きい方を選んでください。画像と音声を入力するには、同じリポジトリのmmprojファイルを追加します。メインのビルドとは別に0.99 GBが必要です。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic Chatでgemma-4-E2B-itを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵し、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでgemma-4-E2B-itを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで実行できるすべてのGemmaモデルをご覧ください。または、高速なMoEの上位モデルGemma 4 26B A4Bへの移行も選択肢です。
gemma-4-E2B-itのライセンス
gemma-4-E2B-itはApache 2.0ライセンスで公開されています。商用利用、改変、再配布がロイヤリティなしで認められているため、自社製品に組み込んで提供したり、自分のハードウェア上で利用料金なしで実行したりできます。
