Gemma 4 12Bとは
Gemma 4 12Bは、Google DeepMindの、パラメータ数11.95Bのマルチモーダルなデンスモデルです。E2B、E4B、26B A4B、31Bを含む5モデルのファミリーで、中規模に位置します。ファミリーの「Unified」モデルであり、ほかのGemma 4モデルが専用エンコーダーでマルチモーダルデータを処理してからLLMに渡すのに対し、12Bは生の画像パッチと音声波形を軽量な線形層を介してデコーダーへ直接射影します。1つのチェックポイントでテキスト、画像、音声、動画を読み取れるため、一般向けのマシンで求められる構成です。Google DeepMindは、これにより一般向けデバイスに適したデプロイサイズと、簡素化されたローカル実行を実現したと説明しています。
| 仕様 | Gemma 4 12B |
|---|---|
| 総パラメータ数 | 11.95B |
| アーキテクチャ | デコーダーのみのデンスモデル、エンコーダーを使わないマルチモーダル構成 |
| 層数 | 48 |
| アテンション | ローカルのスライディングウィンドウ層(1,024トークン)とグローバル層を交互に配置 |
| コンテキスト長 | 256Kトークン |
| 語彙数 | 262Kトークン |
| モダリティ | テキスト、画像、音声、動画の入力、テキストの出力 |
| 推論 | システムプロンプトで切り替える思考モード |
| 関数呼び出し | ツール使用をネイティブにサポート |
| 言語 | 標準で35以上の言語に対応、140以上の言語で事前学習 |
| 学習データのカットオフ | 2025年1月 |
| ベースモデル | google/gemma-4-12B |
| サンプリングのデフォルト設定 | temperature 1.0, top_p 0.95, top_k 64 |
| ライセンス | Apache 2.0 |
グローバル層は統合されたキーとバリューを共有し、Proportional RoPEを使用します。これにより、12BモデルでもKVキャッシュがメモリを圧迫することなく256Kのコンテキストを扱えます。ハイブリッドアテンションでは、ローカルのスライディングウィンドウアテンションと完全なグローバルアテンションを交互に配置し、最後は必ずグローバル層になります。Googleは、エンコーダーをなくす利点として、マルチモーダル処理のレイテンシ低減と、モデル全体を1回の処理でファインチューニングできることを挙げています。システムプロンプトの先頭に<|think|>トークンを置くと思考が有効になり、取り除くと無効になります。思考を無効にしても、モデルは空のブロックを囲む思考タグを出力します。Gemma 4では、systemロールのネイティブサポートも追加されています。画像はさまざまなアスペクト比と解像度で入力でき、画像1枚あたりの視覚トークン数の上限は70、140、280、560、1,120トークンです。分類、キャプション生成、動画フレームには少なめの上限を、OCR、文書解析、小さな文字の読み取りには多めの上限を使用します。音声クリップは最大30秒、動画は毎秒1フレームで最大60秒に対応します。
Gemma 4 12Bのベンチマーク
Googleがリリース時に公表した数値では、指示チューニング済みの12Bを、同じファミリーのGemma 4 26B A4BとGemma 4 31B、オンデバイス向けのE4B、前世代のGemma 3 27Bと比較しています。
| ベンチマーク | Gemma 4 12B | Gemma 4 26B A4B | Gemma 4 31B | Gemma 4 E4B | Gemma 3 27B(思考なし) |
|---|---|---|---|---|---|
MMLU Pro 学術知識 | 77.2 | 82.6 | 85.2 | 69.4 | 67.6 |
AIME 2026 数学競技 | 77.5 | 88.3 | 89.2 | 42.5 | 20.8 |
LiveCodeBench v6 競技プログラミング | 72.0 | 77.1 | 80.0 | 52.0 | 29.1 |
Codeforces ELO 競技レーティング | 1659 | 1718 | 2150 | 940 | 110 |
GPQA Diamond 専門的な科学知識 | 78.8 | 82.3 | 84.3 | 58.6 | 42.4 |
Tau2 エージェントのツール使用 | 69.0 | 68.2 | 76.9 | 42.2 | 16.2 |
MMMU Pro マルチモーダル推論 | 69.1 | 73.8 | 76.9 | 52.6 | 49.7 |
31Bは、最大のモデルらしく全項目で首位です。意外なのは12Bの結果です。Tau2のツール使用ではMoEの26B A4Bをわずかに上回り、Gemma 3 27Bの半分未満のサイズで全7項目のスコアを上回っています。ただし、GoogleはGemma 3の列を思考なしで測定しています。
モデルカードには、ランキング以外に12Bの用途も記載されています。画像関連では、物体検出、文書とPDFの解析、画面とUIの理解、グラフの理解、多言語OCR、手書き文字認識、位置の指示に対応し、テキストと画像は任意の順序で混在させられます。MATH-Visionでは79.7%、MedXPertQA MMでは48.7%、OmniDocBench 1.5では平均編集距離0.164を記録しています。平均編集距離は低いほど良い指標です。音声関連では、音声認識と音声の翻訳テキスト化に対応し、CoVoSTで38.5、FLEURSで0.069(低いほど良い)を記録しています。どちらも中国語を除いた結果です。音声に対応するのはE2B、E4B、12Bのみです。長いコンテキストは別途評価されており、128KでのMRCR v2 8-needleでは43.4%を記録し、Gemma 3 27Bの13.5%を上回っています。
Gemma 4 12Bのハードウェア要件
システム要件で確認すべきなのはメモリです。以下のビルドとファイルサイズは、unsloth/gemma-4-12B-it-GGUFリポジトリに基づいています。このリポジトリには、F16で0.18 GB、F32で0.21 GBのmmprojファイル、Q8_0で0.47 GBのMTPヘッド、さらに表の最小構成より小さい4.21 GBの2ビット量子化版UD-IQ2_Mもあります。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 5 GB | UD-Q2_K_XL | 4.66 GB |
| 6 GB | Q3_K_S | 5.14 GB |
| 8 GB | Q4_K_M | 7.12 GB |
| 10 GB | Q5_K_M | 8.41 GB |
| 12 GB | Q6_K | 9.79 GB |
| 16 GB | Q8_0 | 12.67 GB |
| 32 GB以上 | BF16 | 23.83 GB |
2つのビルドがどちらもメモリに収まる場合は、大きいほうを選びます。
Atomic ChatでGemma 4 12Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザーでGemma 4 12Bを検索し、Download Optionsを開きます。
- 使用できるメモリに収まるビルドを選び、チャットを開始します。
ファミリーのほかのモデルは、ローカルで実行できるすべてのGemmaモデルをご覧ください。
Gemma 4 12Bのライセンス
Gemma 4 12BはApache 2.0で公開されています。商用利用、改変、再配布がロイヤリティなしで認められています。重みをファインチューニングし、それを使った製品を提供し、自分のハードウェアで利用料なしにモデルを実行できます。ただし、Google DeepMindは引き続き、開発者自身の製品ポリシーと用途に合ったコンテンツ安全対策を追加するよう求めています。
