gemma-4-12B-it

更新
04.10.2026
思考
埋め込み
画像認識
音声
推論
コード生成
多言語

Gemma 4 12Bは、Google DeepMindのエンコーダーを使わないマルチモーダルモデルです。テキスト、画像、音声、動画の入力に対応し、コンテキスト長は256K、ライセンスはApache 2.0です。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 11.95B、デンスモデル
  • コンテキスト長: 256Kトークン
  • モダリティ: テキスト、画像、音声、動画の入力
  • 最小ハードウェア要件: メモリ5 GB(UD-Q2_K_XLビルド、4.66 GB)

Gemma 4 12Bとは

Gemma 4 12Bは、Google DeepMindの、パラメータ数11.95Bのマルチモーダルなデンスモデルです。E2B、E4B、26B A4B、31Bを含む5モデルのファミリーで、中規模に位置します。ファミリーの「Unified」モデルであり、ほかのGemma 4モデルが専用エンコーダーでマルチモーダルデータを処理してからLLMに渡すのに対し、12Bは生の画像パッチと音声波形を軽量な線形層を介してデコーダーへ直接射影します。1つのチェックポイントでテキスト、画像、音声、動画を読み取れるため、一般向けのマシンで求められる構成です。Google DeepMindは、これにより一般向けデバイスに適したデプロイサイズと、簡素化されたローカル実行を実現したと説明しています。

仕様Gemma 4 12B
総パラメータ数11.95B
アーキテクチャデコーダーのみのデンスモデル、エンコーダーを使わないマルチモーダル構成
層数48
アテンションローカルのスライディングウィンドウ層(1,024トークン)とグローバル層を交互に配置
コンテキスト長256Kトークン
語彙数262Kトークン
モダリティテキスト、画像、音声、動画の入力、テキストの出力
推論システムプロンプトで切り替える思考モード
関数呼び出しツール使用をネイティブにサポート
言語標準で35以上の言語に対応、140以上の言語で事前学習
学習データのカットオフ2025年1月
ベースモデルgoogle/gemma-4-12B
サンプリングのデフォルト設定temperature 1.0, top_p 0.95, top_k 64
ライセンスApache 2.0

グローバル層は統合されたキーとバリューを共有し、Proportional RoPEを使用します。これにより、12BモデルでもKVキャッシュがメモリを圧迫することなく256Kのコンテキストを扱えます。ハイブリッドアテンションでは、ローカルのスライディングウィンドウアテンションと完全なグローバルアテンションを交互に配置し、最後は必ずグローバル層になります。Googleは、エンコーダーをなくす利点として、マルチモーダル処理のレイテンシ低減と、モデル全体を1回の処理でファインチューニングできることを挙げています。システムプロンプトの先頭に<|think|>トークンを置くと思考が有効になり、取り除くと無効になります。思考を無効にしても、モデルは空のブロックを囲む思考タグを出力します。Gemma 4では、systemロールのネイティブサポートも追加されています。画像はさまざまなアスペクト比と解像度で入力でき、画像1枚あたりの視覚トークン数の上限は70、140、280、560、1,120トークンです。分類、キャプション生成、動画フレームには少なめの上限を、OCR、文書解析、小さな文字の読み取りには多めの上限を使用します。音声クリップは最大30秒、動画は毎秒1フレームで最大60秒に対応します。

Gemma 4 12Bのベンチマーク

Googleがリリース時に公表した数値では、指示チューニング済みの12Bを、同じファミリーのGemma 4 26B A4BとGemma 4 31B、オンデバイス向けのE4B、前世代のGemma 3 27Bと比較しています。

ベンチマークGemma 4 12BGemma 4 26B A4BGemma 4 31BGemma 4 E4BGemma 3 27B(思考なし)
MMLU Pro
学術知識
77.282.685.269.467.6
AIME 2026
数学競技
77.588.389.242.520.8
LiveCodeBench v6
競技プログラミング
72.077.180.052.029.1
Codeforces ELO
競技レーティング
165917182150940110
GPQA Diamond
専門的な科学知識
78.882.384.358.642.4
Tau2
エージェントのツール使用
69.068.276.942.216.2
MMMU Pro
マルチモーダル推論
69.173.876.952.649.7

31Bは、最大のモデルらしく全項目で首位です。意外なのは12Bの結果です。Tau2のツール使用ではMoEの26B A4Bをわずかに上回り、Gemma 3 27Bの半分未満のサイズで全7項目のスコアを上回っています。ただし、GoogleはGemma 3の列を思考なしで測定しています。

モデルカードには、ランキング以外に12Bの用途も記載されています。画像関連では、物体検出、文書とPDFの解析、画面とUIの理解、グラフの理解、多言語OCR、手書き文字認識、位置の指示に対応し、テキストと画像は任意の順序で混在させられます。MATH-Visionでは79.7%、MedXPertQA MMでは48.7%、OmniDocBench 1.5では平均編集距離0.164を記録しています。平均編集距離は低いほど良い指標です。音声関連では、音声認識と音声の翻訳テキスト化に対応し、CoVoSTで38.5、FLEURSで0.069(低いほど良い)を記録しています。どちらも中国語を除いた結果です。音声に対応するのはE2B、E4B、12Bのみです。長いコンテキストは別途評価されており、128KでのMRCR v2 8-needleでは43.4%を記録し、Gemma 3 27Bの13.5%を上回っています。

Gemma 4 12Bのハードウェア要件

システム要件で確認すべきなのはメモリです。以下のビルドとファイルサイズは、unsloth/gemma-4-12B-it-GGUFリポジトリに基づいています。このリポジトリには、F16で0.18 GB、F32で0.21 GBのmmprojファイル、Q8_0で0.47 GBのMTPヘッド、さらに表の最小構成より小さい4.21 GBの2ビット量子化版UD-IQ2_Mもあります。

メモリ選ぶビルドファイルサイズ
5 GBUD-Q2_K_XL4.66 GB
6 GBQ3_K_S5.14 GB
8 GBQ4_K_M7.12 GB
10 GBQ5_K_M8.41 GB
12 GBQ6_K9.79 GB
16 GBQ8_012.67 GB
32 GB以上BF1623.83 GB

2つのビルドがどちらもメモリに収まる場合は、大きいほうを選びます。

Atomic ChatでGemma 4 12Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでGemma 4 12Bを検索し、Download Optionsを開きます。
  3. 使用できるメモリに収まるビルドを選び、チャットを開始します。

ファミリーのほかのモデルは、ローカルで実行できるすべてのGemmaモデルをご覧ください。

Gemma 4 12Bのライセンス

Gemma 4 12BはApache 2.0で公開されています。商用利用、改変、再配布がロイヤリティなしで認められています。重みをファインチューニングし、それを使った製品を提供し、自分のハードウェアで利用料なしにモデルを実行できます。ただし、Google DeepMindは引き続き、開発者自身の製品ポリシーと用途に合ったコンテンツ安全対策を追加するよう求めています。

Hugging Faceからモデルをダウンロード

huggingface-cli download google/gemma-4-12B-it
from transformers import AutoModel
model = AutoModel.from_pretrained("google/gemma-4-12B-it")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

gemma-4-12B-itは、GoogleのGemma 4ファミリーに属する、パラメータ数12Bの指示チューニング済みモデルです。エンコーダーを使わない統合アーキテクチャを採用し、同じプロンプトでテキスト、画像、音声を受け付けます。コンテキスト長は128,000トークンです。「it」は指示チューニング済みのビルドであることを示し、Gemma 4 12Bのベースモデルに対して、チャットとタスクの指示に従うためのファインチューニングを施しています。

4ビット量子化ビルドのサイズは約6.7 GBなので、短いプロンプトであれば8 GBのGPUに収まります。長いコンテキストでも快適に使うには、16 GBのVRAMまたはユニファイドメモリを目安にしてください。プロンプトが長くなるほどKVキャッシュが増えるためです。16-32 GBのユニファイドメモリを搭載したApple MシリーズのMacは、メモリプール全体を使用できるため適しています。

はい。apache-2.0ライセンスで公開されているため、重みを無料でダウンロード、実行、改変し、商用利用できます。費用がかかるのは実行に使うハードウェアまたはクラウドだけで、Atomic Chatではローカルで無料で実行できます。

はい。重みをダウンロードすれば、インターネット接続なしで、自分のCPUまたはGPUだけでモデルを実行できます。Atomic Chatではすべてのプロンプトと応答がデバイス内にとどまるため、プライバシーが求められる作業、機密性の高い作業、エアギャップ環境での作業に適しています。

1つのローカルLLMで、一般的な質疑応答、コード生成とデバッグ、要約、画像や音声の分析をこなせます。内蔵の思考モードは段階的な推論や数学に役立ち、140以上の言語への対応により、翻訳や多言語での文章作成も行えます。日常的なタスクの大半では高速に動作し、プライバシーを保ちながらローカルで無料で実行できます。