gemma-4-31B-itとは?
gemma-4-31B-itは、Google DeepMindのGemma 4ファミリーに属する、指示チューニング済みの31Bデンスモデルです。テキストと画像を入力として受け取り、テキストを出力します。このリリースには5つのサイズ(E2B、E4B、12B、26B A4B、31B)があり、GoogleはE2BとE4Bをモバイル端末やエッジデバイス向け、12B、26B A4B、31Bを一般消費者向けGPUやワークステーション向けとしています。重みは2026年3月11日にApache 2.0ライセンスで公開され、コンテキスト長は256Kトークンです。
| 仕様 | gemma-4-31B-it |
|---|---|
| 総パラメータ数 | 30.7Bに加え、約550Mの視覚エンコーダー |
| アーキテクチャ | デンスモデル、ハイブリッドアテンション(スライディングウィンドウ層 + グローバル層) |
| 層数 | 60 |
| スライディングウィンドウ | 1,024トークン |
| コンテキスト長 | 256Kトークン |
| 語彙数 | 262Kトークン |
| モダリティ | テキストと画像の入力、テキストの出力(このサイズは音声非対応) |
| 動画入力 | フレームのみ、1 fpsで最大60秒 |
| 画像入力 | 可変アスペクト比、視覚トークン数の上限は70から1,120 |
| 言語 | そのままで35以上の言語に対応、事前学習では140以上の言語を使用 |
| 学習データのカットオフ | 2025年1月 |
| 推論 | 思考モード、システムトークン<|think|>で切り替え |
| 関数呼び出し | 標準対応 |
| リリース日 | 2026年3月11日 |
| ライセンス | Apache 2.0 |
アテンション層は、ローカルなスライディングウィンドウ層(ウィンドウ幅は1,024トークン)と全体を参照するグローバル層を交互に配置し、最終層は常にグローバル層です。グローバル層は統合されたキーと値を共有し、Proportional RoPEを使用します。これにより、256Kトークンのコンテキストに必要なメモリを抑えています。思考モードは切り替え可能です。システムプロンプトの先頭に<|think|>トークンを置くと有効になり、取り除くと無効になります。思考モードを無効にしても思考タグは出力されますが、その内部のブロックは空になります。事前学習には、2025年1月をカットオフとするウェブ文書、コード、数学、画像が使われ、140を超える言語が含まれています。
gemma-4-31B-itのベンチマーク
モデルカードに掲載されたGoogleのリリース時の数値では、31Bを、同じファミリーの小型モデルであるGemma 4 26B A4BおよびGemma 4 12B、さらに前世代のGemma 3 27B(思考なし)と比較しています。
| ベンチマーク | gemma-4-31B-it | Gemma 4 26B A4B | Gemma 4 12B | Gemma 3 27B(思考なし) |
|---|---|---|---|---|
MMLU Pro 学術知識 | 85.2 | 82.6 | 77.2 | 67.6 |
AIME 2026(ツールなし) 競技数学 | 89.2 | 88.3 | 77.5 | 20.8 |
LiveCodeBench v6 競技プログラミング | 80.0 | 77.1 | 72.0 | 29.1 |
GPQA Diamond 専門的な科学知識 | 84.3 | 82.3 | 78.8 | 42.4 |
Tau2 ツール使用 | 76.9 | 68.2 | 69.0 | 16.2 |
MMMU Pro マルチモーダル理解 | 76.9 | 73.8 | 69.1 | 49.7 |
MRCR v2 (128k) 長文コンテキスト | 66.4 | 44.1 | 43.4 | 13.5 |
31Bは、提供元の比較表の全項目で最高スコアを記録しています。Gemma 3 27Bの列との差は、MMLU Proで17.6ポイント、MMMU Proで27.2ポイント、GPQA Diamondで41.9ポイント、LiveCodeBench v6で50.9ポイント、MRCR v2 128kで52.9ポイント、Tau2で60.7ポイント、AIME 2026で68.4ポイントです。同じ世代間の比較で、Codeforces ELOは110から2150に上昇しています。
モデルカードは、これらの項目では扱っていない点も補足しています。画像について、Googleは物体検出、文書とPDFの解析、画面とUIの理解、グラフの理解、多言語OCR、手書き文字認識、位置の指示に対応するとしています。視覚ベンチマークの結果もこれを裏付けています。MATH-Visionは85.6、MedXPertQA MMは61.3で、OmniDocBench 1.5の平均編集距離はGemma 3 27Bの0.365に対して0.131です。平均編集距離は低いほど良い指標です。多言語テキストでも良好な結果を示し、MMMLUは88.4、BigBench Extra Hardは74.4です。一方、Humanity's Last Examでは限界が見られ、ツールなしで19.5、検索ありで26.5です。
gemma-4-31B-itのハードウェア要件
システム要件で確認すべきなのはメモリです。Hugging Faceのunsloth/gemma-4-31B-it-GGUFリポジトリでは、量子化ビルドが実際のファイルサイズとともに公開されています。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 12 GB | UD-IQ2_M | 10.75 GB |
| 14 GB | UD-IQ3_XXS | 11.84 GB |
| 16 GB | Q3_K_S | 13.21 GB |
| 20 GB | UD-Q3_K_XL | 15.38 GB |
| 24 GB | Q4_K_M | 18.32 GB |
| 32 GB | Q5_K_M | 21.66 GB |
| 40 GB | Q6_K | 25.20 GB |
| 48 GB以上 | Q8_0 | 32.64 GB |
隣接するビルドのサイズ差は1〜2 GBほどなので、両方がメモリに収まる場合は大きい方を選んでください。特に量子化ビット数が少ない側では、この点が重要です。UD-IQ2_Mは10.75 GB、Q3_K_Sは13.21 GBなので、2ビットに下げても節約できるのは2.46 GBにとどまります。リポジトリ内で最小のビルドであるUD-IQ2_XXSは8.53 GBです。画像入力には、重みに加えて同じリポジトリのmmprojファイルが必要で、さらに1.20 GBを使用します。この形式を初めて使う場合は、まずGGUFとは何かをご覧ください。
Google自身が示す実行方法は、TransformersでAutoProcessorとAutoModelForMultimodalLMを使用し、enable_thinking=Trueで思考モードを有効にするものです。Transformersとllama.cppはいずれもチャットテンプレートを自動で適用します。モデルカードでは、すべての用途で共通のサンプリング設定を指定しています。temperatureは1.0、top_pは0.95、top_kは64です。画像はテキストより前に配置してください。また、複数ターンのチャットでは、ツール呼び出しのターンを除き、過去の思考ブロックを履歴に含めないでください。
Atomic Chatでgemma-4-31B-itを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでgemma-4-31B-itを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
ほかのラインアップについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。
gemma-4-31B-itのライセンス
gemma-4-31B-itはApache 2.0ライセンスで公開されています。ロイヤルティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、使用料を支払わずに自分のハードウェアで実行できます。
