gemma-4-31B-it

更新
04.10.2026
思考
埋め込み
画像認識
音声
推論
コード生成
多言語

Gemma 4 31Bは、Google DeepMindの、パラメータ数30.7Bのオープンなデンスモデルです。テキストと画像の入力、256Kトークンのコンテキスト長に対応し、Apache 2.0ライセンスで公開されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 30.7Bのデンスモデル
  • コンテキスト長: 256Kトークン
  • モダリティ: テキストと画像の入力、テキストの出力
  • 最低ハードウェア要件: メモリ12 GB(2ビットGGUF、10.75 GB)

gemma-4-31B-itとは?

gemma-4-31B-itは、Google DeepMindのGemma 4ファミリーに属する、指示チューニング済みの31Bデンスモデルです。テキストと画像を入力として受け取り、テキストを出力します。このリリースには5つのサイズ(E2B、E4B、12B、26B A4B、31B)があり、GoogleはE2BとE4Bをモバイル端末やエッジデバイス向け、12B、26B A4B、31Bを一般消費者向けGPUやワークステーション向けとしています。重みは2026年3月11日にApache 2.0ライセンスで公開され、コンテキスト長は256Kトークンです。

仕様gemma-4-31B-it
総パラメータ数30.7Bに加え、約550Mの視覚エンコーダー
アーキテクチャデンスモデル、ハイブリッドアテンション(スライディングウィンドウ層 + グローバル層)
層数60
スライディングウィンドウ1,024トークン
コンテキスト長256Kトークン
語彙数262Kトークン
モダリティテキストと画像の入力、テキストの出力(このサイズは音声非対応)
動画入力フレームのみ、1 fpsで最大60秒
画像入力可変アスペクト比、視覚トークン数の上限は70から1,120
言語そのままで35以上の言語に対応、事前学習では140以上の言語を使用
学習データのカットオフ2025年1月
推論思考モード、システムトークン<|think|>で切り替え
関数呼び出し標準対応
リリース日2026年3月11日
ライセンスApache 2.0

アテンション層は、ローカルなスライディングウィンドウ層(ウィンドウ幅は1,024トークン)と全体を参照するグローバル層を交互に配置し、最終層は常にグローバル層です。グローバル層は統合されたキーと値を共有し、Proportional RoPEを使用します。これにより、256Kトークンのコンテキストに必要なメモリを抑えています。思考モードは切り替え可能です。システムプロンプトの先頭に<|think|>トークンを置くと有効になり、取り除くと無効になります。思考モードを無効にしても思考タグは出力されますが、その内部のブロックは空になります。事前学習には、2025年1月をカットオフとするウェブ文書、コード、数学、画像が使われ、140を超える言語が含まれています。

gemma-4-31B-itのベンチマーク

モデルカードに掲載されたGoogleのリリース時の数値では、31Bを、同じファミリーの小型モデルであるGemma 4 26B A4BおよびGemma 4 12B、さらに前世代のGemma 3 27B(思考なし)と比較しています。

ベンチマークgemma-4-31B-itGemma 4 26B A4BGemma 4 12BGemma 3 27B(思考なし)
MMLU Pro
学術知識
85.282.677.267.6
AIME 2026(ツールなし)
競技数学
89.288.377.520.8
LiveCodeBench v6
競技プログラミング
80.077.172.029.1
GPQA Diamond
専門的な科学知識
84.382.378.842.4
Tau2
ツール使用
76.968.269.016.2
MMMU Pro
マルチモーダル理解
76.973.869.149.7
MRCR v2 (128k)
長文コンテキスト
66.444.143.413.5

31Bは、提供元の比較表の全項目で最高スコアを記録しています。Gemma 3 27Bの列との差は、MMLU Proで17.6ポイント、MMMU Proで27.2ポイント、GPQA Diamondで41.9ポイント、LiveCodeBench v6で50.9ポイント、MRCR v2 128kで52.9ポイント、Tau2で60.7ポイント、AIME 2026で68.4ポイントです。同じ世代間の比較で、Codeforces ELOは110から2150に上昇しています。

モデルカードは、これらの項目では扱っていない点も補足しています。画像について、Googleは物体検出、文書とPDFの解析、画面とUIの理解、グラフの理解、多言語OCR、手書き文字認識、位置の指示に対応するとしています。視覚ベンチマークの結果もこれを裏付けています。MATH-Visionは85.6、MedXPertQA MMは61.3で、OmniDocBench 1.5の平均編集距離はGemma 3 27Bの0.365に対して0.131です。平均編集距離は低いほど良い指標です。多言語テキストでも良好な結果を示し、MMMLUは88.4、BigBench Extra Hardは74.4です。一方、Humanity's Last Examでは限界が見られ、ツールなしで19.5、検索ありで26.5です。

gemma-4-31B-itのハードウェア要件

システム要件で確認すべきなのはメモリです。Hugging Faceのunsloth/gemma-4-31B-it-GGUFリポジトリでは、量子化ビルドが実際のファイルサイズとともに公開されています。

メモリ選ぶビルドファイルサイズ
12 GBUD-IQ2_M10.75 GB
14 GBUD-IQ3_XXS11.84 GB
16 GBQ3_K_S13.21 GB
20 GBUD-Q3_K_XL15.38 GB
24 GBQ4_K_M18.32 GB
32 GBQ5_K_M21.66 GB
40 GBQ6_K25.20 GB
48 GB以上Q8_032.64 GB

隣接するビルドのサイズ差は1〜2 GBほどなので、両方がメモリに収まる場合は大きい方を選んでください。特に量子化ビット数が少ない側では、この点が重要です。UD-IQ2_Mは10.75 GB、Q3_K_Sは13.21 GBなので、2ビットに下げても節約できるのは2.46 GBにとどまります。リポジトリ内で最小のビルドであるUD-IQ2_XXSは8.53 GBです。画像入力には、重みに加えて同じリポジトリのmmprojファイルが必要で、さらに1.20 GBを使用します。この形式を初めて使う場合は、まずGGUFとは何かをご覧ください。

Google自身が示す実行方法は、TransformersでAutoProcessorとAutoModelForMultimodalLMを使用し、enable_thinking=Trueで思考モードを有効にするものです。Transformersとllama.cppはいずれもチャットテンプレートを自動で適用します。モデルカードでは、すべての用途で共通のサンプリング設定を指定しています。temperatureは1.0、top_pは0.95、top_kは64です。画像はテキストより前に配置してください。また、複数ターンのチャットでは、ツール呼び出しのターンを除き、過去の思考ブロックを履歴に含めないでください。

Atomic Chatでgemma-4-31B-itを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでgemma-4-31B-itを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、ローカルで実行できるGemmaモデルの一覧をご覧ください。

gemma-4-31B-itのライセンス

gemma-4-31B-itはApache 2.0ライセンスで公開されています。ロイヤルティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、使用料を支払わずに自分のハードウェアで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download google/gemma-4-31B-it
from transformers import AutoModel
model = AutoModel.from_pretrained("google/gemma-4-31B-it")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Google DeepMindが開発した、GoogleのGemma 4ファミリーに属する指示チューニング済みの重み公開モデルです。パラメータ数は32.7B、コンテキスト長は262,144トークンです。HuggingFaceのタグではimage-text-to-textモデルとして分類されており、画像とテキストの両方を扱えます。さらに、推論、コード、多言語にも対応しています。Atomic Chatでは、処理のすべてがお使いのハードウェア上で行われ、オフラインでプライバシーを保ちながら実行できます。

4ビット(Q4)量子化には、およそ18-19GBのVRAMが必要です。日常的な利用には、RTX 3090やRTX 4090などの24GBのカードが余裕のある目安になります。8ビット(Q8)のビルドは約32.6GBです。長いコンテキストでは大きなKVキャッシュが追加で必要になる点に注意してください。コンテキスト長の上限である262K近くでは、重みに加えて約22GBにまで増えることがあります。

はい。このモデルはApache 2.0ライセンスで公開されており、ライセンス料もGoogleとの契約も不要で、個人利用と商用利用が無料で認められています。必要なのは、再配布時にライセンス本文を含め、加えた変更を明記することだけです。

はい。重みをダウンロードすれば、gemma-4-31B-itはネットワーク接続なしで、処理のすべてをお使いのマシン上で実行できます。Atomic Chatはモデルをローカルで読み込むため、プロンプト、文書、画像はデバイス内にとどまり、リモートサーバーには何も送信されません。

文書やPDFの読み取り、OCRや手書き文字の読み取り、グラフやスクリーンショットの分析といったマルチモーダル理解を得意としています。段階的な推論、コード、エージェント型タスクのための構造化されたツール使用にも強みがあります。140以上の言語への対応と262,144トークンのコンテキスト長により、ローカルのハードウェア内で完結させたい、長文を扱う多言語の作業に役立ちます。