Granite-4.0-H-Small

更新
04.10.2026
推論
コード生成
多言語
ツール利用

IBMの32B(アクティブパラメータ9B)のハイブリッドMamba-2/MoE指示チューニング済みモデルです。コンテキスト長128K、高いツール呼び出し性能、多言語対応を備え、Apache 2.0で公開されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計32B、アクティブ9B
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: メモリ16 GB(Q2_Kビルド、11.78 GB)

Granite-4.0-H-Smallとは?

Granite-4.0-H-Smallは、IBMのGraniteチームが開発した、パラメータ数32Bの長いコンテキストに対応する指示チューニング済みモデルです。2025年10月2日にApache 2.0で公開された4つのGranite 4.0言語モデルの中で、最大のモデルです。トークンごとに9BのパラメータがアクティブになるMixture-of-Expertsモデルで、40層のうち36層はアテンションではなくMamba2です。IBMは、一般的な指示への応答と、ビジネス用途を含むさまざまな分野のAIアシスタントの構築に向けて、対応する12言語で利用できるように設計しました。IBM自身がGGUFビルドを公開しているため、少ない手順でローカル実行できます。

仕様Granite-4.0-H-Small
総パラメータ数32B
アクティブパラメータ数9B
アーキテクチャデコーダーのみのMoE Transformer、アテンション 4層とMamba2 36層
埋め込み次元数4096、入力と出力で埋め込みを共有
アテンション32ヘッド、KVヘッド8個(GQA)、ヘッド次元数128
Mamba2128ヘッド、状態次元数128
エキスパートMoEブロックごとに72個、うち10個がアクティブ。さらに共有エキスパートを搭載
エキスパートの隠れ層次元数768、共有エキスパートは1536
活性化関数SwiGLU, RMSNorm
コンテキスト長128Kトークン
モダリティテキスト
対応言語12言語:英語、ドイツ語、スペイン語、フランス語、日本語、ポルトガル語、アラビア語、チェコ語、イタリア語、韓国語、オランダ語、中国語
位置埋め込みなし(NoPE)
ベースモデルGranite-4.0-H-Small-Base
学習に使用した環境CoreWeaveのNVIDIA GB200 NVL72クラスター
公開日2025年10月2日
ライセンスApache 2.0

40層のうち、アテンションは4層だけです。GQAを使用し、32ヘッドに対してKVヘッドは8個、ヘッド次元数は128です。残りの36層はMamba2で、128ヘッド、状態次元数128です。フィードフォワードブロックにはMixture-of-Expertsを採用し、ブロックごとに72個のエキスパートのうち10個がアクティブになるほか、隠れ層次元数1536の共有エキスパートを備えています。IBMは位置埋め込みをNoPE、つまり位置エンコーディングを一切使用しない方式と記載しています。一方、同じファミリーのアテンションのみを使用する3BのMicro DenseはRoPEを採用しています。この指示チューニング済みモデルは、利用条件の緩やかなライセンスの公開データセット、内部で生成した合成データ、人手で精選した例を用い、Granite-4.0-H-Small-Baseに教師ありファインチューニング、強化学習によるアラインメント、モデルマージを施して作られています。

Granite-4.0-H-Smallのベンチマーク

モデルカードに掲載されたIBMの数値は、Granite 4.0の4モデルを比較したものです。32BのH Small MoEを、7BのH Tiny MoEと、3Bの2モデルであるH Micro Denseおよびアテンションのみを使用するMicro Denseと比較しています。

ベンチマークGranite-4.0-H-SmallH TinyH MicroMicro Dense
MMLU
一般知識
78.4468.6567.4365.98
MMLU-Pro
学術知識
55.4744.9443.4844.5
GPQA
科学の専門知識
40.6332.5932.1530.14
IFEval
指示追従
87.5581.4484.3282.31
GSM8K
小学校の算数
87.2784.6981.3585.45
HumanEval
Pythonコーディング
88838180
BFCL v3
関数呼び出し
64.6957.6557.5659.98
MGSM
多言語の数学
38.7245.3644.4828.56

H-Smallは、最後の項目を除くすべての項目で首位です。例外はMGSMで、5言語にわたる8-shotの数学評価では、7BのH Tinyが45.36を記録したのに対し、H-Smallは38.72でした。IBMは別途、指示データの大部分が英語であるため、多言語での性能は英語のタスクに及ばない可能性があると注記しています。

IBMは、要約、テキスト分類、テキスト抽出、質問応答、検索拡張生成、コード関連タスク、関数呼び出し、多言語対話、コードの途中を埋める補完を、モデルの機能として明示しています。IBMによると、Granite 4.0の指示チューニング済みモデルは指示追従とツール呼び出しが改善され、企業向けアプリケーションでより効果的に利用できます。ツールを呼び出すには、OpenAIの関数定義スキーマでツールを宣言し、チャットテンプレートに渡します。モデルは<tool_call>タグ内のJSONオブジェクトで応答します。モデルカードの参照実装のスタックは、通常のTransformersです。2025年10月7日の更新で、チャットテンプレートにデフォルトのシステムプロンプトが追加され、専門的で正確かつ安全な回答をするよう誘導しています。

Granite-4.0-H-Smallのハードウェア要件

システム要件で確認すべきなのはメモリです。IBMはibm-granite/granite-4.0-h-small-GGUFで独自の量子化ビルドを公開しています。11.78 GBのQ2_Kから34.26 GBのQ8_0までの14個の量子化ファイルに加え、64.45 GBのf16もあります。

メモリ選ぶビルドファイルサイズ
16 GBQ2_K11.78 GB
20 GBQ3_K_M15.36 GB
24 GBQ4_K_M19.48 GB
28 GBQ5_K_M22.87 GB
32 GBQ6_K26.47 GB
48 GB以上Q8_034.26 GB

記載のサイズは重みだけの容量なので、各行ではコンテキストとシステムのほかの処理のために、数GBの余裕を残しています。そのメモリ容量内に2つのビルドがどちらも収まる場合は、大きいほうを選んでください。この形式に馴染みがない場合は、まずGGUFとは何かを確認してください。同じメモリ容量で動作するほかのモデルについては、16 GBのMacに最適なローカルLLMをご覧ください。

Atomic ChatでGranite-4.0-H-Smallを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでGranite-4.0-H-Smallを検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを開始します。

同じファミリーの小型モデルも同じ方法で実行できます。ローカルで実行できるすべてのGraniteモデル、またはローカルモデルカタログにあるほかのモデルをご覧ください。

Granite-4.0-H-Smallのライセンス

Granite-4.0-H-SmallはApache 2.0で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。また、IBMによると、ユーザーはGranite 4.0モデルを、対応する12言語以外の言語向けにもファインチューニングできます。IBMは注意点を1つ挙げています。モデルは安全性を考慮してアラインメントされていますが、それでも不正確、偏向的、または安全でない応答を生成する可能性があるため、用途に応じた安全性テストと調整を各自で実施してください。

Hugging Faceからモデルをダウンロード

pip install -U transformers accelerate torch
huggingface-cli download ibm-granite/granite-4.0-h-small
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "ibm-granite/granite-4.0-h-small",
    "messages": [{"role": "user", "content": "What is retrieval augmented generation?"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_path = "ibm-granite/granite-4.0-h-small"
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(model_path, device_map="cuda")
chat = [{"role": "user", "content": "Summarize the Apache 2.0 license in one sentence."}]
prompt = tokenizer.apply_chat_template(chat, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
out = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "not-needed" });
const res = await client.chat.completions.create({
  model: "ibm-granite/granite-4.0-h-small",
  messages: [{ role: "user", content: "Explain mixture-of-experts in two sentences." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Granite-4.0-H-Smallは、総パラメータ数32BのMixture-of-Expertsモデルです。推論時には、トークンごとに約9Bのパラメータがアクティブになります。72個のエキスパートから振り分け先を選び、同時に10個をアクティブにすることで、計算量とメモリ使用量を、32B全体を使用するデンスモデルよりも9Bのデンスモデルに近く抑えています。

Granite-4.0-H-Smallのコンテキスト長は128Kトークンです。IBMはGranite 4.0モデルを最大512Kトークンのサンプルで学習し、128Kまでの性能を検証しているため、長い文書、複数ファイルにまたがるコード、長いRAG入力を余裕をもって処理できます。

はい。Granite-4.0-H-SmallはIBMがApache 2.0ライセンスで公開しており、商用利用、改変、再配布が認められています。重みはHugging Faceから誰でもダウンロードでき、Granite 4.0ファミリーには暗号学的署名が付与され、ISO 42001認証を取得しています。

32Bのパラメータのうちアクティブなのは9Bだけなので、ハイブリッドMamba-2/Transformer設計によってメモリ使用量が大幅に削減されます。4ビット量子化ビルドは24 GBのGPU 1台で動作し、BF16の重み全体には約64 GBが必要です。IBMは、長いコンテキストでの利用において、同等のデンスモデルと比べてメモリ使用量を70%超削減し、推論速度を約2倍に高めたとしています。

公式には、英語、ドイツ語、スペイン語、フランス語、日本語、ポルトガル語、アラビア語、チェコ語、イタリア語、韓国語、オランダ語、中国語の12言語に対応しています。学習データの大部分が英語であるため、英語以外では性能が劣る場合がありますが、few-shotの例が役立ちます。ユーザーは、ほかの言語向けにファインチューニングすることもできます。