Granite-4.0-H-Smallとは?
Granite-4.0-H-Smallは、IBMのGraniteチームが開発した、パラメータ数32Bの長いコンテキストに対応する指示チューニング済みモデルです。2025年10月2日にApache 2.0で公開された4つのGranite 4.0言語モデルの中で、最大のモデルです。トークンごとに9BのパラメータがアクティブになるMixture-of-Expertsモデルで、40層のうち36層はアテンションではなくMamba2です。IBMは、一般的な指示への応答と、ビジネス用途を含むさまざまな分野のAIアシスタントの構築に向けて、対応する12言語で利用できるように設計しました。IBM自身がGGUFビルドを公開しているため、少ない手順でローカル実行できます。
| 仕様 | Granite-4.0-H-Small |
|---|---|
| 総パラメータ数 | 32B |
| アクティブパラメータ数 | 9B |
| アーキテクチャ | デコーダーのみのMoE Transformer、アテンション 4層とMamba2 36層 |
| 埋め込み次元数 | 4096、入力と出力で埋め込みを共有 |
| アテンション | 32ヘッド、KVヘッド8個(GQA)、ヘッド次元数128 |
| Mamba2 | 128ヘッド、状態次元数128 |
| エキスパート | MoEブロックごとに72個、うち10個がアクティブ。さらに共有エキスパートを搭載 |
| エキスパートの隠れ層次元数 | 768、共有エキスパートは1536 |
| 活性化関数 | SwiGLU, RMSNorm |
| コンテキスト長 | 128Kトークン |
| モダリティ | テキスト |
| 対応言語 | 12言語:英語、ドイツ語、スペイン語、フランス語、日本語、ポルトガル語、アラビア語、チェコ語、イタリア語、韓国語、オランダ語、中国語 |
| 位置埋め込み | なし(NoPE) |
| ベースモデル | Granite-4.0-H-Small-Base |
| 学習に使用した環境 | CoreWeaveのNVIDIA GB200 NVL72クラスター |
| 公開日 | 2025年10月2日 |
| ライセンス | Apache 2.0 |
40層のうち、アテンションは4層だけです。GQAを使用し、32ヘッドに対してKVヘッドは8個、ヘッド次元数は128です。残りの36層はMamba2で、128ヘッド、状態次元数128です。フィードフォワードブロックにはMixture-of-Expertsを採用し、ブロックごとに72個のエキスパートのうち10個がアクティブになるほか、隠れ層次元数1536の共有エキスパートを備えています。IBMは位置埋め込みをNoPE、つまり位置エンコーディングを一切使用しない方式と記載しています。一方、同じファミリーのアテンションのみを使用する3BのMicro DenseはRoPEを採用しています。この指示チューニング済みモデルは、利用条件の緩やかなライセンスの公開データセット、内部で生成した合成データ、人手で精選した例を用い、Granite-4.0-H-Small-Baseに教師ありファインチューニング、強化学習によるアラインメント、モデルマージを施して作られています。
Granite-4.0-H-Smallのベンチマーク
モデルカードに掲載されたIBMの数値は、Granite 4.0の4モデルを比較したものです。32BのH Small MoEを、7BのH Tiny MoEと、3Bの2モデルであるH Micro Denseおよびアテンションのみを使用するMicro Denseと比較しています。
| ベンチマーク | Granite-4.0-H-Small | H Tiny | H Micro | Micro Dense |
|---|---|---|---|---|
MMLU 一般知識 | 78.44 | 68.65 | 67.43 | 65.98 |
MMLU-Pro 学術知識 | 55.47 | 44.94 | 43.48 | 44.5 |
GPQA 科学の専門知識 | 40.63 | 32.59 | 32.15 | 30.14 |
IFEval 指示追従 | 87.55 | 81.44 | 84.32 | 82.31 |
GSM8K 小学校の算数 | 87.27 | 84.69 | 81.35 | 85.45 |
HumanEval Pythonコーディング | 88 | 83 | 81 | 80 |
BFCL v3 関数呼び出し | 64.69 | 57.65 | 57.56 | 59.98 |
MGSM 多言語の数学 | 38.72 | 45.36 | 44.48 | 28.56 |
H-Smallは、最後の項目を除くすべての項目で首位です。例外はMGSMで、5言語にわたる8-shotの数学評価では、7BのH Tinyが45.36を記録したのに対し、H-Smallは38.72でした。IBMは別途、指示データの大部分が英語であるため、多言語での性能は英語のタスクに及ばない可能性があると注記しています。
IBMは、要約、テキスト分類、テキスト抽出、質問応答、検索拡張生成、コード関連タスク、関数呼び出し、多言語対話、コードの途中を埋める補完を、モデルの機能として明示しています。IBMによると、Granite 4.0の指示チューニング済みモデルは指示追従とツール呼び出しが改善され、企業向けアプリケーションでより効果的に利用できます。ツールを呼び出すには、OpenAIの関数定義スキーマでツールを宣言し、チャットテンプレートに渡します。モデルは<tool_call>タグ内のJSONオブジェクトで応答します。モデルカードの参照実装のスタックは、通常のTransformersです。2025年10月7日の更新で、チャットテンプレートにデフォルトのシステムプロンプトが追加され、専門的で正確かつ安全な回答をするよう誘導しています。
Granite-4.0-H-Smallのハードウェア要件
システム要件で確認すべきなのはメモリです。IBMはibm-granite/granite-4.0-h-small-GGUFで独自の量子化ビルドを公開しています。11.78 GBのQ2_Kから34.26 GBのQ8_0までの14個の量子化ファイルに加え、64.45 GBのf16もあります。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 16 GB | Q2_K | 11.78 GB |
| 20 GB | Q3_K_M | 15.36 GB |
| 24 GB | Q4_K_M | 19.48 GB |
| 28 GB | Q5_K_M | 22.87 GB |
| 32 GB | Q6_K | 26.47 GB |
| 48 GB以上 | Q8_0 | 34.26 GB |
記載のサイズは重みだけの容量なので、各行ではコンテキストとシステムのほかの処理のために、数GBの余裕を残しています。そのメモリ容量内に2つのビルドがどちらも収まる場合は、大きいほうを選んでください。この形式に馴染みがない場合は、まずGGUFとは何かを確認してください。同じメモリ容量で動作するほかのモデルについては、16 GBのMacに最適なローカルLLMをご覧ください。
Atomic ChatでGranite-4.0-H-Smallを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでGranite-4.0-H-Smallを検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを開始します。
同じファミリーの小型モデルも同じ方法で実行できます。ローカルで実行できるすべてのGraniteモデル、またはローカルモデルカタログにあるほかのモデルをご覧ください。
Granite-4.0-H-Smallのライセンス
Granite-4.0-H-SmallはApache 2.0で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。また、IBMによると、ユーザーはGranite 4.0モデルを、対応する12言語以外の言語向けにもファインチューニングできます。IBMは注意点を1つ挙げています。モデルは安全性を考慮してアラインメントされていますが、それでも不正確、偏向的、または安全でない応答を生成する可能性があるため、用途に応じた安全性テストと調整を各自で実施してください。
