K2 Horizon MoVA-36B-A4B

更新
04.10.2026
思考
ツール利用
推論
コード生成

IFMのK2 Horizon MoVA-36B-A4B:512Kのコンテキスト長、疎な重み、サーバー構成を解説します。Atomic Chatでの対応はまだ確認されていません。

基本情報

  • ライセンス: Apache-2.0(モデルカードによる)
  • パラメータ数: 総パラメータ数36Bクラス、トークンあたりのアクティブパラメータ数4B
  • コンテキスト長: 524,288トークン、中間学習段階からネイティブ対応
  • モダリティ: テキスト入力・出力
  • 最小ハードウェア要件: 未測定。BF16ファイルだけで74.89 GBあり、さらに実行時のメモリが必要です

K2 Horizon MoVA-36B-A4Bとは?

K2 Horizon MoVA 36B-A4Bは、Mixture-of-ExpertsモデルとIFMのMixture-of-Valuesアテンションを組み合わせたモデルです。IFMによると、総パラメータ数は36B、トークンあたりのアクティブパラメータ数は約4Bで、コンテキスト長は512Kです。最終チェックポイントは、テキスト推論とエージェントワークフロー向けに公開されています。

仕様K2 Horizon MoVA-36B-A4B
パラメータ数総パラメータ数36Bクラス、トークンあたりのアクティブパラメータ数4B
アーキテクチャMixture-of-Valuesアテンションを備えたMixture-of-Experts
レイヤー数48
コンテキスト長524,288トークン、中間学習段階からネイティブ対応
モダリティテキスト入力・出力
リリース状況最終チェックポイント公開済み
ライセンスApache-2.0(モデルカードによる)

接尾辞のA4Bは、計算に使われるパラメータ数を表しており、ダウンロードするモデルが4Bであることを意味しません。保存されているパラメータ全体は約37.445Bです。構成は48レイヤー、ルーティング対象のエキスパート100個で、トークンごとに8個が選択され、これに共有エキスパートが加わります。MoVAはアテンション内でもバリューエキスパートを選択します。これは追加のアーキテクチャ上の特徴であり、MoEの別名ではありません。

K2 Horizon MoVA-36B-A4Bのベンチマーク

IFMは、これらのパーセント表示のスコアを、Artificial Analysisの参考スコアとともに公開しています。モデルカードによると、Muse Glimmer-30Bは高い推論強度を使用し、比較対象のほかのオープンモデルは推論モードを使用しています。これらは、量子化したモデルをAtomic Chatで実行した際のベンチマークではありません。出典:公式モデルカード。

ベンチマークK2-Horizon-MoVA-36B-A4BNemotron 3 UltraNemotron 3 SuperG9v3-39A5BQwen3.6-35B-A3BMuse Glimmer-30BGemma 4 31B-it
tau3-Banking
銀行業務エージェント
26.814.210.322.19.323.514.8
Terminal-Bench 2.1
ターミナル操作エージェント
58.653.938.632.644.951.743.4
SciCode
科学分野のコーディング
38.939.936.034.035.843.643.4
Humanity's Last Exam(ツールなし)
専門的な設問
25.228.420.817.522.222.023.6
GPQA Diamond
専門的な科学知識
80.886.780.080.584.183.585.7
AA-LCR
長いコンテキストでの推論
66.371.060.362.066.780.068.3

MoVAは、tau3-BankingとTerminal-Bench 2.1で、掲載されている比較対象を上回っています。一方、GPQA Diamondと長いコンテキストでの推論では、比較対象のいくつかを下回っています。アクティブパラメータ数4Bという数値はアーキテクチャの理解に役立ちますが、スループットを測定しなければ、お使いのハードウェアで速度面の優位性があるとは判断できません。

K2 Horizon MoVA-36B-A4Bのハードウェア要件

元の重みの分割ファイルは合計74.89 GB、公式BF16 GGUFは合計74.92 GBです。このGGUFのファイル名はK2-Horizon-36B-BF16.ggufで、リポジトリではMoVA 36B-A4Bを変換したものとされています。どちらも、特定のトークンで選択されないエキスパートを含め、重み全体を収録しています。

精度配布元ディスク上のサイズ
BF16 SafetensorsIFM/K2-Horizon-MoVA-36B-A4B74.89 GB
BF16 GGUF(公式)IFM/K2-Horizon-MoVA-36B-A4B-GGUF
K2-Horizon-36B-BF16.gguf
74.92 GB

BF16の重み全体は64 GBを超えます。IFMは、モデル固有のルーター設定の上書きを含む、H200を2基使用したSGLangの構成手順を検証しています。数値的な挙動を確認する際は、その構成手順に合わせてください。この構成は必要最小限のGPU数を示すものではなく、512Kのコンテキスト用キャッシュはディスク上の合計サイズとは別に必要です。

サイズは10進表記のGBで、重みのみを対象としています。形式の違いについては、GGUFとはをご覧ください。これらのビルドでは実行時に必要な最小メモリ容量が測定されていないため、メモリ容量の区分は記載していません。

Atomic ChatでK2 Horizon MoVA-36B-A4Bを実行する方法

このチェックポイントをAtomic Chatで実行できるかは、まだ確認されていません。IFMの公式GGUFモデルカードでは、K2 Horizonアーキテクチャに対応したllama.cppビルドが必要とされ、IFMの開発用フォークが案内されています。これらのファイルをダウンロードする前に、アーキテクチャへの対応を確認してください。通常の検索、ダウンロード、チャット開始という流れは、このモデルではまだ検証済みの手順ではありません。ほかのチェックポイントと、文書化されたダウンロード方法については、モデルカタログをご覧ください。

K2 Horizon MoVA-36B-A4Bのライセンス

IFMは公式モデルカードで、このチェックポイントのライセンスをApache-2.0と記載しています。ライセンスの確認には公開元のリリース情報を参照し、実際に再配布するビルドに付属する追加の通知事項も確認してください。コミュニティによる変換版は、Atomic Chatのリリースではありません。

出典とファイル一覧の確認日:2026年9月15日。

Hugging Faceからモデルをダウンロード

# ダウンロードのみ。先にディスクの空き容量を確認してください。
hf download IFM/K2-Horizon-MoVA-36B-A4B --revision de2d2efb32ed7639b7140bccbefe131a0063a982

ポート8000で稼働する互換性のあるローカルサーバーの場合:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"IFM/K2-Horizon-MoVA-36B-A4B","messages":[{"role":"user","content":"Write tests for a function that parses a CSV row."}],"temperature":1,"top_p":0.95,"max_tokens":32768,"chat_template_kwargs":{"reasoning_effort":"high"}}'

先にOpenAI Pythonクライアントをインストールし、互換性のあるローカルサーバーを起動してください。

from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="local")
result = client.chat.completions.create(
    model="IFM/K2-Horizon-MoVA-36B-A4B",
    messages=[{"role": "user", "content": "Write tests for a CSV parser."}],
    temperature=1.0, top_p=0.95, max_tokens=32768,
    extra_body={"chat_template_kwargs": {"reasoning_effort": "high"}},
)
print(result.choices[0].message.content)

互換性のあるローカルサーバーとOpenAI JavaScriptクライアントが必要です。

import OpenAI from "openai";
const client = new OpenAI({baseURL: "http://127.0.0.1:8000/v1", apiKey: "local"});
const result = await client.chat.completions.create({
  "model": "IFM/K2-Horizon-MoVA-36B-A4B",
  "messages": [
    {
      "role": "user",
      "content": "Write tests for a function that parses a CSV row."
    }
  ],
  "temperature": 1,
  "top_p": 0.95,
  "max_tokens": 32768,
  "chat_template_kwargs": {
    "reasoning_effort": "high"
  }
});
console.log(result.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

K2 Horizon MoVA 36B-A4Bは、Mixture-of-ExpertsモデルとIFMのMixture-of-Valuesアテンションを組み合わせたモデルです。IFMによると、総パラメータ数は36B、トークンあたりのアクティブパラメータ数は約4Bで、コンテキスト長は512Kです。最終チェックポイントは、テキスト推論とエージェントワークフロー向けに公開されています。

このチェックポイントをAtomic Chatで実行できるかは、まだ確認されていません。公式GGUFには、K2 Horizonに対応したllama.cppビルドが必要です。GGUFをダウンロードできるというだけでは、アプリが読み込めることは確認できません。

元のBF16重みファイルは合計74.89 GBです。これはディスク使用量であり、検証済みの最小RAM容量やVRAM容量ではありません。推論エンジン用のメモリと、コンテキストに応じて増大するキャッシュ用のメモリも必要です。

いいえ。各トークンの計算に約4Bのパラメータが使われるという意味です。保存されているパラメータ全体は約37.445Bで、BF16 Safetensorsファイルは74.89 GBを占めます。重みの使用メモリに加えて、実行時のメモリとアテンションキャッシュも必要です。

IFMは公式モデルカードで、このチェックポイントのライセンスをApache-2.0と記載しています。ライセンスの確認には公開元のリリース情報を参照し、実際に再配布するビルドに付属する追加の通知事項も確認してください。コミュニティによる変換版は、Atomic Chatのリリースではありません。