Kimi-K2-Instruct

更新
04.10.2026
ツール利用
コード生成
推論
多言語

Moonshot AIの総パラメータ数1T、アクティブパラメータ数32BのMoEチャットモデルです。エージェントによるツール利用と高いコーディング性能を目指して開発されました。

基本情報

  • ライセンス: Modified MIT
  • パラメータ数: 総数1T、アクティブ32B(MoE)
  • コンテキスト長: 128Kトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: 最小のGGUFビルド(UD-TQ1_0)には合計約244 GBのメモリが必要

Kimi-K2-Instructとは?

Kimi-K2-Instructは、Moonshot AIのMixture-of-ExpertsモデルであるKimi K2に事後学習を施したチャットモデルです。総パラメータ数は1Tで、トークンごとに32Bがアクティブになります。重みは2025年7月11日にHugging Faceで公開され、block-fp8形式で保存されており、Modified MIT Licenseの下でリリースされています。Moonshotは、ツール利用、推論、自律的な問題解決といったエージェント用途に向けてこのモデルを開発しました。また、同社は「反射的に応答するモデル」とも表現しており、長い思考段階を挟まずに直接回答することを意味します。

仕様Kimi-K2-Instruct
総パラメータ数1T
アクティブパラメータ数32B
アーキテクチャMixture-of-Experts、384個のエキスパートからトークンごとに8個を選択し、共有エキスパート1個を併用
層数61(うち1層はデンス層)
アテンションMLA
コンテキスト長128Kトークン
語彙数160K
モダリティテキスト
推奨temperature0.6
リリース日2025年7月11日
ライセンスModified MIT

総パラメータ数1Tのうち、各トークンの処理で動作するのは32Bだけです。ルーターが384個のエキスパートから8個を選び、常に動作する共有エキスパートを併用します。Moonshotは15.5兆トークンで事前学習を行い、学習の不安定化は一度も発生しなかったとしています。同社はこれをMuonClipの成果としています。MuonClipは、規模拡大に伴う不安定性を解消する新たな手法とともに、Muonオプティマイザーを同社が前例のない規模と呼ぶ大きさで適用したものです。その結果、このモデルはツール呼び出しを標準でサポートしています。各リクエストでツールの一覧を渡すと、モデルが呼び出すタイミングと方法を判断します。

Kimi-K2-Instructのベンチマーク

モデルカードに掲載されたMoonshotのリリース時の数値では、Kimi-K2-InstructをDeepSeek-V3-0324、非思考モードのQwen3-235B-A22B、拡張思考を無効にしたClaude Sonnet 4およびClaude Opus 4、GPT-4.1と比較しています。提供元の表にはGemini 2.5 Flash Previewの列もありますが、以下のどの行でも首位にはなっていません。

ベンチマークKimi-K2-InstructDeepSeek-V3-0324Qwen3-235B-A22BClaude Sonnet 4Claude Opus 4GPT-4.1
LiveCodeBench v6
競技プログラミング
53.746.937.048.547.444.7
SWE-bench Verified
ソフトウェアエンジニアリング
65.838.834.472.772.554.6
Tau2 telecom
エージェントのツール利用
65.832.522.145.257.038.6
AceBench
関数呼び出し
76.572.770.576.275.680.1
AIME 2025
数学コンテスト
49.546.724.733.133.937.0
GPQA-Diamond
専門科学知識
75.168.462.970.074.966.3
MMLU
一般知識
89.589.487.091.592.990.4

Kimi-K2-Instructは7項目中4項目で首位となり、残りの項目でも僅差につけています。MMLUではClaude Opus 4、エージェントとして実行したSWE-bench VerifiedではClaude Sonnet 4、AceBenchではGPT-4.1が首位です。ここでのSWE-benchのスコアは、bashとエディターツールを使った1回の試行によるものです。複数回の試行と内部の採点モデルを使った場合、Moonshotは71.6と報告しています。

Kimi-K2-Instructのハードウェア要件

確認すべきシステム要件はメモリです。この規模では、サーバーか非常に大規模なワークステーションが必要になります。最小のGGUFビルドでも、サイズは約4分の1テラバイトあります。実際のファイル一覧を確認できるコミュニティ製の量子化版は、unsloth/Kimi-K2-Instruct-GGUFにあります。以下のサイズは、そのリポジトリにある分割ファイルの合計です。

メモリ選ぶビルドファイルサイズ
256 GBUD-TQ1_0243.6 GB
320 GBUD-IQ1_M304.2 GB
384 GBUD-IQ2_M347.1 GB
512 GBUD-Q3_K_XL452.1 GB
640 GB以上UD-Q4_K_XL587.1 GB

ファイルサイズに加えて、KVキャッシュ用のメモリの余裕を確保してください。2つのビルドがどちらも収まる場合は、大きい方を選んでください。元のblock-fp8チェックポイントについて、MoonshotはvLLM、SGLang、KTransformers、TensorRT-LLMを推奨しています。量子化版を使う方法に不慣れな方は、まずGGUFとは何かをご覧ください。

Atomic ChatでKimi-K2-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでKimi-K2-Instructを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを始めます。

その後、Moonshotは更新版チェックポイントのKimi-K2-Instruct-0905を公開しました。同じファミリーのほかのモデルは、当サイトのKimiモデルページに掲載しています。

Kimi-K2-Instructのライセンス

コードリポジトリとモデルの重みは、どちらもModified MIT Licenseの下で公開されています。Hugging Faceのメタデータにはlicense: other、license_name: modified-mitと記載されています。Moonshotはモデルカードで条項を詳しく説明していないため、この重みを使った製品をリリースする前に、リポジトリのLICENSEファイルを読んでください。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download moonshotai/Kimi-K2-Instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "moonshotai/Kimi-K2-Instruct", "messages": [{"role": "user", "content": "Hello"}]}'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("moonshotai/Kimi-K2-Instruct", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("moonshotai/Kimi-K2-Instruct", trust_remote_code=True)
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "moonshotai/Kimi-K2-Instruct",
  messages: [{ role: "user", content: "Hello" }]
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Kimi-K2-Instructは、Moonshot AIが事後学習と指示チューニングを施した大規模言語モデルです。総パラメータ数1T、トークンごとのアクティブパラメータ数32BのMixture-of-Expertsモデルで、汎用的なチャットとエージェントによるツール利用に向けて調整されています。Moonshotは、長い思考連鎖を伴わず、反射的に応答するモデルと説明しています。

Kimi-K2-Instructはモデル全体のパラメータ数が1Tあるため、ローカルでの実行には高いハードウェア要件が伴います。重みはblock-fp8形式で提供されますが、それでも約1 TBを占めるため、fp8でも合計数百ギガバイトのVRAMを備えたマルチGPUサーバーが1台必要です。多くの人は個人のハードウェアではなく、ホスティング型の推論サービスやMoonshot独自のAPIを通じて利用しています。

はい。Moonshot AIはコードとモデルの重みの両方をModified MIT Licenseの下で公開しており、チェックポイントはHugging Faceで入手できます。このライセンスは商用利用を認めています。主な追加条件は、非常に大規模な商用展開に適用される帰属表示条項です。Moonshotの有料APIを通じて利用することもできます。

Kimi-K2-Instructは128Kトークンのコンテキスト長に対応しています。61層にわたってMulti-head Latent Attention(MLA)を使用し、モデルの規模に対して長いコンテキストでの推論を効率的に保つのに役立っています。

Kimi-K2-Instructは、コーディングとツール利用に特化して調整されています。bashとエディターツールを使用し、試行は1回、テスト時の追加計算なしという条件で、SWE-bench Verifiedではpass@1で65.8%、SWE-bench Multilingualでは47.3%を記録しています。また、ツール呼び出しを標準でサポートしており、各リクエストで利用可能なツールを渡すと、モデルが呼び出すタイミングを判断します。