Kimi-K2-Instructとは?
Kimi-K2-Instructは、Moonshot AIのMixture-of-ExpertsモデルであるKimi K2に事後学習を施したチャットモデルです。総パラメータ数は1Tで、トークンごとに32Bがアクティブになります。重みは2025年7月11日にHugging Faceで公開され、block-fp8形式で保存されており、Modified MIT Licenseの下でリリースされています。Moonshotは、ツール利用、推論、自律的な問題解決といったエージェント用途に向けてこのモデルを開発しました。また、同社は「反射的に応答するモデル」とも表現しており、長い思考段階を挟まずに直接回答することを意味します。
| 仕様 | Kimi-K2-Instruct |
|---|---|
| 総パラメータ数 | 1T |
| アクティブパラメータ数 | 32B |
| アーキテクチャ | Mixture-of-Experts、384個のエキスパートからトークンごとに8個を選択し、共有エキスパート1個を併用 |
| 層数 | 61(うち1層はデンス層) |
| アテンション | MLA |
| コンテキスト長 | 128Kトークン |
| 語彙数 | 160K |
| モダリティ | テキスト |
| 推奨temperature | 0.6 |
| リリース日 | 2025年7月11日 |
| ライセンス | Modified MIT |
総パラメータ数1Tのうち、各トークンの処理で動作するのは32Bだけです。ルーターが384個のエキスパートから8個を選び、常に動作する共有エキスパートを併用します。Moonshotは15.5兆トークンで事前学習を行い、学習の不安定化は一度も発生しなかったとしています。同社はこれをMuonClipの成果としています。MuonClipは、規模拡大に伴う不安定性を解消する新たな手法とともに、Muonオプティマイザーを同社が前例のない規模と呼ぶ大きさで適用したものです。その結果、このモデルはツール呼び出しを標準でサポートしています。各リクエストでツールの一覧を渡すと、モデルが呼び出すタイミングと方法を判断します。
Kimi-K2-Instructのベンチマーク
モデルカードに掲載されたMoonshotのリリース時の数値では、Kimi-K2-InstructをDeepSeek-V3-0324、非思考モードのQwen3-235B-A22B、拡張思考を無効にしたClaude Sonnet 4およびClaude Opus 4、GPT-4.1と比較しています。提供元の表にはGemini 2.5 Flash Previewの列もありますが、以下のどの行でも首位にはなっていません。
| ベンチマーク | Kimi-K2-Instruct | DeepSeek-V3-0324 | Qwen3-235B-A22B | Claude Sonnet 4 | Claude Opus 4 | GPT-4.1 |
|---|---|---|---|---|---|---|
LiveCodeBench v6 競技プログラミング | 53.7 | 46.9 | 37.0 | 48.5 | 47.4 | 44.7 |
SWE-bench Verified ソフトウェアエンジニアリング | 65.8 | 38.8 | 34.4 | 72.7 | 72.5 | 54.6 |
Tau2 telecom エージェントのツール利用 | 65.8 | 32.5 | 22.1 | 45.2 | 57.0 | 38.6 |
AceBench 関数呼び出し | 76.5 | 72.7 | 70.5 | 76.2 | 75.6 | 80.1 |
AIME 2025 数学コンテスト | 49.5 | 46.7 | 24.7 | 33.1 | 33.9 | 37.0 |
GPQA-Diamond 専門科学知識 | 75.1 | 68.4 | 62.9 | 70.0 | 74.9 | 66.3 |
MMLU 一般知識 | 89.5 | 89.4 | 87.0 | 91.5 | 92.9 | 90.4 |
Kimi-K2-Instructは7項目中4項目で首位となり、残りの項目でも僅差につけています。MMLUではClaude Opus 4、エージェントとして実行したSWE-bench VerifiedではClaude Sonnet 4、AceBenchではGPT-4.1が首位です。ここでのSWE-benchのスコアは、bashとエディターツールを使った1回の試行によるものです。複数回の試行と内部の採点モデルを使った場合、Moonshotは71.6と報告しています。
Kimi-K2-Instructのハードウェア要件
確認すべきシステム要件はメモリです。この規模では、サーバーか非常に大規模なワークステーションが必要になります。最小のGGUFビルドでも、サイズは約4分の1テラバイトあります。実際のファイル一覧を確認できるコミュニティ製の量子化版は、unsloth/Kimi-K2-Instruct-GGUFにあります。以下のサイズは、そのリポジトリにある分割ファイルの合計です。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 256 GB | UD-TQ1_0 | 243.6 GB |
| 320 GB | UD-IQ1_M | 304.2 GB |
| 384 GB | UD-IQ2_M | 347.1 GB |
| 512 GB | UD-Q3_K_XL | 452.1 GB |
| 640 GB以上 | UD-Q4_K_XL | 587.1 GB |
ファイルサイズに加えて、KVキャッシュ用のメモリの余裕を確保してください。2つのビルドがどちらも収まる場合は、大きい方を選んでください。元のblock-fp8チェックポイントについて、MoonshotはvLLM、SGLang、KTransformers、TensorRT-LLMを推奨しています。量子化版を使う方法に不慣れな方は、まずGGUFとは何かをご覧ください。
Atomic ChatでKimi-K2-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでKimi-K2-Instructを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを始めます。
その後、Moonshotは更新版チェックポイントのKimi-K2-Instruct-0905を公開しました。同じファミリーのほかのモデルは、当サイトのKimiモデルページに掲載しています。
Kimi-K2-Instructのライセンス
コードリポジトリとモデルの重みは、どちらもModified MIT Licenseの下で公開されています。Hugging Faceのメタデータにはlicense: other、license_name: modified-mitと記載されています。Moonshotはモデルカードで条項を詳しく説明していないため、この重みを使った製品をリリースする前に、リポジトリのLICENSEファイルを読んでください。
