Kimi-K2-Instruct-0905とは?
Kimi-K2-Instruct-0905は、Moonshot AIが2025年9月に公開したKimi K2の更新版です。総パラメータ数1T、トークンごとに有効になるパラメータ数32BのMixture-of-Experts型言語モデルです。0905ビルドは、エージェントによるコーディングに明確に重点を置いています。Moonshotは、公開ベンチマークと実際のコーディングエージェントのタスクにおける性能向上、フロントエンドの出力品質の改善、長期にわたる作業に向けたコンテキスト長の128Kから256Kトークンへの拡張を報告しています。重みはModified MITライセンスで公開されているため、十分に大規模なハードウェアさえあれば、モデル全体を自分のハードウェアで実行できます。
| 仕様 | Kimi-K2-Instruct-0905 |
|---|---|
| アーキテクチャ | Mixture-of-Experts(MoE) |
| 総パラメータ数 | 1T |
| 有効パラメータ数 | 32B |
| 層数 | 61(うち1層がデンス層) |
| エキスパート | 384個, トークンごとに8個を選択, 1個を共有 |
| アテンション | MLA, 64ヘッド |
| アテンションの隠れ次元数 | 7168 |
| MoEのエキスパートあたりの隠れ次元数 | 2048 |
| 活性化関数 | SwiGLU |
| コンテキスト長 | 256Kトークン |
| 語彙数 | 160K |
| チェックポイント形式 | Block-FP8 |
| 推奨temperature | 0.6 |
| リリース日 | 2025年9月3日 |
| ライセンス | Modified MIT |
総数1Tのパラメータのうち、各トークンの処理で働くのは32Bだけです。ルーターが384個のエキスパートから8個を選び、それに加えて、すべてのトークンが通る1個の共有エキスパートを使います。各エキスパートは隠れユニット数2048と幅が狭く、一方、アテンションは隠れ次元数7168、64ヘッドで、MLAを使用し、うち1層がデンス層である全61層にわたって動作します。トークンあたりの計算量は32Bモデルの水準にとどまりますが、メモリには依然として1Tの重み全体を保持する必要があります。そのため、以下のハードウェア表では必要な容量が数十GBではなく数百GB単位になっています。
Kimi-K2-Instruct-0905のベンチマーク
Moonshot AIがリリース時に公表した数値は、テストセット全体を5回実行した平均値です。0905ビルドを、前バージョンのK2-Instruct-0711、競合の3モデル、およびClaude Sonnet 4と比較しています。
| ベンチマーク | Kimi-K2-Instruct-0905 | K2-Instruct-0711 | Qwen3-Coder-480B-A35B | GLM-4.5 | DeepSeek-V3.1 | Claude Sonnet 4 |
|---|---|---|---|---|---|---|
SWE-bench Verified ソフトウェア開発 | 69.2 | 65.8 | 69.6 | 64.2 | 66.0 | 72.7 |
SWE-bench Multilingual 多言語でのソフトウェア開発 | 55.9 | 47.3 | 54.7 | 52.7 | 54.5 | 53.3 |
Multi-SWE-Bench 言語横断のソフトウェア開発 | 33.5 | 31.3 | 32.7 | 31.7 | 29.0 | 35.7 |
Terminal-Bench ターミナル操作エージェント | 44.5 | 37.5 | 37.5 | 39.9 | 31.3 | 36.4 |
SWE-Dev 機能開発 | 66.6 | 61.9 | 64.7 | 63.2 | 53.3 | 67.1 |
0905ビルドはTerminal-BenchとSWE-bench Multilingualで単独首位となり、すべての行で0711を上回っています。一方、SWE-bench Verified、Multi-SWE-Bench、SWE-DevではClaude Sonnet 4が首位を維持しています。表にあるオープンモデルの中では、Qwen3-Coderが0.4ポイント上回るSWE-bench Verifiedを除き、すべてで首位です。
ここでは評価方法も重要です。Moonshotは各実行の前にリポジトリを整理し、対象コミットから到達できないGitオブジェクトをすべて削除します。そのため、エージェントが参照できるのは、その時点で存在していたコードだけです。SWE-Devでは、エージェントが実装すべき関数を検証するテストファイルも削除し、想定される実装への手がかりを取り除いています。Terminus-2で実行するTerminal-Benchを除くすべての結果は、SWE-agentをベースにした社内製の評価ハーネスによるものです。このハーネスでは、BashツールとEditツールのコンテキスト長を制限し、タスクに合わせてシステムプロンプトを書き換えています。また、一部の比較対象の数値は再実行した結果ではなく、他社の報告から引用しています。Moonshotはツール呼び出しの性能も高いと主張しています。リクエストごとに利用可能なツールを渡すと、いつ、どのように呼び出すかをモデルが自ら判断します。この機能には、Kimi K2のネイティブなツール呼び出しの解析に対応したエンジンが必要です。
Kimi-K2-Instruct-0905のハードウェア要件
システム要件で確認すべきなのはメモリです。このモデルでは、RAMとVRAMの合計で数百GBが必要です。コミュニティ製のGGUFビルドはunsloth/Kimi-K2-Instruct-0905-GGUFで配布されています。以下の各サイズは、そのビルドの分割ファイルを合計したものです。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 256 GB | UD-TQ1_0 | 248.6 GB |
| 320 GB | UD-IQ1_M | 304.8 GB |
| 384 GB | UD-IQ2_M | 349.1 GB |
| 448 GB | UD-IQ3_XXS | 417.3 GB |
| 512 GB | UD-Q3_K_XL | 452.4 GB |
| 640 GB | UD-Q4_K_XL | 588.1 GB |
| 768 GB | UD-Q5_K_XL | 734.1 GB |
| 1 TB以上 | UD-Q6_K_XL | 879.1 GB |
記載のサイズは重みだけの容量です。ファイルサイズとメモリ容量の上限との差は、KVキャッシュ用に空けておいてください。2つのビルドがどちらも余裕を持って収まる場合は、大きい方を選びます。各段階の容量差は均等ではありません。UD-IQ2_MからUD-TQ1_0に下げると約100 GB減りますが、この最小容量側の範囲で品質が最も急激に低下します。そのため、UD-IQ2_Mより下を選ぶのは、メモリがどうしても足りない場合だけにしてください。同じリポジトリには、2053.2 GBのBF16まで用意されています。Moonshotは、vLLM、SGLang、KTransformers、TensorRT-LLM向けにオリジナルのblock-FP8チェックポイントを配布しており、最初の2つについてはデプロイ例も提供しています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでKimi-K2-Instruct-0905を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでKimi-K2-Instruct-0905を検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
Moonshotはtemperatureを0.6に設定し、デフォルトのシステムプロンプトとして"You are Kimi, an AI assistant created by Moonshot AI."を使うことを推奨しています。
ファミリーのほかのモデルについては、ローカルで実行できるKimiモデルの一覧、または本リリースが置き換える旧版のKimi-K2-Instructをご覧ください。上の容量別一覧を見て実行が難しい場合は、当サイトのローカルLLMカタログに、より小さなモデルがあります。
Kimi-K2-Instruct-0905のライセンス
コードリポジトリとモデルの重みは、どちらもModified MIT Licenseで提供されています。ベースは、制約が最も少ないライセンスの1つであるMITです。Modifiedという部分は、Moonshot AIが独自の条件を追加していることを意味します。そのため、この重みを使って商用製品を開発する前に、Hugging FaceリポジトリのLICENSEファイルを読んでください。
