Kimi-K2-Instruct-0905

更新
04.10.2026
ツール利用
推論
コード生成

1TパラメータのMoEモデル、Kimi-K2-Instruct-0905をAtomic Chatでローカル実行できます。プライバシーを保ちながら、オフラインでエージェントによるツール利用が可能です。APIキーもクラウドも不要です。無料で使えます。

基本情報

  • ライセンス: Modified MIT
  • パラメータ数: 合計1T, 有効32B(MoE)
  • コンテキスト長: 256Kトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: 最小のGGUF(UD-TQ1_0)でRAMとVRAMの合計が約249 GB

Kimi-K2-Instruct-0905とは?

Kimi-K2-Instruct-0905は、Moonshot AIが2025年9月に公開したKimi K2の更新版です。総パラメータ数1T、トークンごとに有効になるパラメータ数32BのMixture-of-Experts型言語モデルです。0905ビルドは、エージェントによるコーディングに明確に重点を置いています。Moonshotは、公開ベンチマークと実際のコーディングエージェントのタスクにおける性能向上、フロントエンドの出力品質の改善、長期にわたる作業に向けたコンテキスト長の128Kから256Kトークンへの拡張を報告しています。重みはModified MITライセンスで公開されているため、十分に大規模なハードウェアさえあれば、モデル全体を自分のハードウェアで実行できます。

仕様Kimi-K2-Instruct-0905
アーキテクチャMixture-of-Experts(MoE)
総パラメータ数1T
有効パラメータ数32B
層数61(うち1層がデンス層)
エキスパート384個, トークンごとに8個を選択, 1個を共有
アテンションMLA, 64ヘッド
アテンションの隠れ次元数7168
MoEのエキスパートあたりの隠れ次元数2048
活性化関数SwiGLU
コンテキスト長256Kトークン
語彙数160K
チェックポイント形式Block-FP8
推奨temperature0.6
リリース日2025年9月3日
ライセンスModified MIT

総数1Tのパラメータのうち、各トークンの処理で働くのは32Bだけです。ルーターが384個のエキスパートから8個を選び、それに加えて、すべてのトークンが通る1個の共有エキスパートを使います。各エキスパートは隠れユニット数2048と幅が狭く、一方、アテンションは隠れ次元数7168、64ヘッドで、MLAを使用し、うち1層がデンス層である全61層にわたって動作します。トークンあたりの計算量は32Bモデルの水準にとどまりますが、メモリには依然として1Tの重み全体を保持する必要があります。そのため、以下のハードウェア表では必要な容量が数十GBではなく数百GB単位になっています。

Kimi-K2-Instruct-0905のベンチマーク

Moonshot AIがリリース時に公表した数値は、テストセット全体を5回実行した平均値です。0905ビルドを、前バージョンのK2-Instruct-0711、競合の3モデル、およびClaude Sonnet 4と比較しています。

ベンチマークKimi-K2-Instruct-0905K2-Instruct-0711Qwen3-Coder-480B-A35BGLM-4.5DeepSeek-V3.1Claude Sonnet 4
SWE-bench Verified
ソフトウェア開発
69.265.869.664.266.072.7
SWE-bench Multilingual
多言語でのソフトウェア開発
55.947.354.752.754.553.3
Multi-SWE-Bench
言語横断のソフトウェア開発
33.531.332.731.729.035.7
Terminal-Bench
ターミナル操作エージェント
44.537.537.539.931.336.4
SWE-Dev
機能開発
66.661.964.763.253.367.1

0905ビルドはTerminal-BenchとSWE-bench Multilingualで単独首位となり、すべての行で0711を上回っています。一方、SWE-bench Verified、Multi-SWE-Bench、SWE-DevではClaude Sonnet 4が首位を維持しています。表にあるオープンモデルの中では、Qwen3-Coderが0.4ポイント上回るSWE-bench Verifiedを除き、すべてで首位です。

ここでは評価方法も重要です。Moonshotは各実行の前にリポジトリを整理し、対象コミットから到達できないGitオブジェクトをすべて削除します。そのため、エージェントが参照できるのは、その時点で存在していたコードだけです。SWE-Devでは、エージェントが実装すべき関数を検証するテストファイルも削除し、想定される実装への手がかりを取り除いています。Terminus-2で実行するTerminal-Benchを除くすべての結果は、SWE-agentをベースにした社内製の評価ハーネスによるものです。このハーネスでは、BashツールとEditツールのコンテキスト長を制限し、タスクに合わせてシステムプロンプトを書き換えています。また、一部の比較対象の数値は再実行した結果ではなく、他社の報告から引用しています。Moonshotはツール呼び出しの性能も高いと主張しています。リクエストごとに利用可能なツールを渡すと、いつ、どのように呼び出すかをモデルが自ら判断します。この機能には、Kimi K2のネイティブなツール呼び出しの解析に対応したエンジンが必要です。

Kimi-K2-Instruct-0905のハードウェア要件

システム要件で確認すべきなのはメモリです。このモデルでは、RAMとVRAMの合計で数百GBが必要です。コミュニティ製のGGUFビルドはunsloth/Kimi-K2-Instruct-0905-GGUFで配布されています。以下の各サイズは、そのビルドの分割ファイルを合計したものです。

メモリ選択するビルドファイルサイズ
256 GBUD-TQ1_0248.6 GB
320 GBUD-IQ1_M304.8 GB
384 GBUD-IQ2_M349.1 GB
448 GBUD-IQ3_XXS417.3 GB
512 GBUD-Q3_K_XL452.4 GB
640 GBUD-Q4_K_XL588.1 GB
768 GBUD-Q5_K_XL734.1 GB
1 TB以上UD-Q6_K_XL879.1 GB

記載のサイズは重みだけの容量です。ファイルサイズとメモリ容量の上限との差は、KVキャッシュ用に空けておいてください。2つのビルドがどちらも余裕を持って収まる場合は、大きい方を選びます。各段階の容量差は均等ではありません。UD-IQ2_MからUD-TQ1_0に下げると約100 GB減りますが、この最小容量側の範囲で品質が最も急激に低下します。そのため、UD-IQ2_Mより下を選ぶのは、メモリがどうしても足りない場合だけにしてください。同じリポジトリには、2053.2 GBのBF16まで用意されています。Moonshotは、vLLM、SGLang、KTransformers、TensorRT-LLM向けにオリジナルのblock-FP8チェックポイントを配布しており、最初の2つについてはデプロイ例も提供しています。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでKimi-K2-Instruct-0905を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでKimi-K2-Instruct-0905を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

Moonshotはtemperatureを0.6に設定し、デフォルトのシステムプロンプトとして"You are Kimi, an AI assistant created by Moonshot AI."を使うことを推奨しています。

ファミリーのほかのモデルについては、ローカルで実行できるKimiモデルの一覧、または本リリースが置き換える旧版のKimi-K2-Instructをご覧ください。上の容量別一覧を見て実行が難しい場合は、当サイトのローカルLLMカタログに、より小さなモデルがあります。

Kimi-K2-Instruct-0905のライセンス

コードリポジトリとモデルの重みは、どちらもModified MIT Licenseで提供されています。ベースは、制約が最も少ないライセンスの1つであるMITです。Modifiedという部分は、Moonshot AIが独自の条件を追加していることを意味します。そのため、この重みを使って商用製品を開発する前に、Hugging FaceリポジトリのLICENSEファイルを読んでください。

Hugging Faceからモデルをダウンロード

huggingface-cli download moonshotai/Kimi-K2-Instruct-0905
from transformers import AutoModel
model = AutoModel.from_pretrained("moonshotai/Kimi-K2-Instruct-0905")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Moonshot AIのKimi K2指示追従モデルの2025年9月リリース版です。総パラメータ数が約1T、トークンごとの有効パラメータ数が約32BのMixture-of-Experts型LLMです。チャット、ツール呼び出し、エージェントによるコーディング向けに調整されており、256Kトークンのコンテキスト長に対応しています。0905の更新では、コーディングエージェントとしての性能強化と、フロントエンドのコード生成の改善に重点が置かれました。

高いハードウェア性能が求められます。量子化されたGGUFビルドでも、システムRAMとVRAMの合計でおよそ250GB以上が必要で、高精度版にはさらに大きな容量が必要です。そのため、一般的なノートパソコンではなく、ワークステーションやサーバーを対象としています。一般的な目安は、RAMとVRAMの合計容量を、量子化版のサイズとほぼ同じにすることです。容量が足りなくてもモデルは動作しますが、層がディスクにオフロードされるため遅くなります。

はい。重みはHugging Faceで一般公開されており、無料でダウンロードできます。ライセンスはModified MIT Licenseで、Moonshot AIはカスタムライセンス("other")として掲載しています。ローカル実行にかかるのは自分のハードウェアと電気の費用だけで、トークンごとのAPI料金はかかりません。

はい。重みをダウンロードした後は、インターネット接続なしで完全にオフラインで実行できます。Atomic Chatではモデルがデバイス上で実行されるため、プロンプトやデータがマシンの外に出ることはありません。接続が必要なのは、モデルファイルを最初にダウンロードするときだけです。

最も得意なのは、ツールを呼び出しながら複数の手順からなるプログラミングタスクを計画し、実行する、エージェントによるコーディングです。0905リリースで改善されたフロントエンドの作業も含まれます。256Kのコンテキスト長により、大規模なコードベースや文書群を扱う長時間のセッションにも適しています。ツール呼び出しへの対応により、ローカルのエージェントや自動化処理を動かせます。