Kimi K3は、利用可能なオープンウェイトモデルの中でも特に高性能なモデルの1つで、重みが公開されたことでローカルで実行できるようになりました。このガイドでは、次の内容を説明します。
- Kimi K3とは
- Kimi K3をローカルとレンタルGPUで実行する方法
- Kimi K3の実行にかかる費用
私自身の経験に基づき、セットアップ中に遭遇しやすい問題もいくつか取り上げます。
Kimi K3とは?
Kimi K3は、Moonshot AIが開発したオープンウェイトのMixture-of-Experts(MoE)言語モデルで、コーディングと長期にわたるエージェント型タスク向けに設計されています。Kimi K3のリリース日は2026年7月16日で、この日にMoonshot AIがAPIアクセスを公開しました。その後、7月26日にKimi K3の重みが公開されました。
2026年時点で、Kimi K3はMoonshot AIの最大のオープンウェイトモデルです。Kimi K3の主な仕様は次のとおりです。
- 総パラメータ数2.8兆
- 100万トークンのコンテキスト長
- トークンあたりのアクティブパラメータ数1040億
- 896個のエキスパート
一般にフル精度でリリースされ、その後コミュニティによって量子化される多くの大規模言語モデルとは異なり、Kimi K3はネイティブのMXFP4形式で配布されています。エキスパートの重みは4ビット精度で保存され、アテンション層と共有エキスパートはBF16のままです。
Moonshot AIは、教師ありファインチューニングの段階から量子化を考慮した学習を用いてKimi K3を学習させたため、このモデルは最初から4ビットの重みでリリースされています。これらの形式について詳しくは、GGUFと量子化のガイドをご覧ください。
長いコンテキストでの推論は、前世代よりも計算コストを削減するために設計された新しいアテンション機構、Kimi Delta Attentionによって効率化されています。また、Kimi K3は推論機能が常に有効な状態で動作します。
Kimi K3のベンチマーク
次の表で、Kimi K3とほかの最先端モデルを比較します。
| モデル | Intelligence Index | GDPval-AA v2 Elo | 重みの公開 |
|---|---|---|---|
| Claude Fable 5 | 60 | 1760 | なし |
| GPT-5.6 Sol | 59 | 1712 | なし |
| Kimi K3 | 57 | 1668 | あり |
| Claude Opus 4.8 | 56 | 1600 | なし |
| GLM-5.2 | 51 | 1514 | あり |
| GPT-5.5 | 50 | 1494 | なし |
| Qwen 3.7 Max | 46 | 1442 | あり |
| DeepSeek V4 Pro | 44 | 1408 | あり |
| MiniMax M3 | 44 | 1396 | あり |
| Gemma 4 31B | 39 | 1284 | あり |
執筆時点で、Kimi K3はIntelligence Indexで4位に位置し、Claude Fable 5には及ばないものの、Opus 4.8を上回っています。ローカルで実行できるモデルとしては非常に優れた結果です。セルフホスト環境とサブスクリプションを比較検討している人にとって、さらに目を引くのはKimi K3とGPT-5.5の差です。K3のスコアは57で、GPT-5.5の50を上回り、この2つのうち重みが公開されているのはK3です。
さらに、開発者によるブラインドテストに基づいてモデルを順位付けするベンチマーク、Frontend Code Arenaでは、Kimi K3が1679ポイントを記録し、Claude Fable 5を上回りました。
Kimi K3をローカルで実行する方法
それでは、Kimi K3を自分のマシンで実行する方法を説明します。次の2つの方法を順に紹介します。
- Atomic Chatを使う
- レンタルGPUを使う
Kimi K3は最先端クラスのモデルで、ほとんどの人は自宅で実行できるハードウェアを持っていません。それでも、自分専用のインスタンスを起動する方法はあります。
一般向けハードウェアで快適に動作するモデルを探している場合は、ノートPCやデスクトップPCに適したサイズのモデルを紹介するコーディングに最適なローカルLLMのガイドをご覧ください。
Atomic ChatでKimi K3を実行する方法
まず、Kimi K3を実行する最も簡単な方法を紹介します。ただし、データセンター級のハードウェアを利用できることが条件です。
Atomic ChatでKimi K3を実行する方法を見ていきましょう。Atomic Chatは、私たちが開発した無料のオープンソースのデスクトップアプリで、Hugging Faceからオープンモデルをダウンロードし、ローカルで実行できます。あらゆるサイズのローカルLLMのビルドを実行する際に使うのと同じアプリで、K3の場合に変わるのは、それを支えるハードウェアの規模だけです。
ハードウェア要件に注意してください:公式のvLLMレシピでは、Kimi K3を提供するために約1680 GBのVRAMが必要です。自分のハードウェアで実行するには、およそ8× B300 NVIDIA GPUが必要になります。
| 構成 | VRAM | Kimi K3の提供可否 |
|---|---|---|
| RTX 5090 | 32 GB | 不可 |
| 8× H200 | 1128 GB | 不可 |
| 8× B200 | 1467 GB | 不可 |
| 8× B300 | 2149 GiB | 可 |
ステップ1:Atomic Chatをインストールする
Atomic Chatをダウンロードし、使用するプラットフォーム向けのビルドをインストールします。
- macOS:Apple Silicon向けのユニバーサル
.dmg - Windows:x64向けの
.exeインストーラー - Linux:x86_64向けの自己完結型
.AppImage。root権限は不要 - iOS:App Storeから入手
- Android:Google Playから入手
ステップ2:カタログでKimi K3を探す
Modelsタブを開き、kimi k3を検索します。

カタログはHugging Faceと連携しており、重みの公開後にリリースされたGGUF変換版が掲載されています。AtomicChat、GrEarl、Unsloth、Bullerwinsによるものも含まれます。
Downloadボタンがある項目は、アプリ内からダウンロードできます。View on HuggingFaceがある項目は、代わりにリポジトリが開きます。
ステップ3:モデルをダウンロードする
Download Optionsをクリックすると、リポジトリ内のファイルが一覧表示されます。

各行の00094という表記は、そのファイルが94個のシャードのうちの1つであることを示しており、各シャードのサイズは約9.4 GBです。すべてのシャードが1つの量子化版を構成しています。
| ビルド | 合計サイズ | シャード数 |
|---|---|---|
| オリジナルのMXFP4 | 1454 GiB | 96 |
GGUF IQ1_S | 528 GiB | 94 |
ここまで進めるとモデルが動作し、Atomic Chat内蔵のチャットでローカルでの対話ができるようになります。
これはほとんどの人にとって現実的ではありませんが、自分専用のKimi K3インスタンスを実行する方法はもう1つあります。GPUクラスターをレンタルする方法です。
レンタルGPUでKimi K3を実行する方法
レンタルGPUでKimi K3のインスタンスを実行できます。AIモデルの実行用ハードウェアを貸し出すサービスはいくつかありますが、このガイドでは、個々の提供者がマシンを時間単位で貸し出すマーケットプレイス、Vast.aiを使います。
注:今回は8× B300をレンタルします。これは1台のマシンに8枚のNVIDIA B300カードを搭載した構成で、合計2149 GiBのVRAMを利用できます。Kimi K3の提供には約1680 GBが必要なため、これがモデルを収容できる最小構成です。これらのマシンがプラットフォームに常に掲載されているとは限りません。私が実行した翌朝には、利用可能なものが1台もありませんでした。現在の空き状況は、次のコマンドで確認できます。
vastai search offers 'gpu_name in [B300,GB300] num_gpus>=8 rentable=true'
ステップ1:Vastのコンソールを開く
vast.aiを開き、Consoleをクリックします。

Loginをクリックしてサインインするか、アカウントを登録します。

ステップ2:クレジットを追加する
サイドバーでBillingを開き、Add Creditをクリックします。

少なくとも$150を追加してください。インスタンスが割り当てられた時点で課金が始まり、1.4 TBのダウンロード中も通常の時間料金がかかるため、空のインスタンスからモデルが動作する状態にするまでに約$100かかります。$200-250あれば、1回失敗しても対応できる余裕があります。
残高がゼロになると、Vastはダウンロード途中のインスタンスも含め、実行中のすべてのインスタンスを終了します。
ステップ3:8× B300で絞り込む
Searchを開き、次のフィルターを設定します。
- #GPUs:
8X - GPU:
B300。Data Center内にあります

Filter Optionsで、Disk Spaceを1900 GBに設定します。
ステップ4:テンプレートを選択する
インスタンスを作成する前に、テンプレートを選択する必要があります。
Select Templateをクリックします。

組み込みテンプレートは現在、kimi-k3イメージに対応していません。そのため、NVIDIA CUDAテンプレートをそのまま使うのではなく、これを基に変更します。Edit(鉛筆)アイコンをクリックしてください。
ステップ5:テンプレートを設定する
Edit Templateで、次の設定を行います。
イメージ
次のように設定します。
- Image:
vllm/vllm-openai - Tag:
kimi-k3
kimi-k3タグは現在、vLLMのナイトリーイメージでのみ利用できます。
Vastに緑色のImage foundという確認表示が出てから、次に進んでください。

起動モード
Launch ModeをSSHに設定します。
SSHモードでは、今回のセットアップには不要なデフォルトのJupyter設定を含まない、最小限のインスタンスが起動します。
ディスク容量
Disk Spaceを1900 GBに設定します。
Kimi K3には約1.9 TBのローカルストレージが必要です。それより小さいディスクでは、モデルのダウンロード中に容量が不足します。
ポート
デフォルトのJupyter用ポートを削除し、ポートを1つだけ追加します。
| ポート |
|---|
8000/TCP |
環境変数
既存の環境変数をすべて削除し、次の変数を追加します。
| 変数 | 値 |
|---|---|
VLLM_ENABLE_K3_LATENT_MOE_TAIL_FUSION | 1 |
HF_HUB_DISABLE_XET | 1 |

起動時スクリプト
Advanced Options内のOn-start scriptに、例示されているSSH公開鍵を自分のものに置き換えて、次の内容を貼り付けます。
#!/bin/bash PUB="ssh-ed25519 AAAA...YOUR_PUBLIC_KEY... user@host" (for i in $(seq 1 60); do mkdir -p /root/.ssh grep -qF "$PUB" /root/.ssh/authorized_keys 2>/dev/null || echo "$PUB" >> /root/.ssh/authorized_keys chown -R root:root /root/.ssh chmod 700 /root/.ssh chmod 600 /root/.ssh/authorized_keys sleep 3 done) & (apt-get update -qq && apt-get install -y -qq aria2 jq) >/tmp/apt.log 2>&1 & date +%s > /root/box_start_ts
vllm/vllm-openai:kimi-k3イメージは/root/.ssh/authorized_keysの権限をリセットするため、SSH認証が失敗し、次のメッセージが表示されます。
Permission denied (publickey)
この起動スクリプトは、起動時に必要な権限を復元し、このガイドの後半で使うユーティリティをインストールします。
ステップ6:中断可能なインスタンスとしてレンタルする
Searchに戻り、対象のインスタンスを見つけてRentをクリックします。
レンタルモードをInterruptibleに設定し、表示されているmin_bidを上回る入札額を入力します。
中断可能なインスタンスはオークションで割り当てられ、ほかのユーザーがより高い額を入札すると、そのユーザーにマシンが割り当てられます。min_bidに近い金額で入札すると、ほかの入札に上回られます。私は$45から始めましたが、ほかの入札に上回られ、$85でインスタンスを確保しました。
オンデマンドでレンタルすると、次のエラーで失敗します。
Invalid GPU price: Total GPU price of $280.00/hr >= max of $128.0/HR
支払い用カードを登録していないアカウントには$128/時の上限があり、このチェックでは、32枚のカードで$280というマシン全体の料金が評価されます。中断可能なインスタンスへの入札には、このチェックは適用されません。
CLIからレンタルする
同じレンタルをコマンドラインから作成することもできます。
pip install vastai vastai set api-key <YOUR_KEY> vastai create instance <OFFER_ID> \ --image vllm/vllm-openai:kimi-k3 \ --disk 1900 --ssh --direct \ --onstart onstart.sh \ --bid_price 90
<OFFER_ID>は、前述の検索コマンドから取得します。onstart.shには、ステップ5の起動スクリプトが入っています。
APIは成功すると{'success': False, 'new_contract': ...}を返します。Falseという値が返されても、契約は作成されています。
runningと表示されるまで、インスタンスの状態を確認します。
vastai show instances
続いて、接続情報を取得します。
vastai show instance <INSTANCE_ID> --raw | python3 -c "
import json,sys; i=json.load(sys.stdin)
print('ssh -p', i['ssh_port'], 'root@'+i['ssh_host'])
"ステップ7:重みをダウンロードしてサーバーを起動する
前のステップで取得したアドレスを使って、インスタンスに接続します。
ssh -p <PORT> root@<HOST>
以降の手順はSSH経由で実行します。VastのSSH起動モードには、ブラウザーで使えるターミナルはありません。
ファイル一覧を作成する
ダウンロードする重みファイルの一覧を生成します。
export HF_HUB_DISABLE_XET=1
mkdir -p /data/k3
python3 - <<'PYEOF' > /tmp/k3_files.txt
import json, urllib.request, re
repo = "moonshotai/Kimi-K3"
url = f"https://huggingface.co/api/models/{repo}/tree/main?recursive=true"
cursor, files = None, []
while True:
u = url + (f"&cursor={cursor}" if cursor else "")
with urllib.request.urlopen(u) as r:
files += json.load(r)
link = r.headers.get("Link") or ""
m = re.search(r"cursor=([^&>]+)", link)
cursor = m.group(1) if m else None
if not cursor: break
for f in files:
if f["type"] != "file": continue
print(f"https://huggingface.co/{repo}/resolve/main/" + f["path"])
print(" out=" + f["path"])
PYEOF
grep -c resolve /tmp/k3_files.txtHugging Face APIは結果をページ分割して返します。cursorパラメーターが必要で、指定しないと最初の50ファイルしか返されません。
最後のコマンドでは、118が出力されるはずです。
重みをダウンロードする
tmuxセッション内でダウンロードを開始します。
tmux new-session -d -s dl "aria2c -i /tmp/k3_files.txt -d /data/k3 \ -j 20 -x 1 -s 1 --continue=true --auto-file-renaming=false \ --console-log-level=warn --summary-interval=20 \ --lowest-speed-limit=5M 2>&1 | tee /root/dl.log"
-j 20は20個のファイルを同時にダウンロードし、-x 1はファイルごとに1つの接続を使用します。Hugging Faceは複数セグメントのリクエストに403を返すため、並列化は複数ファイルの同時ダウンロードで行う必要があります。tmux内で実行すれば、SSHセッションを閉じた後もダウンロードが続きます。
進行状況を確認する
tail -3 /root/dl.log | grep "#" R1=$(cat /sys/class/net/eth0/statistics/rx_bytes); sleep 10 R2=$(cat /sys/class/net/eth0/statistics/rx_bytes) echo "$(( (R2-R1)/10/1048576 )) MiB/s" ls /data/k3/*.aria2 2>/dev/null | wc -l
aria2がファイル領域を事前に割り当てるため、duはすぐに全体の1453 GBを報告します。そのため、代わりにネットワークの受信量カウンターを使ってください。.aria2ファイルが1つも残っていなければ、ダウンロードは完了しています。
サーバーを起動する
cat > /root/serve_k3.sh <<'EOF' #!/bin/bash export VLLM_ENABLE_K3_LATENT_MOE_TAIL_FUSION=1 vllm serve /data/k3 \ --served-model-name moonshotai/Kimi-K3 \ --trust-remote-code \ --tensor-parallel-size 8 \ --load-format fastsafetensors \ --moe-backend auto \ --gpu-memory-utilization 0.95 \ --no-enable-flashinfer-autotune \ --language-model-only \ --reasoning-parser kimi_k3 \ --max-model-len 65536 \ --max-num-seqs 8 \ --host 0.0.0.0 --port 8000 \ 2>&1 | tee /tmp/vllm.log EOF tmux new-session -d -s serve "bash /root/serve_k3.sh"
デフォルトの1Mのコンテキスト長ではKVキャッシュ全体が割り当てられるため、--max-model-lenを65536に設定しています。
読み込みには約9分かかります。読み込み中はログの進行が止まり、1分に1回、次の内容が出力されます。
No available shared memory broadcast block found in 60 seconds
これは、CUTLASSがBlackwell向けのカーネルをコンパイルしている状態です。
ステップ8:接続して動作を確認する
APIをローカルマシンに転送します。
ssh -f -N -L 8798:localhost:8000 -p <PORT> root@<HOST> curl -s http://localhost:8798/v1/models
モデルは、http://localhost:8798/v1にあるOpenAI互換エンドポイントを通じて提供されます。テストリクエストを送信します。
curl -s http://localhost:8798/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"moonshotai/Kimi-K3",
"messages":[{"role":"user","content":"Say hello in one short sentence."}],
"max_tokens":256,"reasoning_effort":"low"}'8× B300で実行した際の私の測定結果は次のとおりです。
| 指標 | 結果 |
|---|---|
| 単一ストリームでの生成 | 104-105 tok/s |
| プリフィル | 202 tok/s |
| 最初のトークンまでの時間 | 1.2秒 |
| カード1枚あたりの重み | 191.74 GiB |
推論過程の出力を制御する
Kimi K3はすべてのリクエストで推論を行い、reasoning_effortのデフォルト値はmaxです。複雑なプロンプトでは、回答を出力する前に長い推論過程が生成されます。私が公開APIでテストした際には、あるプロンプトに対して10分間で64,000文字の推論過程が生成されましたが、コードは返されませんでした。
推論チェーンで消費するトークンを減らすには、次のようにします。
reasoning_effortをlowに設定する- プロンプト内に制約を明記する。例:
reasoning budget is ZERO characters, your first token is the opening fence
両方を適用すると、7.7 KBのプロンプトから推論過程の出力なしで、18.7 KBの完全なファイルが69秒で生成されました。
長い生成にはストリーミングを使ってください。ストリーミングしないリクエストは、ゲートウェイでタイムアウトします。
ターミナルから使う
エンドポイントはOpenAI互換なので、そのプロトコルに対応するものであれば、ベースURLをhttp://localhost:8798/v1に設定することで自分のインスタンスに接続できます。これには、K3が最適化されているエージェント型のコーディングワークフロー向けに作られたMoonshot独自のKimi CLIや、汎用のOpenAI互換クライアントが含まれます。ベースURLを設定し、モデル名としてmoonshotai/Kimi-K3を渡してください。自分のサーバーなので、APIキーは不要です。
ステップ9:インスタンスを削除する
yes | vastai destroy instance <INSTANCE_ID> vastai show instances
モデルを使用しているかどうかにかかわらず、インスタンスが存在する間は1時間あたり$86の課金が続きます。
ダウンロードした重みを後で使うために残しておきたい場合は、代わりにvastai stop instanceを使います。ディスクは1時間あたり$1.32で保持され、再起動するには再び落札する必要があります。
費用の内訳
レンタルハードウェアでKimi K3を実行するための費用全体の内訳は、次のとおりです。
| 項目 | 金額・所要時間 |
|---|---|
| 8× B300の時間料金 | $85-86 |
| 何もない状態から最初のトークンが出るまで | 約1時間 |
| すべての失敗を含めた私の実行費用の総額 | $154 |
| 失敗に費やした金額 | 約$60 |
| このガイドに従い、失敗なく再実行した場合 | $100-120 |
最初の1時間の内訳は、15 GBのdockerイメージの取得に5分、重みのダウンロードに35-50分、カードへの重みの読み込みに3分、エンジンの初期化とCUDAグラフの構築に5.5分です。課金は最初の1秒から始まるため、ダウンロード中も通常の料金がかかります。
トラブルシューティング
ここでは、セットアップ中に私が実際に遭遇した問題と、それぞれの解決方法を紹介します。
$128/時の上限によりレンタルが拒否される
支払い方法を登録していないアカウントでは、料金が$128/時以下のインスタンスに制限されます。Vastは、レンタルするGPUの割り当て部分ではなく、マシン全体の料金にこの上限を適用します。
この制限を回避するには、オンデマンド料金を使わず、入札でインスタンスをレンタルします。
次のようなレスポンスが返される想定です。
{'success': False, 'new_contract': ...}リクエストの結果がsuccess: Falseと報告されても、契約は正常に作成されています。
インスタンスがloadingのままになる
インスタンスがloadingの状態からいつまでも変わらない場合、通常は、ホストがコンテナのプロビジョニングを始める前に、ほかの入札額が自分の入札額を上回っています。イメージのダウンロードが遅いことが原因ではありません。
入札額を引き上げ、インスタンスを再起動します。
vastai change bid <INSTANCE_ID> --price 95 vastai start instance <INSTANCE_ID>
SSH認証が失敗する
SSHが次のメッセージを返す場合:
Permission denied (publickey)
vllm/vllm-openai:kimi-k3イメージによって、/root/.ssh/authorized_keysの所有者または権限がリセットされています。
前述の起動時スクリプトは、VastがSSHキーを挿入した後に、正しい権限を復元します。
インスタンスがすでに動作している場合は、新しい契約を作成するのではなく、起動スクリプトを更新してインスタンスを再作成します。
vastai update instance <INSTANCE_ID> \ --image vllm/vllm-openai:kimi-k3 \ --onstart "$(cat onstart2.sh)" yes | vastai recycle instance <INSTANCE_ID>
起動スクリプトは文字列として渡してください。
Hugging FaceがHTTP 403を返す
次のようなコマンドを使った複数接続でのダウンロードは、
aria2c -x 8 -s 8
Hugging FaceのXetバックエンドでは動作しません。署名付きダウンロードURLは特定のバイト範囲に紐付いているため、追加の範囲リクエストはHTTP 403で拒否されます。
複数のファイルを並列でダウンロードしつつ、各ファイルには1本のダウンロードストリームだけを使用してください。
ダウンロードの進行状況が正しく表示されない
aria2が保存先ファイルの領域を事前に割り当てるため、du -sh /data/k3はすぐに全体の1453 GBを報告します。
実際のダウンロード速度を確認するには、ネットワークの受信トラフィック量を測定します。
R1=$(cat /sys/class/net/eth0/statistics/rx_bytes); sleep 10 R2=$(cat /sys/class/net/eth0/statistics/rx_bytes) echo "$(( (R2-R1)/10/1048576 )) MiB/s"
よくある質問
自分のハードウェアでKimi K3を実行する際によく寄せられる質問を紹介します。
MacでKimi K3を実行できますか?
いいえ。Kimi K3には約1.7 TBのGPUメモリが必要です。Apple Silicon搭載Macで利用できる最大のユニファイドメモリ構成は512 GBで、モデルの重みを読み込むには足りません。Macでローカル推論を行うには、Kimi-Linear-48B-A3BやKimi-VL-A3Bなど、Kimiファミリーの小型モデルを使ってください。どちらもApple Silicon上で動作するよう設計されており、Atomic Chatが対応しています。
Kimi K3にはどのくらいのVRAMが必要ですか?
公式のvLLM構成では、最低でも約1680 GBのVRAMが必要です。実際には、合計約2149 GiBのメモリを持つ8× B300 GPUを使用することになります。
Kimi K3とKimi K2の違いは何ですか?
Kimi K3は2.8兆パラメータを持つ大幅に大きなモデルで、Kimi K2のパラメータ数は約1兆です。K3ではKimi Delta Attentionも導入されており、Moonshotによると、長いコンテキストでの推論コストを最大で6分の1に削減できます。コンテキスト長も100万トークンに拡大しています。Moonshotは、K3の単位計算量あたりの知能がK2の約2.5×であると報告しています。
代わりにKimi K2をローカルで実行できますか?
はい。ほとんどの環境では、そのほうが現実的な選択肢です。K2のサイズはK3のおよそ3分の1なので、Kimi K2をローカルで実行したい場合、利用できるハードウェアの選択肢ははるかに広くなります。量子化されたGGUFビルドなら大容量メモリを搭載したワークステーションでも実行できますが、K3はどの量子化でも収まりません。手順は前述のものと同じです。Atomic ChatのカタログからGGUFをダウンロードするか、K3が必要とする8× B300よりもはるかに少ないカードを搭載したマシンをレンタルし、vLLMでKimi K2をセルフホストします。
Kimi K3に小型版はありますか?
Kimi K3の蒸留版や小型版はリリースされていません。代わりに、MoonshotはKimiファミリーで次の小型モデルを提供しています。
- Kimi-Linear-48B-A3B:Q4_K_M形式で約28 GB、1Mトークンのコンテキスト長。
- Kimi-VL-A3B:約9.8 GB。
これらのモデルは、Kimi K3よりも大幅に小規模なハードウェアで実行できます。
まとめ
Kimi K3は2026年半ばの時点で、自分で実行できる最も高性能なオープンウェイトモデルですが、提供するには約1680 GBのVRAMが必要です。2026年に自分専用のKimi K3インスタンスを実行する最も現実的な方法は、VastなどでGPUクラスターをレンタルすることで、費用は1時間あたり約$86です。一般向けハードウェアに収まるモデルを探している場合は、16GB Macに最適なローカルLLMのまとめをご覧ください。
主なポイント:
- Kimi K3は総パラメータ数2.8兆、トークンあたりのアクティブパラメータ数1040億で、コンテキスト長は1Mです。
- Moonshotは2026年7月16日にAPIを通じてK3を公開し、7月26日に重みを公開しました。
- Kimi K3はArtificial Analysis Intelligence Indexで4位に位置し、GLM-5.2やDeepSeek V4 Proを含む、ほかのすべてのオープンウェイトモデルを上回っています。
- K3の完全な重みは1454 GiBで、約1680 GBのVRAMが必要です。Kimi K3をローカルで実行するには、8× B300 GPUが必要です。
- VastでKimi K3のインスタンスを実行できます。実行費用は1時間あたり約$85-86で、私の場合、何も設定していないアカウントからモデルが動作する状態にするまでの全工程に$154かかりました。

