DeepSeek-V4-Pro

更新
05.10.2026
思考
推論
コード生成
多言語

DeepSeek-V4-Proは、総パラメータ数1.6T、トークンごとに49Bのパラメータを有効化するMoEモデルです。コンテキスト長は1Mトークンで、MITライセンスで提供されています。Atomic Chatで無料でローカル実行できます。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計1.6T、トークンごとに49Bを有効化
  • コンテキスト長: 1Mトークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: 最小のGGUFビルドに約850 GBのメモリ

DeepSeek-V4-Proとは?

DeepSeek-V4-Proは、DeepSeekが開発した総パラメータ数1.6TのMixture-of-Expertsモデルです。より小型のDeepSeek-V4-Flashとともに、V4シリーズのプレビューとして公開されました。トークンごとに49Bのパラメータを有効化し、最大1,000,000トークンのコンテキストを読み取れます。ローカル環境への導入で重要なのは、その効率性です。新しいハイブリッドアテンション設計により、長いコンテキストで必要な計算量とメモリを大幅に削減し、1Mのコンテキスト長を実用的に利用できます。また、MITライセンスにより、どこでも実行できます。重みは2026年4月22日にHugging Faceで公開されました。

仕様DeepSeek-V4-Pro
総パラメータ数1.6T
有効化されるパラメータ数トークンごとに49B
アーキテクチャMoE、ハイブリッドアテンション(Compressed Sparse Attention + Heavily Compressed Attention)
コンテキスト長1Mトークン
モダリティテキスト入力、テキスト出力
精度FP4 + FP8の混合精度:MoEエキスパートはFP4、それ以外の重みの大部分はFP8
推論モードNon-think、Think High、Think Max
事前学習データ32Tトークン超
公開日2026年4月22日
ライセンスMIT

このハイブリッドアテンションは、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせており、長いコンテキストで効果を発揮します。DeepSeekの報告によると、コンテキスト長を最大の1Mトークンに設定した場合、このモデルに必要な1トークンあたりの推論FLOPsはDeepSeek-V3.2のわずか27%、KVキャッシュは10%です。学習では、標準的な残差接続にManifold-Constrained Hyper-Connectionsを追加し、収束を速めるためにMuonオプティマイザも使用しています。事後学習は2段階で行います。まず分野別のエキスパートをSFTとGRPOベースのRLで個別に学習し、その後、オンポリシー蒸留によって単一のモデルに統合します。

DeepSeek-V4-Proのベンチマーク

DeepSeekのモデルカードでは、Proの推論強度を最大にしたDeepSeek-V4-Pro-Maxを、Opus 4.6 Max、GPT-5.4 xHigh、Gemini 3.1 Pro High、K2.6 Thinkingと比較しています:

ベンチマークDeepSeek-V4-Pro MaxOpus 4.6 MaxGPT-5.4 xHighGemini 3.1 Pro HighK2.6 Thinking
LiveCodeBench
競技プログラミング
93.588.8-91.789.6
Codeforces
コンテストレーティング
3206-31683052-
SWE-bench Verified
ソフトウェアエンジニアリング
80.680.8-80.680.2
Terminal Bench 2.0
ターミナルエージェント
67.965.475.168.566.7
GPQA Diamond
専門的な科学知識
90.191.393.094.390.5
Humanity's Last Exam
専門的な設問
37.740.039.844.436.4
MRCR 1M
長いコンテキスト
83.592.9-76.3-

Proは競技プログラミングの両項目で単独首位に立ち、SWE-bench VerifiedではOpus 4.6 Maxに0.2ポイント差まで迫っています。知識系ベンチマークでは引き続きGemini 3.1 Proが首位で、1Mトークンの検索項目ではOpusが首位を維持しています。それでも、このMITライセンスのモデルは、ほぼすべての項目でクローズドな最先端モデルの数ポイント以内に位置しています。

DeepSeek-V4-Proのハードウェア要件

システム要件で確認すべきなのはメモリです。この規模では、サーバー級のメモリ容量が必要になります。unsloth/DeepSeek-V4-Pro-0813-GGUFのGGUFビルドは、それぞれ20個の分割ファイルで配布されており、4ビットのビルドでも合計849.7 GBあります。

メモリ選択するビルドファイルサイズ
896 GBUD-Q4_K_XL849.7 GB
1 TB以上UD-Q8_K_XL873.4 GB

2つのビルドの差は約24 GBしかないため、どちらもメモリに収まる場合はUD-Q8_K_XLを選んでください。KVキャッシュ用に、ファイルサイズを超えるメモリの余裕を確保してください。DeepSeekはThink Maxモードに少なくとも384Kトークンのコンテキスト長を推奨し、ローカル実行にはtemperature 1.0とtop_p 1.0を提案しています。分割ファイルや量子化の名称に馴染みがない場合は、まずGGUFとは何かを参照してください。

Atomic ChatでDeepSeek-V4-Proを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでDeepSeek-V4-Proを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

Proはこのモデルファミリーの最上位モデルです。ローカルで実行できるDeepSeekモデルの一覧、または、はるかに小型の姉妹モデルであるDeepSeek-V4-Flashをご覧ください。DeepSeek-V4-Flashは、総パラメータ数284B、有効化されるパラメータ数13Bで、1Mのコンテキスト長を維持しています。

DeepSeek-V4-Proのライセンス

DeepSeek-V4-ProはMITライセンスで公開されており、リポジトリとモデルの重みの両方が対象です。MITはロイヤリティなしでの商用利用、改変、再配布を認めているため、利用料なしでモデルをファインチューニングし、それを基に製品を開発し、自分のハードウェアから提供できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download deepseek-ai/DeepSeek-V4-Pro
from transformers import AutoModel
model = AutoModel.from_pretrained("deepseek-ai/DeepSeek-V4-Pro")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

DeepSeek-V4-Proは、DeepSeekが公開した総パラメータ数1.6TのMoEモデルで、トークンごとに49Bを有効化します。最大1Mトークンのコンテキストに対応します。公式の公開重みはFP4とFP8の混合精度で、MoEエキスパートにFP4、その他の大部分にFP8を使用しています。

大容量メモリを備えたサーバー向けのモデルです。必要な容量は使用するチェックポイントと量子化形式によって異なり、重みのほかにKVキャッシュと実行環境のメモリが必要です。1Mトークンの上限まで使えるかどうかは別途確認してください。FP4とFP8の混合精度を使う公式重みを、モデル全体がFP8であるかのように見積もることはできません。

はい。重みは、最も制約の少ないオープンソースライセンスの1つであるMITライセンスで公開されています。ライセンス表示を保持する限り、ロイヤリティなしでモデルをダウンロード、実行、ファインチューニング、再配布でき、商用製品への組み込みも可能です。

はい。Hugging Faceから重みをダウンロードすれば、モデルはすべて自分のマシン上で動作し、応答の生成にインターネット接続は必要ありません。Atomic Chatでは、プロンプトと出力がデバイス内にとどまります。

huggingface-cli download deepseek-ai/DeepSeek-V4-Proで重みをダウンロードし、vLLM(MoEのエキスパート並列処理に対応)で推論を実行するか、Transformersに読み込みます。Atomic Chatではワンクリックで利用できるモデルです。特に得意なのは、段階的な推論、1Mトークンのコンテキスト長を生かした大規模リポジトリ全体にわたるコード生成とレビュー、多言語のテキスト処理です。