DeepSeek-V4-Proとは?
DeepSeek-V4-Proは、DeepSeekが開発した総パラメータ数1.6TのMixture-of-Expertsモデルです。より小型のDeepSeek-V4-Flashとともに、V4シリーズのプレビューとして公開されました。トークンごとに49Bのパラメータを有効化し、最大1,000,000トークンのコンテキストを読み取れます。ローカル環境への導入で重要なのは、その効率性です。新しいハイブリッドアテンション設計により、長いコンテキストで必要な計算量とメモリを大幅に削減し、1Mのコンテキスト長を実用的に利用できます。また、MITライセンスにより、どこでも実行できます。重みは2026年4月22日にHugging Faceで公開されました。
| 仕様 | DeepSeek-V4-Pro |
|---|---|
| 総パラメータ数 | 1.6T |
| 有効化されるパラメータ数 | トークンごとに49B |
| アーキテクチャ | MoE、ハイブリッドアテンション(Compressed Sparse Attention + Heavily Compressed Attention) |
| コンテキスト長 | 1Mトークン |
| モダリティ | テキスト入力、テキスト出力 |
| 精度 | FP4 + FP8の混合精度:MoEエキスパートはFP4、それ以外の重みの大部分はFP8 |
| 推論モード | Non-think、Think High、Think Max |
| 事前学習データ | 32Tトークン超 |
| 公開日 | 2026年4月22日 |
| ライセンス | MIT |
このハイブリッドアテンションは、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせており、長いコンテキストで効果を発揮します。DeepSeekの報告によると、コンテキスト長を最大の1Mトークンに設定した場合、このモデルに必要な1トークンあたりの推論FLOPsはDeepSeek-V3.2のわずか27%、KVキャッシュは10%です。学習では、標準的な残差接続にManifold-Constrained Hyper-Connectionsを追加し、収束を速めるためにMuonオプティマイザも使用しています。事後学習は2段階で行います。まず分野別のエキスパートをSFTとGRPOベースのRLで個別に学習し、その後、オンポリシー蒸留によって単一のモデルに統合します。
DeepSeek-V4-Proのベンチマーク
DeepSeekのモデルカードでは、Proの推論強度を最大にしたDeepSeek-V4-Pro-Maxを、Opus 4.6 Max、GPT-5.4 xHigh、Gemini 3.1 Pro High、K2.6 Thinkingと比較しています:
| ベンチマーク | DeepSeek-V4-Pro Max | Opus 4.6 Max | GPT-5.4 xHigh | Gemini 3.1 Pro High | K2.6 Thinking |
|---|---|---|---|---|---|
LiveCodeBench 競技プログラミング | 93.5 | 88.8 | - | 91.7 | 89.6 |
Codeforces コンテストレーティング | 3206 | - | 3168 | 3052 | - |
SWE-bench Verified ソフトウェアエンジニアリング | 80.6 | 80.8 | - | 80.6 | 80.2 |
Terminal Bench 2.0 ターミナルエージェント | 67.9 | 65.4 | 75.1 | 68.5 | 66.7 |
GPQA Diamond 専門的な科学知識 | 90.1 | 91.3 | 93.0 | 94.3 | 90.5 |
Humanity's Last Exam 専門的な設問 | 37.7 | 40.0 | 39.8 | 44.4 | 36.4 |
MRCR 1M 長いコンテキスト | 83.5 | 92.9 | - | 76.3 | - |
Proは競技プログラミングの両項目で単独首位に立ち、SWE-bench VerifiedではOpus 4.6 Maxに0.2ポイント差まで迫っています。知識系ベンチマークでは引き続きGemini 3.1 Proが首位で、1Mトークンの検索項目ではOpusが首位を維持しています。それでも、このMITライセンスのモデルは、ほぼすべての項目でクローズドな最先端モデルの数ポイント以内に位置しています。
DeepSeek-V4-Proのハードウェア要件
システム要件で確認すべきなのはメモリです。この規模では、サーバー級のメモリ容量が必要になります。unsloth/DeepSeek-V4-Pro-0813-GGUFのGGUFビルドは、それぞれ20個の分割ファイルで配布されており、4ビットのビルドでも合計849.7 GBあります。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 896 GB | UD-Q4_K_XL | 849.7 GB |
| 1 TB以上 | UD-Q8_K_XL | 873.4 GB |
2つのビルドの差は約24 GBしかないため、どちらもメモリに収まる場合はUD-Q8_K_XLを選んでください。KVキャッシュ用に、ファイルサイズを超えるメモリの余裕を確保してください。DeepSeekはThink Maxモードに少なくとも384Kトークンのコンテキスト長を推奨し、ローカル実行にはtemperature 1.0とtop_p 1.0を提案しています。分割ファイルや量子化の名称に馴染みがない場合は、まずGGUFとは何かを参照してください。
Atomic ChatでDeepSeek-V4-Proを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでDeepSeek-V4-Proを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
Proはこのモデルファミリーの最上位モデルです。ローカルで実行できるDeepSeekモデルの一覧、または、はるかに小型の姉妹モデルであるDeepSeek-V4-Flashをご覧ください。DeepSeek-V4-Flashは、総パラメータ数284B、有効化されるパラメータ数13Bで、1Mのコンテキスト長を維持しています。
DeepSeek-V4-Proのライセンス
DeepSeek-V4-ProはMITライセンスで公開されており、リポジトリとモデルの重みの両方が対象です。MITはロイヤリティなしでの商用利用、改変、再配布を認めているため、利用料なしでモデルをファインチューニングし、それを基に製品を開発し、自分のハードウェアから提供できます。
