DeepSeek-V4-Flashとは?
DeepSeek-V4-Flashは、DeepSeekが開発したパラメータ数284BのMixture-of-Expertsモデルです。1.6TのDeepSeek-V4-Proとともに、V4シリーズのプレビューとして公開されました。トークンごとに13Bのパラメータが有効になり、1,000,000トークンのコンテキスト長に対応します。V4の2モデルのうち小さい方で、大型ワークステーションで実行可能なモデルです。最小のGGUFビルドは82.6 GBです。重みは2026年4月22日にMITライセンスでHugging Faceに公開されました。
| 仕様 | DeepSeek-V4-Flash |
|---|---|
| 総パラメータ数 | 284B |
| アクティブパラメータ数 | トークンあたり13B |
| アーキテクチャ | MoE、ハイブリッドアテンション(CSA + HCA) |
| コンテキスト長 | 1Mトークン |
| モダリティ | テキスト |
| 推論モード | Non-think、Think High、Think Max |
| 事前学習データ | 32Tトークン超 |
| 精度 | FP4 + FP8の混合精度(MoEエキスパートはFP4、その他の重みの大部分はFP8) |
| リリース日 | 2026年4月22日 |
| ライセンス | MIT |
1,000,000トークンのコンテキスト長は、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせたハイブリッドアテンション設計によって実現しています。DeepSeekによると、大型のV4-Proはコンテキスト長1Mトークンにおいて、単一トークンの推論FLOPsがDeepSeek-V3.2の27%、KVキャッシュが10%です。両方のV4モデルがこのアーキテクチャを共有しています。学習にはMuonオプティマイザ、従来の残差接続を強化するManifold-Constrained Hyper-Connections、32Tトークン超の事前学習データを使用しました。事後学習は2段階で行われました。まず分野別のエキスパートをSFTとRLで個別に学習し、その後オンポリシー蒸留で単一のモデルに統合しました。実用上の注意点として、リポジトリにはJinjaチャットテンプレートではなく、Pythonのエンコーディングスクリプトが含まれています。モデルを自分で組み込む場合には関係しますが、アプリがテンプレートを処理する場合は気にする必要はありません。
DeepSeek-V4-Flashのベンチマーク
DeepSeekは、V4-Flashの3つの推論モードを比較したリリース時の数値をモデルカードに公開しました。比較対象には、Think Maxモードの1.6T V4-Proを使用しています。
| ベンチマーク | V4-Flash Non-Think | V4-Flash High | V4-Flash Max | V4-Pro Max |
|---|---|---|---|---|
MMLU-Pro 学術知識 | 83.0 | 86.4 | 86.2 | 87.5 |
GPQA Diamond 専門的な科学知識 | 71.2 | 87.4 | 88.1 | 90.1 |
LiveCodeBench 競技プログラミング | 55.2 | 88.4 | 91.6 | 93.5 |
HMMT Feb 2026 数学オリンピック問題 | 40.8 | 91.9 | 94.8 | 95.2 |
MRCR 1M 長いコンテキスト | 37.5 | 76.9 | 78.7 | 83.5 |
SWE-bench Verified ソフトウェアエンジニアリング | 73.7 | 78.6 | 79.0 | 80.6 |
Terminal Bench 2.0 ターミナル操作エージェント | 49.1 | 56.6 | 56.9 | 67.9 |
Think Maxでは、アクティブパラメータ数13BのFlashが数学とコードでフラッグシップモデルに1〜2ポイント以内まで迫ります。HMMTではフラッグシップの95.2に対して94.8、LiveCodeBenchでは93.5に対して91.6です。エージェント型のタスクでは差が広がり、Terminal Bench 2.0ではPro Maxが11ポイント上回ります。Non-think列を見ると、思考によってスコアがどれだけ上がるかがわかります。HMMTでは40.8から94.8に上がっています。
DeepSeek-V4-Flashのハードウェア要件
システム要件で確認すべきなのはメモリです。DeepSeekは元の重みをFP4 + FP8の混合精度で提供しています。以下のGGUFビルドはunsloth/DeepSeek-V4-Flash-GGUFで提供されており、それぞれ最大50 GBのシャードに分割されています。ここでは合計サイズを記載しています。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 96 GB | UD-IQ1_S | 82.6 GB |
| 128 GB | UD-IQ3_XXS | 103.0 GB |
| 192 GB | UD-Q4_K_XL | 155.1 GB |
| 256 GB以上 | UD-Q8_K_XL | 161.9 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。284Bのパラメータのうち、トークンごとに有効になるのは13Bだけなので、重みをメモリに読み込んだ後は、ファイルサイズから想像するよりも生成速度を維持できます。重み用のメモリに加えて、コンテキスト用の余裕も確保してください。DeepSeekはThink Maxモードに対して、少なくとも384Kトークンのコンテキスト長を推奨しています。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでDeepSeek-V4-Flashを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザでDeepSeek-V4-Flashを検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを開始します。
ほかのラインアップについては、ローカルで実行できるDeepSeekモデルの一覧、または1.6TのフラッグシップモデルDeepSeek-V4-Proをご覧ください。
DeepSeek-V4-Flashのライセンス
DeepSeek-V4-Flashは、オープンソースライセンスの中でも特に制約の少ないMITライセンスで公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。
