DeepSeek-V4-Flash

更新
04.10.2026
思考
推論
コード生成
多言語

DeepSeek-V4-Flashは、総パラメータ数284B、アクティブパラメータ数13B、コンテキスト長1MトークンのMoEモデルです。DeepSeekがMITライセンスで公開しています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 総数284B、アクティブ13B
  • コンテキスト長: 1Mトークン
  • モダリティ: テキスト
  • 最小ハードウェア要件: 96 GBのRAMまたはユニファイドメモリ(最小のGGUFは82.6 GB)

DeepSeek-V4-Flashとは?

DeepSeek-V4-Flashは、DeepSeekが開発したパラメータ数284BのMixture-of-Expertsモデルです。1.6TのDeepSeek-V4-Proとともに、V4シリーズのプレビューとして公開されました。トークンごとに13Bのパラメータが有効になり、1,000,000トークンのコンテキスト長に対応します。V4の2モデルのうち小さい方で、大型ワークステーションで実行可能なモデルです。最小のGGUFビルドは82.6 GBです。重みは2026年4月22日にMITライセンスでHugging Faceに公開されました。

仕様DeepSeek-V4-Flash
総パラメータ数284B
アクティブパラメータ数トークンあたり13B
アーキテクチャMoE、ハイブリッドアテンション(CSA + HCA)
コンテキスト長1Mトークン
モダリティテキスト
推論モードNon-think、Think High、Think Max
事前学習データ32Tトークン超
精度FP4 + FP8の混合精度(MoEエキスパートはFP4、その他の重みの大部分はFP8)
リリース日2026年4月22日
ライセンスMIT

1,000,000トークンのコンテキスト長は、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせたハイブリッドアテンション設計によって実現しています。DeepSeekによると、大型のV4-Proはコンテキスト長1Mトークンにおいて、単一トークンの推論FLOPsがDeepSeek-V3.2の27%、KVキャッシュが10%です。両方のV4モデルがこのアーキテクチャを共有しています。学習にはMuonオプティマイザ、従来の残差接続を強化するManifold-Constrained Hyper-Connections、32Tトークン超の事前学習データを使用しました。事後学習は2段階で行われました。まず分野別のエキスパートをSFTとRLで個別に学習し、その後オンポリシー蒸留で単一のモデルに統合しました。実用上の注意点として、リポジトリにはJinjaチャットテンプレートではなく、Pythonのエンコーディングスクリプトが含まれています。モデルを自分で組み込む場合には関係しますが、アプリがテンプレートを処理する場合は気にする必要はありません。

DeepSeek-V4-Flashのベンチマーク

DeepSeekは、V4-Flashの3つの推論モードを比較したリリース時の数値をモデルカードに公開しました。比較対象には、Think Maxモードの1.6T V4-Proを使用しています。

ベンチマークV4-Flash Non-ThinkV4-Flash HighV4-Flash MaxV4-Pro Max
MMLU-Pro
学術知識
83.086.486.287.5
GPQA Diamond
専門的な科学知識
71.287.488.190.1
LiveCodeBench
競技プログラミング
55.288.491.693.5
HMMT Feb 2026
数学オリンピック問題
40.891.994.895.2
MRCR 1M
長いコンテキスト
37.576.978.783.5
SWE-bench Verified
ソフトウェアエンジニアリング
73.778.679.080.6
Terminal Bench 2.0
ターミナル操作エージェント
49.156.656.967.9

Think Maxでは、アクティブパラメータ数13BのFlashが数学とコードでフラッグシップモデルに1〜2ポイント以内まで迫ります。HMMTではフラッグシップの95.2に対して94.8、LiveCodeBenchでは93.5に対して91.6です。エージェント型のタスクでは差が広がり、Terminal Bench 2.0ではPro Maxが11ポイント上回ります。Non-think列を見ると、思考によってスコアがどれだけ上がるかがわかります。HMMTでは40.8から94.8に上がっています。

DeepSeek-V4-Flashのハードウェア要件

システム要件で確認すべきなのはメモリです。DeepSeekは元の重みをFP4 + FP8の混合精度で提供しています。以下のGGUFビルドはunsloth/DeepSeek-V4-Flash-GGUFで提供されており、それぞれ最大50 GBのシャードに分割されています。ここでは合計サイズを記載しています。

メモリ選択するビルドファイルサイズ
96 GBUD-IQ1_S82.6 GB
128 GBUD-IQ3_XXS103.0 GB
192 GBUD-Q4_K_XL155.1 GB
256 GB以上UD-Q8_K_XL161.9 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。284Bのパラメータのうち、トークンごとに有効になるのは13Bだけなので、重みをメモリに読み込んだ後は、ファイルサイズから想像するよりも生成速度を維持できます。重み用のメモリに加えて、コンテキスト用の余裕も確保してください。DeepSeekはThink Maxモードに対して、少なくとも384Kトークンのコンテキスト長を推奨しています。この形式に馴染みがない場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでDeepSeek-V4-Flashを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザでDeepSeek-V4-Flashを検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、ローカルで実行できるDeepSeekモデルの一覧、または1.6TのフラッグシップモデルDeepSeek-V4-Proをご覧ください。

DeepSeek-V4-Flashのライセンス

DeepSeek-V4-Flashは、オープンソースライセンスの中でも特に制約の少ないMITライセンスで公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download deepseek-ai/DeepSeek-V4-Flash
from transformers import AutoModel
model = AutoModel.from_pretrained("deepseek-ai/DeepSeek-V4-Flash")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

DeepSeek-V4-Flashは、deepseek-aiが提供する重みが公開されたMixture-of-Experts言語モデルで、deepseek_v4ファミリーに属します。パラメータ数は158.1Bで、FP8で提供され、1,048,576トークンのコンテキスト長に対応しています。記載されている機能は思考、推論、コード、多言語対応です。推論効率を保つため、トークンごとに一部のエキスパートだけが有効になる設計です。

FP8の重み全体のパラメータ数は158.1Bなので、大容量のメモリを搭載したマシンが必要です。一般的には、大容量VRAMを備えたGPU構成、または大容量のユニファイドメモリを搭載したワークステーションを使用します。MoE設計により、トークンごとに実際に必要となる計算量は総パラメータ数から想像するより少なく抑えられ、この点が実行を助けます。Atomic Chatがダウンロードと実行環境を処理するため、主に必要なのは、モデルと使用するコンテキストを保持できる十分なRAMとVRAMです。

はい。重みはMITライセンスで公開されており、Atomic Chatを通じてローカルで実行する場合、トークンごとの費用はかかりません。APIキーもサブスクリプションも不要です。かかるのは、自分のマシンで実行するためのハードウェア費用と電気代だけです。

はい。Atomic Chatで重みをダウンロードすれば、モデルはすべてデバイス上で動作し、インターネット接続は不要です。プロンプトと応答はローカルにとどまるため、データのプライバシーが保たれます。接続が必要なのは、モデルファイルを最初にダウンロードするときだけです。

huggingface-cli download deepseek-ai/DeepSeek-V4-Flashを使ってHugging Faceのdeepseek-aiリポジトリから重みをダウンロードし、TransformersまたはvLLMで推論を実行できます。より簡単な方法は、Atomic Chatを開いてDeepSeek-V4-Flashをワンクリックで読み込むことです。ダウンロードと実行環境が自動で設定されます。その後は、自分のハードウェア上でオフラインのまま、モデルと直接チャットできます。