DeepSeek-V4-Flash-0731

更新
04.10.2026
思考
ツール利用
推論
コード生成
多言語
ウェブ検索

DeepSeek V4 Flash 0731はV4 Flashの正式リリース版です。総パラメータ数284B、アクティブパラメータ数13BのMoEで、コンテキスト長は1M、重みはMITライセンスで公開されています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計284B、トークンあたりのアクティブパラメータ数13B
  • コンテキスト長: 1,048,576トークン
  • 推論: 推論強度はlow、high、max
  • 最小ハードウェア要件: AD-IQ1_Mでメモリ約96 GB

DeepSeek-V4-Flash-0731とは?

DeepSeek-V4-Flash-0731は、2026年7月31日に公開されたDeepSeek V4 Flashの正式リリース版で、プレビュー版を置き換えるものです。プレビュー版の構造を維持し、同じチェックポイントに投機的デコーディング用のモジュールを追加しています。エージェント向けの学習の成果は、以下のベンチマーク表全体に表れています。

仕様DeepSeek V4 Flash 0731
総パラメータ数284B
アクティブパラメータ数トークンあたり13B
アーキテクチャMixture of Experts、ルーティング対象のエキスパート256個のうち6個がアクティブ、共有エキスパート1個
レイヤー数43
コンテキスト長1,048,576トークン
モダリティテキスト入力、テキスト出力
推論推論強度はlow、high、max
投機的デコーディングチェックポイントに付属するDSparkモジュール
リリース日2026年7月31日
ライセンスMIT

284Bモデルを扱えるようにしているのがルーティングです。トークンごとに256個のエキスパートのうち6個が動作するため、全284Bのパラメータをメモリに常駐させながら、生成コストは13Bモデルとほぼ同じになります。1Mトークンのコンテキスト長も大きな特徴で、このモデルが単一ファイルではなくリポジトリ全体を対象に使われる理由です。

DeepSeek V4 Flash 0731のベンチマーク

モデルカードに掲載されたDeepSeekのリリース時の数値では、0731リリース版を2つのV4プレビュー版、GLM-5.2、Claude Opus 4.8と比較しています。

ベンチマークV4 Flash 0731V4 Flash (プレビュー)V4 Pro (プレビュー)GLM-5.2Claude Opus 4.8
Terminal Bench 2.1
ターミナルエージェント
82.761.872.181.085.0
NL2Repo
リポジトリ単位のコーディング
54.239.438.548.969.7
Cybergym
セキュリティ推論
76.738.752.7-83.1
DeepSWE
エージェントによるコーディング
54.47.312.846.258.0
Toolathlon-Verified
長期タスクでのツール利用
70.349.755.959.976.2
Agents' Last Exam
最先端エージェント
25.215.816.523.825.7
AutomationBench
オフィス業務の自動化
25.110.812.812.927.2

プレビュー版からの向上は、モデルの用途を変えるほど大きく、DeepSWEは7.3から54.4に上昇しています。また、アクティブパラメータ数が少ないにもかかわらず、ここに掲載したすべての項目でV4 Pro (プレビュー)を上回っています。Opus 4.8は全項目で引き続き上回っており、差が最も小さいのはAgents' Last Examです。

DeepSeek V4 Flash 0731のハードウェア要件

システム要件で確認すべきなのはメモリです。私たちは元の重みからモデルを量子化し、各ビルドをAtomicChat/DeepSeek-V4-Flash-0731-GGUFとして公開しました。

メモリ選択するビルドファイルサイズ
96 GBAD-IQ1_M70.2 GB
128 GBAD-IQ2_S93.4 GB
192 GBAD-IQ3_S130.8 GB
256 GB以上AD-MXFP4154.5 GB

このサイズのモデルを動かす環境は、ノートパソコンではなく、大容量メモリ構成のMac Studioや複数のGPUを搭載したマシンになります。PCでは、アテンション層を24 GBのGPUに置き、エキスパートをシステムRAMにオフロードできます。トークンあたりのアクティブパラメータ数が13Bにとどまるため、この構成でも動作します。1Mのコンテキスト全体を保持するには、重みに加えてKVキャッシュ用の容量が必要です。

Atomic ChatでDeepSeek V4 Flash 0731を実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでDeepSeek-V4-Flash-0731を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、私たちのDeepSeek V4 Flashをローカルで実行するためのガイドに掲載しています。

ほかのラインアップについては、DeepSeek-V4-Proや以前のV4 Flashプレビュー版を含む、ローカルで実行できるDeepSeekモデルの全一覧をご覧ください。

DeepSeek-V4-Flash-0731のライセンス

DeepSeek-V4-Flash-0731はMITライセンスで公開されています。著作権表示とライセンス表記をコードとともに保持する限り、商用利用、改変、再配布、非公開環境へのデプロイが認められます。

Hugging Faceからモデルをダウンロード

huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-0731
# 当社のGGUFビルド:
huggingface-cli download AtomicChat/DeepSeek-V4-Flash-0731-GGUF --include "AD-IQ2_S/*"
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "DeepSeek-V4-Flash-0731",
    "messages": [{"role": "user", "content": "Port this service from Flask to FastAPI."}],
    "temperature": 1.0,
    "top_p": 0.95
  }'
# 0731リリースには、Jinjaチャットテンプレートの代わりにエンコーディング用スクリプトが含まれています。
from encoding_dsv4 import encode_messages
import transformers

tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Flash-0731")
messages = [{"role": "user", "content": "Explain the DSpark decoding path."}]
prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")
tokens = tokenizer.encode(prompt)
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "DeepSeek-V4-Flash-0731",
  messages: [{ role: "user", content: "Audit this dependency tree for known CVEs." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

2026年7月31日に公開されたDeepSeek V4 Flashの正式リリース版です。総パラメータ数284BのMixture of Expertsモデルで、トークンあたりのアクティブパラメータ数は13B、コンテキスト長は1,048,576トークンです。重みはMITライセンスで公開されています。

構造は同じですが、エージェントとしての能力が大幅に向上しています。DeepSeek自身が公開した表では、DeepSWEが7.3から54.4に、Terminal Bench 2.1が61.8から82.7に上昇し、掲載されたすべてのベンチマークでV4 Proプレビュー版を上回るようになりました。

私たちが提供する最小のビルドであるAD-IQ1_Mは70.2 GBなので、実用上のメモリの下限は約96 GBです。93.4 GBのAD-IQ2_Sは128 GBのマシンに適しており、154.5 GBのAD-MXFP4はリファレンスに近いビルドです。

オフロードする場合に限り、実行できます。アテンション層をGPUに置き、エキスパートをシステムRAMに移します。トークンあたりのアクティブパラメータ数が13Bにとどまるため、実用的に使えますが、生成はすべてをGPUに載せる構成より遅くなります。

はい。重みはMITライセンスで公開されているため、商用利用、改変、再配布が無償で認められています。