DeepSeek-V3-0324

更新
04.10.2026
推論
コード生成
多言語
ツール利用

DeepSeek-AIの671BパラメータのMixture-of-Experts型ローカルLLMです。アクティブパラメータは37B、コンテキスト長は128Kで、優れたコーディング能力と改善された関数呼び出しを備えます。

基本情報

  • ライセンス: MIT
  • パラメータ数: 684.5B(safetensorsの集計値)
  • コンテキスト長: 開発元のモデルカードに記載なし
  • モダリティ: 開発元のモデルカードに記載なし
  • 最小ハードウェア要件: メモリ186 GB以上(最小のGGUFビルド、UD-IQ1_S)

DeepSeek-V3-0324とは?

DeepSeek-V3-0324は、DeepSeekが2025年3月24日にHugging FaceでMITライセンスの下で公開した、重みが公開されているチャットモデルです。初代DeepSeek-V3とまったく同じモデル構造を維持し、より高性能なチェックポイントに置き換えています。DeepSeekは、推論とコーディングのベンチマークスコアの向上、フロントエンドコードの実行可能性の向上、関数呼び出しの精度向上を報告しています。safetensorsの掲載情報ではパラメータ数が684.5Bとされているため、ローカルでの実行では何よりもまずメモリが問題になります。MITライセンスの条件はセルフホスティングを妨げません。

仕様DeepSeek-V3-0324
総パラメータ数684.5B(safetensorsの集計値)
アーキテクチャDeepSeek-V3と同じモデル構造
ネイティブ精度FP8:684.5Bパラメータのうち680.6BをF8_E4M3で格納
その他の重みのデータ型BF16で3.9B、FP32で41.6M
対応機能関数呼び出し、JSON出力、FIM補完
プロンプト形式DeepSeek-V2.5リポジトリに記載
推奨temperature0.3(APIはリクエストで指定された1.0を0.3に引き下げます)
システムプロンプト公式アプリは、アシスタント名をDeepSeek Chatとする日付入りのプロンプトを先頭に追加
推論サーバーでの提供DeepSeek-V3のGitHubリポジトリを参照。Transformersは直接対応していません
技術レポートDeepSeek-V3 Technical Report、arXiv 2412.19437
リリース日2025年3月24日
ライセンスMIT

公開された重みはネイティブFP8です。684.5Bパラメータのうち680.6BがF8_E4M3で格納され、3.9BはBF16、41.6MはFP32のままなので、チェックポイントはパラメータ数に対してすでにコンパクトです。DeepSeekは自社のWebアプリでtemperatureを0.3に設定してモデルを実行しており、APIもリクエストで指定された1.0をその値に変換するため、ローカルでも0.3を設定するとよいでしょう。このモデルは関数呼び出し、JSON出力、文章やコードの中間部分を埋めるfill-in-the-middle補完に対応しており、プロンプト形式はDeepSeek-V2.5リポジトリに記載されています。

推論サーバーでの提供について、開発元はDeepSeek-V3のGitHubリポジトリを案内し、Hugging Face Transformersはこのモデルに直接対応していないと記載しています。そのため、ローカルで実行するには、以下のGGUFビルドが実用的な選択肢です。DeepSeekは、本番環境で使用するプロンプトの構成も公開しています。公式アプリは、アシスタント名をDeepSeek Chatとし、現在の日付を示すシステムプロンプトを先頭に追加します。また、モデルカードにはファイルアップロードとWeb検索のテンプレートが掲載されており、検索用テンプレートは中国語と英語で用意されています。

DeepSeek-V3-0324のベンチマーク

モデルカードに掲載されたDeepSeekの数値は、0324チェックポイントと、その置き換え対象である初代DeepSeek-V3を比較したものです。

ベンチマークDeepSeek-V3-0324DeepSeek-V3
MMLU-Pro
学術知識
81.275.9
GPQA
専門的な科学知識
68.459.1
AIME
数学コンテスト
59.439.6
LiveCodeBench
競技プログラミング
49.239.2

すべての項目でスコアが向上しており、AIMEは19.8ポイント、LiveCodeBenchは10ポイント上昇しています。これらはDeepSeekが自社の旧モデルと比較して示した数値です。モデルカードには、他社モデルとの比較は掲載されていません。

リリースノートのその他の項目には数値がありません。DeepSeekは、フロントエンドコードの実行可能性が向上し、Webページやゲームのフロントエンドの見栄えがよくなったこと、中国語の中長文作成がR1の文体に合わせられたこと、複数ターンの対話的な書き直し、翻訳品質、手紙の作成がいずれも改善したこと、中国語検索ではレポート分析の依頼に対してより詳細な出力が得られること、関数呼び出しの精度が向上し、以前のV3バージョンの問題が修正されたことを述べています。これらはすべて開発元の主張であり、測定結果ではありません。

DeepSeek-V3-0324のハードウェア要件

確認すべきシステム要件はメモリです。この規模では、数百ギガバイト単位で考える必要があります。以下のGGUFビルドはunsloth/DeepSeek-V3-0324-GGUFリポジトリのものです。各ビルドは分割ファイルのセットとして配布されており、記載されたサイズはセット全体の合計です。

メモリ選ぶビルドファイルサイズ
192 GBUD-IQ1_S186.3 GB
224 GBUD-IQ2_XXS218.7 GB
256 GBUD-Q2_K_XL247.6 GB
384 GBUD-Q3_K_XL320.8 GB
512 GBUD-Q4_K_XL404.9 GB
640 GBQ6_K550.8 GB
768 GB以上Q8_0713.3 GB

動的量子化のUDビルドはUD-Q4_K_XLまでです。リポジトリには通常のK-quantsもあり、Q2_Kは244.0 GB、Q3_K_Mは319.2 GB、Q4_K_Mは404.4 GB、Q5_K_Mは475.4 GBです。さらにQ6_K、Q8_0と、30ファイルに分割された合計1,342.4 GBの完全なBF16変換版もあります。2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。低ビットのビルドでは、サイズが数十ギガバイトずつ増えます。UD-IQ1_Sは186.3 GB、UD-IQ1_Mは196.5 GB、UD-IQ2_XXSは218.7 GB、UD-Q2_K_XLは247.6 GBで、この4つのビルドのサイズ差は61 GBです。最小のセットでも約186 GBが必要なので、複数GPUのサーバーか、非常に大容量のユニファイドメモリを備えたマシンを想定してください。分割GGUFファイルを初めて扱う場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでDeepSeek-V3-0324を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでDeepSeek-V3-0324を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

お使いのハードウェアがこのモデルの要件を満たさない場合は、ローカルで実行できるDeepSeekモデルの全一覧、またはより新しいDeepSeek-V3.2をご覧ください。メモリが最大16 GBのノートパソコンでは、代わりに16 GBのMacに最適なローカルLLMを厳選した一覧から探してください。

DeepSeek-V3-0324のライセンス

リポジトリとモデルの重みにはMITライセンスが適用されています。商用利用、改変、再配布がロイヤリティなしで認められているため、別途ライセンス契約を結ぶことなく、モデルのセルフホスティング、ファインチューニング、モデルを利用した製品開発ができます。モデルカードには、DeepSeek-V3 Technical Report、arXiv 2412.19437の引用情報も掲載されています。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download deepseek-ai/DeepSeek-V3-0324
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "deepseek-ai/DeepSeek-V3-0324", "messages": [{"role": "user", "content": "Hello"}]}'
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("deepseek-ai/DeepSeek-V3-0324", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V3-0324", trust_remote_code=True)
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "deepseek-ai/DeepSeek-V3-0324",
  messages: [{ role: "user", content: "Hello" }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

DeepSeek-V3-0324は、DeepSeek-AIが2025年3月にリリースした、重みが公開されている大規模言語モデルです。総パラメータ数671BのMixture-of-Experts(MoE)モデルで、そのうち約37Bがトークンごとにアクティブになります。0324チェックポイントはDeepSeek-V3の事後学習による更新版で、初期リリースと比べて推論、コーディング、関数呼び出しが改善されています。

FP8の重み全体は約700 GBあるため、モデルを量子化せずに実行するには、合計VRAMが約700 GB以上の複数GPUサーバーが必要です。たとえば、大容量メモリを備えたデータセンター向けGPUが8から16基必要になります。Unslothなどのプロジェクトによるコミュニティ製の4ビットおよび1.58ビットのGGUF量子化版では、必要容量が約130から400 GBに減り、大容量RAMを備えたワークステーションや小規模なGPUクラスターに分散して実行できますが、速度は低下します。一般消費者向けのGPUカード1枚に収まるモデルではありません。

はい。リポジトリとモデルの重みはMITライセンスの下で公開されており、商用利用、改変、再配布が認められています。重みはHugging Faceから無料でダウンロードできます。また、DeepSeekのAPIやサードパーティの推論サービスを通じてモデルを利用することもでき、これらはトークン単位で課金されます。

DeepSeek-V3-0324は128Kトークンのコンテキスト長に対応しています。この容量により、1回のリクエストで長い文書、大規模なコードベース、複数ターンにわたる長い会話を扱えます。

DeepSeek-V3-0324は、DeepSeek-V3と同じアーキテクチャを基に、事後学習で更新されたチェックポイントです。DeepSeekは、MMLU-Proが75.9から81.2へ、GPQAが59.1から68.4へ上昇するなど、ベンチマークで明確な改善があったと報告しています。加えて、フロントエンドコード生成能力の向上、複数ターンにわたる書き直しの信頼性向上、関数呼び出しの改善も報告しています。DeepSeek-R1のような独立した推論モデルではなく、引き続き汎用のチャット・指示応答モデルです。