DeepSeek-R1-0528とは?
DeepSeek-R1-0528は、DeepSeekのR1推論モデルを2025年5月28日に更新したモデルです。DeepSeekはマイナーバージョンアップと位置づけていますが、今回の事後学習では計算量の増加と新たなアルゴリズム最適化の仕組みによって、数学、プログラミング、一般的な論理における推論の深さが向上しました。DeepSeekによると、総合性能はO3やGemini 2.5 Proなどの主要モデルに近づいています。重みはネイティブFP8で、safetensorsでの集計では684.5Bパラメータあり、MITライセンスで配布されています。最小のGGUFビルドでも161.62 GBあるため、まずメモリを確認する必要があります。
| 仕様 | DeepSeek-R1-0528 |
|---|---|
| 総パラメータ数 | 684.5B(safetensorsでの集計) |
| 重みの内訳 | FP8が680.6B、BF16が3.9B、FP32が41.6M |
| ネイティブ精度 | FP8 (F8_E4M3) |
| 種類 | 推論モデル、長い思考連鎖 |
| モダリティ | テキスト入力、テキスト出力 |
| 最大生成長 | 64Kトークン(開発元の評価設定) |
| DeepSeekのアプリでのtemperature | 0.6 |
| 蒸留版 | DeepSeek-R1-0528-Qwen3-8B |
| 論文 | arXiv 2501.12948 |
| リリース日 | 2025年5月28日 |
| ライセンス | MIT |
精度の向上は、より長く思考することで得られています。AIMEのテストセットでは、従来のR1は1問あたり平均12Kトークンでしたが、0528では平均23Kトークンです。DeepSeekは、ハルシネーション率の低下、関数呼び出しへの対応強化、バイブコーディングの使い勝手の改善も報告しています。ローカルでの利用では、2つの変更が重要です。システムプロンプトに対応し、思考パターンを強制するために出力をthinkタグで始める必要がなくなりました。DeepSeekは、0528の思考連鎖をQwen3 8B Baseに蒸留することも行いました。その結果であるDeepSeek-R1-0528-Qwen3-8Bは、Qwen3-8Bのアーキテクチャを維持しつつ、0528のトークナイザー設定を使用しています。DeepSeekの数値では、AIME 2024のスコアはQwen3-8Bの76.0に対して86.0で、Qwen3-8Bと同じ方法で実行できます。
DeepSeek-R1-0528のベンチマーク
モデルカードに掲載されたDeepSeekの公開数値は、0528と初代のDeepSeek R1を比較したものです。最大生成長は64Kトークンで、サンプリングが必要なベンチマークでは、DeepSeekはtemperature 0.6、top-p 0.95を設定し、クエリごとに16件の応答を生成してpass@1を推定しました。すべての行で同じ指標を使っているわけではありません。SWE Verifiedは問題の解決率、Aider-Polyglotは正解率で評価されています。
| ベンチマーク | DeepSeek-R1-0528 | DeepSeek R1 |
|---|---|---|
AIME 2025 数学競技 | 87.5 | 70.0 |
HMMT 2025 数学オリンピック | 79.4 | 41.7 |
GPQA Diamond 専門レベルの科学 | 81.0 | 71.5 |
LiveCodeBench 競技プログラミング | 73.3 | 63.5 |
SWE Verified ソフトウェア工学 | 57.6 | 49.2 |
Aider-Polyglot コード編集 | 71.6 | 53.3 |
Humanity's Last Exam 専門的な設問 | 17.7 | 8.5 |
更新版は、ここに掲載したすべての行で上回っています。HMMT 2025は41.7から79.4に、Humanity's Last Examは8.5から17.7に、Aider-Polyglotは53.3から71.6に向上しました。開発元の完全な表で唯一低下したのはSimpleQAで、30.1から27.8に下がっています。
その表の残りの結果は、AIME 2024が79.8から91.4に、CNMO 2024が78.8から86.9に、Codeforces Div1のレーティングが1530から1930に向上しています。一般知識の変化は小さく、MMLU-Reduxは92.9から93.4、MMLU-Proは84.0から85.0、FRAMESは82.5から83.0です。ツール利用のスコアは0528のみが公開されており、R1の列はありません。BFCL v3 MultiTurnは37.0、Tau-Benchは航空分野が53.5、小売分野が63.9で、ユーザー役にはGPT-4.1を使用しています。SWE VerifiedはAgentlessフレームワークで実行され、Humanity's Last Examではテキストのみのプロンプトだけが採点対象となりました。
DeepSeek-R1-0528のハードウェア要件
システム要件で確認すべきなのはメモリです。GGUFビルドは、Hugging Faceのunsloth/DeepSeek-R1-0528-GGUFリポジトリで提供されています。UD-TQ1_0は161.62 GBの単一ファイルです。それ以外のビルドはすべて分割されているため、以下のサイズは各ビルドの分割ファイルを合計したものです。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 192 GB | UD-TQ1_0 | 161.6 GB |
| 256 GB | UD-IQ2_M | 228.5 GB |
| 320 GB | UD-Q3_K_XL | 295.9 GB |
| 384 GB | IQ4_XS | 357.7 GB |
| 512 GB | Q4_K_M | 404.9 GB |
| 640 GB | Q6_K | 551.1 GB |
| 768 GB以上 | Q8_0 | 713.3 GB |
2つのビルドがどちらもコンテキスト用の余裕を残してメモリに収まる場合は、大きい方を選んでください。この表では、リポジトリにある一部の段階を省略しています。UD-TQ1_0とUD-IQ2_Mの間には、185.5 GBのUD-IQ1_S、200.5 GBのUD-IQ1_M、216.8 GBのUD-IQ2_XXSがあります。UD-IQ2_Mより大きいものには、251.1 GBのUD-Q2_K_XL、272.9 GBのUD-IQ3_XXS、384.0 GBのUD-Q4_K_XLがあります。一覧で、手元のメモリ容量により近いビルドを確認してください。どの段階もお使いのハードウェアに収まらない場合は、蒸留版のDeepSeek-R1-0528-Qwen3-8Bが、デスクトップで0528の思考連鎖を利用するための現実的な選択肢です。GGUF形式になじみがない場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでDeepSeek-R1-0528を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでDeepSeek-R1-0528を検索し、Download Optionsを開きます。
- 手元のメモリ容量に収まるビルドを選び、チャットを開始します。
DeepSeekは自社のWebアプリで、2行のシステムプロンプトを設定し、temperature 0.6でモデルを実行しています。1行目ではアシスタントをDeepSeekが開発したDeepSeek-R1と指定し、次の行では現在の日付を与えています。DeepSeekはファイルアップロードとWeb検索用のプロンプトテンプレートを公開しており、DeepSeek PlatformのエンドポイントはOpenAI互換です。セルフホスティングについては、DeepSeek-R1のGitHubリポジトリを案内しています。
同じファミリーのほかのモデルについては、ローカルで実行できるDeepSeekモデルの一覧をご覧ください。また、ローカルLLMの全カタログも参照できます。
DeepSeek-R1-0528のライセンス
DeepSeek-R1-0528はMITライセンスで公開されており、DeepSeekはR1シリーズのBaseとChatの両方で商用利用と蒸留が可能だとしています。これには、モデルを利用した製品の開発、量子化ビルドの再配布、モデルの出力を使った小型モデルの学習が含まれ、利用料はかかりません。
