DeepSeek-R1とは?
DeepSeek-R1は、DeepSeekが2025年1月20日にMITライセンスで公開した、671BパラメータのMixture-of-Experts推論モデルです。トークンあたり37Bのパラメータを活性化し、128Kのコンテキスト長に対応します。DeepSeek-V3-Baseをベースに、大規模な強化学習で学習されています。DeepSeekは、数学、コーディング、推論の各タスクでOpenAI o1に匹敵する性能を報告しています。重みはMITライセンスで公開されているため、利用料なしでモデルの実行や改変、独自モデルへの蒸留が可能です。
| 仕様 | DeepSeek-R1 |
|---|---|
| 総パラメータ数 | 671B |
| 活性化パラメータ数 | トークンあたり37B |
| アーキテクチャ | Mixture-of-Experts、DeepSeek-V3-Baseをベースに学習 |
| コンテキスト長 | 128Kトークン |
| 学習 | 大規模な強化学習:2段階のRLと2段階のSFT |
| 蒸留版 | Qwen2.5とLlama3をベースとする1.5B、7B、8B、14B、32B、70B |
| 公開日 | 2025年1月20日 |
| ライセンス | MIT |
注目すべき点は学習プロセスです。DeepSeekはまず、教師ありファインチューニングの段階を設けず、強化学習だけでR1-Zeroを構築しました。このモデルは、自己検証、振り返り、長い思考過程を自ら獲得しました。一方で、終わりのない反復や言語の混在も生じたため、公開版のR1ではRLの前にコールドスタート用データを追加しています。DeepSeekは大規模モデルとともに、1.5Bから70Bまでの6つの蒸留デンスモデルもオープンソースとして公開しました。Qwenをベースとする32Bの蒸留モデルは、さまざまなベンチマークでOpenAI o1-miniを上回っています。モデルカードには、実用上の注意点として、temperatureを0.5から0.7の間に設定すること、すべての指示をシステムプロンプトではなくユーザープロンプトに記述すること、応答を必ずthinkタグで開始させることが挙げられています。そうしないと、モデルが推論ブロックを省略する場合があるためです。
DeepSeek-R1のベンチマーク
DeepSeekが公開時にモデルカードで示した数値では、R1をOpenAI o1-1217、o1-mini、DeepSeek V3、Claude 3.5 Sonnetと比較しています。
| ベンチマーク | DeepSeek-R1 | OpenAI o1-1217 | OpenAI o1-mini | DeepSeek V3 | Claude 3.5 Sonnet |
|---|---|---|---|---|---|
MMLU 学術知識 | 90.8 | 91.8 | 85.2 | 88.5 | 88.3 |
GPQA Diamond 専門科学知識 | 71.5 | 75.7 | 60.0 | 59.1 | 65.0 |
AIME 2024 数学競技 | 79.8 | 79.2 | 63.6 | 39.2 | 16.0 |
MATH-500 数学問題 | 97.3 | 96.4 | 90.0 | 90.2 | 78.3 |
LiveCodeBench 競技プログラミング | 65.9 | 63.4 | 53.8 | - | 33.8 |
Codeforces 競技順位のパーセンタイル | 96.3 | 96.6 | 93.4 | 58.7 | 20.3 |
SWE-bench Verified ソフトウェアエンジニアリング | 49.2 | 48.9 | 41.6 | 42.0 | 50.8 |
R1は数学の各項目とLiveCodeBenchで単独首位に立ち、Codeforcesのパーセンタイルではo1-1217との差が1ポイント未満です。GPQA DiamondとMMLUではo1-1217が首位を維持し、SWE-bench VerifiedではClaude 3.5 Sonnetが引き続き上回っています。
DeepSeek-R1のハードウェア要件
システム要件で確認すべきなのはメモリです。671Bパラメータのモデルでは要求水準が高く、1ビット版でも140 GBを超えます。以下のGGUF版はunsloth/DeepSeek-R1-GGUFによるもので、ファイルサイズは分割ファイルの合計です。
| メモリ | 推奨する量子化版 | ファイルサイズ |
|---|---|---|
| 160 GB | UD-IQ1_S | 140.2 GB |
| 192 GB | UD-IQ1_M | 168.9 GB |
| 256 GB | UD-Q2_K_XL | 226.6 GB |
| 384 GB | Q3_K_M | 319.2 GB |
| 512 GB | Q4_K_M | 404.4 GB |
| 768 GB以上 | Q8_0 | 713.3 GB |
2つの量子化版がどちらもメモリに収まる場合は、大きい方を選び、ファイルサイズに加えてコンテキストキャッシュ用の余裕を確保してください。手持ちのハードウェアがこれらのどのメモリ容量にも対応しない場合は、DeepSeekの1.5Bから70Bの蒸留モデルを使うのが、現実的なローカル実行の方法です。GGUF形式を初めて知った方は、まずGGUFとは何かをご覧ください。
Atomic ChatでDeepSeek-R1を実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでDeepSeek-R1を検索し、Download Optionsを開きます。
- 搭載メモリに収まる量子化版を選び、チャットを開始します。
ファミリーのほかのモデルについては、ローカルで実行できるDeepSeekモデルの一覧をご覧ください。または、更新版チェックポイントのDeepSeek-R1-0528をご覧ください。
DeepSeek-R1のライセンス
DeepSeek-R1はMITライセンスで公開されており、コードリポジトリとモデルの重みの両方に適用されます。商用利用、改変、派生物の作成が許可され、ほかのローカルLLMを含むLLMの学習に向けた蒸留も明示的に認められています。蒸留版チェックポイントにはベースモデルの利用条件が引き継がれます。Qwenベースの蒸留版はApache 2.0で、Llamaベースの蒸留版にはLlama 3.1とLlama 3.3のライセンスが適用されます。
