1737388897
2025-01-20 12:37:00
第 1 世代の推論モデル、DeepSeek-R1-Zero および DeepSeek-R1 を紹介します。 DeepSeek-R1-Zero は、前段階として教師あり微調整 (SFT) を行わずに大規模強化学習 (RL) によってトレーニングされたモデルであり、推論において顕著なパフォーマンスを示しました。 RL を使用すると、DeepSeek-R1-Zero は多数の強力で興味深い推論動作を備えて自然に出現しました。ただし、DeepSeek-R1-Zero は、無限の繰り返し、可読性の低さ、言語の混在などの課題に直面しています。これらの問題に対処し、推論パフォーマンスをさらに向上させるために、RL の前にコールド スタート データを組み込む DeepSeek-R1 を導入します。 DeepSeek-R1 は、数学、コード、推論タスク全体で OpenAI-o1 に匹敵するパフォーマンスを実現します。研究コミュニティをサポートするために、DeepSeek-R1-Zero、DeepSeek-R1、および Llama と Qwen に基づいて DeepSeek-R1 から抽出された 6 つの高密度モデルをオープンソース化しました。 DeepSeek-R1-Distill-Qwen-32B は、さまざまなベンチマークにわたって OpenAI-o1-mini よりも優れたパフォーマンスを示し、高密度モデルに対して新しい最先端の結果を達成しました。
トレーニング後: 基本モデルでの大規模な強化学習
-
前段階として教師あり微調整 (SFT) に依存せずに、強化学習 (RL) を基本モデルに直接適用します。このアプローチにより、モデルは複雑な問題を解決するための思考連鎖 (CoT) を探索できるようになり、その結果、DeepSeek-R1-Zero が開発されました。 DeepSeek-R1-Zero は、自己検証、リフレクション、長い CoT の生成などの機能を実証し、研究コミュニティにとって重要なマイルストーンを示しています。注目すべきは、これは、LLM の推論能力が、SFT を必要とせずに純粋に RL を通じて奨励できることを検証した最初の公開研究であるということです。この画期的な進歩により、この分野における将来の進歩への道が開かれます。
-
DeepSeek-R1を開発するためのパイプラインを紹介します。このパイプラインには、改善された推論パターンを発見し、人間の好みに合わせることを目的とした 2 つの RL ステージと、モデルの推論機能および非推論機能のシードとして機能する 2 つの SFT ステージが組み込まれています。私たちは、このパイプラインがより良いモデルを作成することで業界に利益をもたらすと信じています。
蒸留: 小型モデルでも強力になる可能性がある
- 私たちは、より大きなモデルの推論パターンをより小さなモデルに蒸留することができ、その結果、小さなモデルで RL を通じて発見された推論パターンと比較してパフォーマンスが向上することを実証します。オープンソースの DeepSeek-R1 とその API は、将来的により優れた小型モデルを蒸留するために研究コミュニティに利益をもたらすでしょう。
- DeepSeek-R1 によって生成された推論データを使用して、研究コミュニティで広く使用されているいくつかの高密度モデルを微調整しました。評価結果は、抽出されたより小さい高密度モデルがベンチマークで非常に優れたパフォーマンスを発揮することを示しています。 Qwen2.5 および Llama3 シリーズに基づいて抽出された 1.5B、7B、8B、14B、32B、および 70B チェックポイントをコミュニティにオープンソースしました。
DeepSeek-R1-Zero および DeepSeek-R1 は、DeepSeek-V3-Base に基づいてトレーニングされています。モデル アーキテクチャの再アップグレードの詳細については、以下を参照してください。 DeepSeek-V3 リポジトリ。
DeepSeek-R1-Distill モデルは、DeepSeek-R1 によって生成されたサンプルを使用して、オープンソース モデルに基づいて微調整されています。構成とトークナイザーをわずかに変更します。これらのモデルを実行するには設定を使用してください。
すべてのモデルで、最大生成長は 32,768 トークンに設定されています。サンプリングが必要なベンチマークの場合、次の温度を使用します。
| カテゴリ | ベンチマーク (メートル法) | クロード-3.5-ソネット-1022 | GPT-4o 0513 | ディープシーク V3 | OpenAI o1-mini | OpenAI o1-1217 | ディープシーク R1 |
|---|---|---|---|---|---|---|---|
| 建築 | – | – | 教育省 | – | – | 教育省 | |
| # アクティブ化されたパラメータ | – | – | 37B | – | – | 37B | |
| 合計パラメータ数 | – | – | 671B | – | – | 671B | |
| 英語 | MMLU (パス@1) | 88.3 | 87.2 | 88.5 | 85.2 | 91.8 | 90.8 |
| MMLU-Redux (EM) | 88.9 | 88.0 | 89.1 | 86.7 | – | 92.9 | |
| MMLU-プロ (EM) | 78.0 | 72.6 | 75.9 | 80.3 | – | 84.0 | |
| DROP(3ショットF1) | 88.3 | 83.7 | 91.6 | 83.9 | 90.2 | 92.2 | |
| IF-Eval (プロンプト厳密) | 86.5 | 84.3 | 86.1 | 84.8 | – | 83.3 | |
| GPQA-ダイヤモンド (Pass@1) | 65.0 | 49.9 | 59.1 | 60.0 | 75.7 | 71.5 | |
| SimpleQA (正解) | 28.4 | 38.2 | 24.9 | 7.0 | 47.0 | 30.1 | |
| フレーム (付属) | 72.5 | 80.5 | 73.3 | 76.9 | – | 82.5 | |
| AlpacaEval2.0 (LC-勝率) | 52.0 | 51.1 | 70.0 | 57.8 | – | 87.6 | |
| アリーナハード (GPT-4-1106) | 85.2 | 80.4 | 85.5 | 92.0 | – | 92.3 | |
| コード | LiveCodeBench (Pass@1-COT) | 33.8 | 34.2 | – | 53.8 | 63.4 | 65.9 |
| コードフォース (パーセンタイル) | 20.3 | 23.6 | 58.7 | 93.4 | 96.6 | 96.3 | |
| コードフォース(評価) | 717 | 759 | 1134 | 1820年 | 2061年 | 2029年 | |
| SWE 確認済み (解決済み) | 50.8 | 38.8 | 42.0 | 41.6 | 48.9 | 49.2 | |
| ヘルプ – 多言語対応 (Ac.) | 45.3 | 16.0 | 49.6 | 32.9 | 61.7 | 53.3 | |
| 数学 | AIME 2024 (パス@1) | 16.0 | 9.3 | 39.2 | 63.6 | 79.2 | 79.8 |
| MATH-500 (Pass@1) | 78.3 | 74.6 | 90.2 | 90.0 | 96.4 | 97.3 | |
| CNMO 2024 (パス@1) | 13.1 | 10.8 | 43.2 | 67.6 | – | 78.8 | |
| 中国語 | クルースク (EM) | 85.4 | 87.9 | 90.9 | 89.9 | – | 92.8 |
| C-評価 (EM) | 76.7 | 76.0 | 86.5 | 68.9 | – | 91.8 | |
| C-SimpleQA (正解) | 55.4 | 58.7 | 68.0 | 40.3 | – | 63.7 |
| モデル | AIME 2024 パス@1 | 2024 年の短所 @64 が好き | MATH-500 パス@1 | GPQA ダイヤモンドパス@1 | LiveCodeBench パス@1 | CodeForces の評価 |
|---|---|---|---|---|---|---|
| GPT-4o-0513 | 9.3 | 13.4 | 74.6 | 49.9 | 32.9 | 759 |
| クロード-3.5-ソネット-1022 | 16.0 | 26.7 | 78.3 | 65.0 | 38.9 | 717 |
| o1-mini | 63.6 | 80.0 | 90.0 | 60.0 | 53.8 | 1820年 |
| QwQ-32B-プレビュー | 44.0 | 60.0 | 90.6 | 54.5 | 41.9 | 1316 |
| DeepSeek-R1-蒸留-Qwen-1.5B | 28.9 | 52.7 | 83.9 | 33.8 | 16.9 | 954 |
| DeepSeek-R1-蒸留-Qwen-7B | 55.5 | 83.3 | 92.8 | 49.1 | 37.6 | 1189 |
| DeepSeek-R1-蒸留-Qwen-14B | 69.7 | 80.0 | 93.9 | 59.1 | 53.1 | 1481年 |
| DeepSeek-R1-蒸留-Qwen-32B | 72.6 | 83.3 | 94.3 | 62.1 | 57.2 | 1691年 |
| DeepSeek-R1-蒸留-ラマ-8B | 50.4 | 80.0 | 89.1 | 49.0 | 39.6 | 1205 |
| DeepSeek-R1-蒸留-ラマ-70B | 70.0 | 86.7 | 94.5 | 65.2 | 57.5 | 1633年 |
DeepSeek の公式 Web サイトで DeepSeek-R1 とチャットできます。 チャット.ディープシーク.comを選択し、「DeepThink」ボタンをオンにします。
DeepSeek プラットフォームでは OpenAI 互換 API も提供しています。 platform.deepseek.com
ぜひご覧ください DeepSeek-V3 DeepSeek-R1 をローカルで実行する方法の詳細については、リポジトリを参照してください。
DeepSeek-R1-Distill モデルは、Qwen または Llama モデルと同じ方法で利用できます。
たとえば、次を使用してサービスを簡単に開始できます。 vLLM:
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager
を使用してサービスを簡単に開始することもできます SGLang
python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2
注: これらのモデルを実行するときは、適切な温度 (0.5 ~ 0.7 の間) を設定することをお勧めします。そうしないと、無限の繰り返しや一貫性のない出力の問題が発生する可能性があります。
このコード リポジトリとモデルの重みは、 私のライセンス。 DeepSeek-R1 シリーズは商用利用をサポートしており、他の LLM をトレーニングするための蒸留を含む (ただしこれに限定されない) あらゆる改変や二次的著作物を許可します。以下の点に注意してください。
- DeepSeek-R1-Distill-Qwen-1.5B、DeepSeek-R1-Distill-Qwen-7B、DeepSeek-R1-Distill-Qwen-14B、および DeepSeek-R1-Distill-Qwen-32B は、以下から派生しています。 Qwen-2.5シリーズ、本来は以下に基づいてライセンスされています。 Apache 2.0 ライセンス、DeepSeek-R1 で厳選された 800,000 個のサンプルで微調整されました。
- DeepSeek-R1-Distill-Llama-8B は Llama3.1-8B-Base から派生しており、元々は次のようにライセンスされています。 ラマ3.1ライセンス。
- DeepSeek-R1-Distill-Llama-70B は Llama3.3-70B-Instruct から派生しており、元々は次のようにライセンスされています。 ラマ3.3ライセンス。
ご質問がある場合は、問題を提起するか、以下までお問い合わせください。 [email protected]。
#GitHub #ディープシークaiディープシークR1
