日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。 もっと詳しく知る
中国のAIスタートアップ ディープシークは、オープンソース テクノロジーで大手 AI ベンダーに挑戦することで知られていますが、DeepSeek-R1 と呼ばれる新しいオープン推論 LLM という別の爆弾を投下しました。
最近導入されたものをもとに、 ディープシーク V3 専門家混合モデルである DeepSeek-R1 は、数学、コーディング、および推論タスク全体で、OpenAI のフロンティア推論 LLM である o1 のパフォーマンスに匹敵します。一番いいところは?これははるかに魅力的なコストで行われ、後者よりも 90 ~ 95% 手頃な価格であることがわかります。
このリリースは、オープンソース分野における大きな前進を示します。これは、汎用人工知能 (AGI) への競争において、オープン モデルがクローズド商用モデルとの差をさらに縮めていることを示しています。その仕事の優秀さを示すために、DeepSeek は R1 を使用して 6 つの Llama モデルと Qwen モデルを抽出し、そのパフォーマンスを新たなレベルに引き上げました。あるケースでは、Qwen-1.5B の精製バージョンが、一部の数学ベンチマークにおいて、はるかに大きなモデルである GPT-4o や Claude 3.5 Sonnet よりも優れたパフォーマンスを示しました。
これらの蒸留モデルに加えて、 メインR1はオープンソース化されており、以下で入手可能です。 MIT ライセンスに基づくハグフェイス。
DeepSeek-R1 は何をもたらしますか?
人間と同じように知的タスクを実行できる AI のレベルである汎用人工知能 (AGI) への注目が高まっています。多くのチームは、モデルの推論機能の強化に力を入れています。 OpenAI は、この分野で最初の注目すべき動きを行いました。 o1モデル、思考連鎖推論プロセスを使用して問題に取り組みます。 RL (強化学習、または報酬主導型の最適化) を通じて、o1 は思考の連鎖を磨き、使用する戦略を洗練することを学びます。最終的には、間違いを認識して修正すること、または現在のアプローチが機能しない場合に新しいアプローチを試すことを学びます。
現在、この方向での作業を継続し、DeepSeek は DeepSeek-R1 をリリースしました。これは、RL と教師付き微調整の組み合わせを使用して、複雑な推論タスクを処理し、o1 のパフォーマンスに匹敵します。
テストしたところ、DeepSeek-R1 は AIME 2024 数学テストで 79.8%、MATH-500 で 97.3% のスコアを獲得しました。また、Codeforces では 2,029 の評価を獲得しました。これは、人間のプログラマーの 96.3% よりも優れています。対照的に、o1-1217 はこれらのベンチマークでそれぞれ 79.2%、96.4%、96.6% のスコアを獲得しました。
また、MMLU の精度が 90.8% で、o1 の 91.8% に次ぐ、強力な一般知識も実証されました。
トレーニング パイプライン
DeepSeek-R1 の推論パフォーマンスは、特に同社が全体をトレーニングした方法を含め、作業全体がオープンソースであるため、米国が支配する AI 分野で中国の新興企業にとって大きな勝利をもたらしました。
ただし、仕事は思ったほど単純ではありません。
研究を説明した論文によると、DeepSeek-R1はDeepSeek-R1-Zeroの強化版として開発されたもので、強化学習のみで訓練された画期的なモデルだという。
同社は最初に DeepSeek-V3 ベースを基本モデルとして使用し、教師ありデータを使用せずに推論機能を開発し、基本的に純粋な RL ベースの試行錯誤プロセスによる自己進化のみに焦点を当てました。作業から本質的に開発されたこの機能により、モデルは、拡張されたテスト時間の計算を活用して思考プロセスをより深く調査および洗練することで、ますます複雑になる推論タスクを解決できるようになります。
「トレーニング中に、DeepSeek-R1-Zero は自然に、数多くの強力で興味深い推論動作を行うようになりました」と研究者らは論文で述べています。 「何千もの RL ステップを経た後、DeepSeek-R1-Zero は推論ベンチマークで優れたパフォーマンスを示しました。たとえば、AIME 2024 の pass@1 スコアは 15.6% から 71.0% に増加し、多数決によりスコアはさらに 86.7% に向上し、OpenAI-o1-0912 のパフォーマンスに匹敵します。」
ただし、初期モデルでは、リフレクションや代替案の探索などの動作を含め、パフォーマンスの向上が見られたにもかかわらず、可読性の低下や言語の混在など、いくつかの問題が発生しました。これを修正するために、同社は、教師あり学習と強化学習の両方を組み合わせた多段階アプローチを使用して、R1-Zero で行われた作業を基にして、強化された R1 モデルを考案しました。
「具体的には、DeepSeek-V3-Base モデルを微調整するために、何千ものコールドスタート データを収集することから始めます」と研究者らは説明しました。 「これに続いて、DeepSeek-R1-Zero のような推論指向の RL を実行します。 RL プロセスの収束が近づくと、RL チェックポイントでの拒否サンプリングを通じて新しい SFT データを作成し、書き込み、事実 QA、自己認知などの領域で DeepSeek-V3 からの教師付きデータと組み合わせて、DeepSeek-V3 を再トレーニングします。・ベースモデル。新しいデータで微調整した後、チェックポイントはすべてのシナリオからのプロンプトを考慮して追加の RL プロセスを受けます。これらの手順を経て、OpenAI-o1-1217 と同等のパフォーマンスを達成する DeepSeek-R1 と呼ばれるチェックポイントを取得しました。」
o1よりもはるかに手頃な価格
新しい DeepSeek-R1 は、すべてのベンチマークで OpenAI の o1 とほぼ一致する強化されたパフォーマンスに加えて、非常に手頃な価格でもあります。具体的には、OpenAI o1 のコストは 100 万入力トークンあたり 15 ドル、出力トークン 100 万あたり 60 ドルですが、R1 モデルに基づく DeepSeek Reasoner は、 費用 入力トークン 100 万あたり 0.55 ドル、出力トークン 100 万あたり 2.19 ドル。
モデルは「DeepThink」としてテストできます。 DeepSeek チャット プラットフォーム、ChatGPT に似ています。興味のあるユーザーは、MIT ライセンスに基づいて Hugging Face 経由でモデルの重みとコード リポジトリにアクセスするか、API を使用して直接統合することができます。