1737544184
2025-01-22 10:37:00
ファイル写真: 中国の AI スタートアップ DeepSeek は、オープン MIT ライセンスの下で新しい R1 モデルをリリースしました。 |写真提供: ゲッティイメージズ
中国のAIスタートアップDeepSeekは、オープンMITライセンスの下で新しいR1モデルをリリースした。これには、複数のベンチマークで OpenAI の o1 と同等の DeepSeek-R1 と呼ばれるオープンソースの推論 AI モデルが含まれています。
DeepSeek は、数分の 1 のコストでトレーニングされたにもかかわらず、ビッグテックのライバルが構築した AI モデルを上回るパフォーマンスを発揮した DeepSeek-V3 を 1 か月前に発表してから、かなりの注目を集めました。
同様の専門家混合構造により、DeepSeek-R1 は OpenAI の同等品よりも構築が 90 ~ 95% 安価であると DeepSeek は主張しています。
つまり、OpenAI の o1 のコストは 100 万入力トークンあたり 15 ドル、100 万出力トークンあたり 60 ドルですが、DeepSeek Reasoner のコストは 100 万入力トークンあたり 0.55 ドル、100 万出力トークンあたり 2.19 ドルです。
モデルのグループには、15 億から 700 億のパラメーターにわたる 6 つのよりコンパクトな DeepSeek-R1-Distill モデルに加えて、DeepSeek-R1-Zero と DeepSeek-R1 が含まれます。
同社によると、R1 は、AIME (数学的推論)、MATH-500 (文章題)、SWE ベンチ検証 (プログラミング) などのベンチマークで o1 のパフォーマンスを上回りました。
研究者らは、教師あり微調整なしで強化学習を使用して DeepSeek-R1-Zero バリアントをトレーニングし、その上に DeepSeek-R1 を構築しました。
発行済み – 2025 年 1 月 22 日午後 4 時 07 分(IST)
#中国の #企業 #DeepSeek #がオープンソース推論モデル #DeepSeekR1 #を発表 #OpenAIのo1を破る