1758253764
2025-09-19 03:43:00
中国のAI開発者Deepseekは、R1モデルのトレーニングに294,000ドルを費やしたと述べました。これは、人工知能を開発するための競争で北京の場所をめぐる議論を再燃させる可能性のある論文で、米国のライバルについて報告された数字よりもはるかに低い。
杭州に拠点を置く会社からのまれなアップデートであるR1のトレーニングコストの最初の見積もりは、水曜日に公開されたアカデミックジャーナルNatureの査読済みの記事に掲載されました。
Deepseekが1月の低コストのAIシステムであると言ったことのリリースにより、新しいモデルがNVIDIAを含むAIリーダーの支配を脅かす可能性があると心配していたため、世界の投資家はハイテク株を投棄するようになりました。
それ以来、同社と創設者のLiang Wenfengは、いくつかの新製品の更新を押し出すことを除いて、大部分が公共の場から姿を消しています。
Liangを共著者の1人としてリストしたNatureの記事は、Deepseekの推論に焦点を当てたR1モデルのトレーニングには294,000ドルかかり、512 Nvidia H800チップを使用したと述べました。 1月に公開された記事の以前のバージョンには、この情報は含まれていませんでした。
AIチャットボットに動力を供給する大規模な言語モデルのトレーニングコストは、強力なチップのクラスターを数週間または数か月実行して、膨大な量のテキストとコードを処理することから生じる費用を指します。
US AI Giant OpenaiのCEOであるSam Altmanは、2023年に、基礎モデルのトレーニングには1億ドルよりも「はるかに多く」の費用がかかっていたと述べましたが、彼の会社はそのリリースの詳細な数字を与えていません。
開発コストとそれが使用した技術に関するDeepseekの声明のいくつかは、米国の企業や役人によって疑問視されています。
言及されたH800チップは、2022年10月の米国がより強力なH100およびA100 AIチップを中国に輸出することを違法にした後、中国市場向けにNVIDIAによって設計されました。
米国当局者は、6月にロイターに、Deepseekは米国の輸出管理が実施された後に調達されたH100チップの「大量」にアクセスできると語った。 Nvidiaは当時、ロイターに、DeepseekはH100ではなく合法的に取得したH800チップを使用したと語った。
Natureの記事に付随する補足情報文書で、同社は初めてA100チップを所有していることを認め、開発の準備段階でそれらを使用したと述べました。
「DeepSeek-R1に関する研究に関して、A100 GPUを利用して、より小さなモデルでの実験に備えました」と研究者は書いています。この初期段階の後、R1はH800チップの512チップクラスターで合計80時間トレーニングされたと付け加えました。
ロイターは以前、Deepseekが中国で最も明るい心を引き付けることができた理由の1つは、A100スーパーコンピューティングクラスターを運営した数少ない国内企業の1つだったからだと報告しています。
Deepseekはまた、1月のトップホワイトハウスアドバイザーや他の米国のAIからの主張から、Openaiのモデルを独自に「蒸留」したと初めて応答しました。
Deepseekは、モデルのパフォーマンスが向上しながら、訓練や走行がはるかに安くなり、そのようなモデルのエネルギー集約的なリソース需要のためにAIを搭載したテクノロジーへのより広範なアクセスを可能にしながら、モデルのパフォーマンスが向上しているため、蒸留を一貫して擁護してきました。
この用語とは、あるAIシステムが別のAIシステムから学習する手法を指し、新しいモデルが以前のモデルの構築にかかった時間とコンピューティングパワーの投資の利点を享受できるが、関連するコストはない。
Deepseek氏は1月、MetaのオープンソースLlama AIモデルを使用して、独自のモデルの蒸留バージョンに使用したと述べました。
Deepseek氏は、V3モデルのトレーニングデータは、「かなりの数のOpenAI-Modelが生成した回答を含むクロールされたWebページに依存していると述べました。
しかし、それは意図的ではなく、むしろ偶然のものであると言いました。
Openaiは、コメントのリクエストにすぐに応答しませんでした。
公開 – 2025年9月19日09:13 on
#中国のDeepseekはHIT #AIモデルのトレーニングにわずか294000ドルの費用がかかると言います