1738059908
2025-01-27 23:50:00
2025年1月27日
3 最小読みます
DeepseekのAIモデルが米国でトップ評価のアプリになった理由
中国の新興企業は、最先端に一致するより安価で低いテクノロジーAIアシスタントを備えたテクノロジー業界と金融市場を驚かせました
Deepseekの人工知能アシスタントは月曜日に大きな波を起こし、Apple Storeのトップ評価のアプリになり、Tech Stocksを下向きの転倒に送りました。何についての大騒ぎは何ですか?
中国の新興企業であるDeepseekは、Openaiの最新モデルの能力に匹敵する新しいモデルで、投資がはるかに少なく、容量の減少チップを使用する新しいモデルで、ハイテク業界を驚かせました。米国は、中国への最先端のコンピューターチップの輸出を禁止し、チップメイキング機器の販売を制限します。中国東部の杭州に拠点を置くDeepseekは、禁止前の時代から高性能Nvidia A100チップの備蓄を持っていたと伝えられています。そのため、エンジニアはそれらを使用してモデルを開発できました。しかし、主要なブレークスルーでは、スタートアップは、代わりに、Deepseek-R1と呼ばれる新しいモデルをトレーニングするために、はるかに低い電力NVIDIA H800チップを使用したと述べています。
「AIで働いている大規模なハイテク企業の成功は、テクノロジーが実際に何であったかではなく、彼らがどれだけのお金を集めたかで測定されたことを見てきました」と、AI Company Plano Intelligence、IncのCEOのCEOであるAshlesha Nesarikar氏は言います。 。
科学ジャーナリズムの支援について
この記事を楽しんでいる場合は、受賞歴のあるジャーナリズムを支援することを検討してください。 購読。サブスクリプションを購入することで、今日の私たちの世界を形作る発見やアイデアに関するインパクトのあるストーリーの未来を確保するのに役立ちます。
VentureBeatによると、数学とコーディングの一般的なAIテストでは、DeepSeek-R1がOpen AIのO1モデルのスコアと一致しました。米国企業は、ChatGPTなどの人気のあるチャットボットを埋めるシステムである独自の大規模な言語モデル(LLMS)をトレーニングするコストを開示していません。しかし、Openai CEOのSam Altmanは、2023年にMITの聴衆に、ChatGPT-4のトレーニングは1億ドル以上の費用がかかると語った。 DeepSeek-R1はユーザーが無料でダウンロードできますが、CHATGPTの同等のバージョンは月額200ドルです。
Deepseekの600万ドルの数字は、必ずしもLLMをゼロから構築するコストを反映しているわけではない、とNesarikar氏は言います。そのコストは、この最新バージョンの微調整を表す可能性があります。それにもかかわらず、彼女は、モデルのエネルギー効率の向上は、より多くの業界でより多くの人々がAIをよりアクセスしやすくするだろうと彼女は言います。 LLMで新しいデータを生成する計算コストは、一般的な検索エンジンクエリの4〜5倍高いため、AIの環境への影響に関しては、効率の向上は朗報です。
Emory Universityの情報システムおよび運用管理の次期助教授であるHanchang Cao氏は、計算能力が低いため、DeepSeek-R1を実行するコストは同様の競合他社のコストの10分の1です。 「学術研究者や新興企業にとって、このコストの違いは本当に多くのことを意味します」とCao氏は言います。
Deepseekはいくつかの方法でその効率を達成しました、と マシンが学習する理由:現代のAIの背後にあるエレガントな数学。このモデルには、トレーニング中に学習する6700億パラメーター、または変数があり、これまでで最大のオープンソースの大規模な言語モデルとなっています、とAnanthaswamyは説明します。しかし、このモデルでは、「専門家の混合」と呼ばれるアーキテクチャを使用して、これらのパラメーターの一部(数億人ではなく数十億人の数十億)のみが、特定のクエリに対して活性化されます。これにより、コンピューティングコストが削減されます。 DeepSeek LLMは、マルチヘッド潜在的な注意と呼ばれる方法を使用して、推論の効率を高めます。また、単語ごとに回答を予測する代わりに、一度に複数の単語を生成します。
このモデルは、トレーニング中の学習を強化する方法で、O1のような他のモデルとさらに異なります。多くのLLMには、それらと一緒に実行され、エラーを修正し、検証済みの回答に向けてLLMを微調整する外部の「批評家」モデルがありますが、DeepSeek-R1はモデルの内部のルールのセットを使用して、生成する可能性のある回答のどれが最適かを教えます。 「Deepseekはそのプロセスを合理化しました」とAnanthaswamy氏は言います。
Deepseek-R1のもう1つの重要な側面は、同社が製品のオープンソースの背後にあるコードを作成したことです、とAnanthaswamyは言います。 (トレーニングデータは独自のままです。)これは、会社の請求を確認できることを意味します。モデルがDeepSeekの主張と同じくらい計算上効率的である場合、彼は、おそらく作業でAIを使用してより迅速かつ安価に行う研究者に新しい道を開くでしょう。また、LLMS自体の内部の仕組みに関するより多くの研究を可能にします。
「大きなことの1つは、アカデミアがこれらの非常に大きなモデルと協力したり、意味のある方法で研究を行うことができなかったため、学界と産業の間に開かれたこの格差でした」とアナンサスワミーは言います。 「しかし、このようなことは、あなたがコードを持っているので、今は学界の手の届かないところにあります。」
#DeepseekのAIモデルが米国でトップ評価のアプリになった理由