1737833189
2025-01-25 19:22:00
中国はChatGPTのライバルとなる手頃な価格のオープンソースをリリースした OpenAI そしてそれは一部の科学者を興奮させ、シリコンバレーを心配させました。
DeepSeek、中国の人工知能研究所 (AI) イノベーションの背後には Free Large Language Model (LLM) が導入されました DeepSeek-V3 2024 年 12 月末には、次のように主張しています。 わずか 558 万ドルの費用で 2 か月で建設されました – シリコンバレーの競合企業が必要とする時間とコストの数分の一。
これに続いて、と呼ばれるさらに新しいモデルが続きます。 ディープシーク-R1』が1月20日(月)に発売されました。サードパーティのベンチマーク テストでは、DeepSeek-V3 は OpenAI の GPT-4o や Anthropic の Claude Sonnet 3.5 の機能に達し、問題解決、コーディング、数学などのタスクでは Meta の Llama 3.1 や Alibaba の Qwen2.5 などの他の機能を上回りました。
今、R1 も最後のモデル o1 を超えています チャットGPT 多くの同じテストで。他のモデルの数分の一のコストでのこの素晴らしいパフォーマンス、部分的にオープンな性質、および大幅に少ないグラフィックス処理装置 (GPU) でのトレーニングは AI 専門家に感銘を与え、中国の AI モデルが米国の AI モデルを上回るというシナリオが浮上しました。
«私たちは中国の動向を非常に真剣に受け止めるべきです“、 言った サティア・ナデラ1月22日、スイスのダボスで開催された世界経済フォーラムで、OpenAIの戦略的パートナーであるマイクロソフトのCEOが語った。
AI システムは、人間の入力から取得したトレーニング データを使用して学習するため、そのトレーニング データ セット内で発生するさまざまなパターンの確率に基づいて結果を生成できます。
大規模な言語モデルの場合、このデータはテキストです。たとえば、2023 年にリリースされた OpenAI の GPT-3.5 は、書籍、オンライン記事、Wikipedia などの Web サイトから抽出された Common Crawl リポジトリの約 570 GB のテキスト データ (約 3,000 億語に相当) でトレーニングされました。
R1 や o1 などの推論モデルは、「連鎖思考」と呼ばれる手法を使用して推論を見直し、再評価する標準 LLM のアップグレード バージョンであり、これにより、より複雑なタスクをより正確に取り組むことができます。これにより、推論モデルが次のような人々の間で人気を博しました。 科学者 人工知能を仕事に取り入れたいと考えているエンジニア。
しかし、OpenAI の o1 とは異なり、DeepSeek は「オープン ウェイト」モデルであり、(そのトレーニング データは独自のままですが) ユーザーがアルゴリズムの内部を覗いて微調整することができます。 同様に重要なのは、ユーザーにとっての価格の引き下げです – o1 の 27 分の 1 です。
DeepSeek を取り巻く誇大宣伝は、そのパフォーマンスに加えて、その費用対効果からもたらされています。このモデルの予算は、ライバル企業が競合他社のトレーニングに費やす数千万から数億に比べて最小限です。
さらに、最高のAIコンピューティングチップへの中国企業のアクセスを制限する米国の輸出規制により、R1の開発者はコンピューティング能力の不足を補うために、よりスマートでエネルギー効率の高いアルゴリズムを構築する必要が生じた。 OpenAI は、トレーニング データを処理するために 10,000 個の Nvidia GPU を必要としたと報告されています。 DeepSeek は、わずか 2,000 回で同様の結果を達成したと主張しています…
[via]
#中国は飛躍的な低コストであっという間に #ChatGPT #を上回りました