1767342914
2026-01-02 07:10:00
DeepSeek は、AI をトレーニングするための新しいアイデアで今年をスタートさせました。そしてアナリストらは、業界に多大な影響を与える可能性があると述べている。
中国のAI新興企業は水曜日に研究論文を発表し、「基礎モデルの進化」を形作る可能性のある大規模な言語モデルをトレーニングする方法について説明したと述べた。
創設者のLiang Wenfeng氏との共著によるこの論文では、DeepSeekが「Manifold-Constrained Hyper-Connections」(mHC)と呼んでいる、モデルが不安定になったり完全に壊れたりすることなくモデルをスケールするように設計されたトレーニングアプローチを紹介している。
言語モデルが成長するにつれて、研究者はモデルのさまざまな部分が内部でより多くの情報を共有できるようにすることでパフォーマンスを向上させようとすることがよくあります。しかし、これにより情報が不安定になるリスクが高まると同紙は述べている。
DeepSeekの最新の研究により、モデルが制約された方法でより豊富な内部コミュニケーションを共有できるようになり、モデルがスケールしてもトレーニングの安定性と計算効率が維持されると付け加えた。
DeepSeekの新しい手法は「驚くべき画期的な進歩」
Counterpoint Research の AI 担当主席アナリスト、Wei Sun 氏は金曜日、Business Insider に対し、このアプローチは「驚くべき進歩」であると語った。
Sun氏によると、DeepSeekはさまざまな技術を組み合わせて、モデルのトレーニングにかかる追加コストを最小限に抑えたという。彼女は、コストがわずかに増加したとしても、新しいトレーニング方法によりはるかに高いパフォーマンスが得られる可能性があると付け加えました。
Sun氏は、この論文はDeepSeekの内部能力について述べたものであると述べた。トレーニングスタックをエンドツーエンドで再設計することで、同社は「迅速な実験と非常に型破りな研究アイデア」を組み合わせることができることを示している。
同社がR1推論モデルを発表した2025年1月の「スプートニクの瞬間」に言及しながら、ディープシークは「再び計算のボトルネックを回避し、インテリジェンスの飛躍を解き放つことができる」と述べた。
この発表はハイテク業界と米国の株式市場に衝撃を与え、R1 モデルが ChatGPT の o1 などの上位競合他社に匹敵する可能性があることを示しました。 コストの一部。
テクノロジー調査・コンサルティング会社オムディアの首席アナリスト、リアン・ジェ・スー氏は金曜日、Business Insiderに、公表された調査結果は、 波及効果 業界全体で、ライバルの AI ラボが独自のバージョンのアプローチを開発しています。
「新モデルを通じて独自の価値を提供し続けながら、重要な発見を業界と共有する意欲は、製品に対する新たな自信を示しています。 中国のAI産業」とスー氏はDeepSeekの論文について語った。 オープン性とは、 同氏は、「戦略的優位性と主要な差別化要因」として歓迎されていると付け加えた。
次の DeepSeek モデルは登場する予定ですか?
この論文は、DeepSeekが以前の延期を受けて、次期主力モデルR2のリリースに向けて取り組んでいると報じられている中で発表された。
インフォメーションの6月の報道によると、R2は2025年半ばに予定されていたが、梁氏が同モデルの性能に不満を表明したため延期された。報告書は、先進的なAIチップの不足によっても打ち上げが複雑になったと述べており、その制約が中国の研究所がフロンティアモデルを訓練し展開する方法をますます形作っている。
この論文ではR2については言及されていないが、そのタイミングは眉をひそめる結果となった。 DeepSeek は以前、R1 モデルの発売に先立って基礎的なトレーニング研究を発表しました。
Su氏は、DeepSeekの実績は、新しいアーキテクチャが「間違いなく新しいモデルに実装される」ことを示唆していると述べた。
一方、サン氏はより慎重だ。 「おそらくスタンドアロンの R2 は登場しないでしょう」と Sun 氏は語った。 DeepSeek はすでに初期の R1 アップデートを V3 モデルに統合しているため、この技術は DeepSeek の V4 モデルのバックボーンを形成する可能性がある、と同氏は付け加えた。
Business Insider の Alistair Barr 氏 は6月に、DeepSeekのR1モデルのアップデートはハイテク業界で大きな注目を集めることができなかったと書いた。バー氏は、流通が重要であり、特に西側市場では、OpenAIやGoogleなどの大手AI研究所が享受している幅広いリーチにDeepSeekはまだ欠けていると主張した。
#DeepSeek #が #LLM #をより簡単に拡張するための新しい #トレーニング手法を公開