1738214322
2025-01-30 04:02:00
- DualPipeと呼ばれる新しいアプローチは、Deekseekの成功の鍵のようです
- 1人の専門家は、帯域幅の効率を最大化するOn-GPU仮想DPUと説明しています
- DeepseekはNvidia GPUのみを使用していますが、AMDの本能がどのように機能するか疑問に思います
中国のdeepseek ai チャットボット テクノロジー業界を驚かせ、信頼できる代替手段を表しています Openai‘s chatgpt わずかなコストで。
a 最近の論文 Deepseek V3が2,048のクラスターで訓練されたことが明らかになった nvidia H800 GPU – H100の不自由なバージョン(それがどれほど強力で実行されるか想像することしかできません AMD 本能加速器!)。伝えられるところによれば、それは、事前トレーニングに279万GPU時間、14.8兆トークンの微調整、およびコストを必要としました – によって行われた計算によると 次のプラットフォーム – わずか558万ドル。
しかし、Deepseekの開発者がこの偉業をどのように管理したかは、賢いハックにかかっている可能性があります。
GPU自体の仮想DPU
まず、背景。 Deepseekは、各タスクでアーキテクチャの最も関連性の高い部分のみを選択的にアクティブにすることにより、パフォーマンスを最適化するように設計された高度な混合物(MOE)言語モデルです。モデルの3番目のバージョンであるDeepSeek-V3は、合計6710億パラメーターを備えており、特定のトークン予測に対して370億のみがアクティブになっています。この選択的アクティベーションは、高性能と精度を維持しながら、計算コストを大幅に削減します。これにより、試してみるかどうかがわかります。
Deepseekとそのトレーニングに関して行われた主張に懐疑的になるのは簡単ですが、この論文は、開発者が作業しなければならなかった不自由なハードウェアを最大限に活用するために思いついた魔法の一部を明らかにしています。これには、効率的なパイプライン並列性のためのデュアルパイプアルゴリズムの作成が含まれます。
DeepSeekが公開した情報によると、DualPipeは前方および後方計算を重複し、レイテンシを減らし、GPU全体のデータの動きを最適化します。コミュニケーションを効率的に管理することにより、アイドル時間(パイプラインバブル)を最小限に抑え、計算と通信の間でGPUコンピューティングコア(ストリーミングマルチプロセッサ)を動的にバランスを取り、モデルのスケールとしてデータ転送ボトルネックを防ぎます。
コメンター 次のプラットフォーム デュアルパイプは、「すべてのコミュニケーションを処理するためにGPU自体に基本的に仮想DPUを作成する」と説明しています。これは、データ転送効率の最適化における役割を強調しています。
この論文は、「デュアルパイプの十分な計算パフォーマンスを確保するために、効率的なクロスノードのすべての通信カーネル(派遣と結合を含む)をカスタマイズして、通信専用のSMSの数を節約します。カーネルは、ClusterのMOEゲーティングアルゴリズムとクラスターのネットワークトポロジーと共同設計されています。
あなたも好きかもしれません
#GPU内の仮想DPU巧妙なハードウェアハックはDeepSeekの画期的なAI効率の背後にあることができますか