1753913407
2025-07-30 22:08:00
- Elon Muskは、わずか5年以内に5,000万H100 GPUに相当するAIを計画しています
- Xaiのトレーニング目標は50のExaflopsに等しいが、それは5000万のリテラルGPUを意味するものではありません
- H100で50個のエクサフロップを達成すると、35個の原子力発電所に相当するエネルギーが必要です
Elon MuskはXaiの大胆な新しいマイルストーンを共有しています。 GPU 2030年までに。
AIトレーニングパフォーマンスの尺度としてフレーム化されたこのクレームとは、文字通りの単位数ではなく、容量の計算を指します。
それでも、AI Accelerator Hardwareで進行中の進歩があっても、この目標は、特に電力と資本における並外れたインフラストラクチャのコミットメントを意味します。
コンピューティングスケールの大規模な飛躍。
Xの投稿で、マスクは「Xaiの目標は、5年以内にオンラインでオンラインでH100に相当するAI計算(ただし、はるかに優れた電力効率)の単位で5,000万人である」と述べました。
それぞれ nvidia H100 AI GPUは、AIトレーニング用の一般的な形式であるFP16またはBF16で約1,000 TFLOPSを提供できます。そのベースラインを使用して50のエクスフロップに到達するには、理論的には5000万H100を必要とします。
ただし、BlackwellやRubinなどの新しいアーキテクチャは、チップあたりのパフォーマンスを劇的に改善します。
パフォーマンスの予測によると、ターゲットに到達するには、Feynman Ultra Architectureを将来的に使用する約650,000 GPUのみが必要になる場合があります。
同社はすでに積極的にスケーリングを開始しており、現在のColossus 1クラスターは、200,000のホッパーベースのH100およびH200 GPUに加えて、30,000のBlackwellベースのGB200チップを搭載しています。
新しいクラスターであるColossus 2は、550,000 GB200とGB300ノードを組み合わせて、100万個以上のGPUユニットですぐにオンラインになる予定です。
これにより、Xaiは最先端のAIライターおよびモデルトレーニングテクノロジーの最も迅速な採用者になります。
同社はおそらく、新しいH200よりもH100を選択した可能性があります。なぜなら、前者はAIコミュニティでよく理解されている基準点であり、大規模な展開で広くベンチマークされ、使用されているからです。
その一貫したFP16およびBF16スループットは、長期計画のための明確な測定単位になります。
しかし、おそらく最も差し迫った問題はエネルギーです。 H100 GPUを搭載した50個のExaFlops AIクラスターには、35の原子力発電所に十分な35GWが必要です。
Feynman Ultraなどの最も効率的な投影GPUを使用しても、50のExaFlopsクラスターには最大4.685GWの電力が必要になる場合があります。
これは、Xaiの今後のColossus 2の電力使用量の3倍以上のものです。効率が進歩しても、エネルギー供給のスケーリングは依然として重要な不確実性です。
さらに、コストも問題になります。現在の価格設定に基づいて、単一のNVIDIA H100のコストは25,000ドル以上です。
代わりに650,000の次のGen GPUを使用すると、相互接続、冷却、施設、およびエネルギーインフラストラクチャをカウントすることなく、ハードウェアだけでも数千億ドルに達する可能性があります。
最終的に、Xaiに対するMuskの計画は技術的にもっともらしいが、経済的にもロジスティック的には困難です。
経由 トムシャードウェア
あなたも好きかもしれません
#イーロンマスクは小さな国を乾杯するのに十分なAIの力を望んでいます #誰がこの核サイズの夢にお金を払っていますか