日本語版
最新ニュース
世界

ウェーハスケールエンジンvs GPU:AIインフラストラクチャの未来

ケイリー・ハリソン 人工知能は、モデルのサイズと複雑さの両方で拡大し続けており、その基礎となるインフラストラクチャはその限界まで押し上げられています。 GPUは長い間機械学習と推論のデフォルトでしたが、新しいクラスのハードウェアであるWafer-Sale Engines(WSES) - は標準に挑戦しています。これらの大規模なプロセッサは、レイテンシが低く、エネルギー効率が向上している大規模なAIワークロードを処理するように設計されており、次世代AIシステムを構築する企業の真剣な候補として配置します。 WSEは、従来のチップアーキテクチャからのシフトを表しています。クラスター内の複数のチップに処理能力を分散するのではなく、WSEは数十万のA-Optimizedコアを単一のシリコンウェーハに統合します。を取る セレブラスWSE-3:特に兆しパラメーターAIモデルを訓練および実行するために構築されたモノリシックチップ。 WSESの統合された性質は、スループットの改善と操作あたりの電力の削減にも役立ちます。これは、データセンターの持続可能性が最終的な懸念になりつつある時代のキーの利点です。 最近のピアレビュー研究 カリフォルニア大学リバーサイド校のエンジニアから、ウェーハスケールシステムのケースに学力を加えています。デバイスで公開されたこのレビューは、大規模なAIの上昇するパフォーマンスとエネルギー需要を満たすことができるハードウェアの必要性の高まりを強調しています。 UC Riversideチーム(エンジニアリングとコンピューターサイエンスの分野)は、セレブラスウェーハスケールエンジン3(WSE-3)のようなウェーハスケールの加速器の可能性を検討しました。郵便切手の大きさの従来のGPUとは異なり、WSEはディナープレートのほぼ直径のシリコンウェーハ全体に構築されています。このスケールにより、WSE-3の場合、単一のウェーハで900,000個の特殊なAIコアと4兆個のトランジスタを使用して、前例のないコンピューテリソースの濃度が可能になります。 研究者たちは、これらのアーキテクチャが大幅に効率的なデータ移動を可能にすると結論付けました。これは、AIモデルが数兆のパラメーターに成長するにつれて重要です。ウェーハスケールシステムは、GPUベースのクラスターで既知のボトルネックである個別のチップ間のエネルギー集約型通信の必要性を減らします。 論文の主著者であるUCRのBourns College of EngineeringのMihri Ozkan教授によると、従来のシステムは、現代AIのエネルギーと熱的需要にますます緊張しています。この分析では、AIハードウェアのシフトは、パフォーマンスの速いだけでなく、過度の電力を過熱したり消費したりせずに極端なデータスループットを管理できるアーキテクチャの構築についても強調しています。 レビューはそれも指摘しています テスラの道場D1チップ 同様の哲学に従い、約9,000のコアと1.25兆のトランジスタをモジュラーユニットに梱包します。どちらのシステムも、計算をウェーハにローカルに保ち、従来の相互接続間でデータの転送で失われた時間とエネルギーを排除することにより、AIワークロードを合理化することを目指しています。 テスラの道場システムは、ウェーハスケールの考え方を紹介します。単一のウェーハではなく、それぞれ25 d1チップで構成される相互接続されたトレーニングタイルを介して拡張します。 WSE-3のようなモノリシックではありませんが、Dojoのモジュラー設計により、自律運転などのワークロード用に最適化されたタイルごとの理論的計算能力の1.3エクサフロップが可能になります。緊密な相互接続と高度な冷却により、Dojoは従来のGPUセットアップを制限することが多いノード間レイテンシなしで競争力のあるパフォーマンスを提供します。 それでも、トレードオフがあります。 WSEは高価で、多くの場合、システムあたり200万ドル以上の費用がかかります。彼らの限られたソフトウェアエコシステムは、開発者が既存のフレームワークを適応させる必要があることを意味します。CerebrasはSDKを提供しますが、CUDAの成熟とはほど遠いものです。大規模なウェーハや物理的なスケーラビリティの制限の欠陥耐性など、製造上の課題も広範な展開を妨げます。 GPUは主力のままですが、どれくらいの間ですか? 新しいハードウェア周辺の話題にもかかわらず、GPUは数十年にわたる生態系の開発により、AIインフラストラクチャを支配し続けています。 GPUの最大の利点の1つはソフトウェアです。 PytorchやTensorflowなどのフレームワークは、NvidiaのCUDAプラットフォームと密接に統合されており、分散トレーニング、推論の最適化、ハードウェア加速のための堅牢なツールを提供します。 AWS、META、Microsoftなどの主要なプレーヤーは、DGX SuperPodなどのH100ベースのシステムに依存して大規模なAIサービスを実行し、クラウドおよびエンタープライズの展開におけるGPUクラスターの継続的な関連性を反映しています。 ただし、AIモデルが兆パラメーターマークを超えて成長するにつれて、GPUインフラストラクチャは制限を示し始めます。 GPU間の通信 - Via PCIEまたはNVLINK…

ウェーハスケールエンジンvs GPU:AIインフラストラクチャの未来

1750977417
2025-06-26 22:00:00

ケイリー・ハリソン

人工知能は、モデルのサイズと複雑さの両方で拡大し続けており、その基礎となるインフラストラクチャはその限界まで押し上げられています。 GPUは長い間機械学習と推論のデフォルトでしたが、新しいクラスのハードウェアであるWafer-Sale Engines(WSES) – は標準に挑戦しています。これらの大規模なプロセッサは、レイテンシが低く、エネルギー効率が向上している大規模なAIワークロードを処理するように設計されており、次世代AIシステムを構築する企業の真剣な候補として配置します。

WSEは、従来のチップアーキテクチャからのシフトを表しています。クラスター内の複数のチップに処理能力を分散するのではなく、WSEは数十万のA-Optimizedコアを単一のシリコンウェーハに統合します。を取る セレブラスWSE-3:特に兆しパラメーターAIモデルを訓練および実行するために構築されたモノリシックチップ。 WSESの統合された性質は、スループットの改善と操作あたりの電力の削減にも役立ちます。これは、データセンターの持続可能性が最終的な懸念になりつつある時代のキーの利点です。

最近のピアレビュー研究 カリフォルニア大学リバーサイド校のエンジニアから、ウェーハスケールシステムのケースに学力を加えています。デバイスで公開されたこのレビューは、大規模なAIの上昇するパフォーマンスとエネルギー需要を満たすことができるハードウェアの必要性の高まりを強調しています。

UC Riversideチーム(エンジニアリングとコンピューターサイエンスの分野)は、セレブラスウェーハスケールエンジン3(WSE-3)のようなウェーハスケールの加速器の可能性を検討しました。郵便切手の大きさの従来のGPUとは異なり、WSEはディナープレートのほぼ直径のシリコンウェーハ全体に構築されています。このスケールにより、WSE-3の場合、単一のウェーハで900,000個の特殊なAIコアと4兆個のトランジスタを使用して、前例のないコンピューテリソースの濃度が可能になります。

研究者たちは、これらのアーキテクチャが大幅に効率的なデータ移動を可能にすると結論付けました。これは、AIモデルが数兆のパラメーターに成長するにつれて重要です。ウェーハスケールシステムは、GPUベースのクラスターで既知のボトルネックである個別のチップ間のエネルギー集約型通信の必要性を減らします。

論文の主著者であるUCRのBourns College of EngineeringのMihri Ozkan教授によると、従来のシステムは、現代AIのエネルギーと熱的需要にますます緊張しています。この分析では、AIハードウェアのシフトは、パフォーマンスの速いだけでなく、過度の電力を過熱したり消費したりせずに極端なデータスループットを管理できるアーキテクチャの構築についても強調しています。

レビューはそれも指摘しています テスラの道場D1チップ 同様の哲学に従い、約9,000のコアと1.25兆のトランジスタをモジュラーユニットに梱包します。どちらのシステムも、計算をウェーハにローカルに保ち、従来の相互接続間でデータの転送で失われた時間とエネルギーを排除することにより、AIワークロードを合理化することを目指しています。

テスラの道場システムは、ウェーハスケールの考え方を紹介します。単一のウェーハではなく、それぞれ25 d1チップで構成される相互接続されたトレーニングタイルを介して拡張します。 WSE-3のようなモノリシックではありませんが、Dojoのモジュラー設計により、自律運転などのワークロード用に最適化されたタイルごとの理論的計算能力の1.3エクサフロップが可能になります。緊密な相互接続と高度な冷却により、Dojoは従来のGPUセットアップを制限することが多いノード間レイテンシなしで競争力のあるパフォーマンスを提供します。

それでも、トレードオフがあります。 WSEは高価で、多くの場合、システムあたり200万ドル以上の費用がかかります。彼らの限られたソフトウェアエコシステムは、開発者が既存のフレームワークを適応させる必要があることを意味します。CerebrasはSDKを提供しますが、CUDAの成熟とはほど遠いものです。大規模なウェーハや物理的なスケーラビリティの制限の欠陥耐性など、製造上の課題も広範な展開を妨げます。

GPUは主力のままですが、どれくらいの間ですか?

新しいハードウェア周辺の話題にもかかわらず、GPUは数十年にわたる生態系の開発により、AIインフラストラクチャを支配し続けています。

GPUの最大の利点の1つはソフトウェアです。 PytorchやTensorflowなどのフレームワークは、NvidiaのCUDAプラットフォームと密接に統合されており、分散トレーニング、推論の最適化、ハードウェア加速のための堅牢なツールを提供します。 AWS、META、Microsoftなどの主要なプレーヤーは、DGX SuperPodなどのH100ベースのシステムに依存して大規模なAIサービスを実行し、クラウドおよびエンタープライズの展開におけるGPUクラスターの継続的な関連性を反映しています。

ただし、AIモデルが兆パラメーターマークを超えて成長するにつれて、GPUインフラストラクチャは制限を示し始めます。 GPU間の通信 – Via PCIEまたはNVLINK – は、パフォーマンスボトルネックになる可能性があります。たとえば、80億パラメーターモデルを実行すると、セレブラスのWSE-3は1秒あたり1,800トークを超えるトークンを達成しますが、ハイエンドのH100クラスターはしばしば約240ピークに達します。これらのパフォーマンスギャップは、分散システムにおけるレイテンシーとメモリの動きの影響を強調しています。

エネルギー効率も別の懸念事項です。個々のH100 GPUは約700ワットを消費し、データセンターにスケーリングするとハイエンドの冷却とパワーインフラストラクチャが必要です。ウェーハスケールシステムは、相互接続エネルギーのオーバーヘッドの多くを排除することにより、エッジを獲得します。 Cerebrasは、炭素キャプチャなどのドメイン固有のシミュレーションでワットあたりのパフォーマンスが大幅に向上していると報告しており、テスラはDojoの最新世代で1.3×効率の向上を主張しています。

最後の言葉

エンタープライズAIランドスケープは急速に進化しており、インフラストラクチャの要求も進化しています。 WSEは、モデルのサイズと速度の境界を押し広げる組織に魅力的な利点を提供します。特に、潜時、エネルギー使用、スループットはミッションクリティカルです。一方、GPUは、成熟したツールと幅広い可用性のおかげで、多くのワークロードに対してより柔軟で費用対効果の高いソリューションのままです。

これはバイナリの選択ではなく、戦略的な選択です。基本的なAIモデルを構築したり、大規模なLLMを展開したりする企業向けに、WSEのような次世代ハードウェアに投資すると、競争力を提供する場合があります。他の人にとっては、GPUクラスターを活用し続けること – 将来のアーキテクチャのシフトのためにアジャイルな状態を維持することは、健全なアプローチを提供します。

#ウェーハスケールエンジンvs #GPUAIインフラストラクチャの未来

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。