1760270155
2025-10-10 18:14:00
Microsoft は、次世代 NVIDIA InfiniBand ネットワークを介して接続された NVIDIA Blackwell Ultra GPU を備えた、4,600 を超える NVIDIA GB300 NVL72 を備えた初の大規模運用クラスターを提供します。
マイクロソフトが提供するのは、 次世代 NVIDIA InfiniBand ネットワークを介して接続された NVIDIA Blackwell Ultra GPU を備えた、4,600 以上の NVIDIA GB300 NVL72 を備えた初の大規模運用クラスター。このクラスターは、数十万の Blackwell Ultra GPU に拡張するための最初のクラスターです。 Microsoft の AI データセンター全体に導入 これは、AI インフラストラクチャの再定義と NVIDIA とのコラボレーションに対する当社の継続的な取り組みを反映しています。 Blackwell Ultra GPU を備えた大規模クラスターにより、数か月ではなく数週間でモデルのトレーニングが可能になり、推論ワークロードに高いスループットを提供します。また、より大規模で強力なモデルのロックを解除し、数百兆のパラメーターを備えたトレーニング モデルを初めてサポートする予定です。
これは、NVIDIA だけでなく、ハードウェア、システム、サプライ チェーン、施設、その他の複数の分野にわたるコラボレーションによって可能になりました。
Microsoft Azure による NVIDIA GB300 NVL72 スーパークラスターの発売は、フロンティア AI の進歩におけるエキサイティングな一歩です。この共同設計システムは、世界初の大規模 GB300 実稼働クラスターを提供し、OpenAI が数兆パラメータのモデルを処理するために必要なスーパーコンピューティング エンジンを提供します。これは、アクセラレーション コンピューティングの決定的な新しい標準を設定します。
Ian Buck 氏、NVIDIA ハイパースケールおよびハイパフォーマンス コンピューティング担当副社長
NVIDIA GB200 から GB300 へ: AI パフォーマンスの新しい標準
今年の初めに、 Azure が ND GB200 v6 仮想マシン (VM) を導入、NVIDIA の Blackwell アーキテクチャによって高速化されます。これらはすぐに、業界で最も要求の厳しい AI ワークロードのバックボーンとなりました。これには、既に Azure 上で GB200 NVL2 の大規模クラスターを使用してフロンティア モデルをトレーニングおよびデプロイしている OpenAI や Microsoft などの組織も含まれます。
現在、ND GB300 v6 VM により、Azure は再び基準を引き上げています。これらの VM は、推論モデル、エージェント AI システム、マルチモーダル生成 AI 用に最適化されています。ラックスケール システム上に構築されており、各ラックには合計 72 個の GPU を備えた 18 個の VM があります。
- 72 個の NVIDIA Blackwell Ultra GPU (36 個の NVIDIA Grace CPU を搭載)。
- 次世代 NVIDIA Quantum-X800 InfiniBand (2x GB200 NVL72) による、GPU あたり 800 ギガビット/秒 (Gbp/s) のクロスラック スケールアウト帯域幅。
- ラック内の NVIDIA NVLink 帯域幅は 1 秒あたり 130 テラバイト (TB)。
- 37TBの高速メモリ。
- 最大 1,440 ペタフロップス (PFLOPS) の FP4 Tensor コア パフォーマンス。
大規模な AI スーパーコンピューティングの構築
フロンティア AI のインフラストラクチャを構築するには、コンピューティング、メモリ、ネットワーキング、データセンター、冷却、電源など、スタックのすべての層を統合システムとして再考する必要があります。 ND GB300 v6 VM は、シリコン、システム、ソフトウェアにわたる長年のコラボレーションによるこの変革を明確に表しています。
ラック レベルでは、NVLink と NVSwitch によってメモリと帯域幅の制約が軽減され、合計 37 TB の高速メモリを接続する最大 130 TB/秒のラック内データ転送が可能になります。各ラックは緊密に結合されたユニットとなり、大規模なモデルとより長いコンテキスト ウィンドウでレイテンシーを低減しながらより高い推論スループットを実現し、エージェントおよびマルチモーダル AI システムの応答性とスケーラビリティをこれまで以上に向上させます。
ラックを超えて拡張するために、Azure は、現在利用可能な最速のネットワーク ファブリックである NVIDIA Quantum-X800 Gbp/s InfiniBand を使用した完全なファットツリーのノンブロッキング アーキテクチャをデプロイしています。これにより、顧客は最小限の通信オーバーヘッドで超大規模モデルのトレーニングを効率的に数万の GPU にスケールアップでき、エンドツーエンドのトレーニング スループットが向上します。同期オーバーヘッドの削減は、GPU の最大限の利用にもつながり、AI トレーニング ワークロードのコンピューティングを大量に消費する性質にもかかわらず、研究者が反復処理をより速く、より低コストで行うのに役立ちます。カスタム プロトコル、集合ライブラリ、ネットワーク内コンピューティングを含む Azure の共同設計スタックにより、ネットワークの信頼性が高く、アプリケーションが最大限に活用できることが保証されます。 NVIDIA SHARP のような機能は、スイッチ内で演算を実行することで集合的な操作を加速し、実効帯域幅を 2 倍にし、大規模なトレーニングと推論をより効率的かつ信頼性の高いものにします。
Azure の高度な冷却システムは、スタンドアロンの熱交換器ユニットと施設冷却を使用して、GB300 NVL72 のような高密度の高性能クラスターの熱安定性を維持しながら、水の使用量を最小限に抑えます。また、ND GB300 v6 VM クラスの GPU クラスターに必要な高エネルギー密度と動的負荷分散をサポートできる新しい電力分配モデルの開発と展開も継続しています。
さらに、ストレージ、オーケストレーション、スケジューリング用に再設計されたソフトウェア スタックは、スーパーコンピューティング規模でコンピューティング、ネットワーキング、ストレージ、データセンター インフラストラクチャを最大限に活用できるように最適化されており、前例のないレベルのパフォーマンスを高効率でお客様に提供します。

将来を見据えて
Microsoft は、最新テクノロジーへの迅速な対応と移行を可能にするために、AI インフラストラクチャに長年投資してきました。それも理由です アズール は、今日のフロンティア AI の需要を満たすために、生産規模で GB300 NVL72 インフラストラクチャを急速なペースで提供できる独自の立場にあります。
Azure が GB300 の世界的な展開を強化し続けるにつれて、お客様は前世代と比較してわずかな時間で新しいモデルをトレーニングして展開できることが期待できます。 ND GB300 v6 VM v6 は AI インフラストラクチャの新しい標準となる準備が整っており、Azure はその先導者であることを誇りに思っており、お客様が最先端の AI 開発を進めることをサポートしています。
Azure が NVIDIA GB300 NVL72 の実稼働デプロイメントを世界的に拡大するにつれて、さらなる更新とパフォーマンス ベンチマークにご期待ください。
#NVIDIA #GB300 #NVL72 #大規模な次世代 #インフラストラクチャ