1707255517
2024-02-06 21:28:08
Nvidia が開発した「Grace」 CG100 サーバー プロセッサーは、同社初の本格的なサーバー CPU であり、「Hopper」 GH100 GPU アクセラレータのメモリ空間を拡張するための非常に便利な付属品であり、HPC シミュレーションとモデリング ワークロードに最適に設計されています。 また、いくつかの主要なスーパーコンピューティング ラボが Grace CPU を HPC のペースでテストしており、いくつかの興味深い初期結果が得られています。
Grace CPU はコア数が比較的多く、熱フットプリントが比較的低く、ラップトップで使用されている種類の低消費電力 DDR5 (LPDDR5) メモリのバンクを備えていますが、サーバー クラスになるようエラー訂正が強化されており、十分な容量があります。 HPC システムでは、最近ではノードあたり 256 GB または 512 GB が一般的ですが、それより少ない場合もあります。
2 つの Grace CPU を Grace-Grace スーパーチップに統合します。これは、LPDDR5 メモリ バンク全体でメモリ コヒーレンスを提供し、消費電力がわずか約 500 ワットである NVLink チップ間相互接続を使用した密結合パッケージであり、HPC 群衆にとって非常に興味深いものになります。 。 これにより、Armv9 アーキテクチャを備えた合計 144 個の Arm Neoverse 「Demeter」 V2 コアと、546 GB/秒のピーク理論帯域幅を備えた 1 TB の物理メモリが得られます。 何らかの理由で、おそらく LPDDR5 メモリの歩留まりに関連して、実際に使用できるメモリ容量は 480 GB のみ、メモリ帯域幅は 512 GB/秒のみです。 Nvidia がそれを実現したい場合は、合計帯域幅 1 TB/秒で 288 コアと 960 GB のメモリにわたってコヒーレントな 4 ウェイ Grace コンピューティング モジュールを作成できます。 このようなクワッドは、 N-1 または N-2 第 2 世代の GPU はコストパフォーマンスに優れています。 。 。 。
参考までに、私たちがやったのは、 Grace チップに関する最初の分析 2022 年 3 月の発売時には、 Grace チップのアーキテクチャを掘り下げた 2022 年 8 月 (当時は Nvidia がどの Arm コアを使用しているかまだ誰もわかっていませんでした)、 Demeter V2コアに深く入り込みました 2023 年 9 月に Arm がアーキテクチャの詳細を発表しました。 アーキテクチャについて改めて説明するつもりはありませんが、Nvidia が (独自のコアを設計するのではなく) Grace に採用した Arm V2 コアには 4 つの 128 ビット SVE2 ベクトル エンジンが搭載されており、このペアに匹敵するものであることを思い出してください。 Intel Xeon SP アーキテクチャに AVX-512 ベクトル エンジンを搭載しているため、従来の HPC ワークロードだけでなく、特定の AI 推論ワークロード (大きすぎないもの) を実行でき、場合によっては適度なサイズの AI モデルの再トレーニングも実行できます。
バルセロナ スーパーコンピューティング センターと、ストーニー ブルックとバッファローにあるニューヨーク州立大学のキャンパスから最近発表されたデータは、これを確かに裏付けています。 両グループは、さまざまな HPC および AI ベンチマークで Grace-Hopper と Grace-Grace スーパーチップを比較したいくつかのベンチマーク結果を公開しました。それは、私たちがすでに推測していることを示しています。熱とおそらくコストを考慮すると、Grace CPU は、 HPC でその重みを発揮します。
両組織は以下の論文を発表しました。 HPC アジア 2024 カンファレンス 先週名古屋で開催されました。 BSCから出たものはと呼ばれます HPC アプリケーション向けの Nvidia Grace スーパーチップの早期評価、 ここで読むことができます、ストーニーブルックとバッファローの研究者によるものは次のように呼ばれています。 科学ワークロード向けの Nvidia Grace CPU スーパーチップと Nvidia Grace Hopper スーパーチップの第一印象、 ここで読むことができます。 これらの論文は合わせて、主要な HPC アプリケーションが Grace-Grace および Grace-Hopper スーパーチップ上でどのように動作するかについての現実的な見解を示しています。 SUNY の研究者らの論文は、複数の HPC センターと 1 つのクラウド ビルダーからのパフォーマンスの数値をまとめているため、より有用であると考えられます。 具体的には、2 番目の論文のデータは、Stony Brook、AWS、ピッツバーグ スーパーコンピューティング センター、テキサス アドバンスト コンピューティング センター、およびパデュー大学からのパフォーマンス データを利用しています。
BSC は、Nvidia Grace-Grace および Grace-Hopper スーパーチップのパフォーマンスを比較しました。これらは、その実験クラスター部分の一部です。 MareNostrum 5 システムは、2.1 GHz で動作する 24 コアの「Skylake」Xeon SP-8160 Platinum プロセッサのペアで構成されるノードに基づいていた、以前の MareNostrum 4 スーパーコンピュータの X86 CPU ノードと比較します。 以下は、Grace-Hopper ノードおよび Grace-Grace ノードと比較した MareNostrum 4 ノードの便利なブロック図です。
Grace-Hopper ノードでは、BSC はスーパーチップの CPU 部分でさまざまな HPC アプリケーションのみをテストしました。 (Stony Brook チームは、初期採用 Nvidia システムの評価において、CPU と CPU のペアと CPU と GPU のペアをテストしました。)
以下は、BSC がテストした 3 つのシステムのアーキテクチャを比較してまとめた、別の便利な表です。
BSC によると、Grace プロセッサの早期アクセス バージョンには 3.2 GHz までに調整された CPU が搭載されており、メモリ帯域幅も Nvidia が完全な量産ユニットに想定していたものよりも調整されていなかったという。 正確な量は定量化されていませんが、テストされたユニットの Grace CPU のクロック速度は約 3.2 GHz でした。
アプリケーションに関しては、BSC は自社開発の Alya 計算力学コード、OpenFOAM 数値流体力学、NEMO 海洋気候モデル、LAMMPS 分子動力学モデル、および PhysiCell 多細胞シミュレーション フレームワークを 3 種類のノード上で実行しました。 以下は、Grace-Grace ノードと MareNostrum 4 ノードの比較の概要です。 Grace-Hopper ノードは GPU が使用されておらず、Grace-Grace ノードのパフォーマンスのおよそ半分になるはずなので無視します。 同じ数のコアを使用した場合の高速化を見てください。
- Alya アプリケーションでは、Grace-Grace は 1.67 倍から 1.81 倍高速でした。
- OpenFOAM では、Grace-Grace による高速化は 4.49 倍でした。
- NEMO では、スピードアップは 2.78 倍でした。
- LAMMPS では、同じコア数 (1 ~ 288 の範囲) で速度向上は 2.1 倍から 2.9 倍でした。
- PhysiCell では、各ノード上の同じ 48 コアの速度向上は 3.24 倍でした。
明らかに、Grace-Grace ユニットには 3 倍のコアがあるため、ノード間のパフォーマンスはこれに比例するはずです。
上で指摘したように、Stony Brook の論文でも多数のベンチマークを実行し、他のマシンからの結果を収集しました。 以下は、HPC チャレンジ (HPCC) ベンチマークを実行しているさまざまなノードの相対パフォーマンスを示す表です。マトリックス、LINPACK、FFT 要素は個別に抽出されています。
エラーバーのあるベンチマーク データを目にするのは久しぶりです。誤差バーは、読み取りが難しいため常に存在しており、ほとんどのテストには含まれていません。 とにかく、ソケットレベルで見ると、Grace-Grace スーパーチップのパフォーマンスは、Intel「Ice Lake」と「Skylake」Xeon SP の間、「Milan」と「Rome」AMD Epyc よりも高いです。 (美しいテーブルですが、方法はありません。 ありがとう。)
コンピューティング帯域幅とメモリ帯域幅のバランスが重視され、スーパーコンピューターが哀れに見えることも多い、より厳しい HPCG (High Performance Conjugate Gradients) テストでは、Grace-Grace スーパーチップの結果は次のとおりです。
すべてのマシンで 1,100 万セルを使用した MotoBikeQ シミュレーションを使用して、Grace-Grace が OpenFOAM 上でどのように積み上げられたかを次に示します。
私たちは、グレース・グレースユニットがここでより良いパフォーマンスを発揮することを期待していました。 うーん。
そして最後に、Gromacs 分子動力学ベンチマークが CPU-GPU と CPU のみの両方のバリエーションでさまざまなノード上でどのように並んでいるかを示します。
勝者が決まりました! グレースとホッパーの組み合わせがどれほどうまく機能するかを見てください。 ただし、同じ Hopper GPU と組み合わせた CPU であれば、おそらく同様に動作します。 CPU のみの Grace-Grace ユニットでは、Gromacs のパフォーマンスは、「Sapphire Rapids」Xeon Max シリーズ CPU のペアとほぼ同じくらい強力です。 このチップ上の HBM メモリが Gromacs にはあまり役に立たないことは注目に値します。 うーん。
とにかく、これは Grace CPU と HPC のワークロードについて考える材料です。 Stony Brook の論文には他のベンチマークもありますので、ぜひチェックしてください。
#Nvidia #のGraceArm #CPU #が #HPC #向け #X86 #に対抗