日本語版
最新ニュース
世界

Vista により、TACC には将来の Horizo​​n スーパーコンピュータへの 3 つの道ができました

米国、ヨーロッパ、中国の国立スーパーコンピューティング センターは、非常に強力なマシンを構築できるだけでなく、各国政府のおかげで、賭け金をヘッジするために複数の、多少互換性のないアーキテクチャを引き受け、サポートするのに十分な金持ちでもあります。彼らのリスクを軽減します。 米国では、エネルギー省と協力して、国立科学財団が選択肢をオープンにしておくのを好みます。 次のプラットフォーム 過去 10 年間にわたり、NSF の主力施設であるテキサス大学のテキサス アドバンスト コンピューティング センターを通じて、TACC 内のさまざまなベンダーに複数のアーキテクチャを提供するのに十分な意欲と資金さえあります。 しかし最終的には、TACC の主力システムとして 1 つのコンピューティング エンジンが選択され、施設で最近「Vista」ハイブリッド CPU-GPU クラスターが稼働したことにより、インテルとインテルの間の三つ巴の競争の舞台が整いました。 、AMD、および Nvidia が、将来の「Horizon」スーパーコンピューターの計算エンジンのサプライヤーとなる予定。 現在のオールCPUスーパーコンピュータ「Frontera」、建設に6,000万ドルかかり、2019年に設置されました。 インテル製品ラインとコロナウイルスのパンデミックの問題が発生する前、TACC は、おそらくその計算能力の多くまたはほとんどを提供する何らかのアクセラレーターを備えた Frontera の第 2 フェーズが 2021 年に提供されることを期待していましたが、代わりにTACC は、その関連システムである「Lonestar」および「Stampede」システムをアップグレードし、合計 448,448 個のコアと 38.7 ピーク ペタフロップスのパフォーマンスを備えた 8,008…

Vista により、TACC には将来の Horizo​​n スーパーコンピュータへの 3 つの道ができました

1706575247
2024-01-29 23:48:13

米国、ヨーロッパ、中国の国立スーパーコンピューティング センターは、非常に強力なマシンを構築できるだけでなく、各国政府のおかげで、賭け金をヘッジするために複数の、多少互換性のないアーキテクチャを引き受け、サポートするのに十分な金持ちでもあります。彼らのリスクを軽減します。

米国では、エネルギー省と協力して、国立科学財団が選択肢をオープンにしておくのを好みます。 次のプラットフォーム 過去 10 年間にわたり、NSF の主力施設であるテキサス大学のテキサス アドバンスト コンピューティング センターを通じて、TACC 内のさまざまなベンダーに複数のアーキテクチャを提供するのに十分な意欲と資金さえあります。

しかし最終的には、TACC の主力システムとして 1 つのコンピューティング エンジンが選択され、施設で最近「Vista」ハイブリッド CPU-GPU クラスターが稼働したことにより、インテルとインテルの間の三つ巴の競争の舞台が整いました。 、AMD、および Nvidia が、将来の「Horizon」スーパーコンピューターの計算エンジンのサプライヤーとなる予定。 現在のオールCPUスーパーコンピュータ「Frontera」、建設に6,000万ドルかかり、2019年に設置されました。

インテル製品ラインとコロナウイルスのパンデミックの問題が発生する前、TACC は、おそらくその計算能力の多くまたはほとんどを提供する何らかのアクセラレーターを備えた Frontera の第 2 フェーズが 2021 年に提供されることを期待していましたが、代わりにTACC は、その関連システムである「Lonestar」および「Stampede」システムをアップグレードし、合計 448,448 個のコアと 38.7 ピーク ペタフロップスのパフォーマンスを備えた 8,008 個の 2 ソケット「Cascade Lake」Xeon SP ノードを順調に稼働させ続けました。

2021年導入機「ロンスター6」 は、AMD の「Milan」Epyc 7763 プロセッサをベースにしており、71,680 個のコアを備え、3 ペタフロップスのピーク F64 出力を 840 万ドルで提供します。

Stampede 3 は昨年インストールされました そして間もなく生産開始される予定です。 Stampede 3 マシンは、以前の Stampede 2 システムで使用されていた 1,064 個の Intel 「Skylake」 Xeon SP ノードと 224 個の「Ice Lake」 Xeon SP ノードを維持し、HBM2e メモリを搭載した Intel の「Sapphire Rapids」 Max シリーズ CPU に基づいて 560 個のノードを追加しました。合計 137,952 コア (Intel の「Ponte Vecchio」GPU Max シリーズ アクセラレータを使用するいくつかの実験ノードを含む) と、FP64 精度でのピーク 10 ペタフロップス弱を組み合わせます。

Vista システムでは、Nvidia が積極的に取り組んでいます。 Vista マシンには 600 個のスーパーチップが搭載されており、コヒーレントなメモリ空間で 72 コアの「Grace」 CG100 Arm サーバー CPU と「Hopper」 GH100 GPU アクセラレータを組み合わせています。 H100 GPU のベクトル エンジンだけで 20.4 テラフロップスのピーク FP64 パフォーマンスを実現し、H100 に組み込まれた行列演算ユニットの FP64 ではその 2 倍の最大 40.2 テラフロップスを実現できます。 基本的に、Vista は Frontera と同じくらい生の活力を持っています。もちろん、コードを CPU から GPU に移植できるという条件で。 したがって、理論的には、Frontera の 10 倍の生のパフォーマンスを生み出すには、Vista を 10 台組み合わせるだけで済みます。これが、TACC がオースティン郊外に建設中の新しいリーダーシップ クラスのコンピューティング施設に搭載される予定の将来の Horizon スーパーコンピューターの目標です。と組み合わせて コロケーション データセンター オペレーター スイッチ

ザ・ロックとして知られるこの施設は、スイッチが運営する5番目の主要データセンター・サイトで、リノ、ラスベガス、アトランタ、グランドラピッズで運営するデータセンターに次ぐものとなる。 オースティンのサイトのうち、Horizon スーパーコンピューターが設置される部分は次のようになります。

Switch が建設中の The Rock データセンター コンプレックスは次のようになります。

TACC は、将来の Horizon スーパーコンピューターと、それと他の将来のスーパーコンピューターを収容する LCCF 施設の設計に非常に長い視野を持って取り組んできました。 NFS 2020年9月に初期設計作業に350万ドルの資金を提供した、そして今 NSFは2024年から2027年の間にLCCFに全額資金を提供するために5億2000万ドルから6億2000万ドルの間の資金を求めている (これらは、その年の 7 月 31 日に終了する米国政府の会計年度です)。 しかし、同じ文書には、2029 年度までの支出総額が 6 億 5,600 万ドルであることを示す表があります。 このうち、年間 4,000 万ドルが LCCF の運営に割り当てられます。

Horizon システムはその予算の大きな部分を占めていますが、皆さんが考えているほどではありません。 テキサス大学の研究担当副学長であり、TACC のエグゼクティブディレクターである Dan Stanzione 氏は、デンバーで開催されたスーパーコンピューティング会議 SC23 で発表される前に、Stampede 3 と間もなく登場する Vista マシンについて話したときに、TACC の考え方について洞察を与えてくれました。去年。 当時、私たちが Stanzione だったら、Grace-Grace マシンと Grace-Hopper マシンを何台か購入し、コンピューティング エンジン ベンダー 3 社すべてを入札合戦で獲得するだろうと話しましたが、彼は笑うだけでした。

おそらくそれがまさに計画通りだからでしょう。

しかし、NSF のワークロードの多様性を考慮すると、LCCF の最初のマシンとなる Horizon システムを実際に設計するのは簡単ではありません。

「Horizon 用にプロファイリングしているアプリケーションについては、現時点で 40% の GPU が良好な状態にあることがわかっています」と Stanzione 氏は語ります。 次のプラットフォーム。 「しかし、それは、私たちの大規模な科学アプリケーションの 60% がそうではないことを意味します。 そのため、アプリとほぼ同じ割合で資金を投資するつもりですが、Horizon 用に重要な CPU コンポーネントを用意することを約束しました。 つまり、GPU のコストは 40 パーセント、ピーク フロップの観点から見ると 4 ~ 5 倍安いため、約 80 パーセントの GPU フロップを意味します。」

私たちの最善の推測は、Horizon は「Blue Waters」マシンとほぼ同じコストになるだろうということでした。 Cray は 2011 年にイリノイ大学の国立スーパーコンピューティング応用センター向けに構築されました。この費用は 1 億 8,800 万ドルであり、NSF による単一システムへの支出としては最高水準でした。 そしてスタンツィオーネ氏は、2025年に建設され2026年に稼働するHorizonシステムのコストはその程度で、オークリッジの「フロンティア」システムにかかる5億ドルと比べても「くしゃみするようなものではない」と認めた。国立研究所が2年前に設置したときの費用、あるいはローレンス・リバモア国立研究所が現在開発中の差し迫った「エル・キャピタン」システムの費用4億ドルだ。 (これらは、システムコストから非経常エンジニアリング (NRE) コストを差し引いたものです。)

そのため、現在実行されているアプリケーションのパフォーマンスが Frontera と比較して 10 倍向上するという問題は残ります。

TACC の 190 名の研究者の 1 人である Lars Koesterke 氏は、2023 年 3 月に Frontera と Horizon に関するプレゼンテーションをまとめました。 この記事を書くために今日探し回っていたときに見つけたもの。 これは、TACC が米国の HPC にとってどのように中心になったかを示しています。

ちなみに、LCCF の定格は 15 MW ですが、UT キャンパスの現在の施設の定格は 12 MW です。 しかし、オースティン郊外のスイッチ データセンターには成長の余地がたくさんあり、現在の TACC の場所にさらに多くの電力を供給することに苦労する必要はありません。

また、年間 70 億の計算時間と 50 億のファイルを処理してください。 それはそれ自身の種類のハイパースケールです。 そして、何万ものユーザーと何千ものプロジェクトを管理するのは冗談ではありません。 以前にも言いましたが、もう一度言います。ある意味、ハイパースケーラーは楽です。 彼らは大規模ないくつかのワークロードを管理します。 しかし、パフォーマンスを絶対限界まで押し上げようとしている場合、桁違いに高いワークロード数を管理することは、それ自体が特別な悪夢です。 そして、TACC はおそらくこれを行う上で世界最高の HPC センターであり、Koesterke 氏がまとめたプレゼンテーションまでの 12 か月間で配信された 113 万件のジョブにおいて 99.2% の稼働率と 95.4% の稼働率を達成しました。

これは、Stanzione のチームが TACC の主力マシンで対処しなければならない悪夢です。

これは世界で最もクレイジーなテトリス ゲームであり、ワークロード マネージャーがこれを実現できるのは人間の天才の証です。

TACC が将来の Horizon システムのアーキテクチャを計画する際にコストをどのように考えているかは次のとおりです。

現実世界には、HPC 関係者が熟考すべき冷や水が存在します。

これらすべてが Horizon の設計に反映されます。Horizon には CPU 間ノードと CPU 間 GPU ノードが混在し、Frontera の 10 倍という目標によってアプリケーションのパフォーマンスを向上させるように明示的に設計されています。 Koesterke 氏は、アプリケーションのパフォーマンスに関して TACC が注目する要素は 4 つあると述べており、次のように引用しています。

  • ランタイムが変わったのでしょうか? (Strong Scaling に似ています。同じ問題をより短い時間で実行します)。
  • 問題のサイズは変わりましたか? (Weak Scaling に似ています – 固定時間内に大きな問題を実行します)
  • 総リソースの多かれ少なかれ使用しましたか? (スループットに似ています)。
  • 物理学が変わったのか? (良いアナログではありません)。

ここから、TACC が Horizon 設計を推進するために使用する実際のデルタがわかります。

上記の 4 つの係数の乗算として平均化されますが、同じ CPU と GPU ハードウェアであっても、すべてのアプリケーションがこれら 4 つの係数を同じ割合で乗算するわけではありません。 目標は、ケスターケが調査した20の「特性科学応用」またはCSA(天文学と天体物理学、生物物理学と生物学、数値流体力学、地球力学と地球システム、材料工学に及ぶ)の範囲で10倍の成績を収めることです。コードの性質とアイアンへのマッピングを考慮すると、個々のアプリケーションにとって意味のある方法であれば何でも構いません。

重要なのは、400 ペタフロップスの CPU-GPU マシン、または合計で最大 400 ペタフロップスとなる CPU 専用ノードと GPU アクセラレーション ノードの組み合わせを構築して、それを 1 日で完了するほど単純ではないということです。 TACC には、多くの異なるコードと多くの異なる顧客がいます。これは、多くの場合、少数のキー コードと、アーキテクチャの飛躍を超えてコードを移植するための多額の資金を保有する他の米国国立研究所とは異なります。 Frontera にはこれらの機能クラスのワークロードが一定数ありますが、これらが独占するわけではありません。

NSF と TACC がハードウェアをジョブにどのようにマッピングするかを見るのを楽しみにしています。 Horizon がどのように構築されるかから、私たちは皆、多くのことを学ぶことができます。

#Vista #によりTACC #には将来の #Horizon #スーパーコンピュータへの #つの道ができました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。