先週、次の2025年の会議に先立って、次に基調講演中にGoogle Cloudの前のブリーフィング前のブリーフィングの一環として、Googleのトップブラスは、「Ironwood」TPU V7PシステムのポッドをLawrence Livermore National Laboratoryの「El Capitan」スーパーコンピューターと比較し続けました。そして、彼らはそれを間違え続け、それは私たちを悩ませました。
マシンの主な目的は、従来のHPCシミュレーションとモデリングワークロードを実行することであり、他のマシン(Ironwood Pod)では、マシンが高精度のフローティングポイント数学をまったく実行できず、実際にAIトレーニングと推論を行うように設計されている場合でも、大規模なAIシステムに対してこのような比較を行うことは完全に合法です。ある意味では、CPUとGPUのハイブリッドアーキテクチャを使用するマシンは、計算の幅広い数値と精度と多種多様なワークロードを考えると、より汎用マシンであり、そのようなマシンアーキテクチャには多目的であるという点があります。
しかし、結局のところ、ローレンス・リバモアのエル・カピタンやアルゴンヌ国立研究所の「オーロラ」のようなエクサスケールクラスのマシンは、カスタムXPUアクセラレーターで構築されたマシンに対して独自の機械を保持することができます。 AIワークロードのためにTPUにアクセスをレンタルする人。
これが私たちが見た問題のあるチャートの1つです。

この数学では、GoogleはEl Capitanの持続的なパフォーマンスを、44,544 AMDの「Antares-A」本能MI300AハイブリッドCPU-GPUコンピューティングと比較しています。
これは完全に愚かな比較であり、Googleのトップブラスはよりよく知っているだけでなく、そうする必要があります。しかし、おそらくもっと重要なことは、パフォーマンスはストーリーの半分にすぎないことです。コンピューティングのコストも考慮する必要があります。高性能は可能な限り低コストを持たなければならず、米国政府のエネルギー省よりもHPCギアでより良い取引を得る人はいません。
多くのデータがない場合、最新のAI/HPCシステムの価格/パフォーマンス分析を行いました。その多くはCPUとGPUの組み合わせに基づいており、後者はAMDまたはNVIDIAからのものであり、前者は生の計算に関してそれほど重要ではありません。見てください:
クリックして拡大します
この比較は完璧ではない、と私たちは認識しています。 GoogleおよびAmazonのWebサービス価格には、システムを3年間レンタルするコストが含まれています。これには、電源、冷却、施設、管理のコストが含まれます。示されているスーパーコンピューターの多くにとって、予算は施設、電力、3〜4年にわたって冷却されており、非繰り返しのエンジニアリング(NRE)コストを含めて、フィールドで機械を走らせて調整してもらうために最善を尽くしました。さまざまなAIマシンについて、情報が利用できなかったマシンのサイズとコストに関する推定値を示しました。
すべての推定値は大胆な赤い斜体で示されており、現時点では推定を行うことができない疑問符があります。
3Dトーラス相互接続がかなり大きなポッドにリンクするTPUシステムのみを示しました。したがって、以前の生成「Trillium」TPU V6Eシステムは、2D Torusトポロジの256個の計算エンジンにのみスケーリングされます。
ご想像のとおり、過去4年間で、FP64高精度とFP16とFP8の両方のコストが、マシンのパフォーマンスが上がっても減少しています。これは良いことです。しかし、マシンのコストは急速に上昇しています。これは、機能クラスのAIスーパーコンピューターと呼ばれるものが数十億ドルの費用がかかるまで上昇しています。 (上記のXai「Colossus」マシンを考えてみてください。これは昨年インストールされました。)
上記の表では、Amazon Webサービスでの予約されたインスタンス価格設定に似ており、長期的なコミットメントの割引を提供する、コミットされた使用割引またはCUDSでGoogle TPUポッドをレンタルするコストを計算しました。従来のHPCスーパーコンピューターは3年間、時には4年間フィールドにいたため、これは良い比較ポイントです。推定Ironwood TPU POD価格は、TPU V4ポッドからTPU V5Pポッドへのジャンプにあるため、Googleがやや攻撃的であると想定しています。
さて、混乱を解消するために。 Ironwood TPU V7P PODの定格は、FP16解像度で21.26 ExaFlopsで、42.52 ExaFlopsのFP8解像度で2倍になります。このPODには1.69 pbのHBMメモリがあり、3年間で11億ドルの建設に約4億4500万ドル、11億ドルの賃貸料がかかると推定しています。それについて数学を行うと、それはGoogleにうまく機能し、9,216のIronwood TPUがテラフロップあたり約21ドルでインターリンクされているIronwood Podを使用でき、テラフロップスあたり約52ドルでレンタルできます。
Hewlett Packard Enterpriseによって建設されたEl Capitan Machineは、Lawrence Livermoreが6億ドルになり、Peak PerformanceでFP16解像度でTeraflopsあたり14ドルになります。 IntelはArgonneの「Aurora」マシンで3億ドルの繰り返しを受け取ったため、DOE LabはそのAI/HPCシステムに2億ドルしか支払っていません。エルピタンのMI300Aの両方とは異なり、オーロラマシンの「ポンテヴェッキオ」GPU セピージーピー Ironwood PodのTPU V7Pエンジンは、FP8処理をサポートしていませんが、3D Torusセットアップで使用されているGoogle TPUの2つの世代と同様に、INT8処理をサポートしています。
FP8およびINT8形式は、それを備えたマシンで価格/パフォーマンスを2倍にする効果があり、そのワークロードが活用される可能性があります。 Nvidiaの「Blackwell」GPUで利用できるFP4は、将来のXPU AIコンピューティングエンジンに追加され、再び2倍になります。
AIのHPCおよびFP16のFP64パフォーマンスを単純に保つために正規化しますが、FP8またはINT8処理の列を追加しました。企業は、この時点でできる限りトレーニングと推論の両方にわたって浮動小数点形式に固執し、最終的にはINT16、INT8、およびINT4形式が非推奨になります。
AWS P5 Ultraclusterは、2023年から2023年まで、および2023年初頭にNVIDIA「Hopper」H100 GPUを使用して構築されたクラスターのポスターチャイルドです。20,000GPUでクラスターをレンタルするコストを計算し、その後、H100およびその他のシステムコストに基づいて取得の推定コストに戻りました。 Microsoft AzureとGoogle Cloudは、同様のマシンを構築するだけでなく、エンドユーザーに容量をレンタルするためにほぼ同じ金額を支払っていたでしょう。 AWSとMicrosoftは、実際にはGPUインスタンスの価格をロックしました。
アイアンウッドポッドは、当社の見積もりが正しい場合、Googleが構築し、顧客がこれらの同様のパフォーマンスのH100クラスターよりも約3分の1の費用がかかり、コンピューティングエンジンの半分未満を使用します。 (少なくともソケットカウントで測定されています。)
しかし、最後に、明確にしましょう。 El Capitanは、ピーク理論的パフォーマンスのアイアンウッドポッドよりも、FP16およびFP8解像度で2.05倍のパフォーマンスを持っています。アイアンウッドポッドは、エルピタンのパフォーマンスを24倍も持っていません。 El CapitanはFP64 Precisionで2.73のピークパフォーマンスを持ち、Ironwoodには何もありません。ElCapitanはFP64モードでHPLで1.74 Exaflopsの評価を持っていました。
私たちは持っていません HPL-MXP結果 エルピタンにはまだですが、6月のハンブルクで開催されたISC 2025会議で1つを期待しています。 HPL-MXPは、多数の混合精度計算を使用して、HPLテストでAll-FP64 Mathと同じ結果に収束し、最近では1桁の効果的なパフォーマンスブーストを提供します。この混合精度を使用すると、実際のHPCアプリケーションをどのように調整してブーストできるかを導きます。したがって、同じハードウェアでより多くの作業を完了するか、同じ作業を完了するためにハードウェアを使用します。
ニュースレターにサインアップしてください
関連記事
#GoogleのアイアンウッドTPUポッドを他のAIスーパーコンピューターに積み重ねる
