1750129984
2025-06-04 15:59:00
負け犬を応援することを楽しんでいる人のために、最新のMLPERFベンチマークの結果は失望します:NVIDIAのGPUは競争を支配しています まだまた。これには、最新かつ最も要求の厳しいベンチマークでのチャートトップパフォーマンスが含まれ、Llama 3.1 403b大規模な言語モデルを前提としています。とはいえ、最新のAMD GPUであるMI325Xを中心に構築されたコンピューターは、NvidiaのH200のパフォーマンスに一致しました。 ブラックウェル 前任者、最も人気のあるLLM微調整ベンチマーク。これは、AMDがNvidiaの1世代にあることを示唆しています。
MLPERFトレーニングは、MLCommonsコンソーシアムが運営する機械学習競技の1つです。 「AIのパフォーマンスは、時にはワイルドウェストのようなものになる可能性があります。MLPERFは、その混乱に秩序をもたらすことを目指しています」と、NvidiaのAccelerated Computing製品のディレクターであるDave Salvatorは言います。 「これは簡単な作業ではありません。」
競争は6つのベンチマークで構成されており、それぞれが異なる業界関連の機械学習タスクを調査しています。ベンチマークは、コンテンツの推奨、大規模な言語モデルの事前トレーニング、大規模な言語モデルの微調整、マシンビジョンアプリケーションのオブジェクト検出、画像生成、および詐欺検出や創薬などのアプリケーションのグラフノード分類です。
大規模な言語モデルの事前トレーニングタスクは最もリソース集中的であり、このラウンドはさらに更新されました。 「事前トレーニング」という用語は、やや誤解を招くものです。「トレーニング」と呼ばれるフェーズが続くという印象を与えるかもしれません。そうではありません。事前トレーニングは、ほとんどの数のクランチが発生する場所であり、次のことは通常、特定のタスクのモデルを改良する微調整です。
以前の反復では、GPT3モデルで事前トレーニングが行われました。この反復は、GPT3の2倍以上のサイズで4倍の大きなコンテキストウィンドウを使用しているMetaのLlama 3.1 403bに置き換えられました。コンテキストウィンドウは、モデルが一度に処理できる入力テキストの量です。この大きなベンチマークは、いくつかのアーキテクチャの更新を含むとともに、これまで以上に大きなモデルの業界の傾向を表しています。
ブラックウェルはチャートの上にあり、その尾の上にAMD
6つのベンチマークすべてについて、最速のトレーニング時間はNvidiaのBlackwell GPUでした。 Nvidia自体はすべてのベンチマークに提出されました(他の企業は、Nvidia GPUの周りに構築されたさまざまなコンピューターを使用して提出しました)。 NvidiaのSalvatorは、これが大規模なBlackwell GPUの最初の展開であり、このパフォーマンスが改善する可能性が高いことを強調しました。 「私たちはまだブラックウェル開発ライフサイクルのかなり早い段階で」と彼は言います。
AMDがトレーニングベンチマークに提出したのはこれが初めてですが、以前の企業はAMD GPUを含むコンピューターを使用して提出していました。最も人気のあるベンチマークであるLLM微調整で、AMDは、その最新の本能MI325X GPUがNVIDIAのH200と同等の演奏を行うことを実証しました。さらに、本能MI325Xでは、その前身である本能MI300Xよりも30%の改善が示されました。 (2つの主な違いは、MI325XにはMI300Xよりも30%高い帯域幅メモリが付属していることです。)
その一部については、GoogleがTrillium TPUを使用して、単一のベンチマークである画像生成タスクに提出しました。
ネットワーキングの重要性
LLM微調整ベンチマークへのすべての提出のうち、GPUの最大数を持つシステムは、512 B200を接続するコンピューターであるNvidiaによって提出されました。この規模では、GPU間のネットワーキングが重要な役割を果たし始めます。理想的には、複数のGPUを追加すると、GPUの数でトレーニングする時間を分割します。現実には、コミュニケーションに失われることのある時期は、それよりも常に効率が低くなります。その損失を最小化することは、最大のモデルを効率的にトレーニングするための鍵です。
これは、最小の提出物が512 GPUを使用し、最大の使用された8,192で使用されている事前化ベンチマークでさらに重要になります。この新しいベンチマークでは、より多くのGPUでのパフォーマンススケーリングは、特に線形に近く、理想的なパフォーマンスの90%を達成しました。
NvidiaのSalvatorは、これをNVL72に帰します。これは、36 Grace CPUと72 Blackwell GPUをNVLinkと接続する効率的なパッケージであり、「単一の巨大なGPUとして機能する」システムを形成します。その後、複数のNVL72がInfinibandネットワークテクノロジーに接続されました。
特に、このラウンドの最大のMLPERF(8192 GPU)の最大の提出は、前登録ベンチマークの需要の増加にもかかわらず、史上最大ではありません。以前のラウンドでは、10,000を超えるGPUで提出されました。 Hewlett Packard EnterpriseのプリンシパルAIおよび機械学習エンジニアであるKenneth Leachは、GPUの改善とそれらの間のネットワーキングの削減に起因しています。 「以前は、16のサーバーノードが必要でした [to pretrain LLMs]、しかし、今日は4でそれを行うことができます。それが私たちが多くの効率的なスケーリングを得ているので、それほど多くの巨大なシステムを見ていない理由の1つだと思います。」
ネットワーキングに関連する損失を回避する1つの方法は、セレブラスによって行われたセレブラスによって行われたのと同じ巨大なウェーハに多くのAI加速器を置くことです。ただし、その結果は人為的な分析によって測定され、ワークロードの実行方法を制御せずに異なるプロバイダーを照会します。したがって、MLPERFベンチマークが保証する方法におけるリンゴとアプリルの比較ではありません。
力の不足
MLPERFベンチマークには、各トレーニングタスクを実現するために消費される電力の量を測定するパワーテストも含まれています。このラウンドでは、1人の提出者であるLenovoのみが、その提出に電力測定が組み込まれており、パフォーマー間で比較することが不可能になります。 2つのブラックウェルGPUでLLMを微調整するのにかかったエネルギーは、6.11ギガジュール、または1,698キロワット時、または冬のために小さな家を暖めるのに必要なほぼエネルギーでした。 AIのエネルギー使用に関する懸念が高まっているため、トレーニングの電力効率は非常に重要であり、この著者はおそらく、より多くの企業が将来のラウンドでこれらの結果を提出することを望んでいるだけではありません。
サイトの記事から
ウェブ上の関連記事
#Nvidia #BlackwellはMLPERFトレーニングベンチマークでSupremeを支配します