1743911810
2025-04-02 15:00:00
MLCommonsの最新の機械学習ベンチマークの結果では、Nvidiaの新しいBlackwell GPUアーキテクチャを中心に構築されたコンピューターが他のすべてを上回りました。しかし、AMDの本能GPUであるMi325での最新のスピンは、それが対抗することを意図した製品であるNvidia H200の一致を証明しました。同等の結果は、主に小規模な大型言語モデルの1つであるLlama2 70b(700億パラメーターの場合)のテストでした。ただし、急速に変化するAIランドスケープに追いつくために、MLPERFは3つの新しいベンチマークを追加して、機械学習がどこに向かっているかをよりよく反映しました。
MLPERFは、コンピューターシステム間のリンゴとアプリの比較を提供するために、機械学習システムのベンチマークを実行します。提出者は独自のソフトウェアとハードウェアを使用しますが、基礎となるニューラルネットワークは同じでなければなりません。現在、サーバーには合計11のベンチマークがあり、今年は3つが追加されています。
MLPERF推論の共同椅子であるミロ・ホダックは、「フィールドの急速な発展に追いつくのは難しい」と述べています。 ChatGPTは2022年後半にのみ登場し、Openaiは昨年9月にタスクを推論できる最初の大規模な言語モデル(LLM)を発表し、LLMは指数関数的に成長しました。GPT3には1750億のパラメーターがありましたが、GPT4は2兆近くであると考えられています。猛烈な革新の結果として、「wHodak氏は、次のように述べています。
新しいベンチマークには2つのLLMが含まれます。人気のある比較的コンパクトなLlama2 70Bはすでに確立されたMLPERFベンチマークですが、コンソーシアムは、人々が今日チャットボットを期待している応答性を模倣したものを望んでいました。そのため、新しいベンチマーク「Llama2-70Bインタラクティブ」が要件を強化します。コンピューターは、あらゆる状況下で少なくとも25秒あたりのトークンを生成する必要があり、回答を開始するために450ミリ秒を超えることはできません。
「エージェントAI」の台頭(複雑なタスクを通じて推論できるネットワーク)が、そのために必要な特性の一部を持つLLMをテストしようとしました。彼らは仕事にllama3.1 405bを選びました。そのLLMには、広いコンテキストウィンドウと呼ばれるものがあります。これは、ドキュメント、コードなどのサンプルなどの情報がすぐに入ることができる量の尺度です。 llama3.1 405bの場合、それは128,000トークンで、Llama2 70bの30倍以上です。
RGATと呼ばれる最後の新しいベンチマークは、グラフ注意ネットワークと呼ばれるものです。ネットワーク内の情報を分類するように機能します。たとえば、RGATをテストするために使用されるデータセットは科学論文で構成されており、すべて著者、機関、および研究分野の間に関係があり、2テラバイトのデータを構成しています。 RGATは、論文を3,000未満のトピックに分類する必要があります。
ブラックウェル、本能の結果
nvidia 独自の提出物と、Dell、Google、Supermicroなどの約15のパートナーの提出を通じて、MLPERFベンチマークの支配を継続しました。第1世代と第2世代のホッパーアーキテクチャGPU(H100とメモリが強化されたH200)の両方が強力なショーを作成しました。 NvidiaのAccelerated Computing ProductsのディレクターであるDave Salvator氏は、2022年に生産を始めたHopperから「昨年、さらに60%のパフォーマンスを獲得することができました」と述べています。 「パフォーマンスの面でまだヘッドルームがあります。」
しかし、NvidiaのBlackwell Architecture GPU、B200が本当に支配的でした。 「ホッパーよりも速いのはブラックウェルだけです」とサルバターは言います。 B200は、H200よりも36%高い帯域幅メモリを搭載していますが、さらに重要なことは、8ビットホッパーの先駆者ではなく、4ビットという低精度で数字を使用して重要な機械学習数学を実行できます。低精度の計算ユニットは小さくなるため、GPUにより適合するため、AIコンピューティングが高速になります。
Llama3.1 405Bベンチマークでは、Supermicroの8-B200システムがCiscoによる8-H200システムの1秒あたりのトークンのほぼ4倍を供給しました。また、同じスーパーミクロシステムは、LLAMA2 70Bのインタラクティブバージョンで最も速いH200コンピューターの3倍の速さでした。
Nvidiaは、GB200と呼ばれるBlackwell GPUとGrace CPUの組み合わせを使用して、NVL72データリンクがラック内の複数のサーバーを統合できるため、1つの巨大なGPUであるかのようにパフォーマンスを発揮します。未検証の結果では、同社が記者と共有しているため、GB200ベースのコンピューターのフルラックは、LLAMA2 70bで1秒あたり869,200トークンを提供します。 MLPERFのこのラウンドで報告されている最速システムは、毎秒98,443トークンを配信したNVIDIA B200サーバーでした。
AMD最新の本能GPUを配置しています MI325Xは、NVIDIAのH200と競争力のあるパフォーマンスを提供します。 MI325Xには、前身であるMI300と同じアーキテクチャがありますが、さらに高い帯域幅メモリとメモリ帯域幅を追加します。256ギガバイトと6テラバイトあたり6テラバイト(それぞれ33%と13%の増加)です。
メモリを追加することは、より大きなLLMとより大きなLLMを処理するためのプレイです。 「AMDのデータセンターGPUマーケティングのディレクターであるMahesh Balasubramanianは、次のように述べています。あなたがt時それらのコミュニケーションを削除すると、あなたのレイテンシーはかなり改善されます。」 AMDは、ソフトウェアの最適化を通じて余分なメモリを利用して、DeepSeek-R1の推論速度を8倍に上げることができました。
LLAMA2 70Bテストでは、同様にトリックアウトされたH200ベースのシステムの速度の3〜7%以内に8-GPU MI325Xコンピューターが得られました。画像生成では、MI325XシステムはNVIDIA H200コンピューターの10%以内でした。
AMDの他の注目すべきマークこのラウンドは、パートナーのMangoBoostからのものでした。マンゴーストは、4つのコンピューターで計算を行うことにより、Llama2 70Bテストでほぼ4倍のパフォーマンスを示しました。
インテル 歴史的に、推論競争でCPUのみのシステムを提出して、一部のワークロードではGPUが実際には必要ないことを示しています。今回は、以前はGranite Rapidsとして知られていて、Intelの3ナノメートルプロセスを使用して作成されていたIntelのXeon 6チップの最初のデータを見ました。毎秒40,285サンプルで、デュアルXeon 6コンピューターの最良の画像認識結果は、2つのNVIDIA H100を搭載したCiscoコンピューターのパフォーマンスの約3分の1でした。
2024年10月のXeon 5の結果と比較して、新しいCPUはそのベンチマークで約80%の増加を提供し、オブジェクトの検出と医療イメージングのさらに大きな後押しを提供します。 2021年(Xeon 3)でXeonの結果の提出を最初に開始して以来、同社はResnetでのパフォーマンスの11倍のブーストを達成しました。
今のところ、IntelはAI Accelerator-Chipバトルでフィールドを辞めたようです。 Nvidia H100の代替品であるGaudi 3は、昨年10月にリリースされた新しいMLPERF結果もバージョン4.1にも登場しませんでした。 Gaudi 3は、そのソフトウェアが準備ができていないため、後期に計画されたリリースを受けました。 Intel Vision 2025での冒頭の発言では、同社の招待のみの顧客会議である新しく造られたCEOのLip-Bu Tanは、IntelのAIの取り組みを謝罪したようです。 「私たちの現在の立場に満足していません」と彼は出席者に語った。 「あなたも幸せではありません。あなたは大声で明確に聞きます。私たちは競争力のあるシステムに向かって取り組んでいます。それは一晩では起こりませんが、私たちはあなたのためにそこに着きます。」
グーグルのTPU V6Eチップも展示を行いましたが、結果は画像生成タスクに限定されていました。 5.48秒あたりのクエリで、4-TPUシステムでは、2024年10月の結果で、前身のTPU V5Eを使用して同様のコンピューターを2.5倍増加させました。それでも、1秒あたり5.48クエリは、NVIDIA H100Sを使用した同様のサイズのLenovoコンピューターとほぼ一致していました。
この投稿は、2025年4月2日に修正され、MI325Xの高帯域幅メモリに適切な値を与えました。
サイトの記事から
ウェブ上の関連記事
#Nvidia #BlackwellはAI推論をリードしAMDは課題を遂げます