日本語版
最新ニュース
世界

NvidiaのBlackwell UltraがMLPERF推論を支配しています

機械学習分野は急速に動いており、使用された尺度の測定の進行状況は、追いつくために競争しなければなりません。 「The Olympics of AI」と呼ばれる隔年機械学習競争であるMLPERFは、フィールドの新しい方向性を反映して3つの新しいベンチマークテストを導入しました。「最近、フィールドで何が起こるかを追跡しようとするのは非常に困難でした」と、AMDエンジニアであり、MLPERF推論ワーキンググループの共同議長であるミロ・ホダックは言います。 「モデルが徐々に大きくなっていることがわかります。過去2ラウンドで、これまでで最大のモデルを導入しました。」これらの新しいベンチマークに取り組んだチップは、通常の容疑者であるNvidia、Arm、およびIntelから来ました。 Nvidiaはチャートのトップで、GB300ラックスケールのデザインにパッケージ化された新しいBlackwell Ultra GPUを導入しました。 AMDは強力なパフォーマンスを発揮し、最新のMI325X GPUを導入しました。 Intelは、Xeonの提出物を使用してCPUに推論を行うことができることを証明しましたが、Intel Arc Proの提出でGPUゲームに参加しました。新しいベンチマーク最後のラウンドでは、MLPERFは、LLAMA3.1-403Bに基づいた大規模な言語モデルである最大のベンチマークを導入しました。このラウンドでは、彼らは再び自分自身を突破し、DeepSeek R1 671Bモデルに基づいたベンチマークを導入しました。これは、以前の最大のベンチマークのパラメーターの数の1.5倍以上です。推論モデルとして、DeepSeek R1は、クエリに近づくときに、考え方のチェーンのいくつかのステップを通過します。これは、計算の多くが推論中に通常のLLM操作で発生することを意味し、このベンチマークがさらに困難になっていることを意味します。推論モデルは最も正確であると主張されており、科学、数学、複雑なプログラミングクエリに最適なテクニックになっています。まだ最大のLLMベンチマークに加えて、MLPERFはLLAMA3.1-8Bに基づいて最小のベンチマークも導入しました。 Mlperf推論タスクフォースチェア、Taran Iyengar氏は、低潜伏期であるが高精度の推論に対する業界の需要が高まっていると説明しています。小さなLLMはこれを提供でき、テキストの要約やエッジアプリケーションなどのタスクに最適です。これにより、LLMベースのベンチマークの合計カウントが混乱を招く4つになります。新しい、最小のllama3.1-8bベンチマークが含まれます。既存のllama2-70bベンチマーク。 Llama3.1-403bベンチマークの最終ラウンドの導入。そして最大の新しいDeepSeek R1モデル。他に何もなければ、このシグナルLLMはどこにも行きません。無数のLLMSに加えて、このMLPERF推論のラウンドには、ウィスパー - ラージ-V3に基づく新しい音声からテキストへのモデルが含まれていました。このベンチマークは、スマートデバイスであろうと音声ベースのAIインターフェイスなど、音声対応アプリケーションの増加に対する応答です。Themlperf Incerfureコンペティションには、2つの幅広いカテゴリがあります。「閉じている」。これには、参照ニューラルネットワークモデルを変更せずに使用する必要があり、モデルの変更が許可されている「オープン」です。それらの中には、テストの実行方法とどのようなインフラストラクチャに関連するサブカテゴリがいくつかあります。正気のために、「閉じた」データセンターサーバーの結果に焦点を当てます。Nvidiaリード驚くべきことは、少なくとも「サーバー」カテゴリの各ベンチマークでのアクセラレータごとの最高のパフォーマンスが、NVIDIA GPUベースのシステムによって達成されました。 Nvidiaはまた、Blackwell Ultraを発表し、2つの最大のベンチマークでチャートを突破しました:Lllama3.1-405bとDeepseek R1 Reasoning。Blackwell Ultraは、Blackwellアーキテクチャのより強力な反復であり、メモリ容量が大幅に増え、注意層の加速度、1.5倍のAI計算、標準のBlackwellと比較してより速いメモリと接続を特徴としています。テストされた2つのベンチマークのように、より大きなAIワークロードを対象としています。ハードウェアの改善に加えて、Nvidia Dave Salvatorの加速コンピューティング製品のディレクターは、Blackwell Ultraの成功が2つの重要な変更に起因すると考えています。まず、Nvidia独自の4ビットフローティングポイント番号フォーマットNVFP4の使用。 「BF16などのフォーマットに匹敵する精度を提供できます」とSalvator氏は言いますが、コンピューティングのパワーをはるかに少なく使用しています。2番目は、いわゆる分解されたサービングです。分解されたサービングの背後にあるアイデアは、推論ワークロードには2つの主要な部分があるということです。プリル、クエリ(「このレポートを要約してください。」)とそのコンテキストウィンドウ全体(レポート)がLLMにロードされ、生成/デコードが実際に計算されます。これらの2つの段階には異なる要件があります。 Prefillは重く計算されますが、生成/デコードはメモリ帯域幅にはるかに依存しています。 Salvatorは、GPUのさまざまなグループを2つの異なる段階に割り当てることにより、Nvidiaのパフォーマンスは50%近くを達成していると述べています。AMDはすぐ後ろですAMDの最新のアクセラレータチップ、MI355Xは7月に発売されました。同社は、モデルに対するソフトウェアの変更が許可されている「オープン」カテゴリでのみ結果を提供しました。 Blackwell Ultraと同様に、MI355Xは4ビットのフローティングポイントサポートと、拡張された高帯域幅メモリを備えています。…

NvidiaのBlackwell UltraがMLPERF推論を支配しています

1758546131
2025-09-10 15:00:00

機械学習分野は急速に動いており、使用された尺度の測定の進行状況は、追いつくために競争しなければなりません。 「The Olympics of AI」と呼ばれる隔年機械学習競争であるMLPERFは、フィールドの新しい方向性を反映して3つの新しいベンチマークテストを導入しました。

「最近、フィールドで何が起こるかを追跡しようとするのは非常に困難でした」と、AMDエンジニアであり、MLPERF推論ワーキンググループの共同議長であるミロ・ホダックは言います。 「モデルが徐々に大きくなっていることがわかります。過去2ラウンドで、これまでで最大のモデルを導入しました。」

これらの新しいベンチマークに取り組んだチップは、通常の容疑者であるNvidia、Arm、およびIntelから来ました。 Nvidiaはチャートのトップで、GB300ラックスケールのデザインにパッケージ化された新しいBlackwell Ultra GPUを導入しました。 AMDは強力なパフォーマンスを発揮し、最新のMI325X GPUを導入しました。 Intelは、Xeonの提出物を使用してCPUに推論を行うことができることを証明しましたが、Intel Arc Proの提出でGPUゲームに参加しました。

新しいベンチマーク

最後のラウンドでは、MLPERFは、LLAMA3.1-403Bに基づいた大規模な言語モデルである最大のベンチマークを導入しました。このラウンドでは、彼らは再び自分自身を突破し、DeepSeek R1 671Bモデルに基づいたベンチマークを導入しました。これは、以前の最大のベンチマークのパラメーターの数の1.5倍以上です。

推論モデルとして、DeepSeek R1は、クエリに近づくときに、考え方のチェーンのいくつかのステップを通過します。これは、計算の多くが推論中に通常のLLM操作で発生することを意味し、このベンチマークがさらに困難になっていることを意味します。推論モデルは最も正確であると主張されており、科学、数学、複雑なプログラミングクエリに最適なテクニックになっています。

まだ最大のLLMベンチマークに加えて、MLPERFはLLAMA3.1-8Bに基づいて最小のベンチマークも導入しました。 Mlperf推論タスクフォースチェア、Taran Iyengar氏は、低潜伏期であるが高精度の推論に対する業界の需要が高まっていると説明しています。小さなLLMはこれを提供でき、テキストの要約やエッジアプリケーションなどのタスクに最適です。

これにより、LLMベースのベンチマークの合計カウントが混乱を招く4つになります。新しい、最小のllama3.1-8bベンチマークが含まれます。既存のllama2-70bベンチマーク。 Llama3.1-403bベンチマークの最終ラウンドの導入。そして最大の新しいDeepSeek R1モデル。他に何もなければ、このシグナルLLMはどこにも行きません。

無数のLLMSに加えて、このMLPERF推論のラウンドには、ウィスパー – ラージ-V3に基づく新しい音声からテキストへのモデルが含まれていました。このベンチマークは、スマートデバイスであろうと音声ベースのAIインターフェイスなど、音声対応アプリケーションの増加に対する応答です。

Themlperf Incerfureコンペティションには、2つの幅広いカテゴリがあります。「閉じている」。これには、参照ニューラルネットワークモデルを変更せずに使用する必要があり、モデルの変更が許可されている「オープン」です。それらの中には、テストの実行方法とどのようなインフラストラクチャに関連するサブカテゴリがいくつかあります。正気のために、「閉じた」データセンターサーバーの結果に焦点を当てます。

Nvidiaリード

驚くべきことは、少なくとも「サーバー」カテゴリの各ベンチマークでのアクセラレータごとの最高のパフォーマンスが、NVIDIA GPUベースのシステムによって達成されました。 Nvidiaはまた、Blackwell Ultraを発表し、2つの最大のベンチマークでチャートを突破しました:Lllama3.1-405bとDeepseek R1 Reasoning。

Blackwell Ultraは、Blackwellアーキテクチャのより強力な反復であり、メモリ容量が大幅に増え、注意層の加速度、1.5倍のAI計算、標準のBlackwellと比較してより速いメモリと接続を特徴としています。テストされた2つのベンチマークのように、より大きなAIワークロードを対象としています。

ハードウェアの改善に加えて、Nvidia Dave Salvatorの加速コンピューティング製品のディレクターは、Blackwell Ultraの成功が2つの重要な変更に起因すると考えています。まず、Nvidia独自の4ビットフローティングポイント番号フォーマットNVFP4の使用。 「BF16などのフォーマットに匹敵する精度を提供できます」とSalvator氏は言いますが、コンピューティングのパワーをはるかに少なく使用しています。

2番目は、いわゆる分解されたサービングです。分解されたサービングの背後にあるアイデアは、推論ワークロードには2つの主要な部分があるということです。プリル、クエリ(「このレポートを要約してください。」)とそのコンテキストウィンドウ全体(レポート)がLLMにロードされ、生成/デコードが実際に計算されます。これらの2つの段階には異なる要件があります。 Prefillは重く計算されますが、生成/デコードはメモリ帯域幅にはるかに依存しています。 Salvatorは、GPUのさまざまなグループを2つの異なる段階に割り当てることにより、Nvidiaのパフォーマンスは50%近くを達成していると述べています。

AMDはすぐ後ろです

AMDの最新のアクセラレータチップ、MI355Xは7月に発売されました。同社は、モデルに対するソフトウェアの変更が許可されている「オープン」カテゴリでのみ結果を提供しました。 Blackwell Ultraと同様に、MI355Xは4ビットのフローティングポイントサポートと、拡張された高帯域幅メモリを備えています。 AMDのデータセンターGPU製品マーケティングのシニアディレクターであるMahesh Balasubramanian氏は、Mi355XがオープンLlama2.1-70Bベンチマークで2.7倍のベンチマークでMi325Xを破ったと述べています。

AMDの「クローズド」提出には、AMD MI300XおよびMI325X GPUを搭載したシステムが含まれていました。より高度なMI325Xコンピューターは、LLLAMA2-70B上のNVIDIA H200Sで構築されたコンピューター、専門家テストの混合、および画像生成ベンチマークと同様に実行されます。

このラウンドには、AMD MI300XとMI325Xの両方のGPUが同じ推論タスクであるLlama2-70Bベンチマークに使用された最初のハイブリッド提出も含まれていました。ハイブリッドGPUの使用は重要です。なぜなら、新しいGPUが毎年ケイデンスに来ており、古いモデルであるEN-Masseが展開されていないため、どこにも行かないからです。さまざまな種類のGPU間でワークロードを広めることができることが不可欠なステップです。

IntelはGPUゲームに入ります

過去には、インテルは機械学習を行うためにGPUを必要としないという不動のままでした。実際、IntelのXeon CPUを使用した提出物は、オブジェクト検出ベンチマークでNVIDIA L4と同等に実行されましたが、推奨システムベンチマークでは到達しました。

このラウンドは、初めて、Intel GPUもショーを行いました。 Intel Arc Proは2022年に初めてリリースされました。MLPERF提出には、2つのGPUと48ギガバイトのメモリを含むMaxsun Intel Arc Pro B60 Dual 48Gターボと呼ばれるグラフィックカードが特徴でした。このシステムは、小さなLLMベンチマークでNvidiaのL40を使用してParで実行され、Llama2-70Bベンチマークでそれを追跡しました。

サイトの記事から

ウェブ上の関連記事

#NvidiaのBlackwell #UltraがMLPERF推論を支配しています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。