日本語版
最新ニュース
世界

Nvidia Rubin のネットワーク帯域幅が 2 倍に

今週初め、NVIDIA はラスベガスのコンシューマー エレクトロニクス ショーで新しい Vera Rubin アーキテクチャ (最近発表された望遠鏡とは関係ありません) をサプライズ発表しました。今年後半に顧客に提供される予定のこの新しいプラットフォームは、Nvidia の Blackwell アーキテクチャと比較して、推論コストを 10 分の 1 に削減し、特定のモデルのトレーニングに必要な GPU の数を 4 分の 1 に削減できると宣伝されています。 パフォーマンス向上の主な原因は GPU です。実際、新しい Rubin GPU は、少なくとも大規模な言語モデルのようなトランスフォーマーベースの推論ワークロードでは、Blackwell の 10 ペタフロップスと比較して、4 ビット計算で 1 秒あたり 50 京の浮動小数点演算 (ペタ FLOPS)…

Nvidia Rubin のネットワーク帯域幅が 2 倍に

1768091268
2026-01-10 14:00:00

今週初め、NVIDIA はラスベガスのコンシューマー エレクトロニクス ショーで新しい Vera Rubin アーキテクチャ (最近発表された望遠鏡とは関係ありません) をサプライズ発表しました。今年後半に顧客に提供される予定のこの新しいプラットフォームは、Nvidia の Blackwell アーキテクチャと比較して、推論コストを 10 分の 1 に削減し、特定のモデルのトレーニングに必要な GPU の数を 4 分の 1 に削減できると宣伝されています。

パフォーマンス向上の主な原因は GPU です。実際、新しい Rubin GPU は、少なくとも大規模な言語モデルのようなトランスフォーマーベースの推論ワークロードでは、Blackwell の 10 ペタフロップスと比較して、4 ビット計算で 1 秒あたり 50 京の浮動小数点演算 (ペタ FLOPS) を誇ります。

ただし、GPU だけに注目すると全体像が見えなくなります。 Vera-Rubin ベースのコンピューターには、Vera CPU、Rubin GPU、および 4 つの異なるネットワーク チップの合計 6 つの新しいチップが搭載されています。 Nvidia のネットワーキング担当シニア バイスプレジデントである Gilad Shainer 氏は、パフォーマンス上の利点を実現するには、コンポーネントが連携して動作する必要があると述べています。

「同じユニットを異なる方法で接続しても、まったく異なるレベルのパフォーマンスが得られます」とシャイナー氏は言います。 「だからこそ、私たちはこれをエクストリーム・コ・デザインと呼んでいます。」

「ネットワーク内コンピューティング」の拡張

AI ワークロードは、トレーニングと推論の両方で、多数の GPU で同時に実行されます。 「2 年前、推論は主に単一の GPU、単一のボックス、単一のサーバーで実行されていました」と Shainer 氏は言います。 「現在、推論は分散化されつつあり、ラック内だけでなく、ラックを越えて行われるようになっています。」

これらの大量に分散されたタスクに対応するには、できるだけ多くの GPU が 1 つとして効果的に動作する必要があります。これが、いわゆるスケールアップ ネットワークの目的、つまり単一ラック内で GPU を接続することです。 Nvidia は、NVLink ネットワーキング チップを使用してこの接続を処理します。新しいラインには、前バージョンの 2 倍の帯域幅 (NVLink5 スイッチの 1,800 GB/秒と比較して、GPU 間接続で 3,600 ギガバイト/秒) の NVLink6 スイッチが含まれています。

帯域幅の 2 倍に加えて、スケールアップ チップには 2 倍の SerDes (より少ないワイヤでデータを送信できるシリアライザー/デシリアライザー) と、ネットワーク内で実行できる計算の数が増えています。

「スケールアップ ネットワークは、実際にはネットワークそのものではありません」と Shainer 氏は言います。 「これはコンピューティング インフラストラクチャであり、コンピューティング操作の一部はネットワーク上、つまりスイッチ上で行われます。」

一部の操作を GPU からネットワークにオフロードする根拠は 2 つあります。まず、一部のタスクをすべての GPU で実行するのではなく、1 回だけ実行できるようになります。この一般的な例は、AI トレーニングにおける all-reduce 操作です。トレーニング中に、各 GPU は独自のデータ バッチに対して勾配と呼ばれる数学的演算を計算します。モデルを正しくトレーニングするには、すべての GPU がすべてのバッチにわたって計算された平均勾配を知る必要があります。各 GPU が他のすべての GPU に勾配を送信し、それぞれが平均を計算するのではなく、ネットワーク内でその操作が 1 回だけ実行されるため、計算時間と電力が節約されます。

2 番目の理論的根拠は、途中で GPU 上で計算を実行することで、GPU 間でデータをやり取りするのにかかる時間を隠すことです。シャイナー氏は、注文品の配達にかかる時間を短縮しようとしているピザ屋の例えでこれを説明しています。 「もっと多くのオーブンや労働者がいたら何ができるでしょうか?それは役に立ちません。より多くのピザを作ることはできますが、1枚のピザにかかる時間は変わりません。あるいは、オーブンを車に積んで、私があなたのところへ行く間にピザを焼くとしたら、これが時間を節約できます。これが私たちの仕事です。」

ネットワーク内コンピューティングは、Nvidia アーキテクチャのこの反復にとって新しいものではありません。実際、これは 2016 年頃から一般的に使用されています。しかし、この反復により、さまざまなワークロードやさまざまな数値形式に対応するために、ネットワーク内で実行できる幅広い計算が追加されると Shainer 氏は言います。

スケールアウトとスケールアップ

Rubin アーキテクチャに含まれる残りのネットワーキング チップは、いわゆるスケールアウト ネットワークを構成します。データセンター内の異なるラック間を接続する部分です。

これらのチップは ConnectX-9、ネットワーク インターフェイス カードです。 BlueField-4 は、いわゆるデータ処理ユニットで、2 つの Vera CPU と ConnectX-9 カードと組み合わせて、ネットワーキング、ストレージ、セキュリティ タスクの負荷を軽減します。最後に、Spectrum-6 イーサネット スイッチです。これは、ラック間でデータを送信するために一緒にパッケージ化された光ファイバーを使用します。また、イーサネット スイッチは帯域幅を前世代の 2 倍にし、ジッター (情報パケットの到着時間の変動) を最小限に抑えます。

「スケールアウト インフラストラクチャでは、分散コンピューティング ワークロードを実行するために、GPU が適切に通信できることを確認する必要があります。つまり、ジッターのないネットワークが必要です」と彼は言います。ジッターの存在は、異なるラックが計算の異なる部分を実行している場合、それぞれからの応答が異なる時間に到着することを意味します。 1 つのラックは常に残りのラックよりも遅くなり、高価な機器が満載された残りのラックは最後のパケットを待っている間アイドル状態になります。 「ジッターとはお金を失うことを意味します」とシャイナー氏は言う。

Nvidia の多数の新しいチップは、「スケールアクロス」と呼ばれるデータセンター間の接続に特化したものはありません。しかしシャイナー氏は、これが次のフロンティアだと主張する。 「データセンターの GPU の数を増やす需要が見られるため、これで終わりではありません」と彼は言います。 「一部のワークロードには 100,000 GPU ではもはや十分ではありません。現在、複数のデータセンターを接続する必要があります。」

あなたのサイトの記事から

ウェブ上の関連記事

#Nvidia #Rubin #のネットワーク帯域幅が #倍に

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。