エージェント AI の時代は、企業インフラストラクチャのニーズを根本的に変えています。組織が動的な推論と自律的な実行が可能なシステムを構築するにつれて、基盤となるインフラストラクチャも同様に進化する必要があります。これらのエージェント ワークロードを大規模な専門家混合 (MoE) アーキテクチャと並行して拡張するには、深く最適化された共同設計されたスタックが必要です。
これらの需要に応えるために、Google Cloud AI ハイパーコンピューターは、AI に最適化されたサービスとしてのインフラストラクチャであり、パフォーマンスが最適化されたハードウェア、最先端のソフトウェア、オープン フレームワーク、柔軟な消費モデルを単一の一貫したシステムに統合し、超低レイテンシー、高スループット、コスト効率の高い推論を実現します。この統合アーキテクチャ内でお客様にさらに多くのオプションを提供するために、当社は NVIDIA とのパートナーシップを拡大しています。
今週の NVIDIA GTC 2026 では、Google Cloud と NVIDIA がパートナーシップを拡大し、共同設計された AI インフラストラクチャ基盤を紹介する一連の新しい発表を行います。
- インフラストラクチャーとハードウェア
-
NVIDIA RTX Pro 6000 Server Edition を活用した Google Cloud G4 VM の勢いが強い
-
NVIDIA vGPU テクノロジーを使用した柔軟なフラクショナル G4 VM のプレビュー – NVIDIA RTX Pro 6000 Server Edition では業界初
-
NVIDIA Vera Rubin NVL72 プラットフォームの今後のサポート
-
ソフトウェアとプラットフォーム
-
生態系
アナウンスを詳しく見てみましょう。
G4 VM による AI ワークロードの高速化
NVIDIA RTX Pro 6000 Server Edition GPU を搭載した G4 VM は、高度な空間コンピューティングから完全な AI 開発ライフサイクルまで、さまざまな範囲の高性能ワークロードを強化するように構築されています。たとえば、Otto Group One.O や WPP などの企業は、G4 を使用して物理的に正確なシミュレーションとリアルタイム 3D レンダリングを大規模に実行しています。
シミュレーションを超えて、G4 はモデルの微調整と推論、特に 30B から 100B 以上のパラメーターにわたるモデルの場合にも優れています。 4 ビット浮動小数点 (FP4) 精度と Google のピアツーピア (P2P) 通信を活用することで、お客様はモデル提供のスループットの向上とレイテンシーの大幅な削減を実現し、新しいクラスのリアルタイムのマルチモーダル AI エージェントと応答性の高い生成 AI アプリケーションを可能にします。
お客様がすでに G4 VM のパフォーマンスと効率を活用して、最も要求の厳しいワークロードを高速化している例をいくつか示します。
「Google Cloud の G4 VM は、パイプラインを通じて数十億マイルのフォトリアリスティックなシミュレーションを推進するために必要なスケーラブルな GPU バックボーンを提供します。スループットが 4 倍向上するということは、ML チームがより高速に反復し、より豊富なデータでトレーニングし、モデルが現実世界に登場するずっと前にエッジケースを検証できることを意味します。」 – Sony Mohapatra 氏、ゼネラル モーターズ、AI/ML エンジニアリング担当ディレクター
「現在、NVIDIA Blackwell を搭載した G4 VM を使用して、私たちはマルチモーダル モデルをさらに推し進めています。より高速な推論、より高い信頼性、言語を超えた即時応答です。目標は変わりません。妥協することなくエンタープライズ規模で動作する音声エージェントを作成することです。私たちは一緒に構築を続け、これをお客様が導入するのを見ることに興奮しています。」 – マティ・スタニシェフスキー、イレブンラボ共同創設者
「Google Cloud G4 VM はロボット調整レイヤーの計算バックボーンを提供し、物流センター全体で自律型フリートをミリ秒単位の精度で同期できるようになります。高忠実度のデジタル ツインで複雑な倉庫環境をシミュレートすることで、単一のロボットがフロア上を移動する前に、サプライ チェーン全体を仮想的に最適化できます。」 – ステファン・ボルスツキー博士、Otto Group One.O CEO
「G4 VM への移行後、Terraform スクリプトを更新するだけで、処理遅延が 50% 削減され、スループットが 6 倍向上しました。運用上のオーバーヘッドをまったく追加せずに、コア ワークロードのパフォーマンスがこれほど向上することはまれです。」 – Imgix エンジニアリング責任者、Alfonso Acosta 氏
フラクショナル G4 VM の導入
AI およびグラフィックスのワークロードに非常に効率的でコスト効率の高いエントリー ポイントを提供するフラクショナル G4 VM のプレビューを発表できることを嬉しく思います。 NVIDIA 仮想 GPU (vGPU) テクノロジを使用したこれらの新しい構成により、NVIDIA RTX PRO 6000 Blackwell Server Edition GPU の能力を柔軟かつ小規模な増分で活用できるため、アプリケーションの特定の要求に合わせてインフラストラクチャのサイズを適切に調整できます。
フラクショナル G4 VM は、高度なハードウェアへのよりきめ細かいアクセスを提供することで、パフォーマンスを犠牲にすることなくリソース割り当てを最適化し、オーバーヘッドを削減できます。特定のニーズに合わせて追加の GPU スライス サイズを選択できるようになりました。
-
1/2 GPU: LLM 推論、ロボット センサー シミュレーション、高忠実度 3D レンダリングなど、より集中的なタスクに最適です。
-
1/4 GPU: ミッドレンジのクリエイティブ デザイン、ビデオ コード変換、リアルタイム データ ビジュアライゼーションなどの主流のワークロード向けに最適化されています。
-
1/8 GPU: リモート デスクトップ、生産性ツール、エントリーレベルのストリーミング サービスなどの軽量アプリケーションに最適です。
これらの柔軟な G4 サイズ ポートフォリオにより、次のことが可能になります。
-
適切なサイズのインフラストラクチャ: 軽量のリモート デスクトップから集中的なデータ処理に至るまで、GPU の容量をアプリケーションの要求に正確に適合させます。
-
コスト効率を最大化: 特定のタスクに必要な一部の GPU リソースのみを利用し、料金を支払うことで、運用オーバーヘッドを削減します。
-
多様なワークロードを拡張します。 高忠実度のクリエイティブなデザインやストリーミングから、複雑なロボティクス シミュレーションやリアルタイム推論まで、幅広いイノベーションを推進します。
これらのフラクショナル G4 VM は Google Kubernetes Engine (GKE) で管理できるため、開発者は高度なコンテナ ビンパッキングを使用して、さらに高いコスト パフォーマンスとリソース使用率を実現できます。 Dynamic Workload Scheduler を通じて管理する場合、部分スライスのフォールバック優先順位を設定できます。これにより、スケジューラーがワークロードごとに利用可能な GPU 構成を自動的に見つけられるようになり、取得可能性が大幅に向上します。
「G4 vGPU の柔軟なサイジングにより、各分子シミュレーションの規模に合わせてコンピューティング リソースを正確に調整でき、創薬パイプライン全体で最大限の効率を確保できます。このきめ細かな制御により、研究者は固定ハードウェア構成に制約されることなく、小規模なワークフローと大規模な並列処理の間をシームレスに切り替えることができます。」 – シェーン・ブラウナー氏、副社長、CIO、シュレディンガー氏
NVIDIA Vera Rubin NVL72 による AI ハイパーコンピューターのスケーリング
NVIDIA との深いエンジニアリング パートナーシップに基づいて、NVIDIA Blackwell アーキテクチャの後継である最近発表された NVIDIA Vera Rubin プラットフォームをサポートできることを誇りに思っています。当社は、2026 年後半に NVIDIA Vera Rubin NVL72 ラックスケール システムを提供する最初のクラウド プロバイダーの 1 社となり、それらを当社の AI ハイパーコンピューター アーキテクチャに統合して、次世代の推論 AI とエージェント AI を強化する予定です。
AI インフラストラクチャ スタック全体で効率を実現
完全にオープンなエコシステムへの取り組みの一環として、Dynamo と GKE Inference Gateway の統合を発表できることを嬉しく思います。この統合により、アプリケーション層とハードウェア全体にわたるモジュール式のオープンソース コントロール プレーンが提供されます。 Dynamo と GKE 上の推論ゲートウェイを組み合わせることで、チームはインフラストラクチャを正確なニーズに合わせて調整できるため、アクセラレータから最大の ROI を引き出し、新しい AI モデルの市場投入までの時間を短縮し、将来も安心してデプロイできるようになります。
A4X VM (NVIDIA GB200 NVL72 および Dynamo を搭載) の新しい高度なスケーリング レシピを通じて、大規模 MoE アーキテクチャのパフォーマンスを最大化する方法を学ぶことができます。これらの構成は、AI ハイパーコンピューターで AI 推論ワークロードを実行するときにメモリと相互接続のボトルネックを克服する方法を示しています。
また、A4X および A4X Max 用のカレンダー モードと Flex Start (NVIDIA GB300 NVL72 を搭載)、G4 VM 用の新しい Flex Start サポートにより、Dynamic Workload Scheduler によるリソースの取得可能性も強化しています。 Dynamic Workload Scheduler を使用すると、必要な正確な容量を予約したり、柔軟な開始ウィンドウを使用したりできます。
Google Cloud の長年の顧客である Snap は、2 つの主要なデータ処理パイプラインを NVIDIA L4 Tensor コア GPU を搭載した Google Cloud G2 VM に移行することで、大幅なコスト削減を達成しました。これは、GPU 効率を最適化するためにシャッフル負荷の高いワークロードの最適化を自動化する NVIDIA の新しい cuDF ライブラリと GKE 上の Spark を活用することで可能になりました。 詳細については、GTC セッション S81678 をご覧ください。
Vertex AI トレーニングと Model Garden の進歩
Vertex AI トレーニング クラスターに対する 2 つの主要なインフラストラクチャの進歩により、次世代 AI の需要に応えています。まず、サポート A4X VM ドメイン Vertex AI のマネージド インフラストラクチャとフレームワーク機能を活用して、大規模なトレーニングを行うことができます。 NVIDIA GB200 NVL72 ラックスケールシステム。これらの集中的なワークロードが中断されないようにするため、新しいハードウェア復元機能により、構成可能なプロアクティブな障害検出スキャンを適用できるようになり、重要な「ヒーロー」トレーニングの実行が中断される前に、潜在的なハードウェアの問題を特定して軽減できます。これらの機能により、より高い成果が得られ、コストのかかる再起動を行わずに数週間にわたるトレーニング ジョブを確実に軌道に乗せることができます。
「私たちは、Google と NVIDIA と協力して、高機能で一貫性があり、正確で応答性の高い AI エージェントを提供する、エージェント エンタープライズ向けの新しい標準を確立しています。NVIDIA GB200 NVL72 上の Vertex AI トレーニング クラスターを活用して Agentforce 360 プラットフォームを強化することで、インフラストラクチャのボトルネックを排除し、GPU を完全に飽和状態に保ちました。この高性能で復元力のあるアーキテクチャにより、研究者は大規模なイノベーションに集中でき、最も複雑な推論で大幅な利益を推進できます」仕事量。」 – Salesforce 社主任研究員、シルビオ・サバレーゼ氏
同時に、NVIDIA のオープン モデル Nemotron 3 ファミリのサポートにより、Vertex AI Model Garden の拡張を続けます。これらには、プライベート VPC への統合を簡素化するワンクリック展開を特徴とする Nemotron 3 Nano が含まれます。また、高性能で大規模な推論にすぐにアクセスできるように、カタログを拡張して NVIDIA Nemotron 3 Super 120B モデルを追加しました。これらのモデルの価値を最大化するために、NVIDIA の最新パフォーマンス ライブラリを Vertex AI に直接統合し、NVIDIA TensorRT-LLM 上の人気のオープンソース モデルを最適化しました。
公共部門の AI スタートアップを支援する
エコシステム内で継続的なイノベーションを促進するために、Google Public Sector と NVIDIA は AI スタートアップ アクセラレータ プログラムを立ち上げています。この 1 年間にわたる取り組みは、公共部門向けのソリューションを構築する、AI に焦点を当てた独立系ソフトウェア ベンダー (ISV) の厳選されたグループをサポートします。
参加者は、NVIDIA Inception と Google Cloud の ISV アクセラレータ リソースの両方に二重アクセスできます。 GTC で開始され、Google Cloud Next を通じて継続されるこの共同プログラムは、新興テクノロジー リーダーに、ミッション クリティカルな公共部門のアプリケーションを拡張するために必要な、共同エンジニアリングされたインフラストラクチャ、技術指導、市場投入サポートを提供します。プログラムの詳細については、次の情報を入力してください。 興味フォーム。今後さらに追加のコホートが選択され、発表される予定です。
共同エンジニアリングによるコラボレーションが AI スタックのすべての層を強化します
複雑なエージェント AI への移行には、単なる生のコンピューティング以上のものが必要です。完全に最適化され、共同設計されたスタックが必要です。フラクショナル G4 インスタンスや今後の Vera Rubin プラットフォームなどの柔軟なハードウェアを AI ハイパーコンピューター アーキテクチャに統合し、綿密なソフトウェア コーエンジニアリングと組み合わせることで、最も野心的な AI ビジョンを現実にするために必要なスケール、復元力、効率性を提供します。
GTC に来ますか?詳細については、ブース #513 にお立ち寄りいただき、当社チームにご相談ください。 NVIDIA とのコラボレーションの詳細については、cloud.google.com/NVIDIA でいつでもご覧いただけます。
#NVIDIA #GTC #での #Google #Cloud #インフラストラクチャ