日本語版
最新ニュース
世界

NVIDIA Dynamo Planner がマルチノード LLM 推論に SLO 主導の自動化をもたらす

Microsoft と NVIDIA は、大規模言語モデル推論のための NVIDIA Dynamo の実行に関するコラボレーションのパート 2 をリリースしました。 Azure Kubernetes サービス (AKS)。最初の発表では、分散型で毎秒 120 万トークンの生のスループットを目標としていました。 GPU システム。今回の最新リリースでは、開発者の作業の迅速化と運用効率の向上を支援することに重点を置いています。これは、自動化されたリソース プランニングと動的スケーリング機能を通じて行われます。 新しい機能は、2 つの統合コンポーネントを中心としています。 Dynamo Planner プロファイラー そしてSLOベースの ダイナモプランナー。これらのツールは連携して、細分化されたサービスにおける「レート マッチング」の課題を解決します。チームは推論ワークロードを分割するときにこの用語を使用します。これらは、入力コンテキストを処理するプレフィル操作を、出力トークンを生成するデコード操作から分離します。これらのタスクは、異なる GPU プールで実行されます。適切なツールがなければ、チームはこれらのフェーズに最適な GPU 割り当てを決定するのに多くの時間を費やします。 Dynamo Planner Profiler は、導入前のシミュレーション ツールです。最適な構成の検索を自動化します。開発者は、さまざまな並列化戦略と GPU 数を手動でテストする必要がなくなり、GPU の使用時間を節約できます。代わりに、彼らは自分たちのニーズを次のように定義します。…

NVIDIA Dynamo Planner がマルチノード LLM 推論に SLO 主導の自動化をもたらす

1769852600
2026-01-31 09:00:00

Microsoft と NVIDIA は、大規模言語モデル推論のための NVIDIA Dynamo の実行に関するコラボレーションのパート 2 をリリースしました。 Azure Kubernetes サービス (AKS)。最初の発表では、分散型で毎秒 120 万トークンの生のスループットを目標としていました。 GPU システム。今回の最新リリースでは、開発者の作業の迅速化と運用効率の向上を支援することに重点を置いています。これは、自動化されたリソース プランニングと動的スケーリング機能を通じて行われます。

新しい機能は、2 つの統合コンポーネントを中心としています。 Dynamo Planner プロファイラー そしてSLOベースの ダイナモプランナー。これらのツールは連携して、細分化されたサービスにおける「レート マッチング」の課題を解決します。チームは推論ワークロードを分割するときにこの用語を使用します。これらは、入力コンテキストを処理するプレフィル操作を、出力トークンを生成するデコード操作から分離します。これらのタスクは、異なる GPU プールで実行されます。適切なツールがなければ、チームはこれらのフェーズに最適な GPU 割り当てを決定するのに多くの時間を費やします。

Dynamo Planner Profiler は、導入前のシミュレーション ツールです。最適な構成の検索を自動化します。開発者は、さまざまな並列化戦略と GPU 数を手動でテストする必要がなくなり、GPU の使用時間を節約できます。代わりに、彼らは自分たちのニーズを次のように定義します。 DynamoGraphDeploymentRequest (DGDR) マニフェストします。プロファイラーは自動化された スイープ 構成スペースの。プリフィル ステージとデコード ステージの両方で、さまざまなテンソル並列処理サイズをテストします。これは、遅延制限内に保ちながらスループットを向上させる設定を見つけるのに役立ちます。

プロファイラーには、事前に測定されたパフォーマンス データに基づいて約 20 ~ 30 秒でパフォーマンスをシミュレートできる AI Configurator モードが含まれています。この機能により、チームは物理 GPU リソースを割り当てる前に構成を迅速に繰り返すことができます。出力は、チームが「」と呼ぶものを強化するために調整されたセットアップを提供します。グッドプットこれは、最初のトークンまでの時間とトークン間の待ち時間の設定制限内に収まりながら、可能な最高のスループットです。

システムが運用に入ると、SLO ベースの Dynamo Planner がランタイム オーケストレーション エンジンとして引き継ぎます。このコンポーネントは「LLM 対応」です。つまり、従来のロード バランサーとは異なり、クラスターの状態を監視します。デコード プール内のキーと値のキャッシュの負荷やプレフィル キューの深さなどを追跡します。 Planner は、プロファイラーのパフォーマンス境界を使用して、プリフィルおよびデコード ワーカーをスケールします。これは、トラフィック パターンの変化に応じてサービス レベルの目標を達成するのに役立ちます。

この発表では、航空アシスタントの詳細なシナリオを通じてこれらの機能が説明されています。この場合、 クウェン3-32B-FP8 モデルは航空会社のモバイル アプリをサポートしています。これは、最初のトークンまでの時間は 500 ミリ秒、トークン間の待ち時間は 30 ミリ秒という厳格なサービス レベル アグリーメントに従います。短い乗客クエリによる通常の操作中、システムは 1 つのプレフィル ワーカーと 1 つのデコード ワーカーで実行されます。天候の乱れにより 200 人のユーザーが複雑なルート変更リクエストを送信すると、プランナーはその急増に気づきました。その後、2 つのプレフィル ワーカーにスケールアップしますが、1 つのデコード ワーカーは保持します。チームの報告によると、新しいワーカーは数分以内にオンラインになり、トラフィックの急増中にシステムが遅延目標を維持できるようになりました。

手動セットアップから自動化された SLO 主導のリソース管理への移行は、チームが Kubernetes 上で大規模な言語モデルのデプロイメントをより適切に処理できる方法を示しています。 Planner コンポーネントは、レイテンシのニーズを GPU の割り当てとスケーリングの選択肢に変えるツールを提供します。これは、分離された推論アーキテクチャを実行する際の運用負担を軽減することを目的としています。自動化ツールは、推論が重要な LLM または長いコンテキストの LLM を扱う組織を支援します。これらにより、複雑なマルチノード GPU セットアップの管理が容易になります。また、トラフィック パターンの変化時にサービス レベルの目標を達成することもサポートします。

#NVIDIA #Dynamo #Planner #がマルチノード #LLM #推論に #SLO #主導の自動化をもたらす

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。