日本語版
最新ニュース
世界

AKS で Ray を大規模に実行する

Microsoft の Azure Kubernetes Service (AKS) チームは次のことを共有しています。 ガイダンス Anyscale のマネージドを実行するため レイ 大規模なサービス。彼らは、GPU 容量の制限、分散した ML ストレージ、認証情報の有効期限の問題という 3 つの重要な問題に焦点を当てています。 Ray は、AI および ML のワークロードを 1 台のラップトップから数千のノードにまたがるクラスターまで拡張するように設計された Python ネイティブの分散コンピューティング フレームワークです。 Anyscale のマネージド プラットフォームは、本番環境で使用するための機能を備えて Ray を強化します。新しいガイダンスでは、Azure の統合を改善するための Microsoft と Anyscale のパートナーシップが示されています。 GPU…

AKS で Ray を大規模に実行する

1773307399
2026-03-12 09:00:00

Microsoft の Azure Kubernetes Service (AKS) チームは次のことを共有しています。 ガイダンス Anyscale のマネージドを実行するため レイ 大規模なサービス。彼らは、GPU 容量の制限、分散した ML ストレージ、認証情報の有効期限の問題という 3 つの重要な問題に焦点を当てています。

Ray は、AI および ML のワークロードを 1 台のラップトップから数千のノードにまたがるクラスターまで拡張するように設計された Python ネイティブの分散コンピューティング フレームワークです。 Anyscale のマネージド プラットフォームは、本番環境で使用するための機能を備えて Ray を強化します。新しいガイダンスでは、Azure の統合を改善するための Microsoft と Anyscale のパートナーシップが示されています。

GPU の不足は、大規模 ML における最も重大な運用上の課題の 1 つです。 NVIDIA GPU などの需要の高いアクセラレータでは、Azure リージョンでクォータと可用性の問題が発生することがよくあります。これにより、クラスターのセットアップとジョブのスケジュールが遅れる可能性があります。

Microsoft が提案するソリューションでは、マルチクラスター、マルチリージョンのセットアップが使用されます。 Ray クラスターをさまざまな Azure リージョンの異なる AKS インスタンスに分散することで、チームは次のことが可能になります。 リージョンの制限を超えて GPU クォータを集約し、停止または容量の問題が発生したときにワークロードを自動的に再ルーティングし、Azure Arc と AKS を使用してコンピューティング プールをオンプレミス システムまたは他のクラウド プロバイダーに拡張します。

Anyscale コンソールには、これらの登録済みクラスターが 1 つのビューで表示されます。 Anyscale Workspaces は、利用可能な容量を使用してワークロードのスケジュールを手動または自動で管理します。新しいリージョンを追加するには、cloud_resource.yaml マニフェストを作成します。次に、Anyscale CLI を使用して適用します。この構成優先のアプローチにより、マルチリージョン拡張の管理が容易になります。

ML 運用における一般的な問題は、パイプライン ステージ間でのトレーニング データ、モデル チェックポイント、アーティファクトの転送です。これには、事前トレーニングから微調整、そして推論への移行が含まれます。このガイダンスでは、Azure BlobFuse2 でこの問題に対処しています。これは、Azure Blob Storage を POSIX 互換のファイル システムとして Ray ワーカー ポッドにマウントします。

Ray の観点からは、マウント ポイントは単なるローカル ディレクトリです。タスクとアクターは、標準のファイル I/O を使用してデータセットを読み取り、チェックポイントを書き込みます。次に、BlobFuse2 はデータを Azure Blob Storage に保存します。これにより、ポッドとノード プール全体でデータが利用できるようになります。ローカル キャッシュにより、大規模なトレーニング実行中の GPU ストールが防止され、データがコンピューティングから切り離されるため、Ray クラスターはデータを損失することなくスケールアップおよびスケールダウンできます。

もう 1 つの重要なトピックは、認証の信頼性です。 Anyscale と Azure は、30 日ごとに有効期限が切れる CLI トークンまたは API キーと統合されていました。これは手動でのローテーションが必要であることを意味しており、サービス中断の危険がありました。

新しい方法では、 Microsoft サインイン サービス プリンシパルと AKS ワークロード ID。有効期間の短いトークンを自動的に発行します。 Anyscale Kubernetes Operator ポッドは、ユーザー割り当てのマネージド ID を使用します。この ID は、Entra ID から Anyscale サービス プリンシパルのアクセス トークンを要求します。 Azure はトークンの更新を透過的に処理します。つまり、長期間有効な資格情報がクラスターに保存されず、手動のローテーションも必要ありません。

著者らは、これはマルチクラスタ環境では特に重要であると述べています。ここで、多くのクラスターにわたって資格情報を手動で管理すると、運用上の負担が増大します。 Workload Identity モデルは、Azure リソース アクセスに対してきめ細かい RBAC を提供し、副産物として Azure アクティビティ ログを通じて完全な監査証跡を生成します。

Anyscale on AKS 統合は現在プライベート プレビュー段階にあります。アクセスを希望するチームは、Microsoft アカウント チームにお問い合わせください。 AKS GitHub リポジトリにリクエストを提出することもできます。 Ray ワークロードとターゲット リージョンに関する詳細を含めます。 DeepSpeed と LLaMA-Factory を使用して微調整するためのセットアップとワークロードの例を、 Azure-サンプル/aks-anyscale GitHub 上のリポジトリ。これには、LLM 推論エンドポイントも含まれます。

この賭けを行っているのは Microsoft だけではありません。 AWS 発表された Ray Summit 2024 での Anyscale パートナーシップ。これにより、EKS クラスターが RayTurbo ランタイムに接続されます。 NVIDIA GPU と AWS の Trainium および Inferentia アクセラレータを組み合わせることで、ハードウェアの柔軟性が強調されます。さらに、SageMaker HyperPod は、ノードレベルの復元力を必要とする長時間実行のトレーニング ジョブの展開ターゲットになりました。 Google Cloud はオープンソースへの貢献においてリードしています。

GKE チーム 働いた Anyscale エンジニアと協力して、ラベルベースのスケジューリングを Ray v2.49 にアップストリームします。また、マルチチップ TPU セットアップにおけるリソースの断片化を軽減するために、ray.util.tpu レイヤーも作成されました。さらに、新しい GB200 ベースのインスタンスに動的リソース割り当てを追加しました。

3 つのハイパースケーラーはすべて同じマネージド Ray オペレーターを選択し、それぞれがインフラストラクチャを追加しました。これは、業界が AI ワークロードに Kubernetes-plus-Ray を好んでいることを示しています。現在、競争はランタイムではなく、どのクラウドが周囲のインフラストラクチャを最も効率的に効率化できるかという点に重点が置かれています。

#AKS #で #Ray #を大規模に実行する

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。