日本語版
最新ニュース
企業

IBM、Red Hat、Google は、LLM 推論用の Kubernetes ブループリントを CNCF に寄贈しました。

Kubernetes と AI の融合は、あらゆるモデル、あらゆるアクセラレータ、あらゆるクラウドに推論スタックをデプロイする複製可能な Kubernetes ブループリントである llm-d に実現されました。 火曜日に KubeCon ヨーロッパ 2026 アムステルダムで、IBM Research、Red Hat、Google Cloud は、 llm‑d、オープンソースの分散推論フレームワーク、 クラウド ネイティブ コンピューティング財団 (CNCF) サンドボックスプロジェクトとして。 この動きは、創設協力者である NVIDIA と CoreWeave、AMD、Cisco、Hugging Face、Intel、Lambda、Mistral AI の支援を受けて、スケーラブルでベンダー中立な大規模言語モデル (LLM) 推論のためのコミュニティ管理の青写真として llm‑d を確立します。 2025年に打ち上げられ、 llm‑d は、大規模なサービス基盤モデルを予測可能、移植可能、クラウドネイティブにするために構築されました。これにより、即席のモデルごとの課題からの推論が、複製可能な本番グレードの Kubernetes…

IBM、Red Hat、Google は、LLM 推論用の Kubernetes ブループリントを CNCF に寄贈しました。

Kubernetes と AI の融合は、あらゆるモデル、あらゆるアクセラレータ、あらゆるクラウドに推論スタックをデプロイする複製可能な Kubernetes ブループリントである llm-d に実現されました。

火曜日に KubeCon ヨーロッパ 2026 アムステルダムで、IBM Research、Red Hat、Google Cloud は、 llm‑d、オープンソースの分散推論フレームワーク、 クラウド ネイティブ コンピューティング財団 (CNCF) サンドボックスプロジェクトとして。

この動きは、創設協力者である NVIDIA と CoreWeave、AMD、Cisco、Hugging Face、Intel、Lambda、Mistral AI の支援を受けて、スケーラブルでベンダー中立な大規模言語モデル (LLM) 推論のためのコミュニティ管理の青写真として llm‑d を確立します。

2025年に打ち上げられ、 llm‑d は、大規模なサービス基盤モデルを予測可能、移植可能、クラウドネイティブにするために構築されました。これにより、即席のモデルごとの課題からの推論が、複製可能な本番グレードの Kubernetes ベースのシステムに変換されます。 Llm-d は、2025 年に Red Hat が買収した Neural Magic によって作成されました。IBM の目標は次のように述べています。 カルロス・コスタKubeCon の IBM Research Distinguished Engineer の基調講演では、「ファーストクラスのクラウドネイティブ ワークロードに対応する大規模モデルを作成する」ことを掲げています。

具体的には、llm-d は、大規模言語モデル (LLM) 推論を運用グレードの分散ワークロードとして実行するためのオープンソースの Kubernetes ネイティブ フレームワークです。これが実際に意味することは次のとおりです。

  • Llm-d は、LLM サービスを分散システムに変換します。推論をプレフィル フェーズとデコード フェーズ (分解) に分割し、それらを異なるポッドで実行します。つまり、各フェーズを個別にスケールおよび調整できるということです。
  • LLM 対応のルーティングおよびスケジューリング層が追加されます。これは、次の情報に基づいてリクエストをルーティングするゲートウェイ拡張機能を介して行われます。 KVキャッシュ 状態、ポッド負荷、およびハードウェア特性を調整して、レイテンシーとスループットを向上させます。
  • 最後に、Kubernetes 上にモジュラー スタックを提供します。 vLLM 推論ゲートウェイと関連コンポーネントとして機能し、「あらゆるモデル、あらゆるアクセラレータ、あらゆるクラウド」の再利用可能な青写真を提供します。

概念的には、vLLM は高速推論エンジンとして機能しますが、llm‑d は、一般的な HTTP ワークロードではなく LLM トラフィック向けに調整されたインテリジェントなスケジューリング、キャッシュ認識ルーティング、自動スケーリングを備えた GPU/TPU のクラスター全体でそのエンジンを実行できるようにするオペレーティング レイヤーを提供します。

記者会見では、 ブライアン・スティーブンスNeural Magic の元 CEO で、現在は Red Hat SVP 兼 AI CTO である同氏は、「私たちは新しいアクセラレータを導入することに多くの仕事をしています。TPU、AMD、Nvidia、その他のアクセラレータのロングテールです。私たちは、それらが参入する方法を持っていることを本当に望んでいます。そうすれば、Linux と同じように、BLM、任意のモデル、任意のアクセラレータを使用して、任意のハードウェア、任意のアプリケーションを実行できます。」と述べています。

これは、推論を実行する古い方法よりも高速かつ安価です。 Google Cloud による初期のテストでは、「最初のトークンまでの時間が 2 倍改善 コード補完などのユースケースで、より応答性の高いアプリケーションを可能にします。これは、従来のオートスケーラー、汎用 API、およびリクエスト ルーティングが、効率的な KV キャッシュ管理、プリフィル/デコード オーケストレーション、および異種アクセラレータに依存するステートフル推論ワークロード向けに設計されていないためです。

Llm‑d はこれらの問題に正面から取り組みます。プレフィックスキャッシュを意識したルーティングとプレフィル/デコードの分解が導入され、推論フェーズを独立して拡張できるようになります。 GPU、CPU、ストレージ層にわたる階層型キャッシュ オフロードをサポートし、アクセラレータ メモリを過負荷にすることなく、より大きなコンテキスト ウィンドウを有効にします。

トラフィックとハードウェアを認識するオートスケーラーは、基本的な使用率メトリクスに依存するのではなく、ワークロード パターンに動的に適応します。また、次のような新しい Kubernetes API と連携して動作するように設計されています。 ゲートウェイ API 推論拡張機能 (GAIE) そして リーダーワーカーセット (LWS)。この 3 つを組み合わせることで、分散推論を第一級の Kubernetes ワークロードにするように設計されています。

プロジェクトの貢献者は、llm‑d を、実験から本番環境に移行する組織にとっての「明るい道」であると説明しています。 「私たちはあなたのためにこれをテストしました。私たちはそれをベンチマークしました。私たちは痛みを経験しました」とコスタ氏は言いました。このフレームワークは、再現可能なベンチマーク、検証済みの展開パターン、Nvidia GPU から Google TPU、AMD や Intel ハードウェアまでの主要なアクセラレータ ファミリにわたる互換性を提供します。

IBM とパートナーは、llm‑d を CNCF に貢献することで、AI 推論が間もなく Prometheus や Envoy と同じくらいクラウドネイティブ スタックの基盤となることに賭けています。

IBM は、この寄付が分散推論の導入と管理の標準化にとって極めて重要であると考えています。 「CNCFはAIインフラストラクチャーの本拠地になりつつある」とコスタ氏は語った。 「共通のパターン、API、ガバナンスが集約され、全員が同じプレイブックに基づいて構築できるようになります。」

今後を見据えて、llm-d の次の開発サイクルは、マルチモーダル ワークロード、HuggingFace に関する llm-d の機能の拡張に焦点を当てます。 マルチLoRA 最適化、および vLLM とのより深い統合。具体的には、 ミストラルAI はすでに、細分化されたサービスに関するオープン スタンダードを推進するコードを提供しています。

IBM Research は、強化学習や自己最適化 AI インフラストラクチャなど、推論とトレーニングの交差点を引き続き探索していきます。コスタ氏は、「共通の基盤スタックを作成することで、エコシステムは基本を再構築するのではなく、AI を前進させることに集中できるようになります。」と述べています。 CNCF を新たな本拠地として、llm‑d はクラウドネイティブ AI 時代の基礎となる準備が整っています。

YouTube.COM/THENEWSTACK

テクノロジーの進歩は速いので、エピソードを見逃さないでください。 YouTube チャンネルに登録すると、すべてのポッドキャスト、インタビュー、デモなどをストリーミングできます。

購読する

スケッチで作成されたグループ。

Steven J. Vaughan-Nichols (別名 sjvn) は、CP/M-80 が最先端の PC オペレーティング システムであり、300 bps の高速インターネット接続であり、WordStar が最先端のワード プロセッサであり、私たちが気に入っていた頃からテクノロジーとテクノロジーのビジネスについて執筆してきました。

Steven J. Vaughan-Nichols の続きを読む
#IBMRed #HatGoogle #はLLM #推論用の #Kubernetes #ブループリントを #CNCF #に寄贈しました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。