日本語版
最新ニュース
科学&テクノロジー

ai-dynamo/dynamo:データセンタースケール分散推論フレームワーク

| ガイド | アーキテクチャと機能 | API | SDK | Nvidia Dynamoは、マルチノード分散環境で生成AIおよび推論モデルを提供するために設計された高スループットの低遅延推論フレームワークです。 Dynamoは、推論エンジンアゴーシスティックであるように設計されており(TRT-LLM、VLLM、SGLANGなどをサポートし、次のようなLLM固有の機能をキャプチャします。 refill&decodeの推論を分解しました - GPUスループットを最大化し、スループットとレイテンシの間のトレードオフを容易にします。 動的GPUスケジューリング - 変動する需要に基づいてパフォーマンスを最適化します LLM-Awareリクエストルーティング - 不要なKVキャッシュの再計算を排除します 加速データ転送 - NIXLを使用して推論応答時間を短縮します。 KVキャッシュオフロード - より高いシステムスループットのために複数のメモリ階層を活用します パフォーマンスのために錆び、拡張性のためにPythonに組み込まれたDynamoは、完全にオープンソースであり、透明なOSS(オープンソースソフトウェア)の最初の開発アプローチによって駆動されます。 次の例には、いくつかのシステムレベルパッケージが必要です。 X86_64 CPUでUbuntu 24.04を使用することをお勧めします。見る support_matrix.md apt-get update DEBIAN_FRONTEND=noninteractive apt-get install…

ai-dynamo/dynamo:データセンタースケール分散推論フレームワーク

1742379599
2025-03-18 20:44:00


Githubリリース
不和

| ガイド | アーキテクチャと機能 | API | SDK |

Nvidia Dynamoは、マルチノード分散環境で生成AIおよび推論モデルを提供するために設計された高スループットの低遅延推論フレームワークです。 Dynamoは、推論エンジンアゴーシスティックであるように設計されており(TRT-LLM、VLLM、SGLANGなどをサポートし、次のようなLLM固有の機能をキャプチャします。

  • refill&decodeの推論を分解しました – GPUスループットを最大化し、スループットとレイテンシの間のトレードオフを容易にします。
  • 動的GPUスケジューリング – 変動する需要に基づいてパフォーマンスを最適化します
  • LLM-Awareリクエストルーティング – 不要なKVキャッシュの再計算を排除します
  • 加速データ転送 – NIXLを使用して推論応答時間を短縮します。
  • KVキャッシュオフロード – より高いシステムスループットのために複数のメモリ階層を活用します

パフォーマンスのために錆び、拡張性のためにPythonに組み込まれたDynamoは、完全にオープンソースであり、透明なOSS(オープンソースソフトウェア)の最初の開発アプローチによって駆動されます。

次の例には、いくつかのシステムレベルパッケージが必要です。 X86_64 CPUでUbuntu 24.04を使用することをお勧めします。見る support_matrix.md

apt-get update
DEBIAN_FRONTEND=noninteractive apt-get install -yq python3-dev python3-pip python3-venv libucx0
python3 -m venv venv
source venv/bin/activate

pip install ai-dynamo[all]

注記

Tensort-llmサポートは現在、aで利用できます 支店

ローカルでLLMとのランニングと対話

モデルを実行してローカルに対話するには、呼び出すことができます dynamo run ハグする顔モデルで。 dynamo run 以下を含むいくつかのバックエンドをサポートします mistralrssglangvllm、 そして tensorrtllm

dynamo run out=vllm deepseek-ai/DeepSeek-R1-Distill-Llama-8B

? User › Hello, how are you?
✔ User · Hello, how are you?
Okay, so I'm trying to figure out how to respond to the user's greeting. They said, "Hello, how are you?" and then followed it with "Hello! I'm just a program, but thanks for asking." Hmm, I need to come up with a suitable reply. ...

Dynamoは、以下を含むローカルの推論コンポーネントセットをスピンアップする簡単な方法を提供します。

  • Openai互換性のあるフロントエンド – さびに記載されている高性能Openai互換HTTP APIサーバー。
  • BASICおよびKV AWAREルーター – 労働者のセットへのルートと負荷のバランストラフィック。
  • 労働者 – 事前に構成されたLLMサービングエンジンのセット。

最小限の構成を実行するには、事前に構成された例を使用できます。

ダイナモ分散ランタイムサービスを開始します

最初にダイナモ分散ランタイムサービスを開始します。

docker compose -f deploy/docker-compose.yml up -d

Dynamo LLMサービスコンポーネントを開始します

次に、HTTPサーバー、基本的なラウンドロビンルーター、および単一のワーカーを使用して、最小限の構成を提供します。

cd examples/llm
dynamo serve graphs.agg:Frontend -f configs/agg.yaml

curl localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "deepseek-ai/DeepSeek-R1-Distill-Llama-8B",
    "messages": [
    {
        "role": "user",
        "content": "Hello, how are you?"
    }
    ],
    "stream":false,
    "max_tokens": 300
  }' | jq

#aidynamodynamoデータセンタースケール分散推論フレームワーク

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。