1742379599
2025-03-18 20:44:00
| ガイド | アーキテクチャと機能 | API | SDK |
Nvidia Dynamoは、マルチノード分散環境で生成AIおよび推論モデルを提供するために設計された高スループットの低遅延推論フレームワークです。 Dynamoは、推論エンジンアゴーシスティックであるように設計されており(TRT-LLM、VLLM、SGLANGなどをサポートし、次のようなLLM固有の機能をキャプチャします。
- refill&decodeの推論を分解しました – GPUスループットを最大化し、スループットとレイテンシの間のトレードオフを容易にします。
- 動的GPUスケジューリング – 変動する需要に基づいてパフォーマンスを最適化します
- LLM-Awareリクエストルーティング – 不要なKVキャッシュの再計算を排除します
- 加速データ転送 – NIXLを使用して推論応答時間を短縮します。
- KVキャッシュオフロード – より高いシステムスループットのために複数のメモリ階層を活用します
パフォーマンスのために錆び、拡張性のためにPythonに組み込まれたDynamoは、完全にオープンソースであり、透明なOSS(オープンソースソフトウェア)の最初の開発アプローチによって駆動されます。
次の例には、いくつかのシステムレベルパッケージが必要です。 X86_64 CPUでUbuntu 24.04を使用することをお勧めします。見る support_matrix.md
apt-get update
DEBIAN_FRONTEND=noninteractive apt-get install -yq python3-dev python3-pip python3-venv libucx0
python3 -m venv venv
source venv/bin/activate
pip install ai-dynamo[all]
注記
Tensort-llmサポートは現在、aで利用できます 支店
モデルを実行してローカルに対話するには、呼び出すことができます dynamo run ハグする顔モデルで。 dynamo run 以下を含むいくつかのバックエンドをサポートします mistralrs、 sglang、 vllm、 そして tensorrtllm。
dynamo run out=vllm deepseek-ai/DeepSeek-R1-Distill-Llama-8B
? User › Hello, how are you?
✔ User · Hello, how are you?
Okay, so I'm trying to figure out how to respond to the user's greeting. They said, "Hello, how are you?" and then followed it with "Hello! I'm just a program, but thanks for asking." Hmm, I need to come up with a suitable reply. ...
Dynamoは、以下を含むローカルの推論コンポーネントセットをスピンアップする簡単な方法を提供します。
- Openai互換性のあるフロントエンド – さびに記載されている高性能Openai互換HTTP APIサーバー。
- BASICおよびKV AWAREルーター – 労働者のセットへのルートと負荷のバランストラフィック。
- 労働者 – 事前に構成されたLLMサービングエンジンのセット。
最小限の構成を実行するには、事前に構成された例を使用できます。
最初にダイナモ分散ランタイムサービスを開始します。
docker compose -f deploy/docker-compose.yml up -d
次に、HTTPサーバー、基本的なラウンドロビンルーター、および単一のワーカーを使用して、最小限の構成を提供します。
cd examples/llm
dynamo serve graphs.agg:Frontend -f configs/agg.yaml
curl localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "deepseek-ai/DeepSeek-R1-Distill-Llama-8B",
"messages": [
{
"role": "user",
"content": "Hello, how are you?"
}
],
"stream":false,
"max_tokens": 300
}' | jq
#aidynamodynamoデータセンタースケール分散推論フレームワーク