Nvidiaは11月11日に、ロボットと物理AIの新しいビジョン言語モデルを発表したと発表しました。 NVIDIA Technologyのブログによると、このモデルは今年GTC 2025で最初に導入されましたが、事前知識、身体的理解、および常識に基づいて現実世界を理解し、行動するように設計されたオープンソースのカスタムメイドの合理的なビジョン言語モデルです。
Cosmos Rejenyはビデオとテキストに入り、ステップごとの思考を通じて論理的な応答を提供します。マップ学習のマイクロ調整と補強学習を組み合わせて構築するモデルは、人間の解説なしに世界のメカニズムを推測する能力を持っています。パフォーマンスに関しては、物理的なAI作業のマイクロ調整により、基本モデルの10%以上が改善され、学習を強化することで5%のパフォーマンスを達成しました。これにより、ロボット工学と自動運転車の主要なベンチマークで平均65.7ポイントを獲得しました。
使用の主な領域には、データキュレーションとスズの自動化、ロボットの計画と推論による複雑な環境での意思決定、大規模なビデオ分析による洞察抽出が含まれます。特に、都市の交通ネットワーク、工場、倉庫の分析に使用できます。
開発者は、抱きしめる顔からモデルチェックポイントをダウンロードして、GitHubから関連するスクリプトを取得できます。 Cosmos Rejenic WorksはNvidia GPU用に最適化されており、build.nvidia.comで直接体験できます。
モデルの詳細については、 Nvidia開発者ブログで見つけることができます。
画像ソース:nvidia
#人間のように考えるロボットを作るnvidiaは視覚モデルのオープンソースとして発表されたコスモスレスト