日本語版
最新ニュース
世界

Cosmos Policy は 1 段階のビデオ適応により 98.5% のロボット制御を達成

研究者たちは、複雑な物理的タスクをビデオから直接学習する能力をロボットに装備するという課題に取り組んでおり、NVIDIA の Moo Jin Kim、Yihuai Gao、Tsung-Yi Lin と、NVIDIA の Yunhao Ge、Grace Lam らが主導した新しい研究は、重要な前進を示しています。 Cosmos Policy と呼ばれるその革新的なアプローチは、事前トレーニングされたビデオ モデルを効果的なロボット制御システムに適応させるプロセスを合理化し、複雑なアーキテクチャの変更や多段階のトレーニングを必要とせずに、シミュレーションと現実世界の両方のベンチマークで最先端の結果を達成します。これには、LIBERO シミュレーションでの 98.5% という驚くべき成功率が含まれます。 Cosmos Policy は、ビデオの潜在空間内でロボットのアクションを生成する方法を学習することで、既存の時空間理解を活用して成功するアクションの軌道を計画し、経験を通じてパフォーマンスをさらに磨き、ロボットがより簡単かつ効率的に学習して適応できる未来を約束します。 この革新的なアプローチは、ゼロからトレーニングされた強力な普及ポリシーだけでなく、既存のビデオベースのポリシーや、同じロボットのデモンストレーションで微調整された最先端の視覚-言語-行動モデルをも上回ります。チームの成功は、事前トレーニングされたビデオ モデルの機能を活用して、複雑で高次元のマルチモーダルな配信をモデル化し、統一されたフレームワーク内で他のモダリティと並んでアクションを表現することに由来しています。この取り組みは、多段階のトレーニング プロセスや複雑なアーキテクチャの追加を超えて、ロボット制御の新しいパラダイムを確立します。 Cosmos Policy は、ビデオ モデルを直接微調整してアクション、将来の状態、値を同時に生成することで、ビデオ データに固有の豊富な時空間事前分布を活用しながら学習プロセスを簡素化します。研究者はコード、モデル、トレーニング データを公開し、ロボット工学コミュニティ内でのさらなる探索と開発を促進します。この研究は、ビデオ生成とロボット制御の間の強力な相乗効果を明らかにし、よりインテリジェントで適応性のあるロボットを作成するための新しい道を開きます。予測された将来の状態に基づいて行動の軌道を計画する Cosmos Policy の機能は、ロボットの自律性の大幅な進歩を表しており、ロボットがより高い効率と信頼性で複雑な操作タスクに取り組むことができる可能性があります。この画期的な進歩により、確立されたベンチマークでのパフォーマンスが向上するだけでなく、現実世界のシナリオでも有望な結果が実証され、将来のより多用途で有能なロボット システムへの道が開かれます。 ロボット政策学習の潜在的普及 この革新的な技術により、モデルは複雑なアクションの分布を驚くべき効率で捉えることができます。この研究では、ベストオブ…

Cosmos Policy は 1 段階のビデオ適応により 98.5% のロボット制御を達成

1769472212
2026-01-26 23:48:00

研究者たちは、複雑な物理的タスクをビデオから直接学習する能力をロボットに装備するという課題に取り組んでおり、NVIDIA の Moo Jin Kim、Yihuai Gao、Tsung-Yi Lin と、NVIDIA の Yunhao Ge、Grace Lam らが主導した新しい研究は、重要な前進を示しています。 Cosmos Policy と呼ばれるその革新的なアプローチは、事前トレーニングされたビデオ モデルを効果的なロボット制御システムに適応させるプロセスを合理化し、複雑なアーキテクチャの変更や多段階のトレーニングを必要とせずに、シミュレーションと現実世界の両方のベンチマークで最先端の結果を達成します。これには、LIBERO シミュレーションでの 98.5% という驚くべき成功率が含まれます。 Cosmos Policy は、ビデオの潜在空間内でロボットのアクションを生成する方法を学習することで、既存の時空間理解を活用して成功するアクションの軌道を計画し、経験を通じてパフォーマンスをさらに磨き、ロボットがより簡単かつ効率的に学習して適応できる未来を約束します。

この革新的なアプローチは、ゼロからトレーニングされた強力な普及ポリシーだけでなく、既存のビデオベースのポリシーや、同じロボットのデモンストレーションで微調整された最先端の視覚-言語-行動モデルをも上回ります。チームの成功は、事前トレーニングされたビデオ モデルの機能を活用して、複雑で高次元のマルチモーダルな配信をモデル化し、統一されたフレームワーク内で他のモダリティと並んでアクションを表現することに由来しています。この取り組みは、多段階のトレーニング プロセスや複雑なアーキテクチャの追加を超えて、ロボット制御の新しいパラダイムを確立します。

Cosmos Policy は、ビデオ モデルを直接微調整してアクション、将来の状態、値を同時に生成することで、ビデオ データに固有の豊富な時空間事前分布を活用しながら学習プロセスを簡素化します。研究者はコード、モデル、トレーニング データを公開し、ロボット工学コミュニティ内でのさらなる探索と開発を促進します。この研究は、ビデオ生成とロボット制御の間の強力な相乗効果を明らかにし、よりインテリジェントで適応性のあるロボットを作成するための新しい道を開きます。予測された将来の状態に基づいて行動の軌道を計画する Cosmos Policy の機能は、ロボットの自律性の大幅な進歩を表しており、ロボットがより高い効率と信頼性で複雑な操作タスクに取り組むことができる可能性があります。この画期的な進歩により、確立されたベンチマークでのパフォーマンスが向上するだけでなく、現実世界のシナリオでも有望な結果が実証され、将来のより多用途で有能なロボット システムへの道が開かれます。

ロボット政策学習の潜在的普及

この革新的な技術により、モデルは複雑なアクションの分布を驚くべき効率で捉えることができます。この研究では、ベストオブ N サンプリングを利用して、候補アクションを生成し、その結果生じる将来の状態を想像し、予測値によってこれらの状態をランク付けすることで計画を立て、最終的に最も価値の高いアクションを実行して成功率を高めました。研究者たちは、ターゲット プラットフォーム上のロボット デモンストレーション データを注意深く収集し、このデータを使用して事前トレーニングされたビデオ モデルを微調整し、視覚運動制御と計画機能を確立しました。チームはシミュレーションと現実世界のベンチマークの両方で Cosmos Policy を評価し、LIBERO (平均成功率 98.5%) と RoboCasa (平均成功率 67.1%) で最先端のパフォーマンスを達成しました。

さらに、Cosmos Policy は、難しい両手操作タスクにおいて、ゼロから訓練された強力な拡散ポリシー、ビデオベースのポリシー、最先端のビジョンアクションモデルを上回り、平均成功率 93.6% を達成しました。特に、この研究では、Cosmos Policy がモデルベースの計画で強化された場合、現実世界の操作タスクにおいてタスク完了率が平均 12.5% 高いことが実証されました。科学者らは、EDM ノイズ除去スコア マッチング定式化でトレーニングされた Wan2.1 時空間 VAE トークナイザーを利用した潜在ビデオ拡散モデルである Cosmos-Predict2-2B-Video2World モデルをこの画期的な基盤として利用しました。この単一の統合アーキテクチャは、ポリシー、世界モデル、および価値機能として同時に機能し、ロボット制御の大幅な進歩を表しています。

Cosmos Policy はロボット制御ベンチマークで優れています

チームは 4 つの LIBERO タスク スイート全体で成功を測定し、それぞれ 98.1%、100.0%、98.2%、97.6% という一貫した高いパフォーマンスを実証しました。データによると、Cosmos Policy は RoboCasa シミュレーションでも優れており、タスクあたりわずか 50 回のトレーニング デモンストレーションで平均成功率 67.1% に達しており、競合する手法で必要な 300 回のデモンストレーションよりも大幅に少ないことが示されています。この画期的な進歩により、シンプルな単一ステージのトレーニング後プロセスが実現し、ビデオ モデルをロボット工学に適応させるために通常必要となる複雑なアーキテクチャの変更が不要になります。具体的には、LIBERO では、Cosmos Policy が Diffusion Policy を上回り、成功率は 72.4% 対 78.3%、Dita は 92.3% 対 97.4%、π0 は 94.2% 対 96.8%、そして先進的な UniVLA でさえ 95.2% 対 96.5% でした。

この研究では、すべてのタスクにわたってメソッドごとに 101 回の試行を使用してパフォーマンスを綿密に評価し、固定の初期状態セットとの公平な比較を保証しました。さらに、実世界の ALOHA ロボット評価の分析により、π0.5 や OpenVLA-OFT+ などの競合手法では頻繁に失敗する、ミリメートル公差のジップロック スライダー バッグの掴みなどの高精度操作に対するコスモス ポリシーの優れた処理が明らかになりました。定性的観察によると、他のモデルは「キャンディーをボウルに入れる」や「キャンディーをジップロックの袋に入れる」などのタスクに苦戦する一方、Cosmos Policy は高度なアクションのマルチモダリティと正確な把握を伴う課題に効果的に対処していることがわかりました。チームの世界モデル予測は、ポリシー展開データの微調整を通じて洗練され、状態を正確に予測し、より効果的な計画を可能にし、最終的にエピソードの成功率の向上に貢献しました。

潜在拡散により、一段のロボット制御を大幅に実現

この方法は、ビデオ生成技術の既存のロボティクス アプリケーションでよく見られる複雑なアーキテクチャの変更や多段階のトレーニング手順の必要性を回避します。著者らは、Cosmos Policy が現在、トレーニング デモンストレーションと同様の条件で最高のパフォーマンスを発揮していることを認めていますが、配布外のシナリオでも強力なパフォーマンスを示しており、これらの特定のテストでは π0.5 がわずかに優れた結果を示しています。アブレーション研究では、トレーニング中に補助損失を取り除くと成功率が 1.5 ポイント低下し、ゼロからモデルをトレーニングすると 3.9 ポイント低下することが明らかになり、事前トレーニングされたモデルと共同学習目標の重要性が強調されています。将来の研究では、Cosmos Policy をより複雑なロボット プラットフォームやタスクに拡張し、目に見えない環境やシナリオへの一般化機能をさらに強化する方法を調査する可能性があります。

#Cosmos #Policy #は #段階のビデオ適応により #のロボット制御を達成

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。