日本語版
最新ニュース
科学&テクノロジー

AIは、単一のハウツービデオのロボットタスクを教えています

この方法は、人間とロボットの動きのギャップを橋渡しし、模倣を通じてより柔軟で効率的な学習を可能にします。わずか30分間のロボットデータで、韻を備えたロボットは、以前のアプローチよりも50%以上のタスクの成功を達成し、よりスマートで能力のあるロボットアシスタントへの大きな一歩を示しています。重要な事実:ワンショット学習: 韻により、ロボットは1つのハウツービデオから学習できます。ミスマッチソリューション: システムは、人間とロボットのアクションの違いを橋渡しします。効率的なトレーニング: 30分間のロボットデータのみが必要であり、タスクの成功を50%増加させます。コーネル大学の研究者は、ライム(不一致の実行中のハイブリッド模倣の検索)と呼ばれる人工知能を搭載した新しいロボットフレームワークを開発しました。これにより、ロボットは単一のハウツービデオを視聴することでタスクを学習できます。ロボットは気難しい学習者になる可能性があります。歴史的に、彼らは基本的なタスクを完了するために正確で段階的な指示を必要としており、ツールを落としたり、ネジを紛失した後など、物事がオフスクリプトになったときにそれをやめる傾向があります。 ライムはチームの答えです。これは、ロボットをより微妙で適応性のあるものにするスケーラブルなアプローチです。ロボットシステムをスーパーチャージして、独自のメモリを使用し、見たビデオを描くことによって一度だけ表示されたタスクを実行するときにドットを接続します。クレジット:Neuroscience Newsしかし、ライムは、それらを訓練するのに必要な時間、エネルギー、お金を大幅に削減することにより、ロボットシステムの開発と展開を迅速に追跡することができると研究者は述べた。「ロボットを操作することの迷惑なことの1つは、さまざまなタスクを行っているロボットに関する非常に多くのデータを収集することです」と、コンピューターサイエンスの分野の博士課程の学生であるKushal Kedia氏は述べています。「それは人間がどのように仕事をするかではありません。私たちは他の人をインスピレーションと見なしています。」ケディアは、5月にアトランタで開催された電気エレクトロニクスエンジニア国際ロボットと自動化に関する国際会議で、「不一致の実行中のワンショット模倣」という論文を発表します。ホームロボットアシスタントは、物理的な世界とその無数の偶発性をナビゲートする機知が不足しているため、まだ長い道のりです。ロボットをスピードアップするために、ケディアのような研究者は、ハウツービデオに相当するものでそれらをトレーニングしています。ラボ設定でのさまざまなタスクの人間のデモンストレーションです。「模倣学習」と呼ばれる機械学習の分野であるこのアプローチの希望は、ロボットが一連のタスクをより速く学習し、実際の環境に適応できることです。「私たちの仕事はフランス語を英語に翻訳するようなものです。特定のタスクを人間からロボットに翻訳しています」と、コンピューターサイエンスの助教授であるSanjiban Choudhury氏は述べています。しかし、この翻訳タスクは依然としてより広範な課題に直面しています。人間はロボットが追跡して模倣するにはあまりにも流動的に動き、ビデオでロボットをトレーニングするにはゴブが必要です。さらに、ビデオとロボットの間のアクションの不一致が歴史的にロボット学習のために綴られているため、ビデオデモンストレーションはナプキンや積み重ねディナープレートを拾い上げたり、ゆっくりと完璧に実行したりする必要があります。「人間がロボットの動きとは異なる方法で動くと、この方法はすぐにバラバラになります」とChoudhury氏は言います。「私たちの考えは、「人間とロボットがタスクをする方法の間のこの不一致に対処する原則的な方法を見つけることができますか?」ライムはチームの答えです。これは、ロボットをより微妙で適応性のあるものにするスケーラブルなアプローチです。ロボットシステムをスーパーチャージして、独自のメモリを使用し、見たビデオを描くことによって一度だけ表示されたタスクを実行するときにドットを接続します。たとえば、韻を備えたロボットがカウンターからマグカップを取得し、近くのシンクに置く人間がビデオのバンクを組み合わせて、カップをつかんで調理器具を下げるなど、同様のアクションからインスピレーションを引き出すビデオを示しました。Rhymeは、ロボットが複数のステップシーケンスを学習しながら、トレーニングに必要なロボットデータの量を大幅に低下させる方法を舗装していると研究者は述べた。このAIとロボット研究ニュースについてオリジナルの研究: クローズドアクセス。「不一致の実行中のワンショット模倣」Sanjiban Choudury、et al。 arxiv抽象的な不一致の実行中のワンショット模倣プロンプトとしての人間のデモンストレーションは、ロボットをプログラムして長老型操作タスクを実行する強力な方法です。ただし、これらのデモンストレーションをロボットに実行可能なアクションに変換することは、動きのスタイルと物理的能力の実行の不一致により、重要な課題をもたらします。ヒトロボット翻訳の既存の方法は、ペアのデータに依存します。ペアのデータは、スケーリングするのが不可能であるか、実際に壊れることが多いフレームレベルの視覚的類似性に大きく依存しています。これらの課題に対処するために、シーケンスレベルの最適な輸送コスト関数を使用して、人間とロボットの軌跡を自動的にペアにする新しいフレームワークであるRhymeを提案します。長老のロボットのデモンストレーションを考えると、ライムは、短いホリゾンのヒューマンクリップを取得および構成することにより、意味的に同等の人間ビデオを統合します。このアプローチは、ペアのデータを必要とせずに効果的なポリシートレーニングを容易にします。コードとデータセットをリリースします このHTTPS URL。 #AIは単一のハウツービデオのロボットタスクを教えています

AIは、単一のハウツービデオのロボットタスクを教えています

この方法は、人間とロボットの動きのギャップを橋渡しし、模倣を通じてより柔軟で効率的な学習を可能にします。わずか30分間のロボットデータで、韻を備えたロボットは、以前のアプローチよりも50%以上のタスクの成功を達成し、よりスマートで能力のあるロボットアシスタントへの大きな一歩を示しています。

重要な事実:

  • ワンショット学習: 韻により、ロボットは1つのハウツービデオから学習できます。
  • ミスマッチソリューション: システムは、人間とロボットのアクションの違いを橋渡しします。
  • 効率的なトレーニング: 30分間のロボットデータのみが必要であり、タスクの成功を50%増加させます。

コーネル大学の研究者は、ライム(不一致の実行中のハイブリッド模倣の検索)と呼ばれる人工知能を搭載した新しいロボットフレームワークを開発しました。これにより、ロボットは単一のハウツービデオを視聴することでタスクを学習できます。

ロボットは気難しい学習者になる可能性があります。歴史的に、彼らは基本的なタスクを完了するために正確で段階的な指示を必要としており、ツールを落としたり、ネジを紛失した後など、物事がオフスクリプトになったときにそれをやめる傾向があります。

ライムはチームの答えです。これは、ロボットをより微妙で適応性のあるものにするスケーラブルなアプローチです。ロボットシステムをスーパーチャージして、独自のメモリを使用し、見たビデオを描くことによって一度だけ表示されたタスクを実行するときにドットを接続します。クレジット:Neuroscience News

しかし、ライムは、それらを訓練するのに必要な時間、エネルギー、お金を大幅に削減することにより、ロボットシステムの開発と展開を迅速に追跡することができると研究者は述べた。

「ロボットを操作することの迷惑なことの1つは、さまざまなタスクを行っているロボットに関する非常に多くのデータを収集することです」と、コンピューターサイエンスの分野の博士課程の学生であるKushal Kedia氏は述べています。

「それは人間がどのように仕事をするかではありません。私たちは他の人をインスピレーションと見なしています。」

ケディアは、5月にアトランタで開催された電気エレクトロニクスエンジニア国際ロボットと自動化に関する国際会議で、「不一致の実行中のワンショット模倣」という論文を発表します。

ホームロボットアシスタントは、物理的な世界とその無数の偶発性をナビゲートする機知が不足しているため、まだ長い道のりです。

ロボットをスピードアップするために、ケディアのような研究者は、ハウツービデオに相当するものでそれらをトレーニングしています。ラボ設定でのさまざまなタスクの人間のデモンストレーションです。

「模倣学習」と呼ばれる機械学習の分野であるこのアプローチの希望は、ロボットが一連のタスクをより速く学習し、実際の環境に適応できることです。

「私たちの仕事はフランス語を英語に翻訳するようなものです。特定のタスクを人間からロボットに翻訳しています」と、コンピューターサイエンスの助教授であるSanjiban Choudhury氏は述べています。

しかし、この翻訳タスクは依然としてより広範な課題に直面しています。人間はロボットが追跡して模倣するにはあまりにも流動的に動き、ビデオでロボットをトレーニングするにはゴブが必要です。

さらに、ビデオとロボットの間のアクションの不一致が歴史的にロボット学習のために綴られているため、ビデオデモンストレーションはナプキンや積み重ねディナープレートを拾い上げたり、ゆっくりと完璧に実行したりする必要があります。

「人間がロボットの動きとは異なる方法で動くと、この方法はすぐにバラバラになります」とChoudhury氏は言います。

「私たちの考えは、「人間とロボットがタスクをする方法の間のこの不一致に対処する原則的な方法を見つけることができますか?」

ライムはチームの答えです。これは、ロボットをより微妙で適応性のあるものにするスケーラブルなアプローチです。ロボットシステムをスーパーチャージして、独自のメモリを使用し、見たビデオを描くことによって一度だけ表示されたタスクを実行するときにドットを接続します。

たとえば、韻を備えたロボットがカウンターからマグカップを取得し、近くのシンクに置く人間がビデオのバンクを組み合わせて、カップをつかんで調理器具を下げるなど、同様のアクションからインスピレーションを引き出すビデオを示しました。

Rhymeは、ロボットが複数のステップシーケンスを学習しながら、トレーニングに必要なロボットデータの量を大幅に低下させる方法を舗装していると研究者は述べた。

このAIとロボット研究ニュースについて

オリジナルの研究: クローズドアクセス。
不一致の実行中のワンショット模倣」Sanjiban Choudury、et al。 arxiv

抽象的な

不一致の実行中のワンショット模倣

プロンプトとしての人間のデモンストレーションは、ロボットをプログラムして長老型操作タスクを実行する強力な方法です。ただし、これらのデモンストレーションをロボットに実行可能なアクションに変換することは、動きのスタイルと物理的能力の実行の不一致により、重要な課題をもたらします。

ヒトロボット翻訳の既存の方法は、ペアのデータに依存します。ペアのデータは、スケーリングするのが不可能であるか、実際に壊れることが多いフレームレベルの視覚的類似性に大きく依存しています。

これらの課題に対処するために、シーケンスレベルの最適な輸送コスト関数を使用して、人間とロボットの軌跡を自動的にペアにする新しいフレームワークであるRhymeを提案します。

長老のロボットのデモンストレーションを考えると、ライムは、短いホリゾンのヒューマンクリップを取得および構成することにより、意味的に同等の人間ビデオを統合します。このアプローチは、ペアのデータを必要とせずに効果的なポリシートレーニングを容易にします。

コードとデータセットをリリースします このHTTPS URL

#AIは単一のハウツービデオのロボットタスクを教えています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。