日本語版
最新ニュース
科学&テクノロジー

ロボットヘルパーが間違いを犯しますか?正しい方向にそれを微調整するだけです| MITニュース

ロボットがあなたが料理をきれいにするのに役立つと想像してください。シンクからソーピーボウルをつかむように頼みますが、そのグリッパーはマークを少し見逃します。MITおよびNvidiaの研究者によって開発された新しいフレームワークを使用して、単純な相互作用でロボットの動作を修正できます。この方法では、ボウルを指したり、画面上の軌跡を追跡したり、単にロボットの腕に正しい方向にナッジを与えることができます。ロボットの動作を修正する他の方法とは異なり、この手法では、ユーザーは新しいデータを収集し、ロボットの脳を動かす機械学習モデルを再訓練する必要はありません。これにより、ロボットは直感的でリアルタイムの人間のフィードバックを使用して、ユーザーの意図を満たすために可能な限り近くになる実行可能なアクションシーケンスを選択できます。研究者が彼らの枠組みをテストしたとき、その成功率は、人間の介入を活用しなかった代替方法よりも21%高かった。長期的には、このフレームワークにより、ユーザーは、ロボットが自宅やその中のオブジェクトを見たことがないにもかかわらず、工場訓練を受けたロボットをより簡単に導き、さまざまな家庭用タスクを実行できるようになります。「素人がデータ収集を実行し、ニューラルネットワークモデルを微調整することを期待することはできません。消費者は、ロボットが箱から出してすぐに動作することを期待します。そうでない場合は、直感的なメカニズムをカスタマイズする必要があります。これが私たちがこの作業で取り組んだ挑戦です」と、電気工学およびコンピューターサイエンス(EECS)の大学院生であり、主任著者であるFelix Yanwei Wang氏は言います。 この方法に関する論文。彼の共著者には、Lirui Wang Phd '24とYilun du Phd '24が含まれます。シニア著者のジュリー・シャー、航空学と宇宙飛行士のMIT教授であり、コンピューターサイエンスおよび人工知能研究所(CSAIL)のインタラクティブロボティクスグループのディレクター。 Balakumar Sundaralingam、Xuning Yang、Yu-Wei Chao、Claudia Perez-D'Arpino PhD '19、およびNvidiaのDieter Fox。この研究は、ロボットと自動化に関する国際会議で発表されます。不整合を軽減します最近、研究者は、事前に訓練された生成AIモデルを使用して、「ポリシー」または一連のルールを学習し始めました。これは、ロボットがアクションを完了するために続きます。生成モデルは、複数の複雑なタスクを解決できます。トレーニング中、モデルは実行可能なロボットモーションのみを見るため、ロボットが従うべき有効な軌道を生成することを学びます。これらの軌跡は有効ですが、それはそれらが常に現実の世界でのユーザーの意図と常に一致することを意味しません。ロボットは、棚からノックすることなく棚から箱をつかむように訓練されていたかもしれませんが、棚がトレーニングで見たものとは異なる方向に向けられている場合、誰かの本棚の上の箱に到達することができない可能性があります。これらの障害を克服するために、エンジニアは通常、新しいタスクを実証するデータを収集し、生成モデルを再訓練します。これは、機械学習の専門知識を必要とする費用と時間のかかるプロセスです。代わりに、MITの研究者は、ユーザーが間違いを犯したときに展開中にロボットの動作を操縦できるようにしたいと考えていました。しかし、人間がロボットと相互作用してその動作を修正すると、生成モデルが無効なアクションを選択することを不注意に引き起こす可能性があります。ユーザーが望む箱に到達するかもしれませんが、その過程で棚から本をノックアウトします。「ユーザーがこの種の間違いを導入せずにロボットと対話できるようにしたいので、展開中にユーザーの意図とはるかに整合する動作を取得しますが、それも有効で実現可能です」とワンは言います。彼らのフレームワークは、ロボットの動作を修正する3つの直感的な方法をユーザーに提供することでこれを達成します。それぞれが特定の利点を提供します。まず、ユーザーは、カメラビューを表示するインターフェイスでロボットを操作するオブジェクトを指すことができます。第二に、彼らはそのインターフェイスで軌道を追跡し、ロボットがオブジェクトに到達する方法を指定できるようにすることができます。第三に、彼らはそれを望んでいる方向にロボットの腕を物理的に動かすことができます。「環境の2D画像を3Dスペースでアクションにマッピングしている場合、いくつかの情報が失われます。ロボットを物理的に微調整することは、情報を失うことなくユーザーの意図を指定する最も直接的な方法です」とWang氏は言います。成功のためのサンプリングこれらの相互作用により、ロボットが他のオブジェクトと衝突するなど、無効なアクションを選択しないようにするために、研究者は特定のサンプリング手順を使用します。この手法により、モデルは、ユーザーの目標と最も密接に一致する有効なアクションのセットからアクションを選択できます。「ユーザーの意志を単に課すのではなく、ロボットにユーザーが意図していることのアイデアを与えますが、サンプリング手順は独自の学習行動のセットを中心に振動させます」とWang氏は説明します。このサンプリング方法により、研究者のフレームワークは、シミュレーションや実験中に、おもちゃのキッチンで実際のロボットアームを使用した他の方法と比較した他の方法を上回ることができました。その方法は常にすぐにタスクを完了するとは限らないかもしれませんが、ユーザーは、ロボットが何か間違ったことをしているのを見て、それが終了するのを待ってから新しい指示を与えるのではなく、ロボットをすぐに修正できるという利点を提供します。さらに、ユーザーが正しいボウルを拾うまでロボットを数回微調整した後、その是正措置を記録し、将来のトレーニングを通じて行動に組み込むことができます。その後、翌日、ロボットはナッジを必要とせずに正しいボウルを拾うことができました。「しかし、その継続的な改善の鍵は、ユーザーがロボットと対話する方法を持っていることです。これがここで示したものです」とWang氏は言います。将来、研究者は、パフォーマンスを維持または改善しながら、サンプリング手順の速度を高めたいと考えています。また、新しい環境でのロボットポリシー生成を実験したいと考えています。 #ロボットヘルパーが間違いを犯しますか正しい方向にそれを微調整するだけです #MITニュース

ロボットヘルパーが間違いを犯しますか?正しい方向にそれを微調整するだけです| MITニュース

1741414996
2025-03-07 05:00:00

ロボットがあなたが料理をきれいにするのに役立つと想像してください。シンクからソーピーボウルをつかむように頼みますが、そのグリッパーはマークを少し見逃します。

MITおよびNvidiaの研究者によって開発された新しいフレームワークを使用して、単純な相互作用でロボットの動作を修正できます。この方法では、ボウルを指したり、画面上の軌跡を追跡したり、単にロボットの腕に正しい方向にナッジを与えることができます。

ロボットの動作を修正する他の方法とは異なり、この手法では、ユーザーは新しいデータを収集し、ロボットの脳を動かす機械学習モデルを再訓練する必要はありません。これにより、ロボットは直感的でリアルタイムの人間のフィードバックを使用して、ユーザーの意図を満たすために可能な限り近くになる実行可能なアクションシーケンスを選択できます。

研究者が彼らの枠組みをテストしたとき、その成功率は、人間の介入を活用しなかった代替方法よりも21%高かった。

長期的には、このフレームワークにより、ユーザーは、ロボットが自宅やその中のオブジェクトを見たことがないにもかかわらず、工場訓練を受けたロボットをより簡単に導き、さまざまな家庭用タスクを実行できるようになります。

「素人がデータ収集を実行し、ニューラルネットワークモデルを微調整することを期待することはできません。消費者は、ロボットが箱から出してすぐに動作することを期待します。そうでない場合は、直感的なメカニズムをカスタマイズする必要があります。これが私たちがこの作業で取り組んだ挑戦です」と、電気工学およびコンピューターサイエンス(EECS)の大学院生であり、主任著者であるFelix Yanwei Wang氏は言います。 この方法に関する論文

彼の共著者には、Lirui Wang Phd ’24とYilun du Phd ’24が含まれます。シニア著者のジュリー・シャー、航空学と宇宙飛行士のMIT教授であり、コンピューターサイエンスおよび人工知能研究所(CSAIL)のインタラクティブロボティクスグループのディレクター。 Balakumar Sundaralingam、Xuning Yang、Yu-Wei Chao、Claudia Perez-D’Arpino PhD ’19、およびNvidiaのDieter Fox。この研究は、ロボットと自動化に関する国際会議で発表されます。

不整合を軽減します

最近、研究者は、事前に訓練された生成AIモデルを使用して、「ポリシー」または一連のルールを学習し始めました。これは、ロボットがアクションを完了するために続きます。生成モデルは、複数の複雑なタスクを解決できます。

トレーニング中、モデルは実行可能なロボットモーションのみを見るため、ロボットが従うべき有効な軌道を生成することを学びます。

これらの軌跡は有効ですが、それはそれらが常に現実の世界でのユーザーの意図と常に一致することを意味しません。ロボットは、棚からノックすることなく棚から箱をつかむように訓練されていたかもしれませんが、棚がトレーニングで見たものとは異なる方向に向けられている場合、誰かの本棚の上の箱に到達することができない可能性があります。

これらの障害を克服するために、エンジニアは通常、新しいタスクを実証するデータを収集し、生成モデルを再訓練します。これは、機械学習の専門知識を必要とする費用と時間のかかるプロセスです。

代わりに、MITの研究者は、ユーザーが間違いを犯したときに展開中にロボットの動作を操縦できるようにしたいと考えていました。

しかし、人間がロボットと相互作用してその動作を修正すると、生成モデルが無効なアクションを選択することを不注意に引き起こす可能性があります。ユーザーが望む箱に到達するかもしれませんが、その過程で棚から本をノックアウトします。

「ユーザーがこの種の間違いを導入せずにロボットと対話できるようにしたいので、展開中にユーザーの意図とはるかに整合する動作を取得しますが、それも有効で実現可能です」とワンは言います。

彼らのフレームワークは、ロボットの動作を修正する3つの直感的な方法をユーザーに提供することでこれを達成します。それぞれが特定の利点を提供します。

まず、ユーザーは、カメラビューを表示するインターフェイスでロボットを操作するオブジェクトを指すことができます。第二に、彼らはそのインターフェイスで軌道を追跡し、ロボットがオブジェクトに到達する方法を指定できるようにすることができます。第三に、彼らはそれを望んでいる方向にロボットの腕を物理的に動かすことができます。

「環境の2D画像を3Dスペースでアクションにマッピングしている場合、いくつかの情報が失われます。ロボットを物理的に微調整することは、情報を失うことなくユーザーの意図を指定する最も直接的な方法です」とWang氏は言います。

成功のためのサンプリング

これらの相互作用により、ロボットが他のオブジェクトと衝突するなど、無効なアクションを選択しないようにするために、研究者は特定のサンプリング手順を使用します。この手法により、モデルは、ユーザーの目標と最も密接に一致する有効なアクションのセットからアクションを選択できます。

「ユーザーの意志を単に課すのではなく、ロボットにユーザーが意図していることのアイデアを与えますが、サンプリング手順は独自の学習行動のセットを中心に振動させます」とWang氏は説明します。

このサンプリング方法により、研究者のフレームワークは、シミュレーションや実験中に、おもちゃのキッチンで実際のロボットアームを使用した他の方法と比較した他の方法を上回ることができました。

その方法は常にすぐにタスクを完了するとは限らないかもしれませんが、ユーザーは、ロボットが何か間違ったことをしているのを見て、それが終了するのを待ってから新しい指示を与えるのではなく、ロボットをすぐに修正できるという利点を提供します。

さらに、ユーザーが正しいボウルを拾うまでロボットを数回微調整した後、その是正措置を記録し、将来のトレーニングを通じて行動に組み込むことができます。その後、翌日、ロボットはナッジを必要とせずに正しいボウルを拾うことができました。

「しかし、その継続的な改善の鍵は、ユーザーがロボットと対話する方法を持っていることです。これがここで示したものです」とWang氏は言います。

将来、研究者は、パフォーマンスを維持または改善しながら、サンプリング手順の速度を高めたいと考えています。また、新しい環境でのロボットポリシー生成を実験したいと考えています。

#ロボットヘルパーが間違いを犯しますか正しい方向にそれを微調整するだけです #MITニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。