日本語版
最新ニュース
世界

フレームワークにより、人は別の人間に与えるフィードバックの種類を使用してロボットのアクションを修正することができます

大学院生のフェリックス・ヤンウェイ・ワンは、グループの研究室に設置されたおもちゃのキッチンでボウルを操作しているロボットアームを微調整します。 Frameworkを使用して、Wangと彼の共同研究者が開発され、ロボットをわずかに微調整することは、その動作を修正する1つの方法です。クレジット:Melanie Gonick、MIT ロボットがあなたが料理をきれいにするのに役立つと想像してください。シンクからソーピーボウルをつかむように頼みますが、そのグリッパーはマークを少し見逃します。 MITおよびNvidiaの研究者によって開発された新しいフレームワークを使用して、単純な相互作用でロボットの動作を修正できます。この方法では、ボウルを指したり、画面上の軌跡を追跡したり、単にロボットの腕に正しい方向にナッジを与えることができます。 仕事はそうです 公開 プリプリントサーバーで arxiv。 ロボットの動作を修正するための他の方法とは異なり、この手法では、ユーザーが新しいデータを収集して再訓練する必要はありません 機械学習モデル それはロボットの脳を動かします。ロボットが直感的に使用できるようになり、 リアルタイム ユーザーの意図を満たすために可能な限り近くになる実行可能なアクションシーケンスを選択するための人間のフィードバック。 研究者が彼らのフレームワークをテストしたとき、それ 成功率 人間の介入を活用しなかった代替方法よりも21%高かった。 長期的には、このフレームワークにより、ユーザーは、ロボットが自宅やその中のオブジェクトを見たことがないにもかかわらず、工場訓練を受けたロボットをより簡単に導き、さまざまな家庭用タスクを実行できるようになります。 「素人がデータ収集を実行し、ニューラルネットワークモデルを微調整することを期待することはできません。消費者はロボットがすぐに動作することを期待します。 電気工学 およびコンピューターサイエンス(EECS)の大学院生であり、 arxiv 紙。 彼の共著者には、リルイ・ワン博士が含まれます。 yilun du ph.d;シニア著者のジュリー・シャー、航空学と宇宙飛行士のMIT教授であり、コンピューターサイエンスおよび人工知能研究所(CSAIL)のインタラクティブロボティクスグループのディレクター。 Balakumar Sundaralingam、Xuning Yang、Yu-Wei Chao、Claudia Perez-D'Arpino Ph.D.、およびNvidiaのDieter Fox。この研究は、ロボットと自動化に関する国際会議で発表されます。 不整合を軽減します 最近、研究者は、事前に訓練された生成AIモデルを使用して、「ポリシー」または一連のルールを学習し始めました。これは、ロボットがアクションを完了するために続きます。生成モデルは、複数の複雑なタスクを解決できます。 トレーニング中、モデルは実行可能なロボットモーションのみを見るため、ロボットが従うべき有効な軌道を生成することを学びます。 これらの軌跡は有効ですが、それはそれらが常に現実の世界でのユーザーの意図と常に一致することを意味しません。ロボットは、棚からノックすることなく棚から箱をつかむように訓練されていたかもしれませんが、棚がトレーニングで見たものとは異なる方向に向けられている場合、誰かの本棚の上の箱に到達することができない可能性があります。…

フレームワークにより、人は別の人間に与えるフィードバックの種類を使用してロボットのアクションを修正することができます

1741566668
2025-03-07 14:43:00

大学院生のフェリックス・ヤンウェイ・ワンは、グループの研究室に設置されたおもちゃのキッチンでボウルを操作しているロボットアームを微調整します。 Frameworkを使用して、Wangと彼の共同研究者が開発され、ロボットをわずかに微調整することは、その動作を修正する1つの方法です。クレジット:Melanie Gonick、MIT

ロボットがあなたが料理をきれいにするのに役立つと想像してください。シンクからソーピーボウルをつかむように頼みますが、そのグリッパーはマークを少し見逃します。

MITおよびNvidiaの研究者によって開発された新しいフレームワークを使用して、単純な相互作用でロボットの動作を修正できます。この方法では、ボウルを指したり、画面上の軌跡を追跡したり、単にロボットの腕に正しい方向にナッジを与えることができます。

仕事はそうです 公開 プリプリントサーバーで arxiv

ロボットの動作を修正するための他の方法とは異なり、この手法では、ユーザーが新しいデータを収集して再訓練する必要はありません 機械学習モデル それはロボットの脳を動かします。ロボットが直感的に使用できるようになり、 リアルタイム ユーザーの意図を満たすために可能な限り近くになる実行可能なアクションシーケンスを選択するための人間のフィードバック。

研究者が彼らのフレームワークをテストしたとき、それ 成功率 人間の介入を活用しなかった代替方法よりも21%高かった。

長期的には、このフレームワークにより、ユーザーは、ロボットが自宅やその中のオブジェクトを見たことがないにもかかわらず、工場訓練を受けたロボットをより簡単に導き、さまざまな家庭用タスクを実行できるようになります。

「素人がデータ収集を実行し、ニューラルネットワークモデルを微調整することを期待することはできません。消費者はロボットがすぐに動作することを期待します。 電気工学 およびコンピューターサイエンス(EECS)の大学院生であり、 arxiv 紙。

彼の共著者には、リルイ・ワン博士が含まれます。 yilun du ph.d;シニア著者のジュリー・シャー、航空学と宇宙飛行士のMIT教授であり、コンピューターサイエンスおよび人工知能研究所(CSAIL)のインタラクティブロボティクスグループのディレクター。 Balakumar Sundaralingam、Xuning Yang、Yu-Wei Chao、Claudia Perez-D’Arpino Ph.D.、およびNvidiaのDieter Fox。この研究は、ロボットと自動化に関する国際会議で発表されます。

不整合を軽減します

最近、研究者は、事前に訓練された生成AIモデルを使用して、「ポリシー」または一連のルールを学習し始めました。これは、ロボットがアクションを完了するために続きます。生成モデルは、複数の複雑なタスクを解決できます。

トレーニング中、モデルは実行可能なロボットモーションのみを見るため、ロボットが従うべき有効な軌道を生成することを学びます。

これらの軌跡は有効ですが、それはそれらが常に現実の世界でのユーザーの意図と常に一致することを意味しません。ロボットは、棚からノックすることなく棚から箱をつかむように訓練されていたかもしれませんが、棚がトレーニングで見たものとは異なる方向に向けられている場合、誰かの本棚の上の箱に到達することができない可能性があります。

これらの障害を克服するために、エンジニアは通常、新しいタスクを実証するデータを収集し、生成モデルを再訓練します。これは、機械学習の専門知識を必要とする費用と時間のかかるプロセスです。

代わりに、MITの研究者は、ユーザーが間違いを犯したときに展開中にロボットの動作を操縦できるようにしたいと考えていました。

しかし、人間がロボットと相互作用してその動作を修正すると、生成モデルが無効なアクションを選択することを不注意に引き起こす可能性があります。ユーザーが望む箱に到達するかもしれませんが、その過程で棚から本をノックアウトします。

「これらの種類の間違いを導入せずにユーザーがロボットと対話できるようにしたいので、展開中にユーザーの意図とはるかに整合する動作を取得しますが、それも有効で実現可能です」とWang氏は言います。

彼らのフレームワークは、ロボットの動作を修正する3つの直感的な方法をユーザーに提供することでこれを達成します。それぞれが特定の利点を提供します。

まず、ユーザーは、カメラビューを表示するインターフェイスでロボットを操作するオブジェクトを指すことができます。第二に、彼らはそのインターフェイスで軌道を追跡し、ロボットがオブジェクトに到達する方法を指定できるようにすることができます。第三に、彼らはそれを望んでいる方向にロボットの腕を物理的に動かすことができます。

「環境の2D画像を3Dスペースでアクションにマッピングしている場合、いくつかの情報が失われます。ロボットを物理的に微調整することは、情報を失うことなくユーザーの意図を指定する最も直接的な方法です」とWang氏は言います。

成功のためのサンプリング

これらの相互作用により、ロボットが他のオブジェクトと衝突するなど、無効なアクションを選択しないようにするために、研究者は特定のサンプリング手順を使用します。この手法により、モデルは、ユーザーの目標と最も密接に一致する有効なアクションのセットからアクションを選択できます。

「ユーザーの意志を課すのではなく、ロボットにユーザーが意図していることのアイデアを与えますが、サンプリング手順は独自の学習行動セットを中心に振動させます」とWang氏は説明します。

このサンプリング方法により、研究者のフレームワークは、シミュレーションや実験中に、おもちゃのキッチンで実際のロボットアームを使用した他の方法と比較した他の方法を上回ることができました。

その方法は常にすぐにタスクを完了するとは限らないかもしれませんが、ユーザーは、ロボットが何か間違ったことをしているのを見て、それが終了するのを待ってから新しい指示を与えるのではなく、ロボットをすぐに修正できるという利点を提供します。

さらに、ユーザーが正しいボウルを拾うまでロボットを数回微調整した後、その是正措置を記録し、将来のトレーニングを通じて行動に組み込むことができます。その後、翌日、ロボットはナッジを必要とせずに正しいボウルを拾うことができました。

「しかし、その継続的な改善の鍵は、ユーザーがロボットと対話する方法を持っていることです。これがここで示したものです」とWang氏は言います。

将来、研究者は、パフォーマンスを維持または改善しながら、サンプリング手順の速度を高めたいと考えています。また、新しい環境でのロボットポリシー生成を実験したいと考えています。

詳細:
Yanwei Wang et al、人間の相互作用による推論時のポリシーステアリング、 arxiv (2024)。 doi:10.48550/arxiv.2411.16627

ジャーナル情報:
arxiv


によって提供されます
マサチューセッツ工科大学


このストーリーは、MITニュースの好意により再発行されています(web.mit.edu/newsoffice/)、MITの研究、革新、教育に関するニュースをカバーする人気のあるサイト。

引用:フレームワークにより、人は2025年3月9日にhttps://techxplore.com/news/2025-03から取得した別の人間(2025年3月7日)に与えるフィードバックの種類を使用してロボットのアクションを修正することができます。

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#フレームワークにより人は別の人間に与えるフィードバックの種類を使用してロボットのアクションを修正することができます

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。