日本語版
最新ニュース
世界

ロボットは私たちを見るだけでツールを使用することを学ぶことができます

クレジット:UIUC HCAラボ 数十年の進歩にもかかわらず、ほとんどのロボットは、特定の繰り返しのタスクのためにまだプログラムされています。彼らは予想外のことと格闘しており、骨の折れる再プログラミングなしでは新しい状況に適応することはできません。しかし、彼らが子供のように自然にビデオを見ることで、ツールを使用することを学ぶことができたらどうでしょうか? ラボのロボットの1つがフライパンに卵をひっくり返すのを見たとき、私はまだ覚えています。事前にプログラムされていませんでした。誰もジョイスティックでそれをコントロールしていませんでした。ロボットは、人間がそれをしているビデオを見て、それ自体をやりました。ロボットをより適応性のあるものにする方法について何年も考えてきた人にとって、その瞬間はスリリングでした。 イリノイ大学アーバナシャンペーン校のチームは、コロンビア大学とUTオースティンの協力者とともに、まさにその質問を探りました。ロボットは、誰かが爪を叩くか、ミートボールをすくい取るのを見て、コストのかかるセンサー、モーションキャプチャスーツ、またはリモートの遠隔操作時間なしで自分でそれを行う方法を見つけ出すことができますか? そのアイデアは、私たちが呼ぶ新しいフレームワークを作成するように導きました」インターフェイスとしてのツール、" 現在 利用可能 に arxiv プリプリントサーバー。目標は簡単です。毎日の仕事をしている人々の普通のビデオに過ぎない複雑でダイナミックなツール使用スキルを教えることです。必要なのは、アクションの2つのカメラビューだけです。いくつかのスマートフォンでキャプチャできるものです。 クレジット:UIUC HCAラボ これがどのように機能しますか。このプロセスは、これらの2つのビデオフレームから始まります。これは、Mast3Rと呼ばれるビジョンモデルがシーンの3次元モデルを再構築するために使用します。次に、3Dガウスのスプラッティングとして知られるレンダリング方法を使用して、シーンの3D画像をデジタル的にペイントすると考えています。ロボットが複数の角度からタスクを「見る」ことができるように、追加の視点を生成します。 しかし、本当の魔法は、シーンから人間をデジタルで削除するときに起こります。 「接地されたサム」の助けを借りて、私たちのシステムはツールと環境との相互作用のみを分離します。ロボットに「人間を無視し、ツールが何をしているかに注意を払うだけです」と言うようなものです。 この「ツール中心の」視点は秘密の成分です。それは、ロボットが人間の手の動きをコピーしようとしていないことを意味しますが、代わりにツール自体の正確な軌跡と方向を学習しています。これにより、アームやカメラの構成方法に関係なく、スキルが異なるロボット間で転送できます。 これを5つのタスクでテストしました。爪を叩き、ミートボールをすくい、フットを鍋に入れ、ワインのボトルのバランスをとること、さらには蹴ります。 サッカーボール 目標に。これらは単純な選択と場所の仕事ではありません。速度、精度、適応性が必要です。従来のテレオ操作方法と比較して、ツールとしてのインターフェイスは71%の成功率を達成し、トレーニングデータを収集して77%速くなりました。 私のお気に入りのテストの1つは、人間がより多くのタスクに投げ込まれている間、ロボットをすくい取るミートボールでした。ロボットはためらいませんでした、それはただ適応しました。別の場合、それは鍋でゆるい卵をひっくり返しました。 「私たちのアプローチは、子どもたちが学んだ方法に触発されました。それは大人を見ることです」と私の同僚であり著者のハオナン・チェンは言いました。 「彼らは見ている人と同じツールを操作する必要はありません。彼らは似たようなことで練習することができます。ロボットでその能力を模倣できるかどうか知りたいと思いました。」 技術的な説明ビデオ。クレジット:UIUC HCAラボ これらの結果は、より良いラボデモよりも大きなものを指し示しています。専門家のオペレーターや特殊なハードウェアの必要性を削除することにより、スマートフォンビデオ、YouTubeクリップ、またはクラウドソーシングの映像から学習しているロボットを想像できます。 「ロボットの周りに多くの誇大宣伝にもかかわらず、彼らはまだ彼らが確実に動作できる場所で制限されており、ほとんどのタスクで人間よりもはるかに悪いです」と、私たちの研究室を率いるケイティ・ドリッグス・キャンプベル教授は言いました。 「私たちは、ロボットが最小限のエンジニアリングの努力を持つ人々から簡単に学ぶことができるようにするフレームワークとアルゴリズムの設計に関心があります。」 もちろん、まだ課題があります。現在、システムは、このツールがロボットのグリッパーに厳密に固定されていると想定しています。また、6Dポーズの推定エラーに苦労することもあり、合成されたカメラビューは、角度シフトが極端すぎる場合、リアリズムを失う可能性があります。 将来的には、認識システムをより堅牢にしたいと考えています。 ロボット たとえば、誰かが1種類のペンを使用してから、そのスキルをさまざまな形やサイズのペンに適用するのを見ることができます。 これらの制限があっても、ロボットがどのように学習できるか、骨の折れるプログラミングから自然な観察に向かって、どのように学習できるかに大きな変化が見られると思います。数十億のカメラは、人間がツールを使用する方法をすでに記録しています。適切なアルゴリズムを使用すると、これらのビデオは、次世代の適応可能な役立つロボットのトレーニング資料になる可能性があります。 この研究は、Foundation Models and Neural-Symbolic(NESY)AIに関するICRA 2025ワークショップで最高の論文賞を受賞したことで、その可能性を解き放ち、人間の録音されたビデオの広大な海洋を、子供と同じように自然に学び、適応できるグローバルなトレーニングライブラリに変換するための重要なステップです。…

ロボットは私たちを見るだけでツールを使用することを学ぶことができます

1756072344
2025-08-23 13:10:00

クレジット:UIUC HCAラボ

数十年の進歩にもかかわらず、ほとんどのロボットは、特定の繰り返しのタスクのためにまだプログラムされています。彼らは予想外のことと格闘しており、骨の折れる再プログラミングなしでは新しい状況に適応することはできません。しかし、彼らが子供のように自然にビデオを見ることで、ツールを使用することを学ぶことができたらどうでしょうか?

ラボのロボットの1つがフライパンに卵をひっくり返すのを見たとき、私はまだ覚えています。事前にプログラムされていませんでした。誰もジョイスティックでそれをコントロールしていませんでした。ロボットは、人間がそれをしているビデオを見て、それ自体をやりました。ロボットをより適応性のあるものにする方法について何年も考えてきた人にとって、その瞬間はスリリングでした。

イリノイ大学アーバナシャンペーン校のチームは、コロンビア大学とUTオースティンの協力者とともに、まさにその質問を探りました。ロボットは、誰かが爪を叩くか、ミートボールをすくい取るのを見て、コストのかかるセンサー、モーションキャプチャスーツ、またはリモートの遠隔操作時間なしで自分でそれを行う方法を見つけ出すことができますか?

そのアイデアは、私たちが呼ぶ新しいフレームワークを作成するように導きました」インターフェイスとしてのツール、” 現在 利用可能arxiv プリプリントサーバー。目標は簡単です。毎日の仕事をしている人々の普通のビデオに過ぎない複雑でダイナミックなツール使用スキルを教えることです。必要なのは、アクションの2つのカメラビューだけです。いくつかのスマートフォンでキャプチャできるものです。






https://www.youtube.com/watch?v=dku0pl1lfq8

クレジット:UIUC HCAラボ

これがどのように機能しますか。このプロセスは、これらの2つのビデオフレームから始まります。これは、Mast3Rと呼ばれるビジョンモデルがシーンの3次元モデルを再構築するために使用します。次に、3Dガウスのスプラッティングとして知られるレンダリング方法を使用して、シーンの3D画像をデジタル的にペイントすると考えています。ロボットが複数の角度からタスクを「見る」ことができるように、追加の視点を生成します。

しかし、本当の魔法は、シーンから人間をデジタルで削除するときに起こります。 「接地されたサム」の助けを借りて、私たちのシステムはツールと環境との相互作用のみを分離します。ロボットに「人間を無視し、ツールが何をしているかに注意を払うだけです」と言うようなものです。

この「ツール中心の」視点は秘密の成分です。それは、ロボットが人間の手の動きをコピーしようとしていないことを意味しますが、代わりにツール自体の正確な軌跡と方向を学習しています。これにより、アームやカメラの構成方法に関係なく、スキルが異なるロボット間で転送できます。

これを5つのタスクでテストしました。爪を叩き、ミートボールをすくい、フットを鍋に入れ、ワインのボトルのバランスをとること、さらには蹴ります。 サッカーボール 目標に。これらは単純な選択と場所の仕事ではありません。速度、精度、適応性が必要です。従来のテレオ操作方法と比較して、ツールとしてのインターフェイスは71%の成功率を達成し、トレーニングデータを収集して77%速くなりました。

私のお気に入りのテストの1つは、人間がより多くのタスクに投げ込まれている間、ロボットをすくい取るミートボールでした。ロボットはためらいませんでした、それはただ適応しました。別の場合、それは鍋でゆるい卵をひっくり返しました。

「私たちのアプローチは、子どもたちが学んだ方法に触発されました。それは大人を見ることです」と私の同僚であり著者のハオナン・チェンは言いました。 「彼らは見ている人と同じツールを操作する必要はありません。彼らは似たようなことで練習することができます。ロボットでその能力を模倣できるかどうか知りたいと思いました。」






https://www.youtube.com/watch?v=cr5t14ebt0m

技術的な説明ビデオ。クレジット:UIUC HCAラボ

これらの結果は、より良いラボデモよりも大きなものを指し示しています。専門家のオペレーターや特殊なハードウェアの必要性を削除することにより、スマートフォンビデオ、YouTubeクリップ、またはクラウドソーシングの映像から学習しているロボットを想像できます。

「ロボットの周りに多くの誇大宣伝にもかかわらず、彼らはまだ彼らが確実に動作できる場所で制限されており、ほとんどのタスクで人間よりもはるかに悪いです」と、私たちの研究室を率いるケイティ・ドリッグス・キャンプベル教授は言いました。

「私たちは、ロボットが最小限のエンジニアリングの努力を持つ人々から簡単に学ぶことができるようにするフレームワークとアルゴリズムの設計に関心があります。」

もちろん、まだ課題があります。現在、システムは、このツールがロボットのグリッパーに厳密に固定されていると想定しています。また、6Dポーズの推定エラーに苦労することもあり、合成されたカメラビューは、角度シフトが極端すぎる場合、リアリズムを失う可能性があります。

将来的には、認識システムをより堅牢にしたいと考えています。 ロボット たとえば、誰かが1種類のペンを使用してから、そのスキルをさまざまな形やサイズのペンに適用するのを見ることができます。

これらの制限があっても、ロボットがどのように学習できるか、骨の折れるプログラミングから自然な観察に向かって、どのように学習できるかに大きな変化が見られると思います。数十億のカメラは、人間がツールを使用する方法をすでに記録しています。適切なアルゴリズムを使用すると、これらのビデオは、次世代の適応可能な役立つロボットのトレーニング資料になる可能性があります。

この研究は、Foundation Models and Neural-Symbolic(NESY)AIに関するICRA 2025ワークショップで最高の論文賞を受賞したことで、その可能性を解き放ち、人間の録音されたビデオの広大な海洋を、子供と同じように自然に学び、適応できるグローバルなトレーニングライブラリに変換するための重要なステップです。

この物語はの一部です サイエンスXダイアログ、研究者が公開された研究記事からの調査結果を報告できる場合。 このページにアクセスしてください Science xダイアログと参加方法については。

詳細:
Haonan Chen et al、Tool-asインターフェイス:模倣学習を通じて、人間のツールの使用からロボットポリシーの学習、 arxiv (2025)。 doi:10.48550/arxiv.2504.04612

ジャーナル情報:
arxiv


Cheng Zhuは、InterfaceのTool-As-Interfaceの2番目の著者です。模倣学習、UIUC BSコンピューターエンジニアリング、Upenn MSE Roboを通じて、人間のツールの使用からロボットポリシーを学習する

引用:ロボットは、2025年8月24日にhttps://techxplore.com/news/2025-08-08-obots-tools.htmlから取得した私たち(2025年8月23日)を見ることでツールの使用を学ぶことができます。

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#ロボットは私たちを見るだけでツールを使用することを学ぶことができます

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。