日本語版
最新ニュース
科学&テクノロジー

ロボットに限界を教え、無制限のタスクを安全に完了する |マサチューセッツ工科大学ニュース

誰かがあなたに「自分の限界を知りなさい」とアドバイスした場合、その人はおそらく適度に運動するなどのことを勧めているでしょう。しかし、ロボットにとって、このモットーは、安全かつ正確に雑用を行うための学習上の制約、つまり機械の環境内での特定のタスクの制限を表します。たとえば、周囲の物理学を理解していないロボットにキッチンの掃除を依頼することを想像してください。部屋をきれいに保つための実用的な複数段階の計画をマシンはどのように生成できるのでしょうか?大規模言語モデル (LLM) を使用すればそれに近づけることができますが、モデルがテキストのみでトレーニングされている場合は、ロボットが到達できる距離や近くに回避すべき障害物があるかどうかなど、ロボットの物理的制約に関する重要な詳細を見逃してしまう可能性があります。 LLM だけを使用すると、床板についたパスタの汚れを取り除くことになる可能性があります。これらの無制限のタスクを実行するロボットをガイドするために、MIT のコンピューター サイエンスおよび人工知能研究所 (CSAIL) の研究者は、ビジョン モデルを使用してマシンの近くにあるものを確認し、その制約をモデル化しました。チームの戦略には、LLM が計画を作成し、それが安全で現実的であることをシミュレーターでチェックすることが含まれます。その一連のアクションが実行不可能な場合、ロボットが実行できるプランに到達するまで、言語モデルは新しいプランを生成します。研究者らが「継続的制約満足のためのコードによるロボットの計画」(PRoC3S)と呼ぶこの試行錯誤手法は、長期計画をテストしてすべての制約を確実に満たし、ロボットがライティングなどの多様なタスクを実行できるようにする。個々の文字、星を描く、ブロックを並べ替えてさまざまな位置に配置する。将来的には、PRoC3S は、ロボットが家のような動的な環境でより複雑な家事を完了できるようにする可能性があります。ロボットは、多くのステップで構成される一般的な家事 (「朝食を作って」など) を実行するように求められる可能性があります。「LLM や、タスク プランナーやモーション プランナーなどの古典的なロボット システムは、この種のタスクを単独で実行することはできませんが、それらを組み合わせることで、相乗効果により無制限の問題解決が可能になります」と共同リーダーの博士課程学生 Nishanth Kumar SM '24 は述べています。 PRoC3S に関する新しい論文の著者。 「私たちはロボットの周囲にあるもののシミュレーションをその場で作成し、考えられる多くの行動計画を試しています。ビジョン モデルは、ロボットが長期計画の各ステップで実行可能なアクションを推論できるようにする、非常に現実的なデジタル世界を作成するのに役立ちます。」このチームの研究は先月、ドイツのミュンヘンで開催されたロボット学習会議 (CoRL) で発表された論文で発表されました。 ビデオを再生する ロボットに無制限の家事の限界を教える CSAILで 研究者の手法では、インターネット上のテキストで事前トレーニングされた LLM が使用されます。 PRoC3S にタスクの実行を依頼する前に、チームはターゲット タスク…

ロボットに限界を教え、無制限のタスクを安全に完了する |マサチューセッツ工科大学ニュース

1734116300
2024-12-12 22:00:00

誰かがあなたに「自分の限界を知りなさい」とアドバイスした場合、その人はおそらく適度に運動するなどのことを勧めているでしょう。しかし、ロボットにとって、このモットーは、安全かつ正確に雑用を行うための学習上の制約、つまり機械の環境内での特定のタスクの制限を表します。

たとえば、周囲の物理学を理解していないロボットにキッチンの掃除を依頼することを想像してください。部屋をきれいに保つための実用的な複数段階の計画をマシンはどのように生成できるのでしょうか?大規模言語モデル (LLM) を使用すればそれに近づけることができますが、モデルがテキストのみでトレーニングされている場合は、ロボットが到達できる距離や近くに回避すべき障害物があるかどうかなど、ロボットの物理的制約に関する重要な詳細を見逃してしまう可能性があります。 LLM だけを使用すると、床板についたパスタの汚れを取り除くことになる可能性があります。

これらの無制限のタスクを実行するロボットをガイドするために、MIT のコンピューター サイエンスおよび人工知能研究所 (CSAIL) の研究者は、ビジョン モデルを使用してマシンの近くにあるものを確認し、その制約をモデル化しました。チームの戦略には、LLM が計画を作成し、それが安全で現実的であることをシミュレーターでチェックすることが含まれます。その一連のアクションが実行不可能な場合、ロボットが実行できるプランに到達するまで、言語モデルは新しいプランを生成します。

研究者らが「継続的制約満足のためのコードによるロボットの計画」(PRoC3S)と呼ぶこの試行錯誤手法は、長期計画をテストしてすべての制約を確実に満たし、ロボットがライティングなどの多様なタスクを実行できるようにする。個々の文字、星を描く、ブロックを並べ替えてさまざまな位置に配置する。将来的には、PRoC3S は、ロボットが家のような動的な環境でより複雑な家事を完了できるようにする可能性があります。ロボットは、多くのステップで構成される一般的な家事 (「朝食を作って」など) を実行するように求められる可能性があります。

「LLM や、タスク プランナーやモーション プランナーなどの古典的なロボット システムは、この種のタスクを単独で実行することはできませんが、それらを組み合わせることで、相乗効果により無制限の問題解決が可能になります」と共同リーダーの博士課程学生 Nishanth Kumar SM ’24 は述べています。 PRoC3S に関する新しい論文の著者。 「私たちはロボットの周囲にあるもののシミュレーションをその場で作成し、考えられる多くの行動計画を試しています。ビジョン モデルは、ロボットが長期計画の各ステップで実行可能なアクションを推論できるようにする、非常に現実的なデジタル世界を作成するのに役立ちます。」

このチームの研究は先月、ドイツのミュンヘンで開催されたロボット学習会議 (CoRL) で発表された論文で発表されました。

ビデオを再生する

ロボットに無制限の家事の限界を教える
CSAILで

研究者の手法では、インターネット上のテキストで事前トレーニングされた LLM が使用されます。 PRoC3S にタスクの実行を依頼する前に、チームはターゲット タスク (星を描く) に関連するサンプル タスク (正方形を描くなど) を言語モデルに提供しました。サンプル タスクには、アクティビティの説明、長期計画、ロボットの環境に関する関連詳細が含まれています。

しかし、これらの計画は実際にはどうなったのでしょうか?シミュレーションでは、PRoC3S は星と文字をそれぞれ 10 回中 8 回描画することに成功しました。また、デジタル ブロックをピラミッドやラインに積み重ねたり、皿の上の果物などのアイテムを正確に配置したりすることもできます。これらのデジタル デモのそれぞれにおいて、CSAIL メソッドは、次のような同等のアプローチよりも、要求されたタスクをより一貫して完了しました。 「LLM3」 そして 「ポリシーとしてコードを記述する」

次に CSAIL エンジニアは、そのアプローチを現実世界に適用しました。彼らの手法はロボットアーム上で計画を立てて実行し、ブロックを直線に配置するようにロボットアームに教えた。また、PRoC3S により、マシンは青と赤のブロックを対応するボウルに配置し、すべてのオブジェクトをテーブルの中央近くに移動させることができました。

Kumar 氏と共同主著者で CSAIL で働く博士課程の学生でもある Aidan Curtis SM ’23 氏は、これらの発見は、LLM が人間が実際に機能することを信頼できるより安全な計画をどのように開発できるかを示していると述べています。研究者らは、より一般的なリクエスト (「チップを持ってきて」など) を与え、それを実行するために必要な具体的な手順を確実に把握できる家庭用ロボットを構想しています。 PRoC3S は、ロボットが同一のデジタル環境で計画をテストし、有効な行動方針を見つけるのに役立ちます。そしてさらに重要なことに、おいしいスナックを提供してくれるでしょう。

今後の研究では、研究者らは、より高度な物理シミュレータを使用して結果を改善し、よりスケーラブルなデータ検索技術を介して、より複雑で長期的なタスクに拡張することを目指しています。さらに、歩行や周囲のスキャンを含むタスクのために、四足歩行ロボットなどの移動ロボットに PRoC3S を適用する予定です。

「ChatGPT のような基盤モデルを使用してロボットの動作を制御すると、幻覚によって危険な動作や誤った動作が発生する可能性があります」と、この研究には関与していない AI Institute の研究者エリック ローゼン氏は述べています。 「PRoC3S は、高レベルのタスク ガイダンスのための基礎モデルを活用することでこの問題に取り組み、一方で、世界について明確に推論して検証可能に安全で正しいアクションを保証する AI 技術を採用しています。計画ベースのアプローチとデータ駆動型のアプローチのこの組み合わせは、現在可能であるよりも広範囲のタスクを理解し、確実に実行できるロボットを開発するための鍵となる可能性があります。」

Kumar 氏と Curtis 氏の共著者も CSAIL 加盟者です。MIT 学部研究者の Jing Cao 氏と、MIT 電気工学およびコンピュータ サイエンス学科の教授 Leslie Pack Kaelbling 氏と Tomás Lozano-Pérez 氏です。彼らの研究は、米国科学財団、空軍科学研究局、海軍研究局、陸軍研究局、MIT クエスト・フォー・インテリジェンス、および AI 研究所によって部分的に支援されました。

#ロボットに限界を教え無制限のタスクを安全に完了する #マサチューセッツ工科大学ニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。