1723930383
2024-08-17 19:17:31
MITの研究者らは、ロボットを誘導するために言語を利用するAIナビゲーション手法を開発しました。大規模な言語モデルを採用して視覚シーンのテキスト記述を処理し、ナビゲーション手順を生成することで、トレーニングプロセスを簡素化し、さまざまな環境への適応性を高めています。
MIT と MIT-IBM Watson AI ラボの研究者は、視覚データを言語記述に変換してロボットが複雑なタスクをナビゲートするのを支援する新しい AI ナビゲーション手法を開発しました。
このアプローチでは、大規模な言語モデルを使用して合成トレーニング データを生成し、言語入力に基づいてナビゲーションの決定を行います。視覚ベースのモデルよりも優れているわけではありませんが、リソースの消費量が少なく、さまざまなタスクや環境に適応しやすいという利点があります。
いつか、家庭用ロボットに汚れた衣類を階下に運ばせ、地下室の左端にある洗濯機に詰めてもらいたいと思うかもしれません。ロボットは、あなたの指示と視覚的な観察を組み合わせて、このタスクを完了するために必要な手順を決定する必要があります。
AI エージェントにとって、これは言うほど簡単ではありません。現在のアプローチでは、タスクのさまざまな部分に取り組むために、複数の手作りの機械学習モデルを使用することが多く、その構築には多大な人間の労力と専門知識が必要です。視覚的表現を使用して直接ナビゲーションの決定を行うこれらの方法は、トレーニングに大量の視覚データを必要としますが、それを入手するのは困難な場合がよくあります。
強化されたナビゲーションのための言語モデルの統合
これらの課題を克服するために、MIT と MIT-IBM Watson AI ラボの研究者は、視覚的表現を言語の断片に変換し、それを 1 つの大きな言語モデルに取り込んで、マルチステップ ナビゲーション タスクのすべての部分を実現するナビゲーション方法を考案しました。
ロボットの周囲の画像から視覚的特徴を視覚的表現としてエンコードする(これは計算負荷が高い)のではなく、ロボットの視点を説明するテキストキャプションを作成するという手法です。大規模な言語モデルは、キャプションを使用して、ユーザーの言語ベースの指示を実行するためにロボットが取るべきアクションを予測します。
彼らの方法は純粋に言語ベースの表現を利用するため、大規模な言語モデルを使用して膨大な量の合成トレーニングデータを効率的に生成できます。
このアプローチは視覚的特徴を使用する手法より優れているわけではありませんが、トレーニングに十分な視覚データが不足している状況では優れたパフォーマンスを発揮します。研究者は、言語ベースの入力と視覚信号を組み合わせると、ナビゲーションのパフォーマンスが向上することを発見しました。
「知覚表現として言語のみを使用する私たちのアプローチは、より直接的です。すべての入力を言語としてエンコードできるため、人間が理解できる軌跡を生成できます」と、このアプローチに関する論文の主執筆者であり、電気工学およびコンピューターサイエンス (EECS) の大学院生であるボーエン・パン氏は言います。
Pan 氏の共著者には、彼の指導教官であり、MIT シュワルツマン コンピューティング カレッジの戦略的産業エンゲージメント担当ディレクター、MIT の MIT-IBM Watson AI ラボのディレクター、コンピューター科学および人工知能研究所 (CSAIL) の上級研究科学者でもある Aude Oliva 氏、EECS の准教授で CSAIL のメンバーである Philip Isola 氏、EECS の助教授で CSAIL のメンバーである主任著者 Yoon Kim 氏、および MIT-IBM Watson AI ラボとダートマス大学のその他のメンバーが含まれます。この研究は、計算言語学会の北米支部の会議で発表されます。
言語で視覚問題を解決する
大規模言語モデルは利用可能な機械学習モデルの中で最も強力なため、研究者たちはそれを視覚と言語のナビゲーションと呼ばれる複雑なタスクに組み込むことを模索したとパン氏は言う。
しかし、このようなモデルはテキストベースの入力を受け付け、ロボットのカメラからの視覚データを処理できない。そのため、チームは代わりに言語を使用する方法を見つける必要があった。
彼らの技術は、ロボットの視覚的観察のテキスト説明を取得するために、単純なキャプション モデルを利用します。これらのキャプションは言語ベースの指示と組み合わされ、ロボットが次に取るべきナビゲーション ステップを決定する大規模な言語モデルに入力されます。
大規模言語モデルは、ロボットがそのステップを完了した後に見るシーンのキャプションを出力します。これは、ロボットがどこにいたかを追跡できるように、軌跡履歴を更新するために使用されます。
ユーザーフレンドリーな AI ナビゲーションの設計
モデルはこれらのプロセスを繰り返し、ロボットを一歩ずつ目的地まで導く軌道を生成します。
プロセスを効率化するために、研究者らはテンプレートを設計し、観察情報が標準的な形式、つまりロボットが周囲の状況に基づいて行える一連の選択肢としてモデルに提示されるようにした。
たとえば、キャプションには「左 30 度のところにドアがあり、その横には鉢植えがあります。背後には机とコンピューターのある小さなオフィスがあります」などと表示されます。モデルは、ロボットがドアに向かって移動するか、オフィスに向かって移動するかを選択します。
「最大の課題の 1 つは、エージェントにタスクの内容と対応方法を理解させるために、この種の情報を適切な方法で言語にエンコードする方法を見つけることでした」と Pan 氏は言います。
言語の利点
このアプローチをテストしたところ、視覚ベースの手法を上回ることはできませんでしたが、いくつかの利点があることがわかりました。
まず、テキストの合成には複雑な画像データよりも少ない計算リソースが必要なため、この手法を使用して合成トレーニング データを迅速に生成できます。あるテストでは、現実世界の視覚的軌跡 10 個に基づいて 10,000 個の合成軌跡が生成されました。
この技術は、シミュレーション環境で訓練されたエージェントが現実世界でうまく機能しないというギャップを埋めることもできる。このギャップは、照明や色などの要素により、コンピューターで生成された画像が現実世界のシーンとかなり異なって見えるためによく発生する。しかし、合成画像と実際の画像を説明する言語では、区別するのがはるかに難しいだろうとパン氏は言う。
また、モデルが使用する表現は自然言語で記述されているため、人間にとって理解しやすいものとなっています。
「エージェントが目的を達成できなかった場合、どこで失敗したのか、なぜ失敗したのかをより簡単に判断できます。履歴情報が十分に明確でなかったり、観察で重要な詳細が無視されている可能性があります」とパン氏は言います。
さらに、彼らの方法は、1 種類の入力のみを使用するため、さまざまなタスクや環境に簡単に適用できます。データを言語としてエンコードできる限り、変更を加えることなく同じモデルを使用できます。
しかし、彼らの方法では、深度情報など、視覚ベースのモデルによって取得される一部の情報が自然に失われるという欠点があります。
しかし、研究者たちは、言語ベースの表現と視覚ベースの方法を組み合わせることでエージェントのナビゲーション能力が向上することに驚きました。
「これは、言語が、純粋な視覚機能では捉えられないような高次の情報を捉えられることを意味しているのかもしれない」と彼は言う。
これは研究者が今後も研究を続けたい分野です。また、この方法の性能を向上させるナビゲーション指向のキャプション作成ツールの開発も望んでいます。さらに、大規模な言語モデルが空間認識を発揮する能力を調査し、それが言語ベースのナビゲーションにどのように役立つかを調べたいと考えています。
参考文献:「LangNav: ナビゲーションのための知覚表現としての言語」、Bowen Pan、Rameswar Panda、SouYoung Jin、Rogerio Feris、Aude Oliva、Phillip Isola、Yoon Kim著、2024年3月30日、 コンピュータサイエンス > コンピュータビジョンとパターン認識。
arXiv:2310.07889
この研究は、MIT-IBM Watson AI Lab の資金提供を受けて実施されています。
#MITのAIが言語ガイド付きナビゲーションをマスターする方法