クレジット: arxiv (2025)。 doi:10.48550/arxiv.2505.04831
ChatGptやClaudeのようなチャットボットは、幅広いタスクであなたを助けることができるため、過去3年間で使用された流行の増加を経験しています。シェークスピアソネットを書いている、デバッグコードを書いている場合でも、あいまいなトリビアの質問に対する答えが必要な場合でも、人工知能(AI)システムがカバーしているようです。この汎用性のソース?インターネット上の数十億または数兆個のテキストデータがポイントします。
ただし、ロボットに役立つ世帯や工場のアシスタントになるように教えるのに十分ではありません。さまざまな環境にわたってオブジェクトのさまざまな配置を処理、積み重ね、配置する方法を理解するには、ロボットがデモンストレーションが必要です。ロボットのトレーニングデータは、タスクの各動きをシステムを歩くハウツービデオのコレクションと考えることができます。
これらのデモンストレーションを実際のロボットで収集するのは時間がかかり、完全に繰り返し可能ではないため、エンジニアはAI(多くの場合、実際の物理学を反映していない)を使用してシミュレーションを生成したり、各デジタル環境をゼロから手作りしたりすることでトレーニングデータを作成しました。
MITのコンピューターサイエンスおよび人工知能研究所(CSAIL)とトヨタリサーチインスティテュートの研究者は、多様で現実的なトレーニンググラウンドロボットが必要とする方法を見つけた可能性があります。彼らの「操縦可能なシーン生成」アプローチは、キッチン、リビングルーム、エンジニアが多くの現実世界の相互作用やシナリオをシミュレートするために使用できるレストラン、レストランなどのデジタルシーンを作成します。
テーブルやプレートなどのオブジェクトのモデルで満たされた4400万を超える3Dルームで訓練されているこのツールは、既存のアセットを新しいシーンに配置し、それぞれを物理的に正確でリアルな環境に洗練させます。方法はです 投稿されました に arxiv プリプリントサーバー。
ステアブルシーンの生成は、ランダムノイズから視覚を生成するAIシステムである拡散モデルを「ステアリング」することにより、これらの3Dワールドを作成します。研究者は、この生成システムを使用して環境を「塗りつぶす」ために、シーン全体で特定の要素を埋めました。
空白のキャンバスが突然3Dオブジェクトが散らばったキッチンに変わると想像できます。これは、実際の物理学を模倣するシーンに徐々に再配置されます。たとえば、システムは、フォークがテーブルの上のボウルを通過しないことを保証します。これは、モデルが重複または交差する「クリッピング」と呼ばれる3Dグラフィックスの一般的なグリッチです。
ただし、シーン生成がどのように正確にリアリズムに向けてその創造を導くかは、選択した戦略に依存します。その主な戦略は「モンテカルロツリー検索」(MCTS)です。ここでは、モデルが一連の代替シーンを作成し、特定の目標に向かってさまざまな方法でそれらを埋めます(シーンをより物理的に現実的にするか、できるだけ多くの食用アイテムを含むなど)。 AIプログラムAlphagoがGO(Chessに似たゲーム)で人間の敵を倒すために使用されています。これは、システムが最も有利なものを選択する前に潜在的な動きのシーケンスを考慮しているためです。
「私たちは、シーン生成タスクを連続した意思決定プロセスとしてフレーミングすることにより、MCTをシーン生成に適用した最初の人です」と、MIT電気工学およびコンピューターサイエンスおよびコンピューターサイエンス科(EECS)博士号は言います。学生のニコラス・プファフは、CSAilの研究者であり、作業を提示する論文の主著者である著者である ギルブ。 「私たちは部分的なシーンの上に構築し続けて、時間の経過とともに優れたまたはより多くの望ましいシーンを作成します。その結果、MCTSは拡散モデルがトレーニングされたものよりも複雑なシーンを作成します。」
特に実験では、MCTSがシンプルなレストランシーンに最大数のオブジェクトを追加しました。平均で17のオブジェクトしかないシーンでトレーニングした後、薄暗い皿の巨大なスタックを含む、テーブル上の34個ものアイテムを備えていました。
操縦可能なシーンの生成を使用すると、強化学習を通じて多様なトレーニングシナリオを生成することもできます。本質的には、試行錯誤による目標を達成するための拡散モデルを教えることです。最初のデータでトレーニングした後、システムは2番目のトレーニング段階を遂行し、報酬(または基本的には目標にどれだけ近いかを示すスコアで望ましい結果)を概説します。このモデルは、より高いスコアのシーンを作成することを自動的に学習し、多くの場合、訓練されたシナリオとはまったく異なるシナリオを作成します。
ユーザーは、特定の視覚的な説明を入力することでシステムを直接促すこともできます(「4本のリンゴとテーブルにボウルが付いたキッチン」など)。その後、操縦可能なシーン生成は、リクエストを正確に実現することができます。たとえば、このツールは、パントリーの棚のシーンを構築するときに98%、乱雑な朝食テーブルの86%の場合、98%のレートでユーザーのプロンプトを正確に追跡しました。両方のマークは、ような同等の方法よりも少なくとも10%の改善です ミディフョン そして ディフスケン それぞれ。
また、システムは、プロンプトや軽い方向(「同じオブジェクトを使用して異なるシーンアレンジメントを作成する」など)を介して特定のシーンを完了することもできます。たとえば、キッチンテーブルの上にリンゴをいくつかのプレートに置くか、ボードゲームや本を棚に置くように頼むことができます。空のスペースにアイテムをスロットすることで、本質的に「空白を埋める」ことができますが、残りのシーンは保存されます。
クレジット:マサチューセッツ工科大学
研究者によると、彼らのプロジェクトの強さは、ロボット奏者が実際に使用できる多くのシーンを作成する能力にあります。 「私たちの調査結果からの重要な洞察は、私たちが実際に望んでいるシーンに正確に似ていないことが事前に守られたシーンにとっては大丈夫だということです」とPfaff氏は言います。 「ステアリング方法を使用して、その広範な分布を超えて「より良い」ものからサンプリングすることができます。つまり、ロボットを実際に訓練したい多様で現実的で、タスクに沿ったシーンを生成します。」
このような広大なシーンは、さまざまなアイテムと対話する仮想ロボットを記録できるテストの根拠になりました。たとえば、マシンはフォークとナイフをカトラリーホルダーに慎重に配置し、さまざまな3D設定のプレートにパンを再配置しました。各シミュレーションは流動的で現実的に見え、操縦可能なシーン生成がいつか訓練するのに役立つ現実世界の適応可能なロボットに似ています。
このシステムは、ロボットの多様なトレーニングデータを生成する際の前進する勇気づけの道になる可能性がありますが、研究者は自分の仕事がより概念の実証であると言います。将来的には、生成AIを使用して、固定された資産ライブラリを使用する代わりに、まったく新しいオブジェクトとシーンを作成したいと考えています。また、ロボットが開いたりねじれたりすることができる明確なオブジェクト(食べ物で満たされたキャビネットや瓶など)を組み込んで、シーンをさらにインタラクティブにすることを計画しています。
「今日、シミュレーションのための現実的なシーンを作成することは非常に挑戦的な努力になる可能性があります。手続き上の生成は容易に多くのシーンを生成できますが、ロボットが現実の世界で遭遇する環境を代表することはないでしょう。
「ポストトレーニングと推論時間検索を備えた操縦可能なシーン生成は、大規模なシーン生成を自動化するための斬新で効率的なフレームワークを提供します」と、トヨタリサーチインスティテュートのロボティストリックコリーSM ’08、博士号は言います。 ’10、紙にも関わっていなかった。さらに、「ダウンストリームタスクにとって重要と見なされる「これまでにない」シーンを生成することができます。将来、このフレームワークと膨大なインターネットデータを組み合わせることで、現実世界での展開のためのロボットの効率的なトレーニングに向けた重要なマイルストーンを解き放つことができます。」
詳細:
Nicholas Pfaff et al、ポストトレーニングと推論時間検索を伴う操縦可能なシーン生成、 arxiv (2025)。 doi:10.48550/arxiv.2505.04831
引用:生成AIを使用して、2025年9月30日に回収されたロボットの仮想トレーニンググラウンド(2025、9月29日)を多様化する
このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。
#生成AIを使用してロボットの仮想トレーニングの根拠を分散させる