日本語版
最新ニュース
世界

プロンプトを使用して人型ロボットをトレーニングします。 1X NEO はビデオ生成を通じてタスクを学習するようになりました

ここ数年、私たちは印象的なロボット工学のビデオをたくさん見てきましたが、1X が発表したものは、これらの機械が実際に私たちの家庭に入る方法における根本的な変化のように感じられます。 ノルウェーのロボット企業は、同社の人型ロボット NEO が、プロンプトからトレーニング ビデオを生成するだけで、複雑なタスクを学習して実行できるようになったと発表しました。音声コマンドであれテキスト入力であれ、ロボットは基本的にタスクの完了を視覚化し、その動きを物理世界で実行します。 従来、ロボットのトレーニングは遠隔操作を伴う骨の折れるプロセスであり、人間が手動でロボットを何百回、何千回もガイドしてタスクを実行する必要がありました。 この新しいアプローチでは、インターネット規模のビデオ データで事前トレーニングされたワールド モデルを使用するため、オブジェクトごとに特定のデモンストレーションを行うことなく、ロボットが人間のインタラクションと物理学を理解できるようになります。 「Neo は、1X ワールド モデルの最新アップデートにより、あらゆるプロンプトを自律的なアクションに変えることができるようになりました。」Eric Jang、AI 担当副社長、1X。 これにより、ロボット業界を長らく妨げてきたデータのボトルネックが解消されるため、その重要性はどれだけ強調してもしすぎることはありません。 ビデオ生成を「認知コア」として使用することで、NEO は、便座や弁当箱などの特定の家庭用品との対話など、これまでに見たことのないタスクに一般化できます。 ロボットは環境を認識し、成功したアクションの視覚化を生成し、逆ダイナミクス モデルを使用してピクセルからモーションへの夢を現実にします。これは、照明の変化や室内のランダムな物体の存在に過度に敏感になることが多いロボット向けの従来の AI モデルからの大きな進歩です。 NEO はウェブから人間の知識の膨大なライブラリを利用しているため、部屋のコンテキストとオブジェクトがどのように動作するかを理解します。 「ワールド モデルを使用すると、NEO は現実世界のタスクを実行する自身のデータを無制限に作成でき、NEO が自分自身に何かを学習できるようにするフライホイールを作成できます。」Eric Jang、AI 担当副社長、1X。 ロボットは、作成者が撮影に時間を費やした特定のタスクのライブラリに制限されなくなるため、スケーリングの可能性はほぼ無限です。 理論的には、人間がタスクを思いつき、それを説明できれば、ロボットは最初に正しい物理的順序を「幻覚」させることによって、そのタスクを実行しようとすることができます。ただし、この「夢を実現する」機能は魅力的ですが、その誇大宣伝と、現世代のハードウェアおよびソフトウェアの実際の現実の一部とのバランスを取る必要があります。 物理学に基づいた高品質のビデオ データの生成は瞬時のプロセスではないため、最も差し迫ったハードルは時間です。デモでは、ロボットがプロンプトを処理するために一時停止し、最初のモーターが回転し始める前に内部ビデオ シーケンスを生成する様子が見られます。 オレンジを拾うような単純なタスクの場合は、数秒の「考える」時間は許容されますが、時間に敏感なアプリケーションの場合、この待ち時間が問題になる可能性があります。これらの大規模な世界モデルを実行するには多大な推論能力が必要となるため、実際のコンピューティングコストも考慮する必要があります。 ChatGPT…

プロンプトを使用して人型ロボットをトレーニングします。 1X NEO はビデオ生成を通じてタスクを学習するようになりました

1768362482
2026-01-13 11:00:00

ここ数年、私たちは印象的なロボット工学のビデオをたくさん見てきましたが、1X が発表したものは、これらの機械が実際に私たちの家庭に入る方法における根本的な変化のように感じられます。

ノルウェーのロボット企業は、同社の人型ロボット NEO が、プロンプトからトレーニング ビデオを生成するだけで、複雑なタスクを学習して実行できるようになったと発表しました。音声コマンドであれテキスト入力であれ、ロボットは基本的にタスクの完了を視覚化し、その動きを物理世界で実行します。

従来、ロボットのトレーニングは遠隔操作を伴う骨の折れるプロセスであり、人間が手動でロボットを何百回、何千回もガイドしてタスクを実行する必要がありました。

この新しいアプローチでは、インターネット規模のビデオ データで事前トレーニングされたワールド モデルを使用するため、オブジェクトごとに特定のデモンストレーションを行うことなく、ロボットが人間のインタラクションと物理学を理解できるようになります。

「Neo は、1X ワールド モデルの最新アップデートにより、あらゆるプロンプトを自律的なアクションに変えることができるようになりました。」

Eric Jang、AI 担当副社長、1X。

これにより、ロボット業界を長らく妨げてきたデータのボトルネックが解消されるため、その重要性はどれだけ強調してもしすぎることはありません。

ビデオ生成を「認知コア」として使用することで、NEO は、便座や弁当箱などの特定の家庭用品との対話など、これまでに見たことのないタスクに一般化できます。

ロボットは環境を認識し、成功したアクションの視覚化を生成し、逆ダイナミクス モデルを使用してピクセルからモーションへの夢を現実にします。これは、照明の変化や室内のランダムな物体の存在に過度に敏感になることが多いロボット向けの従来の AI モデルからの大きな進歩です。

NEO はウェブから人間の知識の膨大なライブラリを利用しているため、部屋のコンテキストとオブジェクトがどのように動作するかを理解します。

「ワールド モデルを使用すると、NEO は現実世界のタスクを実行する自身のデータを無制限に作成でき、NEO が自分自身に何かを学習できるようにするフライホイールを作成できます。」

Eric Jang、AI 担当副社長、1X。

ロボットは、作成者が撮影に時間を費やした特定のタスクのライブラリに制限されなくなるため、スケーリングの可能性はほぼ無限です。

理論的には、人間がタスクを思いつき、それを説明できれば、ロボットは最初に正しい物理的順序を「幻覚」させることによって、そのタスクを実行しようとすることができます。ただし、この「夢を実現する」機能は魅力的ですが、その誇大宣伝と、現世代のハードウェアおよびソフトウェアの実際の現実の一部とのバランスを取る必要があります。

物理学に基づいた高品質のビデオ データの生成は瞬時のプロセスではないため、最も差し迫ったハードルは時間です。デモでは、ロボットがプロンプトを処理するために一時停止し、最初のモーターが回転し始める前に内部ビデオ シーケンスを生成する様子が見られます。

オレンジを拾うような単純なタスクの場合は、数秒の「考える」時間は許容されますが、時間に敏感なアプリケーションの場合、この待ち時間が問題になる可能性があります。これらの大規模な世界モデルを実行するには多大な推論能力が必要となるため、実際のコンピューティングコストも考慮する必要があります。

ChatGPT や Gemini などの LLM へのすべてのクエリがトークンを消費してコストがかかるのと同様に、NEO が実行するすべての「視覚化」にはシリコンと電力のコストがかかります。

推論時に、システムはテキスト プロンプトと開始フレームを受け取ります。 WM は意図した未来を展開し、IDM は必要な軌道を抽出し、ロボットが現実世界でシーケンスを実行します。

あらゆるアクションに世界モデルからの新しい世代が必要な場合、家庭用ロボットの運用コストが、初期導入者にとって毎月のサブスクリプションの悩みの種になる可能性があります。

現在、1X はこれらの生成されたアビリティの長さと成功率を増やし、日常使用においてより信頼できるものにすることに取り組んでいます。私たちはこのテクノロジーの初期段階にあり、ビデオでは NEO が便座と弁当箱を扱っている様子が示されていますが、現実の世界は研究室よりもはるかに混乱しています。

これらの課題にもかかわらず、急速に進歩する生成 AI ビデオ モデルの世界とともに能力が向上するロボットのアイデアは魅力的です。

Sora や Kling のようなモデルが 3D 空間の理解においてより洗練されるにつれて、NEO のようなロボットは新しいハードウェアを必要とせずに自然に能力が向上するでしょう。これにより、ロボットが独自のトレーニング データを生成し、その試みから学習し、時間の経過とともに身体パフォーマンスを向上させる自己改善ループが作成されます。

私たちがスマート ホーム テクノロジーを早期に導入することが多いオーストラリア市場にとって、真の汎用アシスタントの可能性はこれまで以上に近づいているように感じられます。 NEO ベータ版の現地価格は確認されていませんが、1X はこれまで、自社のロボットを長期的に大衆市場で手頃な価格にすることを目指してきました。

大局的に見ると、ハイエンドの人型研究プラットフォームの価格は数十万ドルになる可能性がありますが、消費者向けユニットの目標は、最終的には小型車の価格に達することです。

この分野で同様のテクノロジーを検討すると、高級ヒューマノイドの価格は当初 30,000 オーストラリアドルから 50,000 オーストラリアドル程度になると予想できますが、これは完全に推測の域を出ません。 1X チームが言及した「フライホイール」効果は、実際に皿洗いができるロボットを求める人にとって、この発表の中で最も期待できる部分です。

ロボットがシミュレーションとビデオ生成を通じて自己学習できれば、ロボットが新しいスキルをレパートリーに追加する速度は飛躍的に高まります。私たちは、「if-then」プログラミングから、単にマシンに必要なことを伝え、「どのように」を理解させるかの時代に移行しつつあります。

アプリが作成されるのをまだ待っているとしても、これはロボット工学にとっての「iPhone の瞬間」のように感じられるパラダイムシフトです。 1X 世界モデルは、物理世界が AI のプロンプトから出力までのインターフェイスの 1 つにすぎない未来を表しています。

NEO がこれらのタスクをナビゲートするのを見ていると、デジタル インテリジェンスと肉体労働の間の障壁がついに溶け始めていることは明らかです。バッテリー寿命、モーターの耐久性、推論の純粋な速度に関してやるべきことはたくさんありますが、基礎は築かれました。

あらゆるオブジェクトを使用してあらゆるタスクに汎用化できる能力はロボット工学の「聖杯」であり、1X は非常に賢い近道を見つけたようです。

特にこれらの「世界モデル」が人間環境の予測不可能性にどのように対処するのかを見るのに、この空間を観察するのは興味深い時期です。

詳細については、https://www.1x.tech/discover/world-model-self-learning をご覧ください。

#プロンプトを使用して人型ロボットをトレーニングします #NEO #はビデオ生成を通じてタスクを学習するようになりました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。