ロボットプラットフォーム用のハードウェアは安定したペースで前進しているように見えますが(まあ、常にではないかもしれません)、安全性と精度で新しいシナリオを通じてこれらのロボットを自律的にパイロットできる有能なAIモデルを作成していることは、とらえどころのないことが証明されています。たとえば、業界が「具体化されたAI」と呼んでいるのは、Nvidiaのムーンショットの目標であり、ロボット工学を物理的な世界の一般的な労働者に変える可能性のある聖杯のままです。
これらのラインに沿って、Googleの新しいモデルはGemini 2.0 Large Language Model Foundationの上に構築され、ロボットアプリケーション専用の機能を追加します。 Gemini Roboticsには、Googleが「Vision-Language-action」(VLA)能力と呼ぶものが含まれており、視覚情報の処理、言語コマンドの理解、物理的な動きを生成することができます。対照的に、Gemini Robotics-ERは、空間的理解が強化された「具体化された推論」に焦点を当てており、ロボット奏者が既存のロボット制御システムに接続できるようにします。
たとえば、Gemini Roboticsを使用すると、ロボットに「バナナを拾ってバスケットに入れる」ように頼むことができます。シーンのカメラビューを使用してバナナを認識し、ロボットアームを導き、アクションを正常に実行します。または、「折り紙のキツネを折り畳む」と言うかもしれません。折り紙の知識と、タスクを実行するために紙を慎重に折りたたむ方法を使用します。
Gemini Robotics:AIを物理的な世界にもたらします。
2023年に、GoogleのRT-2をカバーしました。これは、インターネットデータを使用してロボットが言語コマンドを理解し、新しいシナリオに適応するのを支援することにより、より一般化されたロボット機能に向けた顕著なステップを表しています。 2年後、Gemini Roboticsは、何をすべきかを理解するだけでなく、RT-2が明示的に処理できなかった複雑な物理的操作を実行することで、別の実質的な飛躍をもたらしたようです。
より良い一般化された結果
それは重要です。なぜなら、ヒューマノイドロボットが現在どの程度有用であるか、または実際にどれほど有能であるかについて懐疑論が残っているからです。 Teslaは昨年10月にOptimus Gen 3ロボットを発表し、多くの物理的タスクを完了する能力を主張しましたが、その自律的なDemoのいくつかのロボットが人間によってリモートで制御されていることを認めた後、自律的なAI機能の信頼性に懸念が続いています。
ここで、Googleは本物を作ろうとしています:ジェネラリストのロボットの脳。その目標を念頭に置いて、同社はテキサス州オースティンとのパートナーシップを発表しました Apptronik 「ジェミニ2.0で次世代のヒューマノイドロボットを構築する」。一方、主に双方向のロボットプラットフォームで訓練されています アロハ2、Googleは、Gemini Roboticsが研究指向からさまざまなロボットタイプを制御できると述べています フランカロボットアーム ApptronikのApolloロボットのようなより複雑なヒューマノイドシステムに。
Gemini Robotics:器用なスキル。
他の企業は、図AI(2024年3月にヒューマノイドロボットに多額の資金を確保した)や、前述の元アルファベットの子会社であるボストンダイナミクス(昨年4月に柔軟な新しいAtlasロボットを導入した)など、ヒューマノイドロボットハードウェアで懸命に取り組んでいますが、ロボットを本当に有用にするための有用なAI「ドライバー」が導入されています。その面では、Googleは、ボストンダイナミクス、敏ility性ロボット工学、エンチャントツールなどの企業への「信頼できるテスター」プログラムを通じて、Gemini Robotics-ERへのアクセスが制限されています。
安全性と制限
安全性の考慮事項については、Googleは、衝突回避や力の制限などの従来のロボット安全対策を維持する「階層化された全体的なアプローチ」に言及しています。会社は、「ロボット憲法「Isaac Asimov’sに触発されたフレームワーク ロボット工学の3つの法則 そして、当然のことながら「データセット」をリリースする」アシモフ「研究者がロボットアクションの安全性への影響を評価するのを助けるため。
この新しいアシモフデータセットは、物理的な危害防止を超えてロボットの安全性を評価するための標準化された方法を作成するGoogleの試みを表しています。データセットは、研究者がAIモデルがロボットがさまざまなシナリオで取る可能性のあるアクションの潜在的な結果をどの程度理解しているかをテストするのに役立つように設計されているように見えます。 Googleの発表によると、データセットは「研究者が現実世界のシナリオにおけるロボットアクションの安全性への影響を厳密に測定するのに役立ちます」。
同社は、研究段階に残っている新しいAIモデルの可用性のタイムラインまたは特定の商用アプリケーションを発表しませんでした。 Googleが共有するデモビデオは、AI駆動型機能の進歩を描写していますが、制御された研究環境は、これらのシステムが予測不可能な現実世界の設定で実際にどのように機能するかについての未解決の疑問を残しています。
#Googleの新しいロボットAIは繊細な折り紙を折りたたむことができダメージなしでジッパーバッグを閉じることができます