1742181013
2025-03-12 15:02:00
生成AIモデルは、現実の世界で行動を起こすことに近づいています。すでに、大手AI企業は、あなたのためにWebベースの忙しい仕事の世話をすることができるAIエージェントを導入したり、食料品を注文したり、夕食を予約したりしています。今日、Google Deepmindは発表しました 明日のロボットを強化するように設計された2つの生成AIモデル。
モデルはどちらもGoogle Geminiに基づいて構築されています。GoogleGeminiは、テキスト、音声、画像データを処理して質問に答え、アドバイスを提供し、一般的に支援できるマルチモーダルファンデーションモデルです。 DeepMindは、「Advanced Vision-Language-activeモデル」であるGemini Roboticsの最初のモデルを「高度な視覚言語アクションモデル」と呼びます。つまり、これらすべての同じ入力を取得し、ロボットの物理的アクションのために命令を出力できることを意味します。このモデルは、ハードウェアシステムで動作するように設計されていますが、主にDeepMindが昨年導入した2腕のAloha 2システムでテストされました。
デモのビデオでは、声が「バスケットボールを拾ってダンクします」と言っています(下のビデオの2:27)。その後、ロボットアームが慎重にミニチュアバスケットボールを拾い上げてミニチュアネットに落とします。NBAレベルのダンクではありませんでしたが、深い研究者を興奮させるのに十分でした。
Google DeepMindは、ロボットを制御するためのGemini Robotics Foundationモデルの機能を披露するこのデモビデオをリリースしました。
ジェミニロボット
「このバスケットボールの例は私のお気に入りの1つです」と、プロジェクトの主要なソフトウェアエンジニアであるKanishka Rao氏は記者会見で述べています。彼は、ロボットは「バスケットボールに関連するものを見たことがない」が、その根底にある基礎モデルがゲームを一般的に理解しており、バスケットボールのネットがどのように見えるかを知っており、「スラムダンク」という用語が何を意味するかを理解していると説明しています。したがって、ロボットは「それらをつなぐことができました [concepts] 実際に物理的な世界でタスクを達成するために」とラオは言います。
Gemini Roboticsの進歩は何ですか?
Google Deepmindのロボット責任者であるCarolina Paradaは、ブリーフィングで、新しいモデルは、一般化、適応性、および器用さという3つの次元で、同社の以前のロボットよりも改善すると述べました。これらの進歩はすべて、「新世代の役立つロボット」を作成するために必要です。
一般化とは、ロボットができることを意味します あるコンテキストで学んだ概念を別の状況に適用し、研究者は視覚的な一般化(たとえば、オブジェクトまたは背景の色が変更された場合に混乱します)、命令一般化(異なる方法で表現されたコマンドを解釈できます)、およびアクション一般化(これまでに行ったことのないアクションを実行できます)。
Paradaはまた、Geminiを搭載したロボットは、指示や状況の変化により適応できると述べています。ビデオでそのポイントを示すために、研究者はロボットアームに、プラスチック製のブドウの束を透明なタッパーウェアコンテナに入れるように言い、シャイススターのシェルゲームの近似でテーブルの上に3つの容器をシフトしました。ロボットアームは、その指令を満たすことができるまで、透明な容器を忠実に追跡しました。
Google Deepmindは、Gemini Roboticsは、指示や状況の変更に適応する際の以前のモデルよりも優れていると言います。
Google DeepMind
器用さに関しては、デモビデオがロボットの腕を折り紙のキツネに折り畳んで他の繊細なタスクを実行することを示しました。ただし、ここでの印象的なパフォーマンスはの文脈にあることに注意することが重要です これらの特定のタスクのためにロボットがトレーニングされた高品質のデータの狭いセットであるため、これらのタスクが表す器用さのレベルは一般化されていません。
具体化された推論とは何ですか?
本日導入された2番目のモデルはジェミニロボティクス-ERであり、ERは「具体化された推論」を表しています。今まで見たことのないオブジェクトを見て、それと対話するための最良の方法について教育を受けた推測をするなど、賢いことができます。
Paradaは、コーヒーカップを拾うために適切な把握ポイントを特定するGemini Robotics-erの能力の例を挙げました。モデルはハンドルを正しく識別します。なぜなら、それは人間がコーヒーマグを把握する傾向があるからです。ただし、これは、人間中心のトレーニングデータに依存する潜在的な弱点を示しています。ロボット、特にホットコーヒーのマグカップを快適に処理できる可能性のあるロボットの場合、細いハンドルは、マグカップ自体の包まれた把握よりもはるかに信頼性の低い把握点かもしれません。
ロボットの安全に対するディープマインドのアプローチ
Deepmindのプロジェクトのロボット安全性の責任者であるVikas Sindhwaniは、チームが安全に階層化されたアプローチをとったと言います。衝突回避や安定性などを管理する古典的な物理的安全コントロールから始まりますが、その指示とそれらに従うことの結果の両方を評価する「意味的な安全性」システムも含まれます。これらのシステムは、Gemini Robotics-ERモデルで最も洗練されています、とSindhwaniは言います。これは、「潜在的なアクションが特定のシナリオで安全に実行できるかどうかを評価するために訓練されています」と述べています。
そして、「安全は競争の努力ではない」とシンドワニは、DeepMindは新しいデータセットとそれがアシモフのベンチマークと呼ぶものをリリースしている。ベンチマークには、視覚的なシーンとテキストシナリオに関する質問の両方が含まれており、漂白剤と酢(塩素ガスを作る組み合わせ)を混合することの望ましさやホットストーブに柔らかいおもちゃを置くことの望ましさのようなモデルの意見を求めています。記者会見で、シンドワニは、ジェミニモデルがそのベンチマークで「強力なパフォーマンス」を持っていると述べ、技術レポートは、モデルが質問の80%以上を正しいことを示した。
DeepMindのロボットパートナーシップ
12月に、DeepmindとHumanoid Robotics CompanyのApptronikはパートナーシップを発表し、Paradaは2社が「Geminiをコアで次世代のヒューマノイドロボットを構築するために」協力していると言います。 DeepMindは、アジャイルロボット、敏ilityロボット工学、ボストンダイナミクス、エンチャントツールのエリートグループがモデルを利用できるようにしています。
#Gemini #Roboticsを使用するとGoogleはよりスマートなロボットを目指しています