1750850007
2025-06-25 10:57:00
ハイデラバード: Googleは、インターネット接続なしで動作できるGemini Robotics AIモデルのデバイスバージョンを展開します。新しいビジョン言語アクション(VLA)モデルには、今年3月にリリースされたものと同様に、汎用の器用な能力とタスクの一般化が備わっています。
VLAモデルが何であるかを知らない人にとって、それはビジョン、言語、およびアクション機能を組み合わせて、ロボットが環境を理解し、手順を処理し、タスクを実行できるようにするAIモデルの一種です。
この新しいアップデートは、クラウド接続に依存していた以前のモデルからの大幅なシフトを強調しています。ロボットが情報を処理し、デバイス自体を決定できるようにすることにより、Mountain Viewベースの会社は、遠隔地、安全な施設、遅延に敏感な状況などの環境でロボット工学をより実用的にすることを望んでいます。
器用さの評価(画像クレジット:Google Deepmindブログ)
Googleのデバイス上のロボットAIモデルの主なハイライトは、接続性が低いか、まったくない場所で動作し、信頼性が高いことです。さらに、情報をローカルで処理できます。これは、データセキュリティがヘルスケアや産業の自動化などの大きな関心事であるプライバシーに敏感なアプリケーションで役立つと予想されます。
Gemini Robotics On-Device AIモデル
新しいRobotics AIモデルは、モデルが特別にトレーニングされていなくても、ロボットが幅広い物理的タスクを完了できるように設計されています。 DeepMindブログが共有するいくつかのビデオは、Device On-Device AIモデルがDexterityで一般的なタスクをどのように行うことができるかを示しています。
クリップでは、中央の引き出しを開閉し、梨型の容器を閉じるなど、一般的なタスクを実行するように、デバイス上のAIモデルが指示されました。 AIモデルの器用さを確認するために、バッグを解凍してマーカーを除外するように指示されました。

さまざまなタスクを実行するデバイスロボットAIモデル。 (画像クレジット:Google Deepmindブログ)
別のビデオでは、AIモデルが、以前に見えなかったオブジェクトを備えたまったく新しい環境で一般的なタスク命令をどのように実行したかを示しました。デバイス上のGemini Robotics AIモデルはもともとGoogleのAloha Robot専用に訓練されていましたが、ApptronikのApollo HumanoidやDual Armed Franka FR3を含む他のロボットシステムに成功しました。
産業ベルトアセンブリやドレスの折りたたみなどのタスクを実行しました。比較のために、TeslaのヒューマノイドロボットであるOptimusは、衣服の折りたたみ、卵の沸騰、ダンスなどのタスクを実行することもできますが、データを処理して結果を提供するにはインターネット接続が必要です。

アポロヒューマノイドロボットに統合された後、タスクを実行するデバイスロボットAIモデル。 (画像クレジット:Google Deepmindブログ)
3番目のビデオでは、同じオンデバイスモデルがApollo Humanoidロボットに統合された方法を示しています。これは、自然言語の指示に従い、以前に見えないオブジェクトを使用して一般的なタスクを実行しました。
オンデバイスAIモデルパフォーマンス
チームはパフォーマンスを処理し、一般化、命令フォロー、迅速な適応を含む3つのパラメーターに関するデータを提示しました。

一般化ベンチマーク(画像クレジット:Google Deepmindブログ)
最初のグラフは、AIモデルの一般化パフォーマンスを紹介します。驚くべきことに、両方のモデルの視覚的な一般化はわずかに近く、クラウド接続のバリアントはオンデバイスモデルよりも少し優れています。一方、セマンティックとアクションの一般化は、クラウド接続モデルの少し遅れでした。

命令に従うベンチマーク(画像クレジット:Google Deepmindブログ)
2番目のグラフは、両方のAIモデルが自然言語で提供される指示に従った方法を示しています。この評価では、両方のAIモデルが簡単な指示を与えられたときにうまく機能しましたが、クラウドに接続されたフラッグシップジェミニロボットは、ハード指示が与えられたときに大きなリードを奪いました。

高速適応ベンチマーク(画像クレジット:Google Deepmindブログ)
一方、3番目のグラフは、AIモデルが新しいシナリオへの適応に向けて迅速である方法を示しています。驚くべきことに、オンデバイスAIモデルは、クラウド接続のAIモデルに近いものでした。デバイス上のモデルは即座にタスクを実行し、50から100のデモンストレーションから新しいタスクを学ぶことができるためです。
#Google #DeepMindはインターネットなしで機能するデバイスのGemini #Robotics #AIモデルを起動します