日本語版
最新ニュース
科学&テクノロジー

ロボットの学習方法における革命

「そうですね」とサンケティ氏は言った。彼の後ろには、両側にロボットが配置されていることを除いて、同様の設定の別の卓球台がありました。これがどうなるかはわかりました。DeepMind は、ロンドンを拠点とする AI 研究研究所として 2010 年に設立され、古代のボードゲームである囲碁の世界チャンピオンを破った AlphaGo と呼ばれるモデルで最もよく知られています。 AlphaGo はもともと、人間の専門家を模倣できるように、試合のデータベースを与えられていました。その後、新しいバージョンは「セルフプレイ」のみでトレーニングし、自分自身のコピーとスパーリングするようになりました。このモデルは、驚くほど効率的な学習者となりました。これは、AI が人間を模倣するのではなく、試行錯誤によって自ら学習する「強化学習」として知られる手法の最高の例です。モデルが偶然良い動きをするたびに、そこに導いた決定が強化され、モデルは改善されました。このトレーニングをたった 30 時間続けただけで、この選手は地球上で最高の選手の 1 人になりました。ただし、物理世界でデータを収集することは、コンピューター内でデータを収集することよりもはるかに困難です。 Google DeepMind の最高の囲碁モデルは数秒で仮想ゲームをプレイできますが、ボールがピンポンできる速さは物理的に制限されています。同社の卓球ロボットは部屋全体を占有しており、その数は 3 台だけです。研究者らは、ルーブ・ゴールドバーグのファン、漏斗、ホッパーを使ってルーズボールをロボット対ロボットのゲームに戻す装置を発明する必要があった。サンケティ氏の説明によると、現時点ではロボットは防御よりも攻撃のほうが得意であり、そのためゲームが途中で終了してしまうという。 「ラリーを継続させるものは何もない」と彼は言った。だからこそ、チームはロボットを人間に対して訓練し続けなければならなかったのです。すべての参加者に勝つことができるピンポン ロボットは、古典的な DeepMind のように聞こえます。これは、非常に印象的で、風変わりで、読みやすい成果です。また、あなたが上達するにつれて調整してくれる、疲れ知らずのプレイパートナーを想像してみてください。しかし、ロボット工学の責任者であるパラダ氏は、このプロジェクトは実際には終了する可能性があると私に言いました。 2014年にDeepMindを買収し、2023年に社内のAI部門であるGoogle Brainと統合したGoogleは、大胆なAI製品で知られていない。 (彼らは、優れた、やや難解な研究を生み出すことで定評があるが、市場に投入される前に骨抜きになってしまう。)ピンポンボットが示したことは、ロボットはスポーツで競争できるだけの速さで「考える」ことができるということだとパラダ氏は語った。人間と対話することで、身体的なスキルがどんどん向上していきます。の驚くべき機能とともに、 アロハこれらの発見は、人間レベルの器用さへの道を示唆しました。強化学習によって自己学習するロボットは、ロボット工学の行き止まりであると長い間考えられていました。基本的な問題は、いわゆるカリキュラム設計です。学習者が完全に失敗することなく自分の能力を伸ばせるようにするにはどうすればよいでしょうか?囲碁の模擬ゲームでは、手の数と勝利のための特定の条件が有限です。アルゴリズムは、そこに至るあらゆる動きに対して報酬を与えることができます。しかし、物理的な世界では、数え切れないほどの数の動きが存在します。ロボットがペンを回そうとするとき、成功するよりも失敗する方がはるかに多い中で、ロボットはどのようにして進歩していると判断するのでしょうか?ルービック キューブの研究者は、ロボットが従うパンくずを敷くかのように、システムに報酬を手動で組み込む必要がありました。つまり、ロボットは、顔を正確に 90 度ひねるなど、人間が有用であると知っている操作でポイントを獲得しました。人間の不思議なところは、本質的に新しいことを学びたいという欲求があることです。私たちは自分たちで報酬を考え出します。息子は目に見えるものすべてを味わいたいと決心していたので、手を使うことをマスターしたいと考えていました。それが彼に、ハイハイや背中の後ろに手を伸ばすなど、他の新しい能力を練習する動機を与えました。つまり、彼はカリキュラムを自分で設計したのです。彼が何か複雑なことを試みるまでに、彼はすでに基本的な動作の語彙を習得しており、それによって、訓練を受けていないロボットが行うような、激しくけいれんするなど、明らかに運命のような戦略を避けることができます。明確なカリキュラムも明確な報酬もないロボットは、自分自身を傷つけるだけです。私たちの想像上のロボット、ロボコップやターミネーターは人間よりもはるかに頑丈ですが、実際のロボットのほとんどは繊細です。 「ロボットアームを使ってテーブルをたたいたり、何かを押したりすると、ロボットアームが壊れる可能性が高いです」と、OpenAIがルービックキューブの実験で使用した手を作ったShadow Robot社のRich Walker氏は私に語った。 「長時間にわたる強化学習実験はロボットにとって悪用です。訓練を受けていない政策は拷問だ。」これは、彼らが学習できる量を大幅に制限することが判明しました。壊れやすいロボットは、赤ちゃんのように物理世界を探索できません。 (赤ちゃんは驚くほどタフなので、おもちゃを飲み込んだり、ベッドから飛び降りたりする前に、親が介入するのが通例です。)過去数年間、Shadow Robot は…

ロボットの学習方法における革命

1732577886
2024-11-25 11:00:00

「そうですね」とサンケティ氏は言った。彼の後ろには、両側にロボットが配置されていることを除いて、同様の設定の別の卓球台がありました。これがどうなるかはわかりました。

DeepMind は、ロンドンを拠点とする AI 研究研究所として 2010 年に設立され、古代のボードゲームである囲碁の世界チャンピオンを破った AlphaGo と呼ばれるモデルで最もよく知られています。 AlphaGo はもともと、人間の専門家を模倣できるように、試合のデータベースを与えられていました。その後、新しいバージョンは「セルフプレイ」のみでトレーニングし、自分自身のコピーとスパーリングするようになりました。このモデルは、驚くほど効率的な学習者となりました。これは、AI が人間を模倣するのではなく、試行錯誤によって自ら学習する「強化学習」として知られる手法の最高の例です。モデルが偶然良い動きをするたびに、そこに導いた決定が強化され、モデルは改善されました。このトレーニングをたった 30 時間続けただけで、この選手は地球上で最高の選手の 1 人になりました。

ただし、物理世界でデータを収集することは、コンピューター内でデータを収集することよりもはるかに困難です。 Google DeepMind の最高の囲碁モデルは数秒で仮想ゲームをプレイできますが、ボールがピンポンできる速さは物理的に制限されています。同社の卓球ロボットは部屋全体を占有しており、その数は 3 台だけです。研究者らは、ルーブ・ゴールドバーグのファン、漏斗、ホッパーを使ってルーズボールをロボット対ロボットのゲームに戻す装置を発明する必要があった。サンケティ氏の説明によると、現時点ではロボットは防御よりも攻撃のほうが得意であり、そのためゲームが途中で終了してしまうという。 「ラリーを継続させるものは何もない」と彼は言った。だからこそ、チームはロボットを人間に対して訓練し続けなければならなかったのです。

すべての参加者に勝つことができるピンポン ロボットは、古典的な DeepMind のように聞こえます。これは、非常に印象的で、風変わりで、読みやすい成果です。また、あなたが上達するにつれて調整してくれる、疲れ知らずのプレイパートナーを想像してみてください。しかし、ロボット工学の責任者であるパラダ氏は、このプロジェクトは実際には終了する可能性があると私に言いました。 2014年にDeepMindを買収し、2023年に社内のAI部門であるGoogle Brainと統合したGoogleは、大胆なAI製品で知られていない。 (彼らは、優れた、やや難解な研究を生み出すことで定評があるが、市場に投入される前に骨抜きになってしまう。)ピンポンボットが示したことは、ロボットはスポーツで競争できるだけの速さで「考える」ことができるということだとパラダ氏は語った。人間と対話することで、身体的なスキルがどんどん向上していきます。の驚くべき機能とともに、 アロハこれらの発見は、人間レベルの器用さへの道を示唆しました。

強化学習によって自己学習するロボットは、ロボット工学の行き止まりであると長い間考えられていました。基本的な問題は、いわゆるカリキュラム設計です。学習者が完全に失敗することなく自分の能力を伸ばせるようにするにはどうすればよいでしょうか?囲碁の模擬ゲームでは、手の数と勝利のための特定の条件が有限です。アルゴリズムは、そこに至るあらゆる動きに対して報酬を与えることができます。しかし、物理的な世界では、数え切れないほどの数の動きが存在します。ロボットがペンを回そうとするとき、成功するよりも失敗する方がはるかに多い中で、ロボットはどのようにして進歩していると判断するのでしょうか?ルービック キューブの研究者は、ロボットが従うパンくずを敷くかのように、システムに報酬を手動で組み込む必要がありました。つまり、ロボットは、顔を正確に 90 度ひねるなど、人間が有用であると知っている操作でポイントを獲得しました。

人間の不思議なところは、本質的に新しいことを学びたいという欲求があることです。私たちは自分たちで報酬を考え出します。息子は目に見えるものすべてを味わいたいと決心していたので、手を使うことをマスターしたいと考えていました。それが彼に、ハイハイや背中の後ろに手を伸ばすなど、他の新しい能力を練習する動機を与えました。つまり、彼はカリキュラムを自分で設計したのです。彼が何か複雑なことを試みるまでに、彼はすでに基本的な動作の語彙を習得しており、それによって、訓練を受けていないロボットが行うような、激しくけいれんするなど、明らかに運命のような戦略を避けることができます。明確なカリキュラムも明確な報酬もないロボットは、自分自身を傷つけるだけです。

私たちの想像上のロボット、ロボコップやターミネーターは人間よりもはるかに頑丈ですが、実際のロボットのほとんどは繊細です。 「ロボットアームを使ってテーブルをたたいたり、何かを押したりすると、ロボットアームが壊れる可能性が高いです」と、OpenAIがルービックキューブの実験で使用した手を作ったShadow Robot社のRich Walker氏は私に語った。 「長時間にわたる強化学習実験はロボットにとって悪用です。訓練を受けていない政策は拷問だ。」これは、彼らが学習できる量を大幅に制限することが判明しました。壊れやすいロボットは、赤ちゃんのように物理世界を探索できません。 (赤ちゃんは驚くほどタフなので、おもちゃを飲み込んだり、ベッドから飛び降りたりする前に、親が介入するのが通例です。)

過去数年間、Shadow Robot は 3 本の指を備えた中世のガントレットのようなものを開発してきました。指はすべて親指のように向かい合って配置されています。指先の「皮膚」の下にあるゲルの層は、埋め込みカメラで撮影された小さなドットで装飾されています。圧力がかかるとパターンが変形します。これは、ロボットの「脳」が、指が何かに触れたときとその強さを感知するのに役立ちます。 Shadow の元のハンドは数時間ごとに再起動またはメンテナンスする必要がありましたが、このハンドは一度に何百時間も実行されます。ウォーカーは私に、木槌による打撃から生き残った指のビデオを見せてくれた。

「私が私たちのことについて話そうとするたびに、あなたが救難信号に気づくなんて、とても奇妙な偶然ですね。」

エリー・ブラックによる漫画

最近のビデオ通話で、ロンドンにある Google DeepMind の研究所の 1 つで、新しいシャドウハンドの数体が檻の中に閉じ込められたイカのようにぶら下がっているのを見ました。指は常に動き続けており、ほとんどブレてしまうほどの速さでした。私は、片方の手でレゴのような黄色いブロックを拾い上げ、対応するソケットに差し込もうとしているのを見ました。人間にとってこの作業は些細なことですが、1 本の 3 本指のロボットハンドがブロックを落とさずに再配置するのに苦労します。 「これは構造上、非常に不安定な作業です」とディープマインドのロボット部門のエンジニアリングリーダー、フランチェスコ・ノリ氏は説明する。たった 3 桁の場合、ブロックとの接触を頻繁に解除し、指の間で投げるかのように再び接続する必要があります。ブロックをどれだけ強く握るかが微妙に変化すると、ブロックの安定性に影響します。デモンストレーションするために、ノリさんは携帯電話を親指と人差し指の間に置き、グリップを緩めると携帯電話は落ちずに回転しました。 「手の中の物体の向きを変える必要があるので、物体を十分に握り締める必要がありますが、握りすぎないように注意してください。」と彼は言いました。

最初に、研究者らはオペレーターに三本指の手袋を着用し、模倣学習でポリシーを訓練するよう依頼しました。 アロハ スタイル。しかし、オペレーターは 30 分も経つと疲れてきて、自分のような手で操作するのは人間工学的ではないところがありました。さまざまなオペレーターがさまざまな方法でタスクを解決しました。彼らが訓練したポリシーの成功率はわずか 2% でした。行動範囲が広すぎた。ロボットは何を真似すればいいのか分かりませんでした。

チームは代わりに強化学習に目を向けました。彼らはロボットに、各デモンストレーションを一連のサブタスクに分割するという賢い方法で、成功したシミュレーションをマイニングするように教えました。次にロボットは、簡単なタスクからより難しいタスクに移行しながら、サブタスクを練習しました。実際、ロボットは独自のカリキュラムに従っていました。このように訓練されたロボットは、より少ないデータからより多くのことを学習しました。 64% の確率で、ブロックがソケットに収まります。

チームが最初にポリシーを実行し始めたとき、ブロックは明るい黄色でした。しかし、この作業は何度も実行されたため、ロボットの指からのほこりや金属がエッジを黒くしてしまいました。 「このデータは本当に貴重です」と、このプロジェクトの研究員マリア・バウザ氏は語った。データによってシミュレーションが改良され、それによって現実の政策が改善され、シミュレーションがさらに改良されることになります。人間がその輪の中にいる必要はなくなるでしょう。

多くの主要な学術研究機関や産業研究機関と同様に、Google でも、あたかも「スター ウォーズ」に登場するドロイド修理工場にいるような気分を味わうことができます。マウンテンビューで、 アロハ動作しているのは、『ウォーリー」とスタンバイしていました。角を曲がったところには巨大な腕があり、このプロジェクトの研究者は「それほど困難なく」骨を折ることができると説明した。 (ロボットには、そうすることを防ぐための安全装置が備わっています。)それはブロックを積み上げていました。アロハ。ロンドンの研究所には、高さ 20 インチの人型サッカー ボットのチームが所属しています。歴史的に、ロボットのすべてのメーカーとモデルは島でした。あるロボットを制御するために使用したコードは、別のロボットを制御することはできませんでした。しかし研究者たちは現在、単一の人工知能があらゆる種類のロボットを制御できる日を夢見ている。

コンピューター科学者は、たとえば英語とフランス語、またはフランス語とスペイン語の間で翻訳するためのさまざまなモデルを開発していました。最終的に、これらは任意の言語ペア間で翻訳できるモデルに収束しました。それでも、翻訳は、音声転写や画像認識などとは別の問題であると考えられていました。それぞれに、それを専門とする独自の研究チームや企業がありました。その後、大規模な言語モデルが登場しました。驚くべきことに、彼らは言語を翻訳できるだけでなく、司法試験に合格したり、コンピューター コードを書いたりすることもできました。ごった煮が溶けてひとつのAIになり、学習が加速した。 ChatGPT の最新バージョンは、あらゆるトピックについて数十の言語で声を出して話したり、歌を歌ったり、さらにはあなたの調子を測定したりすることができます。できることは何でも、その個別のタスクに特化したスタンドアロン モデルよりも優れたパフォーマンスを発揮します。

同じことがロボット工学でも起こっています。この分野の歴史のほとんどでは、視覚、計画、移動、または非常に難しいものである器用さなどの狭いサブフィールドについて論文全体を書くことができます。しかし、GPT-4 のような「基礎モデル」は、ロボットの計画性や視覚を支援するモデルを大部分包含しており、移動や器用さも間もなく包含されることになるでしょう。これは、さまざまな「実施形態」にわたっても当てはまります。最近、大規模な研究者コンソーシアムは、ある種類のマシンから別の種類のマシンへデータを正常に共有できることを示しました。 「トランスフォーマー」では、人型であろうとトラックであろうと、同じ脳がオプティマス・プライムを制御します。ここで、産業用アーム、ドローン群、または 4 脚の貨物ロボットも制御できると想像してください。

人間の脳は、制御できる機械に関しては可塑的です。義肢を使用したことがない場合でも、レンチやテニス ラケットが自分の体の延長のように感じたことがあるでしょう。二重駐車の車を通り過ぎると、助手席側のミラーが割れてしまう可能性があるかどうかが直感的にわかります。将来の世代の AI が本物の脳の運動可塑性を獲得すると信じる十分な理由があります。 「最終的に、私たちが目にするのは、1つの知性のようなものです」と、Google DeepMindでロボットの研究をしている研究科学者キールタナ・ゴパラクリシュナン氏は私に語った。この目的を達成するために、ヒューマノイドのスタートアップである Figure は OpenAI と提携して、大規模な言語モデルに実体の形を与えました。 OpenAIは数年ぶりにロボットチームの採用を開始した。

#ロボットの学習方法における革命

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。