1745309635
2025-04-22 08:00:00
最近は非常に多くのAIの研究論文がありますが、目立つのは難しいです。しかし、最近では、1つの論文がハイテク業界で多くの議論を発表しました。
「これは、過去2年間でAIで読んだ中で最も刺激的なことです」と、Startupの創設者Suhail Doshiは今週末Xで書いています。 Anthropicの共同設立者であるJack Clarkは、彼の輸入AIニュースレターの月曜日の版でこの論文を特集しました。
シルバーとサットンは、「経験の時代」と呼ばれる新しい期間に入ったと言います。
David SilverとRichard Suttonによる研究論文の「経験の時代へようこそ」からのグラフ
私にとって、これはGoogleがAIの最も永続的な問題の1つであるトレーニングデータの希少性に取り組む新しい試みを表しています。
シミュレーション時代
著者によると、「シミュレーション時代」だった最初の時代から始めましょう。
この期間、ほぼ2010年代半ばに、研究者はデジタルシミュレーションを使用してAIモデルにゲームを繰り返しプレイして人間のように演奏する方法を学びました。私たちは、チェス、ポーカー、アタリ、「グランツーリスモ」など、何百万ものゲームを何度も何度も何度も話しています。
この強化学習方法(RL)は、Googleのアルファゴを生成しました。また、Alphazeroと呼ばれる別のGoogleモデルの作成にも役立ちました。これは、チェスと「Go」の新しい戦略を発見し、人間がこれらのゲームをプレイする方法を変えました。
著者によると、このアプローチの問題は、この方法で訓練されたマシンが特定の問題を正確に定義された報酬を伴う特定の問題でうまくいきましたが、あいまいな見返りに関するより一般的な自由な問題に取り組むことはできませんでした。だから、おそらく本当に完全なAIではありません。
人間のデータ時代
次のエリアは、2017年に公開された別のGoogle Research Paperによって開始されました。「注意が必要です」と、AIモデルをインターネットから人間が作成したデータの山について訓練する必要があることを提案しました。マシンがこのすべての情報に「注意を払う」ことを許可することによって、彼らは人間のように振る舞い、さまざまな異なるタスクで私たちと同様に演奏することを学びます。
これは私たちが現在の時代であり、CHATGPTと、グラフィックデザイン、コンテンツ作成、ソフトウェアコーディングなどのタスクの自動化にますます使用されている他の強力な生成AIモデルとツールのほとんどを生み出しています。
この時代の鍵は、可能な限り高品質の人間で生成されたデータを蓄積しており、それを大規模で計算集約型のトレーニングで使用して、AIモデルを世界を理解して吹き込みます。
Googleの研究者がこの人間のデータの時代を開始している間、これらの人々のほとんどは会社を去り、自分のものを始めました。多くの人がOpenaiに行き、UltimateがChatGPTを制作したテクノロジーに取り組みました。これは、歴史上最も成功した生成AI製品です。他の人は、強力なチャットボット、AIエージェントであるClaudeを実行するもう1つの主要な生成AIスタートアップである人類学を開始しました。
関連するストーリー
ビジネスインサイダーはあなたが知りたい革新的な物語を語っています

ビジネスインサイダーはあなたが知りたい革新的な物語を語っています
グーグルディス?
AI業界の多くの専門家、およびウォール街の一部の投資家とアナリストは、Googleがここでボールを落とした可能性があると考えています。このAIアプローチを思いつきましたが、OpenaiとChatGptはこれまでのところほとんどの略奪品と逃げてきました。
ju審員はまだ出ていないと思います。ただし、著者が人間のデータの時代を解散しているように見える場合、この状況について考えずにはいられません。
「パラダイムの変化がお風呂で赤ちゃんを捨てたと主張することができます」と彼らは書いた。 「人間中心のRLは前例のない幅の行動を可能にしましたが、エージェントのパフォーマンスに新しい天井も課しています。エージェントは既存の人間の知識を超えることはできません。」
シルバーとサットンは、これの1つの側面について正しいです。高品質の人間データの供給は、新しいモデルを訓練し、能力を前進させるために新鮮なコンテンツを必要とするAI Labsや大手ハイテク企業からの飽くなき需要によって上回っています。昨年書いたように、AIフロンティアで大きな飛躍をするのはずっと難しく、より高価になりました。
経験の時代
著者はこれについてかなり根本的な解決策を持っています、そして、彼らがこの論文で提案するのは、新しい経験の時代の中心にあります。
彼らは、モデルとエージェントがそこに出て、現実の世界とのやり取りを通じて独自の新しいデータを作成する必要があることを示唆しています。
これにより、ぐちゃぐちゃなデータサプライの問題が解決されます、と彼らは主張しますが、フィールドがAGIまたは人工的な一般情報を達成するのを助けます。
「最終的に、体験データは、人間で生成されたデータの規模と品質を覆します」とSilverとSuttonは書いています。 「RLのアルゴリズムの進歩を伴うこのパラダイムシフトは、人間が所有するものを上回る多くのドメインでの新しい機能のロックを解除します。」
現代の親は、これを子供にソファから降りて、電話を見るのをやめて、外に出て友達と遊ぶように言うことに相当すると考えることができます。豊かで、満足のいく、そしてより価値のある経験があります。
人類の共同設立者であるクラークは、この提案のチャッツパに感銘を受けました。
「このような論文は、AI業界で見つかった自信を象徴しています」と彼は月曜日にニュースレターに書いて、「これらのエージェントに世界と相互作用して独自のデータを生成できるほど十分な独立性と緯度を与えるための勇気を引用しています」と書いています。
例、および可能な最終dis
著者は、これが新しい経験の時代にどのように機能するかという理論的な例をいくつか浮かびます。
AIのヘルスアシスタントは、安静時の心拍数、睡眠時間、活動レベルなどの信号の組み合わせに基づいて、人の健康目標を報酬に接地することができます。 (AIの報酬は、モデルとエージェントにパフォーマンスを向上させるための一般的な方法です。パートナーがジムに行くと強くなり、見栄えが良くなると言うことで、パートナーがより強くなります。)
教育アシスタントは、ユーザーの言語学習に対する根拠のある報酬に基づいて、試験結果を使用してインセンティブまたは報酬を提供できます。
地球温暖化を減らすことを目標とする科学エージェントは、二酸化炭素レベルの経験的観察に基づいて報酬を使用する可能性がある、と銀とサットンは示唆している。
重要なのは、人間のデータの時代とは異なり、AI開発のこの新しい段階で生成および収集できる情報に制限がない可能性があることです。
現在の人間のデータ期間では、何かが失われたと著者は主張しています。
「この根拠がなければ、エージェントは、どんなに洗練されていても、既存の人間の知識のエコーチャンバーになります」とシルバーとサットンは、オープンの最終的なdisの可能性で書いています。
#新しいGoogle #AI戦略はOpenaiの支配を混乱させる可能性があります