1741247617
2025-03-05 10:00:00
1980年代、 アンドリュー・バルト そして リッチサットン エレガントでありながら最終的には運命のアイデアへのエキセントリックな信者と見なされていました。人間や動物のように、経験から学ぶ機械が学習しています。
数十年後、彼らが先駆者になったテクニックで、今では現代にとってますます重要になっています 人工知能 とのようなプログラム chatgpt、バルトとサットンは、コンピューターサイエンスの分野で最高の栄誉であるチューリング賞を受賞しました。
マサチューセッツ大学アマースト大学の名誉教授であるバルトと、アルバータ大学の教授であるサットンは、強化学習として知られるテクニックを先駆的にしました。 実験と肯定的または否定的なフィードバックのいずれかを組み合わせます。
「この仕事が私のために始まったとき、それは非常にファッショナブルでした」とバルトは笑顔で思い出し、マサチューセッツ州の彼の自宅からズームして話します。 「それは注目に値します [it has] いくつかの影響力といくつかの注意を獲得しました」と彼は付け加えます。
強化学習はおそらく最も有名でした 2016年にGoogle DeepmindがAlphagoを構築するために使用しました、信じられないほど複雑で微妙なボードゲームをどのようにプレイするかを学んだプログラムは、専門家レベルになります。このデモンストレーションは、このテクニックに新たな関心を呼び起こしました。 データセンターエネルギー使用の最適化、金融、そして チップデザイン。このアプローチには、長い歴史もあります ロボット工学、マシンが試行錯誤を通じて物理的なタスクを実行することを学ぶのに役立つ場合。
より最近では、強化学習は、大規模な言語モデル(LLM)の出力を導き、非常に有能なチャットボットプログラムを作成するために重要でした。同じ方法がAIモデルをトレーニングするためにも使用されています 人間の推論を模倣します そして構築する より有能なAIエージェント。
しかし、サットンは、LLMを導くために使用される方法は、独自の探求を通して純粋に学習するアルゴリズムではなく、目標を提供する人間が関与することを指摘しています。彼は、機械を自分で完全に学習させることは、最終的にはより実り多いかもしれないと言います。 「大きな部門はかどうかです [AI is] 人々から学ぶか、それがそれ自体の経験から学んでいるかどうか」と彼は言います。
BartoとSuttonの「過去数十年にわたってAIの進歩のリンチピンでした」 ジェフ・ディーンGoogleの上級副社長は、 コンピューティング機械協会 (ACM)毎年チューリング賞を配ります。 「彼らが開発したツールは、AIブームの中心的な柱のままであり、大きな進歩をもたらしました。」
強化には、AI内で長くチェッカーされた歴史があります。それはフィールドの夜明けにありました、いつ アランチューリング 彼の有名な1950年の論文で、マシンが経験とフィードバックを通して学ぶことができることを提案しました。コンピューティング機械とインテリジェンス、いつか機械が人間のように考えるかもしれないという概念を調べます。 AIの先駆者であるアーサー・サミュエルは、補強学習を使用して最初の機械学習プログラムの1つを構築しました。 チェッカーをプレイできるシステム、1955年。
#パイオニアオブレンス材学習学習者はチューリング賞を受賞しました