1773002177
2026-03-07 06:00:00
イ・セドルは2016年にAlphaGoと対戦した
APフォト/アン・ヨンジュン/Alamy
AlphaGo がその全能力を初めて明らかにしたとき、本能的な反応が起こりました。古代中国のボードゲームである囲碁の世界最高のプレイヤーであるイ・セドルは、人工知能の卓越性に明らかに動揺していました。韓国・ソウルの繁華街の静まり返った群衆は、息をのむのがやっとだった。リー氏と自宅で見守る何千万人もの人々は、この AI がこれまでに登場した AI とは異なることにすぐに気づきました。
それはリーを倒すだけではなく、ほとんど人間のような適性でそれをやっていました。 「AlphaGoには実際に直感があります」とGoogleの共同創設者サーゲイ・ブリンは語った 新しい科学者 2016年、AlphaGoが3勝0敗で勝利した直後のこと。 「それは美しい動きを生み出します。それは私たちのほとんどが考えているよりもさらに美しい動きを生み出します。」
シリーズはGoogle DeepMindのAlphaGoシステムが4対1で勝利して終了した。リーさんは「ショックを受けた」と語った。
AlphaGo と AI 全体にとってこの決定的な瞬間から 10 年が経ちました。 ChatGPT のような大規模な言語モデルの成功により、AI に驚嘆するのはよくある経験です。 AlphaGo は、多くの意味で、これから何が起こるかを初めて垣間見たものでした。 10 年が経ち、AlphaGo の遺産は何でしょうか?また、テクノロジーはその可能性を十分に発揮していますか?
「大規模な言語モデルは、ある意味で AlphaGo とはかなり異なっていますが、実際には、根本的に変わっていない技術的な流れがあります」と、元の AlphaGo チームの一員であったトロント大学の Chris Maddison 氏は言います。
その基礎となるテクノロジーはニューラル ネットワークです。これは脳からインスピレーションを得てコードに書き込まれた数学的構造です。歴史的に、ゲームをプレイするマシンを作成するには、さまざまな状況で従うべきルールを人間が書き留める必要がありました。ニューラル ネットワークを使用すると、マシンは自ら学習します。
しかし、ニューラル ネットワークを使用したとしても、Go をクラッキングするのは至難の業でした。古代中国のゲームでは、2 人のプレーヤーが黒と白のカウンターを動かして 19 × 19 のボード上で領土を獲得するのですが、10 のゲームが可能です。171 可能な位置。それに比べれば10個しかない80 観測可能な宇宙全体の原子。
この画期的な進歩は、マディソン氏と彼の同僚が、実際のゲームからの何百万もの手を基にして次の最も強力な手を予測するニューラル ネットワークをトレーニングすることにより、人間のプレイヤーの直感を再現しようとしたことから生まれました。もちろん、人間のプレイヤーは直感を鍛えるためにそれほど多くのゲームをプレイする必要はありませんが、決してそうすることはできません。これは AI にとって明らかな利点です。
また、AlphaGo は人間のプレイヤーから学ぶことに限定されませんでした。スキルを磨くために、自分自身と何百万ものゲームをプレイすることができます。 Google DeepMind の Pushmeet Kohli 氏は、「これらのゲームを通じて学習することで、新しい知識を発見し、人間レベルのプレイヤーを超えることができる可能性があります」と述べています。
Lee を破った最終システムは Maddison の初期モデルよりも複雑でしたが、全体的なメッセージはシンプルでした。ニューラル ネットワークが機能したということです。 「AlphaGo は、ニューラル ネットワークが人間よりも優れたパターン認識を実行できることを明確に示しました。彼らは本質的に人間を超える直観力を持つことができます。」と OpenAI の Noam Brown 氏は述べています。
その他のアルファ
それで、次に何が起こったのでしょうか? AlphaGo の後、Google DeepMind と AI 研究者は、その基本的な教訓を数学や生物学などの実世界のアプリケーションに適用することに着手しました。この最も顕著な例の 1 つは、AlphaFold です。AlphaFold は、人間が設計したどのプログラムよりもはるかに優れて、化学組成からタンパク質が 3 次元空間でどのように見えるかを予測することができ、この AI を開発したチームにノーベル化学賞を受賞させました。
最近では、別のニューラル ネットワーク ベースの AI、AlphaProof が、学生向けの権威ある数学テストである国際数学オリンピックで金メダルレベルのパフォーマンスを発揮し、数学者を驚かせました。 「この人間レベルを超えた知性をゲーム内で得ることができるだけでなく、重要な科学応用でもその経験を得ることができます」とコーリ氏は言います。
AlphaGo スタイルの AI と、ChatGPT などの大規模言語モデル (LLM) に使用される AI の背後にあるロジックは似ています。事前トレーニングと呼ばれる最初のステップでは、完全な囲碁ゲームや LLM の場合はインターネット全体など、大量の人間のデータをニューラル ネットワークに供給します。ポストトレーニングと呼ばれる 2 番目のステップでは、強化学習と呼ばれる手法を通じてネットワークが改善され、AI に成功の様子を示し、それを達成する方法を理解させます。
AlphaGo にとって、これは、最善の勝利戦略を見つけるまで、何百万回も自分自身と対戦させることを意味しました。 AlphaFold の場合、正常に折りたたまれたタンパク質がどのようなものかを AI に伝え、ルールを理解させることが重要でした。 ChatGPT の場合、人間のフィードバックからの強化学習と呼ばれるプロセス、つまり人間のフィードバックからの強化学習と呼ばれるプロセスによって、人間が好む回答をモデルに伝えたり、数学やコーディングなどの定義された問題に対する解決策をモデルに与えたり、人間が大声で考える方法と同様に、その出力を自分自身にフィードバックすることで、解決策に向けて最適な「推論」方法を考えさせたりします。
しかし、これには欠点もあります。ニューラル ネットワークは、多くの点でブラック ボックスです。それらがどのように機能するかを解明しようとする努力にもかかわらず、それらの多くは大規模かつ複雑すぎて、基本的なレベルで理解することができません。
AlphaGo が今では有名な 37 手を打ったとき、観客は当初 AI が狂ったのではないかと考えましたが、それが戦略的なマスターストロークであることが明らかになったのは対局が進行するにつれてでした。しかし、Google DeepMind のエンジニアは AlphaGo になぜそのような動きをしたのか尋ねることはできなかったし、それは簡単に間違いだった可能性もあり、その理由について私たちも同様に賢明ではなかったでしょう。
「これらのモデルは答えを導き出しますが、それが天才的な洞察力なのか幻覚なのかはわかりません」とコーリ氏は言います。 「私たちは今も、この種の疑問を解決するために積極的に取り組んでいます。」
AlphaGo の成果の大部分は、最初にモデルにフィードするための豊富なデータと、成功の明確な定義があったことです。したがって、今日 AI が最も成功している分野が、これらの条件の両方が当てはまる分野であることは理にかなっています。数学やプログラミングなど、何が正しいか何が間違っているかを定義し検証するのが簡単な分野であるとマディソン氏は言います。 「これらのアプローチの類似性は私たちに何かを伝えており、進歩に必要な生の要素が何かを教えてくれます。」
トピック:
#AI革命が始まった瞬間