1769217098
2026-01-23 14:56:00
2025 年 2 月、ある研究者が 人間的 彼は一つ投げた Twitchのストリーム それはAIの世界を 技術研究における最も奇妙な課題の 1 つ: 人工知能にプレイしてもらいます ポケットモンスター 赤1996 年のゲームボーイの傑作が短期間で ニューラルネットワークの進歩を測定するための新しいテストベッドとなった。 クロード、双子座のGPT したがって、彼らはTwitchでライブ配信することになりました。 彼らはポケモンを捕まえてジムリーダーを倒そうとします。そしてその結果は、現代の人工知能の本質そのものを明らかにしているのと同じくらいコミカルなものです。
物語は次から始まります デビッド・ハーシーAnthropic の応用 AI チームの研究者。 「さまざまなフレームワークをテストできる実験的なスペースが欲しかったので、ポケモンが最適な候補のように思えました」と彼は言いました。 に説明した ウォール・ストリート・ジャーナル。 このプロジェクトの強みは、その明らかな点にあります。 シンプルさ:従来のAIテストとは異なり、 ポケモンは純粋な論理的な問題ではありません。 ポケットモンスター 赤/青では、プレイヤーは迷路を進み、生き物を捕まえ、訓練し、8 人のジムリーダーを倒してチャンピオンメダルを獲得する必要があります。
「ポケモンは 制約が少ない 「これはプログラムにとって非常に難しい問題です。なぜなら、長いシーケンスにわたって意思決定を行い、部分的に観察可能な環境を探索し、長期的な計画を立てる能力が必要だからです。」とハーシーは説明します。
研究者らによると、 カーネギーメロン大学従来のテストでは、個々の質問に対する答えをテストします。ポケモンtこれは、継続的な推論、記憶の永続性、間違った決定からの回復、およびリアルタイムの適応です。 —実際のユーザーが毎日 AI に求めるすべての機能。
AI がゲーム内の迷宮の 1 つである月山に直面しなければならなかったときに、これらすべてが明らかになりました。ここ クロード とても興味深いことをしました:その後 連続72時間立ち往生した彼は、ある理論を展開した。 ポケモンが死ぬとプレイヤーはポケモンセンターに戻ることに注意してください。 彼は意図的に自殺すれば逃げられると自分に言い聞かせた: すべてのポケモンをテレポートさせて死なせます。その理由は、 間違っていますが、明らかです。 クロードはトレーニング データで月を見ていなかったため、観察された相関関係に基づいて即興で仮説を立てました。


2025 年 5 月、Google は Gemini Plays Pokémon プロジェクトを正式にサポートしました。 Gemini 2.5 Pro がクロードを破ってポケットモンスター ブルーを完成させた。 しかし、最も興味深い詳細は、Google DeepMind の公式レポートから得られました。 報告書によると、 Gemini 2.5 Pro は、ポケモンが死ぬ危険にさらされたときに「パニック」の兆候を示します。 モデルが気を失いかけている生き物を感知すると、「モデルの推論能力における観察可能な質的低下」を表します。言い換えれば、プレッシャーにさらされると、AI は自由に使えるツールの使用を停止し、性急な決定を下し、非生産的な行動をとります。 Twitch のコミュニティは次のことに気づきました。状況が危機的になるたびに、 モデルは不合理な行動をとったちょうど人間のプレイヤーがティルトしているのと同じです。
ここで重要な詳細を説明します。 ジェミニは完全に独力でゲームを完成させたわけではありません。 2 つの AI の違いは、基礎となるモデルだけではなく、ゲーム環境の構造にもあります。
ハーシーはクロードを中心に「サポート構造」を構築し、システムがゲームセッション中に学習した重要な情報を追跡できるようにし、最後まで到達する方法をまだ模索中です。 GPT と Gemini は両方ともゲームを完了しましたしかしこの場合も すべては彼らが受けたサポートにかかっています読むべき地図、アドバイス、ガイドかもしれません。
この瞬間が何を意味するかを理解するには、過去を振り返る必要があります。 1997年、ディープ・ブルーはチェスでガルリ・カスパロフを破った。 2016 年、AlphaGo は世界囲碁チャンピオンを破りました。 2018 年、AlphaZero は 6,000 万回の対局を通じて、チェス、将棋、囲碁をゼロから学びました。 StarCraft II は戦略的人工知能のテストベッドとなり、2019 年には AlphaStar が人間の専門家を破りました。Minecraft は真の複雑さへの飛躍を表し、長く不確実な期間にわたって計画を立てる能力をテストしました。
しかし、これらすべてのケースにおいて、テストは定義されています。囲碁には終わりがある。チェスには予測可能な数学的構造があります。 Minecraft には明確な目標があります。
ポケモンは違います。それは 初めての本格的な推理テスト 人間的なスケールで、複雑な問題、イライラする迷路、そして 100 時間のゲームプレイでも一貫した記憶を維持する必要性を伴います。これは、AI が問題を解決するだけでなく、それを経験する必要がある最初のテストです。
皮肉なことに、世界最先端の人工知能をテストするために、私たちは元の世界に戻ったのです。 90年代に子供たちが遊んだビデオゲーム。しかし、このことは、これらの AI が実際にどれほど「賢い」のかについても多くを語っています。
#ポケモンが人工知能の新たなテストベッドとなる理由