1721365667
2024-07-19 03:17:18
「オールイン」相手が高額ポーカーテーブルにチップの山を滑らせます。あなたは自分のカードに目を戻します。6のペアです。ゲームは テキサスホールデム残りは2人だけで、コミュニティカード(表向きのカード)はまだ配られていません。ポーカーでは、物事はこれより単純になることはめったになく、コール(相手の賭け金に同額を賭ける)かフォールド(降参)かの2択の決断を迫られます。しかし、プロのプレイヤーにとっては、あらゆる詳細を考慮する必要があります。オールインプッシュ前の賭けパターンはどのようなものだったか?誰が最初に行動したか?各プレイヤーが何枚のチップを持っていて、ポットに何枚入っているか?ブラインド、つまり強制ベットはいつ増加するか?そしてもちろん、6枚で勝つ可能性はどれくらいか?ポーカー戦略を研究し、暗記した。 確率 テーブルを並べて頭の中で数字を計算してみましょう。客観的に見てフォールドするのが最善の判断であることは明らかです。しかし、トーナメントが長引くにつれて、相手が凡庸なハンドでオーバーベットする傾向があることに気付きました。トレーニングどおりにフォールドしますか、それとも観察した弱点を突くために即座に戦略を調整しますか?
「ゲーム理論の最適プレイと搾取的プレイ」と呼ばれるものを使用するかどうかという問題は、 ハイレベルポーカーその数学的基礎は80年前に遡るが、AIの急速な進歩により、20世紀半ばの数学が現代のゲームの最前線に登場した。ポーカープレイヤーに教える新しいツール 最適な戦略 ゲームのためにそれを使用しているのに、なぜ使用を拒否するのでしょうか?
[Play science-inspired games, puzzles and quizzes in our new Games section]
科学ジャーナリズムを支援することについて
この記事をお楽しみいただけましたら、ぜひ当社の受賞歴のあるジャーナリズムをサポートしてください。 購読する定期購読を購入することで、今日の世界を形作る発見やアイデアに関する影響力のあるストーリーの未来を確実にすることに貢献することになります。
最適なプレイ?
ランダムに配られるカードと複雑な人間心理に基づくゲームでは、客観的に最適なプレイは直感に反するように思えるかもしれない。ブラフを考えてみよう。ブラフとは、相手を怖がらせてフォールドさせるために、負けない手札を持っているふりをすることである。自分の手札について嘘をつくことは本質的に心理的なものであり、厳格な客観性に反する。しかし、人間の行動を整然とした方程式に変える数学者の才能を決して過小評価すべきではない。
実際、数学者ジョン・フォン・ノイマンと経済学者オスカー・モルゲンシュテルンが1944年に出版した数学ゲーム理論の基礎となる本は、 ゲーム理論と経済行動は、ポーカーをその中心的な例として取り上げました。著者らは、ゲームを最も基本的な力学にまで絞り込んだ単純化された変種を分析しました。2人のプレーヤーがそれぞれ0から1までの数字を受け取り、数字が大きいほど強いハンドを表し、1ラウンドの賭けに参加します。フォン・ノイマンとモルゲンシュテルンは、最適な戦略が存在するだけでなく、その戦略にはブラフが不可欠な要素であることを証明しました。
もちろん、テキサスホールデムは、このおもちゃの例よりもはるかに複雑です。本格的なマルチプレイヤーポーカーに最適な戦略が存在すると誰が言えるでしょうか?それは、故数学者ジョン・ナッシュです。1950年代、ナッシュは1994年にノーベル経済学賞を受賞し、後に2001年の伝記映画で描かれました。 ビューティフル・マインド、 当時まだ初期段階にあったゲーム理論の分野を発展させました。彼の最も有名な発見は、現在ではナッシュ均衡と呼ばれていますが、これはゲームのどのプレイヤーも自分の選んだ戦略から逸脱しても利益を得られないというものです (他のプレイヤーが自分の戦略から逸脱しないと仮定した場合)。
ゲーム理論家 この条件は最適であると考えるべきです。なぜなら、あなたと私が、それぞれが古い戦略でゲームを始め、私があなたの行動を見て自分の戦略を調整し、あなたが私の変化に逆適応するといったことを繰り返していくと、最終的にはどちらも改善し続けることができない安定状態に到達するからです。ナッシュ均衡では、プレイヤーは事前に戦略を発表することさえできますが、それでも全員にとって最善の策は均衡を維持することです。 1ページの論文 1950年にジョン・ナッシュは 毎 麻雀からマジック:ザ・ギャザリングまで、有限の競争ゲームには少なくとも 1 つのナッシュ均衡が存在します。
ゲーム理論はその名前にもかかわらず、伝統的なゲームを超えて、経済システム、核抑止力、進化生物学など、幅広いトピックに適用されます。この分野の研究者にとって、ゲームとは、行動と利益が厳密に定義および分析できる合理的な意思決定者間のやり取りを指します。したがって、ナッシュの定理は広範囲にわたる影響を持っています。 ポーカーではかつては直感と手掛かりの読み取りに頼っていたと考えられていたゲームにおいて、最適な戦略を模索することが正当化されます。
AIポーカー革命
テキサス ホールデムにナッシュ均衡があることはわかっているが、それがどのようなものかを知っているわけではない。ゲームが複雑になるにつれ、最適な戦略を解明するのが難しくなる傾向がある。誰でも、いくつかの動きのシーケンスを記憶すれば、一回で完璧な三目並べのプレイ方法を学ぶことができる。チェッカーのような、完璧なプレイで常に引き分けになる複雑なゲームの場合、最適な戦略を実行するのに十分なバリエーションを人間が記憶することは決してできない。 科学者は無敵のアルゴリズムを開発した しかし、コンピュータは膨大な位置のデータベースを保存し、人間ではできない方法でゲームツリーを広範囲に検索できるため、最適なプレイができる。一方、チェスのコンピュータは、1997年頃から(世界チャンピオンのガルリ・カスパロフが 歴史的な試合 チェス コンピューターは、IBM の Deep Blue に匹敵するほどの性能を持っていますが、それでも最適なプレイは実現していません。次世代のチェス エンジンが今日のエンジンを圧倒するでしょう。
チェスと違ってポーカーは 不完全な情報プレイヤーは自分のカードは知っているが、対戦相手のカードは知らないため、ゲームを計算的にモデル化するのはより困難です。これが、ポーカーのアルゴリズム革命が最近のAIブームまで起こらなかった理由です。2015年にコンピューター科学者は アルゴリズムを発表した 2人のプレイヤーと制限された賭け金の制限されたバージョンのゲームでは、基本的に完璧なプレイを見せました。わずか4年後、私たちは マルチプレイヤー テキサス ホールデム向けの初の超人 AIその後、「ソルバー」と呼ばれる市販のソフトウェア ツールが次々と登場し、数年のうちに、数百ドルの余裕のあるすべてのラウンダー (ポーカーで生計を立てている人) は、ほぼあらゆる状況でどのようにプレイすればよいかを教えてくれるカード シャークをすぐに利用できるようになった。
「ポーカーは曖昧な芸術からハードサイエンスへと進化しました」と、元プロポーカープレイヤーのリヴ・ボエリーは言う。今日の環境で優位に立つために、上級プレイヤーは次のようなコンピュータプログラムを使ってゲームを研究している。 ピオソルバー、これは最適な戦略を近似する。単純で一般的な状況では、プロは機械の推奨を記憶するが、まれでより複雑な状況では、機械の行動からより高度な教訓を得る。エリートポーカープレイヤーにとって、これらのソルバーで勉強することは不可欠だ。「最高の相手とハイステークスでプレイしたいなら、絶対に…生きたまま食べられてしまうだろう」 [if you didn’t use solvers]「この概念を全面的に拒否し、ソルバーを使わなかったプレイヤーもいました…そして、ほとんどのプレイヤーは取り残されてしまいました。」と、ワールドシリーズオブポーカーのチャンピオンであるボーリーは言います。
AIはテキサスホールデムの戦略に関するいくつかの常識を裏付けるとともに、プレイヤーが間違っていたいくつかの格言を覆しました。例えば、コンピューターは「ドンクベッティングドンクベッティングは、単に前のラウンドで他のプレイヤーのベットをコールした後、ベッティングラウンドで最初のベットを開始することであり、 アマチュアの動きAI は、熟練した人間がフォールドしがちな状況でも、より多様なハンドをプレイします。チェス エンジンと同様に、マルチプレイヤー ポーカー ソルバーは文字通り最適なプレイをするわけではありませんが、人間を完全に圧倒しており、私たちは AI から多くのことを学ぶことができます。
勝つ方法
ナッシュ均衡を定義する際に、私は重要な詳細を隠しました。均衡は、どのプレイヤーも自分の選択した戦略から逸脱しても利益を得られないときに発生します(他のプレイヤーが自分の戦略から逸脱しないと仮定した場合)。他のプレイヤーが する しかし、それにもかかわらず逸脱する場合には、それに応じて逸脱することが賢明な場合が多いです。
じゃんけんを例に挙げてみましょう。そのナッシュ均衡は何でしょうか。ちょっと考えてみてください。どちらのプレイヤーも、逸脱する動機を残さないような戦略はどれでしょうか。答えは、プレイヤーがじゃんけんを完全にランダムに投げることです。前のすべてのラウンドに関係なく、それぞれ 3 分の 1 の確率で表に出ることになります。この戦略を事前に相手に伝えておけば、相手はあなたの率直さにつけこむことはできません。
あなたと相手が両方ともこの均衡戦略をとれば、決定的なラウンドの半分を勝つことが期待できます (同点の場合は無視)。ここで、相手が逸脱したとします。極端な場合、相手が常にパーを出すとします。均衡戦略に固執すると、勝つハサミと負ける石を同じ頻度で出すため、決定的なラウンドの半分を勝ちます。しかし、代わりに、常にハサミを出して毎ラウンド相手のパーを切ることで、相手の逸脱を利用することができます。それほど劇的ではない逸脱でも、利用する機会はあります。たとえば、 じゃんけんに関する実証研究 1 ラウンドで勝った場合、勝ったばかりの石を投げ直す可能性がわずかに高くなることが示されています。これを知ることで、優位に立つことができます。たとえば、石を投げて負けた場合は、相手が再び石を投げる可能性が高いため、次は紙を投げます。ナッシュ均衡は、悪用されない唯一の戦略です。
ポーカーでは、同じ力学がはるかに複雑な規模で展開されます。プレイヤーは AI の協力者からより最適なテクニックを学ぶにつれて、対戦相手が最適なプレイをしていないことを嗅ぎ分け、対戦相手を最も効果的に罰する方法も学びます。
ここに落とし穴があると思うかもしれません。相手が逸脱した場合、盲目的にナッシュ均衡に固執して潜在的な利益を逃すよりも、容赦なく相手を利用するのが最善の決定ではないでしょうか。相手がナッシュ均衡から予測可能な方法で逸脱していることがわかったら、相手の弱点を利用するために逸脱することでより多くの利益を得られる可能性があります。しかし、相手を利用するとすぐに、 あなたは 均衡から外れて開放される あなた自身 搾取にまで至ります。相手がいつも紙を投げているのに、あなたがハサミだけを投げ始めたら、やがて相手もそれに気づき、ハサミを振り回し始めます。
元ポーカーのプロ、イゴール・クルガノフはこう述べています。「対戦相手のミスに気付いたときはいつでも、相手がゲームについてどう考えているかというモデルを改善し、そのミスを考慮して対戦相手との対戦方法を調整し、それによって自分自身が利用されやすくなるのです。」
ポーカーのトップレベルで競争力を維持するには、ゲーム理論の最適プレイとエクスプロイトプレイを組み合わせなければならないとほとんどのプレイヤーは同意する。最適プレイはより防御的であり、エクスプロイトプレイはより攻撃的である。一部の教師は、トーナメントでは最適なプレイを真似ることから始め、相手の弱点を観察する時間ができた後にエクスプロイトプレイを散りばめるべきだと推奨している。戦略を切り替える柔軟性が、魚とサメを分ける。「このプロセス全体がうまくいくのは、自分が相手より賢いと確信しているほどだ。 [your opponent] 「ゲームについて、相手が自分と同じか、自分より優れていると感じると、搾取的な調整をあまり行わない」とクルガノフ氏は言う。
超人的なポーカーエンジンの登場によってポーカーの魅力が薄れたと考える人がいる一方で、コンピューターがゲームに新たな要素を加えたと主張する人もいる。2019年にプロポーカーから引退し、現在は科学コミュニケーター、慈善家、ポッドキャストのホストとして働いているボーリーは、どちらかというと前者の立場だ。「ゲームから魔法が少し失われたように感じました。『ああ、そうか、謎が解けた』みたいに」と彼女は言う。しかし、ボーリーは新時代のポーカーに熱狂者が不足していないことを認めている。「コロナ以降、ポーカーは活況を呈しています」と彼女は付け加える。「昨年、ワールドシリーズオブポーカーのプレイヤー数は過去最高を記録しました。記録が破られています。ですから、ポーカーが死滅したわけではないのは明らかです」。むしろ、ポーカーを取り巻く状況は依然として均衡を保っていると言えるだろう。
#ナッシュ均衡は最適なポーカー戦略です熟練プレイヤーは必ずしもそれを使用するわけではありません