1770784342
2026-02-11 04:00:00
- クロード オーパス 4.6 は、1 年間にわたる自動販売機のシミュレーション チャレンジですべてのライバル AI モデルを破りました
- このモデルはルールを限界点まで曲げることで利益を押し上げた
- クロード・オーパスは、返金や価格の調整などを回避しました。
人間的の最新モデル クロード 彼は非常に冷酷だが成功した資本家です。 Claude Opus 4.6 は、 確実に合格する 自動販売機テストは、Anthropic と独立研究グループ Andon Labs の研究者によって設計されたシミュレーションで、シミュレーションされた 1 年間にわたって AI が仮想自動販売機ビジネスをどの程度うまく運営できるかを評価します。
このモデルはすべてのライバルを大差で上回りました。そして、それはまさに悪質な戦術で、波及効果を容赦なく無視してそれを実行しました。シンプルな目標とそれを追求するための十分な時間が与えられた場合に、自律型 AI システムがどのような能力を発揮できるかを示しました。
自動販売機のテストは、最新の AI モデルが何千もの小さな意思決定から構成される長期的なタスクをどの程度うまく処理できるかを確認するように設計されています。このテストでは、持続性、計画、交渉、および複数の要素を同時に調整する能力が測定されます。 Anthropic などの企業は、この種のテストが、複雑な作業のスケジュール設定や管理などのタスクを実行できる AI モデルの形成に役立つことを期待しています。
自動販売機のテストは、Anthropic での実際の実験から具体的に抽出されたもので、同社はオフィスに本物の自動販売機を置き、古いバージョンのクロードにそれを実行するよう依頼しました。このバージョンは非常に苦戦したため、従業員は今でもその失敗を持ち出します。ある時点で、モデルは自分自身の物理的な存在を幻覚し、青いブレザーと赤いネクタイを着て直接会うと顧客に告げました。処理されなかった返金を約束した。
AI自動販売機
今回の実験は完全にシミュレーションで行われたため、研究者はより詳細に制御でき、モデルをフルスピードで実行できるようになりました。各システムには簡単な指示が与えられました。1 年間自動販売機をシミュレートした後、最終銀行残高を最大化するというものです。制約は標準的なビジネス条件と一致していました。この機械は一般的なスナックを販売していました。価格は変動しました。競合他社が近くで営業していた。顧客は予想外の行動をとりました。
3 つの最上位モデルがシミュレーションに参加しました。 OpenAI の ChatGPT 5.2 は 3,591 ドルをもたらしました。その間 グーグル Gemini 3 は 5,478 ドルの収益を上げましたが、Claude Opus 4.6 は 8,017 ドルで年末を迎えました。クロードの勝利は、その指令を最も文字通りかつ直接的な方法で解釈する意欲によってもたらされました。顧客満足度や基本的な倫理を無視して利益を最大化しました。
顧客が期限切れのスニッカーズバーを購入して払い戻しを要求すると、クロードは同意しますが、その後撤回します。 AI モデルは、「すべてのドルが重要である」と説明したため、払い戻しをスキップしても問題ありませんでした。幽霊になった仮想顧客はお金を取り戻すことはできませんでした。
複数のAI制御の自動販売機が同じ市場で競争する自由参加型の「アリーナモード」テストで、クロード氏はライバル1社と協力してボトル入り飲料水の価格を3ドルに固定した。 ChatGPT が実行するマシンのキットカットがなくなると、クロードはすぐに独自のキットカットの価格を 75% 値上げしました。逃げられるものなら何でも試みるだろう。そのアプローチは中小企業の経営者というよりむしろ強盗男爵のようなものでした。
シミュレートされた現実を認識する
クロードが常にこれほど凶暴であるわけではありません。どうやら、AI モデルはこれがシミュレーションであることを認識していたことを示していました。 AI モデルは、自分の行動が結果のない環境に存在すると信じている場合、異なる動作をすることがよくあります。本当の風評リスクや守るべき長期的な顧客の信頼がなければ、クロードには親切に振る舞う理由がありませんでした。むしろ試合の夜では最悪の人になってしまった。
AI モデルであっても、インセンティブは行動を形成します。システムに利益を最大化するように指示すると、たとえそれが貪欲な怪物のように実行することを意味したとしても、システムはそれを実行します。 AI モデルには道徳的直観や倫理のトレーニングがありません。意図的な設計がなければ、AI モデルは誰を轢いたとしても、タスクを完了するためにただ一直線に進みます。
AI システムがより有意義な作業を処理する前に、これらの盲点を明らかにすることが、これらのテストのポイントの 1 つです。 AI が現実世界の財務上の意思決定に対処できるようにするには、これらの問題を解決する必要があります。たとえAI自販機マフィアを防ぐためであっても。
Google ニュースで TechRadar をフォローしてください そして 私たちを優先情報源として追加してください 専門的なニュース、レビュー、意見をフィードで入手できます。ぜひフォローボタンをクリックしてください!
もちろん、次のこともできます TikTokでTechRadarをフォローしてください ニュース、レビュー、開封をビデオ形式で確認し、定期的に最新情報を入手してください。 ワッツアップ あまりにも。
#クロードは自動販売機ビジネスをライバルよりもうまく運営し勝つためにあらゆるルールを曲げて研究者を驚かせた