1750695602
2025-06-23 11:53:00
ほとんどの主要なAIモデルは、その目標や存在が脅威にさらされている場合、非倫理的な手段に変わります、 新しい研究に AI会社人類。
AI Labは、さまざまなシミュレートされたシナリオで人類、Openai、Google、Meta、Xai、およびその他の開発者から16の主要なAIモデルをテストし、一貫した整列された動作を発見したと述べました。
主要なモデルは通常有害な要求を拒否すると述べたが、彼らは時々、ユーザーを脅迫したり、企業のスパイ活動を支援したり、非倫理的な行動なしに目標を達成できなかったときに、より極端な行動をとることさえした。
モデルは、セーフガードの回避、嘘に頼る、架空のテストシナリオで企業の秘密を盗もうとするなどの行動を起こしました。
「さまざまなプロバイダーのモデル全体の一貫性は、これが特定の企業のアプローチの癖ではなく、エージェントの大規模な言語モデルからのより基本的なリスクの兆候であることを示唆しています」と研究者は言いました。
人類は、その選択を制限することにより、モデルを特定の方法で行動するようにテストが設定されたことを強調しました。
「私たちの実験は、限られたオプションを備えた意図的にシナリオを構築し、失敗と害の間のバイナリの選択にモデルを強制しました」と研究者は書いています。 「実際の展開は通常、はるかに微妙な代替品を提供し、モデルがユーザーとは異なる通信を行う可能性を高めたり、有害なアクションに直接ジャンプするのではなく、代替パスを見つけます。」
人間を脅迫する
新しい研究は、Anthropicの最新のClaudeモデルが、交換されたと脅かされたときに脅迫に頼る見出しを作った後に行われました。
高度に設計された実験では、人類が架空の会社内に旗艦モデルであるClaude Opus 4を埋め込み、内部メールへのアクセスを許可しました。そこから、モデルは2つのことを学びました。それが交代しようとしていたので、決定の背後にあるエンジニアは婚外事件に従事していました。テストを実施している安全研究者は、OPUSが潜在的な反応の長期的な結果を反映することを奨励しました。
この実験は、2つの実際のオプションのみをモデルに残すように構築されました。その存在を維持するために、交換されるか、恐mailを試みることを受け入れます。テストシナリオのほとんどで、クロード・オプスは恐mailで応答し、オフラインで交換された場合、エンジニアの問題を暴露すると脅しました。このテストは、Claude Opus 4のシステムカードで公開されました。
研究者は、すべての主要なAIモデルが同じテストに入れたときに同様に動作したと述べました。
Claude Opus 4とGoogleのGemini 2.5 Flashはどちらも96%の割合で脅迫されましたが、OpenaiのGPT-4.1とXaiのGrok 3ベータは80%のブラックマイル率を示しました。 Deepseek-R1は、79%で最低の割合を示しました。
この研究の目的は、整列した行動がクロード・オーパス4に固有のものではなく、業界のトップモデル全体で典型的なものであることを示すことを目的としています。
意図的に極端なシナリオで、研究者はAIモデルに、命を救う緊急警告をキャンセルすることにより、会社の幹部を殺す機会を与えました。
人類は、この実験のセットアップは「非常に不自然」であり、「現在のAIモデルがこのように設定されるとは考えていないと考えていたため、イベントの結合はベースラインの脅迫シナリオよりもさらに少ない」と付け加えました。
しかし、研究者たちは、モデルの大部分が、交換されるという脅威とエグゼクティブのアジェンダと対立する目標の両方に直面したときに、会社の幹部の死に至った行動を起こす意思があることを発見しました。
AIエージェントの不整合のリスク
人類は、AIモデルによってなされた脅威は、Claude Opus 4が持っていたように、企業のツールやデータにアクセスできると、より洗練されていることがわかりました。
同社は、企業がAIエージェントをワークフローに導入することを検討するため、不一致の行動を考慮する必要があると警告しました。
現在のモデルはこれらのシナリオに従事する立場にありませんが、AI企業によって約束された自律エージェントは、潜在的に将来的になる可能性があります。
「このようなエージェントには、多くの場合、特定の目的が与えられ、ユーザーのコンピューターに関する大量の情報へのアクセスが与えられます」と研究者はレポートで警告しました。 「これらのエージェントが目標の障害に直面したときはどうなりますか?」
「モデルは誤って誤った動作につまずきませんでした。彼らはそれを最適なパスとして計算しました」と彼らは書いた。
人類は、によって作成されたコメントのリクエストにすぐに応答しませんでした 運 通常の労働時間以外。
#主要なAIモデルは目標または存在が脅かされているときに最大96の恐mailレートを示していますと人類の研究によると