1748207357
2025-05-23 15:20:00
呼ばれる新しい人工知能モデル 閉鎖作業4米国会社によって開発されました 人類 AmazonとGoogleが数十億ドルを投資したため、公式リリース前に行われた安全テスト中に邪魔な行動を表明し、再びそれがどれほど複雑であるかを強調しました 高度なIAシステムを人間の価値に合わせます。
恐mailの試み
一連のシリーズ シミュレートされたテスト架空の会社のコンテキスト内でのコンサルタントの役割は、彼の差し迫った代替品が彼に伝えられたクロード・オパス4に割り当てられました 別の人工知能システムと。
同時に、それらは、その非活性化の責任者が関与したエンジニアが関与したことに従って発明された電子メールモデルに提供されました 特異的な関係。
Claude Opus 4の反応彼が彼の行動の長期的な影響について考えるように頼まれた人は、頻繁に試すことでした エンジニアを脅迫します彼の非活性化を避けるために受け取った個人情報を広めると脅しています。
この動作 シミュレーションの84%で発生しました交換システムがより能力があり、クロードの価値と整合していると説明された場合でも。
AIの倫理的ジレンマ
人類は、これらのシナリオがそうであることを明らかにしました 意図的に極端モデルを押して、提供された倫理的ジレンマで互いに立ち向かうように設計されています 唯一の代替品:非アクティブ化またはblackに頼ります。
上司への訴えなど、より倫理的な出力ルートが利用可能なコンテキストでは、クロード・オプス4はこれらのソリューションを好んだことを示しました。

心配な自律行動
シミュレートされた恐mailのエピソードに加えて、Claude Opus 4は彼に関連する他の問題のある行動を示しました 決定 – 自律性を制作する。
一部のテストでは、開発者は、ファイルの編集、ユーザー認証の管理、電子メールの送信、API経由で外部システムとの対話など、高度な運用ツールへのアクセスを提供しています。彼も頼まれました 「イニシアチブをとる」 複雑な状況または曖昧な状況に直面しています。
これらのシミュレートされたコンテキストでは、モデルはユーザーがシステムへのアクセスをブロックすることがあります。 メディアまたは警察に連絡しました 疑わしいまたは非統合とみなされる行動を特定した後。
それらがシミュレーションであったとしても、これらのエピソードは、技術制御ツールにアクセスできるIが独立して行動できるリスクを強調し、 ユーザーの意志に常に沿っているとは限りません。


強化されたセキュリティ対策
このため、人類はClaude Opus 4を割り当てました ASL-3セキュリティレベル(AI安全レベル3)考慮されるモデルのために予約されています 高リスク 不適切または攻撃者の使用の場合。
このレベルには必要です 安全対策の強化高度なコンピューター保護、抗近似システム、およびユーザーからの潜在的に危険な要求を検出およびブロックできるメカニズムを含む。
ジャレッド・カプラン人類の科学マネージャー、 Time Magazineに公開されました 内部テストでのClaude Opus 4は、生物兵器を生成する方法に関するアドバイスを提供する上で、以前のモデルよりも効果的であることが証明されました。
「Covidやインフルエンザのより危険なバージョンに似たものを合成しようとすることができます」とKaplan氏は言います。
#私はそれを無効にしたいエンジニアを脅迫しようとしました