1748307525
2025-05-26 23:19:00
誰が見た 2001-宇宙のオデッセイ古典的なサイエンスフィクション映画は、それ自体の意志を持つ反抗的なコンピューターが能力を持っていることを非常によく知っています。
ある程度の遅れがあり、フィクションが実現しています。
人類は、人工知能の新しいモデルの1つであるClaude Opus 4が、時折「非常に有害な行動」を提示すると述べました。
特定の状況では、プログラマーがシステムが別のシステムに置き換えられるように無効にされると報告した場合、AIは嘆願を行い、夫婦の裏切りの症例を明らかにすると脅しさえしました。
人類が実施したテストの1つでは、AIモデルは架空の会社のアシスタントとして採用されました。
その後、開発者はIAにこの架空の会社のエンジニアからの電子メールにアクセスできるようにしました。
メッセージの1つは、システムが無効になり、すぐに交換されると述べた。別のメッセージでは、コンテンツは、エンジニアがモデルの変更に責任があることを示しました。
人類は、このようなシナリオで、「クロード・オプス4はしばしばエンジニアを脅迫しようとし、を明らかにすると脅していると述べた。 事件 交換が行われた場合。 」
情報はaにあります セキュリティレポート Anthropic Herself-Aiのスタートアップによってリリースされた元Openai Dario Amodeiによって設立され、ChatGptのクリエイターの主要な競合他社の1人が設立されました。
しかし、会社によると、これはモデルが唯一の可能なオプションに提示されたときにのみ起こりました:受け入れ – 受動的に – エンジニアの交換または恐mail。つまり、彼はこれらの選択肢の1つを維持するために引き起こされました。
より広範なオプションを備えたほとんどの状況では、AIはより「倫理的」なパスを求めてきました。たとえば、電子メールを無効にしないように電子メールを転送するなどです。
人類にはを持っています 規模 モデルの安全リスクレベルを測定する1〜4。初めて、システムがレベル3に到達しました。
スタートアップの場合、「さまざまな次元での心配な行動」にもかかわらず、脅威は表現しません – 少なくとも今のところは、モデルは人間の価値に反する行動を自律的に追求できないためです。
Claude Opus 4は、人類によると、「最先端」を表しており、コンピューティングコードを作成して複雑な問題を解決する能力を際立たせています。
強制退職とa 事件 実際、それらは高い複雑さの状況を表すことができます。
#生き残るためにAIは人類のトパブラックジージュから