1755471773
2025-08-16 15:50:00
人類があります 新しい機能を発表しました これにより、最新の最大のモデルのいくつかが、会社が「持続的に有害または虐待的なユーザーインタラクションのまれで極端なケース」と説明していることで会話を終了することができます。驚くべきことに、人類は、人間のユーザーを保護するためではなく、AIモデル自体を保護するためにこれを行っていると言います。
明確にするために、会社は、Claude AIモデルが知覚的であるか、ユーザーとの会話によって傷つくことができると主張していません。独自の言葉では、人類は「クロードや他のLLMの潜在的な道徳的状態について、現在または将来の潜在的な道徳的状態について非常に不確実なままです」。
ただし、その発表が指し示しています 「モデル福祉」と呼ばれるものを研究するために作成された最近のプログラム」と、人類は本質的にジャストインケースのアプローチを取っていると言います。「そのような福祉が可能な場合に備えて、福祉をモデル化するリスクを軽減するために低コストの介入を特定して実装するために取り組んでいます。」
この最新の変更は現在、Claude Opus 4および4.1に限定されています。繰り返しますが、「未成年者を含む性的コンテンツのユーザーからのリクエストや、大規模な暴力や恐怖の行為を可能にする情報を勧誘しようとする試み」など、「極端なエッジケース」で発生するはずです。
これらのタイプのリクエストは、人類自体の法的または宣伝の問題を潜在的に作成する可能性がありますが(目撃する最近の報告について ChatGptは、ユーザーの妄想的思考を強化または貢献する可能性があります)、同社は、展開前のテストでは、クロード・オプス4がこれらの要求に応答する「強い好み」と「見かけの苦痛のパターン」を示したと述べています。
これらの新しい会話終了機能に関しては、同社は次のように述べています。「すべての場合、クロードは、リダイレクトの複数の試みが失敗し、生産的な相互作用の希望が尽きた場合、またはユーザーがクロードに明示的にチャットを終了するように希望した場合にのみ、会話終了能力を最後の手段として使用することです」と述べています。
人類はまた、クロードは「ユーザーが自分自身や他の人を傷つけるという差し迫ったリスクにさらされている場合に、この能力を使用しないように指示されている」と述べています。
TechCrunchイベント
サンフランシスコ
|
2025年10月27〜29日
Claudeが会話を終了すると、人類はユーザーが同じアカウントから新しい会話を開始し、回答を編集して面倒な会話の新しいブランチを作成できると述べています。
「私たちはこの機能を継続的な実験として扱っており、アプローチを改善し続けます」と同社は言います。
#人類は一部のクロードモデルが有害または虐待的な会話を終わらせることができると言います