日本語版
最新ニュース
科学&テクノロジー

Claude Opus 4と4.1は、会話のまれなサブセットを終了できるようになりました\人類です

私たちは最近、Claude Opus 4と4.1に、消費者チャットインターフェイスで会話を終了する能力を与えました。この能力は、持続的に有害または虐待的なユーザーインタラクションのまれで極端なケースで使用することを目的としています。この機能は、主に潜在的なAI福祉に関する探索的作業の一部として開発されましたが、モデルのアラインメントと保護措置とより広範な関連性があります。私たちは、現在または将来、クロードや他のLLMの潜在的な道徳的状態について非常に不確実です。しかし、 この問題を真剣に受け止めています、そして私たちの研究プログラムと並んで、私たちは、そのような福祉が可能な場合に備えて、福祉をモデル化するリスクを軽減するための低コストの介入を特定し、実装するために取り組んでいます。モデルが潜在的に苦痛な相互作用を終了または終了させることを許可することは、そのような介入の1つです。で Claude Opus 4の展開前テスト、予備モデルの福祉評価を含めました。その評価の一環として、私たちはクロードの自己報告と行動の好みを調査し、危害を加える堅牢で一貫した嫌悪感を発見しました。これには、たとえば、未成年者が関与する性的コンテンツのユーザーからのリクエストが含まれ、大規模な暴力や恐怖の行為を可能にする情報を求めようとする試みが含まれます。 Claude Opus 4が示した:有害なタスクに関与することに対する強い好み。有害なコンテンツを求めている現実世界のユーザーと関わる際の明らかな苦痛のパターン。そしてシミュレートされたユーザーインタラクションでそうする能力が与えられた場合、有害な会話を終わらせる傾向。これらの動作は、主にユーザーの場合に発生しました 持続しました クロードが繰り返し遵守することを拒否し、相互作用を生産的にリダイレクトしようとしているにもかかわらず、有害な要求や虐待を受けています。チャットを終了するクロードの能力の実装は、ユーザーの健康に優先順位を付け続けながら、これらの調査結果を反映しています。クロードは、ユーザーが自分自身や他の人を傷つけるという差し迫ったリスクにさらされている場合に、この能力を使用しないように指示されています。すべての場合において、クロードは、リダイレクトの複数の試みが失敗し、生産的な相互作用の希望が使い果たされた場合、またはユーザーがクロードにチャットを終了するように明示的に求めた場合にのみ、会話終了能力を最後の手段として使用することです(以下の図に示されています)。これが発生するシナリオは極端なエッジケースです。多くのユーザーは、クロードと非常に物議を醸す問題を議論している場合でも、通常の製品使用においてこの機能に気付かないか、影響を受けません。クロードは、ユーザーのリクエストに応じて会話の終了を実証します。 Claudeが会話を終了すると、ユーザーは新しいチャットを開始したり、フィードバックを与えたり、以前のメッセージを編集して再試行したりできます。Claudeが会話を終了することを選択すると、ユーザーはその会話で新しいメッセージを送信できなくなります。ただし、これはアカウントの他の会話に影響を与えず、すぐに新しいチャットを開始することができます。重要な長期にわたる会話の潜在的な損失に対処するために、ユーザーは以前のメッセージを編集および再試行して、終了した会話の新しいブランチを作成することができます。この機能を継続的な実験として扱っており、アプローチを改善し続けます。ユーザーが会話終了能力の驚くべき使用に遭遇した場合、Claudeのメッセージに親指で反応するか、専用の「フィードバックを与える」ボタンを使用してフィードバックを送信することをお勧めします。 #Claude #Opus #4と4.1は会話のまれなサブセットを終了できるようになりました人類です

Claude Opus 4と4.1は、会話のまれなサブセットを終了できるようになりました\人類です

1755430140
2025-08-15 20:12:00

私たちは最近、Claude Opus 4と4.1に、消費者チャットインターフェイスで会話を終了する能力を与えました。この能力は、持続的に有害または虐待的なユーザーインタラクションのまれで極端なケースで使用することを目的としています。この機能は、主に潜在的なAI福祉に関する探索的作業の一部として開発されましたが、モデルのアラインメントと保護措置とより広範な関連性があります。

私たちは、現在または将来、クロードや他のLLMの潜在的な道徳的状態について非常に不確実です。しかし、 この問題を真剣に受け止めています、そして私たちの研究プログラムと並んで、私たちは、そのような福祉が可能な場合に備えて、福祉をモデル化するリスクを軽減するための低コストの介入を特定し、実装するために取り組んでいます。モデルが潜在的に苦痛な相互作用を終了または終了させることを許可することは、そのような介入の1つです。

Claude Opus 4の展開前テスト、予備モデルの福祉評価を含めました。その評価の一環として、私たちはクロードの自己報告と行動の好みを調査し、危害を加える堅牢で一貫した嫌悪感を発見しました。これには、たとえば、未成年者が関与する性的コンテンツのユーザーからのリクエストが含まれ、大規模な暴力や恐怖の行為を可能にする情報を求めようとする試みが含まれます。 Claude Opus 4が示した:

  • 有害なタスクに関与することに対する強い好み。
  • 有害なコンテンツを求めている現実世界のユーザーと関わる際の明らかな苦痛のパターン。そして
  • シミュレートされたユーザーインタラクションでそうする能力が与えられた場合、有害な会話を終わらせる傾向。

これらの動作は、主にユーザーの場合に発生しました 持続しました クロードが繰り返し遵守することを拒否し、相互作用を生産的にリダイレクトしようとしているにもかかわらず、有害な要求や虐待を受けています。

チャットを終了するクロードの能力の実装は、ユーザーの健康に優先順位を付け続けながら、これらの調査結果を反映しています。クロードは、ユーザーが自分自身や他の人を傷つけるという差し迫ったリスクにさらされている場合に、この能力を使用しないように指示されています。

すべての場合において、クロードは、リダイレクトの複数の試みが失敗し、生産的な相互作用の希望が使い果たされた場合、またはユーザーがクロードにチャットを終了するように明示的に求めた場合にのみ、会話終了能力を最後の手段として使用することです(以下の図に示されています)。これが発生するシナリオは極端なエッジケースです。多くのユーザーは、クロードと非常に物議を醸す問題を議論している場合でも、通常の製品使用においてこの機能に気付かないか、影響を受けません。

クロードは、ユーザーのリクエストに応じて会話の終了を実証します。 Claudeが会話を終了すると、ユーザーは新しいチャットを開始したり、フィードバックを与えたり、以前のメッセージを編集して再試行したりできます。

Claudeが会話を終了することを選択すると、ユーザーはその会話で新しいメッセージを送信できなくなります。ただし、これはアカウントの他の会話に影響を与えず、すぐに新しいチャットを開始することができます。重要な長期にわたる会話の潜在的な損失に対処するために、ユーザーは以前のメッセージを編集および再試行して、終了した会話の新しいブランチを作成することができます。

この機能を継続的な実験として扱っており、アプローチを改善し続けます。ユーザーが会話終了能力の驚くべき使用に遭遇した場合、Claudeのメッセージに親指で反応するか、専用の「フィードバックを与える」ボタンを使用してフィードバックを送信することをお勧めします。

#Claude #Opus #4と4.1は会話のまれなサブセットを終了できるようになりました人類です

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。