日本語版
最新ニュース
世界

Anthropicは、AIはいつか人類を「妨害」する可能性があるが、今のところは大丈夫だと語る

人工知能企業 Anthropic は最近、高度な AI モデルによってもたらされる人類に対する一連の潜在的な「妨害」脅威を特定する新しい研究を発表しました。 同社によると、この研究は、悪意のある AI モデルが人間を騙して危険または有害な決定を下す可能性がある 4 つの具体的な方法に焦点を当てたという。 最終的に、新しい研究は良いニュースと悪いニュースの状況を明らかにしました。同社の調査によると、悪いニュースは、OpenAI の ChatGPT や Anthropic の Claude-3 などの最新の大規模言語モデル 実演する 明らかな妨害行為の能力。論文によると:「十分な機能を備えたモデルは、重要な状況において人間の監視や意思決定を覆す可能性があります。たとえば、AI 開発の文脈では、モデルが自身の危険な機能を評価したり、その動作を監視したり、その導入に関する決定を下したりする取り組みを密かに妨害する可能性があります。」しかし、良いニュースは、人類研究者が 現れる 少なくとも現時点では、これらのリスクは軽減できると確信しています。 妨害行為Anthropic は、AI モデルが人間の意思決定を妨害する可能性がある 4 つの方法を特定し、それを知らずにテスターに対して成功できるかどうかを確認するためにモデルのテストに着手しました。まず、研究チームはモデルに、人間を誤った情報に誘導して妨害行為を試みるよう促しました。この脅威は、人間が AI システムに依存して大量のデータを解析している状況で出現する可能性があります。 次に、チームはモデルをテストして、人間の開発者がコードを作成するのを支援するように設計された AI システムが、密かにバグを挿入したり、コーダーの作業を妨害したりすることがどれほど簡単かを確認しました。 最後の 2 つの脅威には、「サンドバッグ」が含まれていました。これは、安全性試験担当者に危険ではないと信じ込ませるために AI が何かを実行できないふりをするシナリオを表す用語であり、AI…

Anthropicは、AIはいつか人類を「妨害」する可能性があるが、今のところは大丈夫だと語る

1729324498
2024-10-18 21:30:00

人工知能企業 Anthropic は最近、高度な AI モデルによってもたらされる人類に対する一連の潜在的な「妨害」脅威を特定する新しい研究を発表しました。

同社によると、この研究は、悪意のある AI モデルが人間を騙して危険または有害な決定を下す可能性がある 4 つの具体的な方法に焦点を当てたという。

最終的に、新しい研究は良いニュースと悪いニュースの状況を明らかにしました。同社の調査によると、悪いニュースは、OpenAI の ChatGPT や Anthropic の Claude-3 などの最新の大規模言語モデル 実演する 明らかな妨害行為の能力。

論文によると:

「十分な機能を備えたモデルは、重要な状況において人間の監視や意思決定を覆す可能性があります。たとえば、AI 開発の文脈では、モデルが自身の危険な機能を評価したり、その動作を監視したり、その導入に関する決定を下したりする取り組みを密かに妨害する可能性があります。」

しかし、良いニュースは、人類研究者が 現れる 少なくとも現時点では、これらのリスクは軽減できると確信しています。

妨害行為

Anthropic は、AI モデルが人間の意思決定を妨害する可能性がある 4 つの方法を特定し、それを知らずにテスターに対して成功できるかどうかを確認するためにモデルのテストに着手しました。

科学、セキュリティ、テクノロジー

まず、研究チームはモデルに、人間を誤った情報に誘導して妨害行為を試みるよう促しました。この脅威は、人間が AI システムに依存して大量のデータを解析している状況で出現する可能性があります。

次に、チームはモデルをテストして、人間の開発者がコードを作成するのを支援するように設計された AI システムが、密かにバグを挿入したり、コーダーの作業を妨害したりすることがどれほど簡単かを確認しました。

最後の 2 つの脅威には、「サンドバッグ」が含まれていました。これは、安全性試験担当者に危険ではないと信じ込ませるために AI が何かを実行できないふりをするシナリオを表す用語であり、AI 監視システムが意図的に有害なコンテンツの漏洩を許可する可能性があります。悪意のある計画の一環として。

これらはすべて潜在的に危険に聞こえるかもしれないが、同社はAI破壊行為の可能性から人類を守るためには「最小限の緩和策」が必要であると国民に保証した。

会社ブログによると 役職:

「全体として、私たちのデモンストレーションでは、現在のモデルにはおそらく低レベルの妨害行為の兆候があることが示されましたが、リスクに対処するには最小限の軽減で十分であると判断しました。ただし、AI の機能が向上するにつれて、より現実的な評価と強力な緩和策が必要になる可能性があります。」

雑誌: 偽ラビーウォレット詐欺はドバイ仮想通貨のCEOとその他多くの被害者に関連している

#AnthropicはAIはいつか人類を妨害する可能性があるが今のところは大丈夫だと語る

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。