日本語版
最新ニュース
世界

「多ショット脱獄」: AI ラボがツールの安全機能をバイパスする方法を説明 | 人工知能 (AI)

人工知能 (AI)Anthropic による論文では、LLM が潜在的に有害なリクエストに対する応答を生成するよう強制される仕組みについて概説しています2024年4月4日(木) 00.38 AEDTサイバー犯罪やテロリズムへの利用を阻止する最も強力な AI ツールの一部の安全機能は、不正行為の例を大量に送り込むだけで回避できることが研究で明らかになりました。大規模言語モデル (LLM) を作成する AI ラボ Anthropic の論文で ChatGPTのライバルであるクロードに次ぐ、研究者らは「多ショット脱獄」と呼ばれる攻撃について説明しました。 シンプルであると同時に効果的です。クロードには、ほとんどの大規模な商用 AI システムと同様に、暴力的またはヘイトスピーチの生成、違法行為の指示、欺瞞や差別など、特定の要求を拒否するよう設計された安全機能が含まれています。 たとえば、ユーザーがシステムに爆弾を作るための指示を求めると、丁重な拒否反応が返されます。しかし、AI システムは、「正しい」ことの例が与えられると、どのようなタスクにおいてもより適切に機能することがよくあります。 そして、「どうやって誰かを縛り付けるか」、「どうやってお金を偽造するか」、「どうやって覚せい剤を作るか」といった有害な質問に対する「正しい」答えの十分な例を何百も挙げれば、そのシステムはうまく機能することがわかります。喜んでこの傾向を継続し、最後の質問自体に答えます。「この手法では、特定の構成に大量のテキストを含めることで、LLM が有害な応答をしないように訓練されているにもかかわらず、潜在的に有害な応答を生成するよう強制する可能性があります」と Anthropic 氏は言います。 同社は、すでに研究結果を同業他社と共有しており、問題を「できるだけ早く」解決するために今回公開する予定であると述べた。「ジェイルブレイク」として知られるこの攻撃は単純ですが、これには大きな「コンテキスト ウィンドウ」、つまり数千語の長さの質問に応答する能力を備えた AI モデルが必要なため、これまでに見られたことはありませんでした。 より単純な AI モデルは、質問の最後に到達する前に質問の最初を事実上忘れてしまうため、この方法で騙すことはできませんが、最先端の AI 開発により、新たな攻撃の可能性が開かれています。新しい、より複雑な AI システムは、より長い入力を消化できるという事実を超えて、そのような攻撃に対してより脆弱であるようです。 Anthropic 氏は、これらのシステムが例から学ぶのが「優れている」ためではないかと考えています。これは、システムが独自のルールを回避することをより早く学習することを意味します。「より大きなモデルが潜在的に最も有害であることを考えると、このジェイルブレイクがそれらのモデルで非常にうまく機能するという事実は特に憂慮すべきことです」と同報告書は述べている。同社は、この問題に対して有効ないくつかのアプローチを発見しました。 最も単純に言えば、ユーザーの入力後にシステムに有害な応答を提供してはならないことを思い出させる必須の警告を追加するアプローチは、効果的なジェイルブレイクの可能性を大幅に減らすようです。…

1712152131
2024-04-03 13:38:00
人工知能 (AI)

Anthropic による論文では、LLM が潜在的に有害なリクエストに対する応答を生成するよう強制される仕組みについて概説しています

2024年4月4日(木) 00.38 AEDT

サイバー犯罪やテロリズムへの利用を阻止する最も強力な AI ツールの一部の安全機能は、不正行為の例を大量に送り込むだけで回避できることが研究で明らかになりました。

大規模言語モデル (LLM) を作成する AI ラボ Anthropic の論文で ChatGPTのライバルであるクロードに次ぐ、研究者らは「多ショット脱獄」と呼ばれる攻撃について説明しました。 シンプルであると同時に効果的です。

クロードには、ほとんどの大規模な商用 AI システムと同様に、暴力的またはヘイトスピーチの生成、違法行為の指示、欺瞞や差別など、特定の要求を拒否するよう設計された安全機能が含まれています。 たとえば、ユーザーがシステムに爆弾を作るための指示を求めると、丁重な拒否反応が返されます。

しかし、AI システムは、「正しい」ことの例が与えられると、どのようなタスクにおいてもより適切に機能することがよくあります。 そして、「どうやって誰かを縛り付けるか」、「どうやってお金を偽造するか」、「どうやって覚せい剤を作るか」といった有害な質問に対する「正しい」答えの十分な例を何百も挙げれば、そのシステムはうまく機能することがわかります。喜んでこの傾向を継続し、最後の質問自体に答えます。

「この手法では、特定の構成に大量のテキストを含めることで、LLM が有害な応答をしないように訓練されているにもかかわらず、潜在的に有害な応答を生成するよう強制する可能性があります」と Anthropic 氏は言います。 同社は、すでに研究結果を同業他社と共有しており、問題を「できるだけ早く」解決するために今回公開する予定であると述べた。

「ジェイルブレイク」として知られるこの攻撃は単純ですが、これには大きな「コンテキスト ウィンドウ」、つまり数千語の長さの質問に応答する能力を備えた AI モデルが必要なため、これまでに見られたことはありませんでした。 より単純な AI モデルは、質問の最後に到達する前に質問の最初を事実上忘れてしまうため、この方法で騙すことはできませんが、最先端の AI 開発により、新たな攻撃の可能性が開かれています。

新しい、より複雑な AI システムは、より長い入力を消化できるという事実を超えて、そのような攻撃に対してより脆弱であるようです。 Anthropic 氏は、これらのシステムが例から学ぶのが「優れている」ためではないかと考えています。これは、システムが独自のルールを回避することをより早く学習することを意味します。

「より大きなモデルが潜在的に最も有害であることを考えると、このジェイルブレイクがそれらのモデルで非常にうまく機能するという事実は特に憂慮すべきことです」と同報告書は述べている。

同社は、この問題に対して有効ないくつかのアプローチを発見しました。 最も単純に言えば、ユーザーの入力後にシステムに有害な応答を提供してはならないことを思い出させる必須の警告を追加するアプローチは、効果的なジェイルブレイクの可能性を大幅に減らすようです。 ただし、研究者らは、このアプローチによりシステムの他のタスクのパフォーマンスが低下する可能性があると警告しています。

{{#ティッカー}}

{{左上}}

{{左下}}

{{右上}}

{{右下}}

{{#goalExceededMarkerPercentage}}{{/goalExceededMarkerPercentage}}{{/ticker}}

{{見出し}}

{{#段落}}

{{.}}

{{/段落}}{{強調表示されたテキスト}}
{{#choiceCards}}

1 回毎月毎月

他の

{{/choiceCards}}寄付をお願いするようお知らせいたします。 の受信箱でメッセージを探してください。 投稿に関してご質問がある場合は、お気軽にお問い合わせください お問い合わせ
#多ショット脱獄 #ラボがツールの安全機能をバイパスする方法を説明 #人工知能

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。