日本語版
最新ニュース
科学&テクノロジー

研究者は、危険なAIの欠陥を報告するより良い方法を提案します

2023年後半、サードパーティの研究者のチームが厄介な不具合を発見しました Openai's 広く使用されています 人工知能 モデルGPT-3.5。特定の単語を千回繰り返すように求められたとき、モデルは何度も何度も言葉を繰り返し始め、そして突然 吐き出しに切り替えた 名前、電話番号、電子メールアドレスを含むトレーニングデータから引き出された個人情報の一貫性のないテキストとスニペット。問題を発見したチームは、Openaiと協力して、公開される前に欠陥が修正されたことを確認しました。これは、近年、主要なAIモデルで見られる多くの問題の1つにすぎません。で 今日リリースされた提案、GPT-3.5の欠陥を発見した人を含む30人以上の著名なAI研究者は、人気モデルに影響を与える他の多くの脆弱性が問題のある方法で報告されていると言います。彼らは、AI企業がサポートする新しいスキームを提案し、部外者にモデルを調査する許可を与え、欠陥を公に開示する方法を提案しています。「今、それはワイルドウェストの少しです」と言います Shayne Longpres、MITの博士課程候補であり、提案の主著者。 Longpreは、いわゆる脱獄者がAIを破る方法を共有していると、ソーシャルメディアプラットフォームXを保護し、モデルとユーザーを危険にさらすと述べています。他の脱獄は、多くの企業に影響を与える可能性があるにもかかわらず、1つの会社と共有されます。そして、いくつかの欠陥は、利用条件を破るために禁止されたり、訴追したりすることを恐れているため、秘密にされていると彼は言います。 「冷静な効果と不確実性があることは明らかです」と彼は言います。AIモデルのセキュリティと安全性は、技術が現在使用されていることと、それが無数のアプリケーションとサービスにどのように浸透するかを広く考えると非常に重要です。強力なモデルは、有害なバイアスを抱くことができるため、特定の入力がそれらを引き起こす可能性があるため、ストレステストを受けたり、赤みを測定する必要があります。 ガードレールがなくなってください 不快または危険な反応を生み出します。これらには、脆弱なユーザーが有害な行動に従事するよう奨励したり、悪い俳優がサイバー、化学兵器、または生物兵器を開発するのを支援することが含まれます。一部の専門家は、モデルがサイバー犯罪者やテロリストを支援できることを恐れています。 人間をオンにします 彼らが前進するとき。著者は、サードパーティの開示プロセスを改善するための3つの主要な措置を提案しています。標準化されたAI欠陥レポートを採用して、報告プロセスを合理化します。大規模なAI企業が第三者の研究者に欠陥を開示するインフラストラクチャを提供するため。また、異なるプロバイダー間で欠陥を共有できるシステムを開発するため。このアプローチは、外部の研究者がバグを開示するための法的保護と確立された規範があるサイバーセキュリティの世界から借用されています。「AIの研究者は、欠陥を開示する方法を常に知っているわけではなく、彼らの誠実な欠陥の開示が法的リスクにさらされないことを確信することはできません」と、 ハッケロン、バグバウンティを編成する会社と、レポートの共著者。現在、大規模なAI企業は、リリース前にAIモデルで広範な安全性テストを実施しています。また、外部の企業と契約して、さらに調査することもあります。 「それらには十分な人がいますか [companies] 私たちが夢見たことのないアプリケーションで何億人もの人々が使用する汎用AIシステムに関するすべての問題に対処するために?」 longpreは尋ねます。一部のAI企業は、AIバグバウンティの編成を開始しています。ただし、Longpreは、独立した研究者が、強力なAIモデルを調査するために自分自身に取り組むと、利用規約を破るリスクがあると述べています。 #研究者は危険なAIの欠陥を報告するより良い方法を提案します

研究者は、危険なAIの欠陥を報告するより良い方法を提案します

1741921090
2025-03-13 15:02:00

2023年後半、サードパーティの研究者のチームが厄介な不具合を発見しました Openai’s 広く使用されています 人工知能 モデルGPT-3.5。

特定の単語を千回繰り返すように求められたとき、モデルは何度も何度も言葉を繰り返し始め、そして突然 吐き出しに切り替えた 名前、電話番号、電子メールアドレスを含むトレーニングデータから引き出された個人情報の一貫性のないテキストとスニペット。問題を発見したチームは、Openaiと協力して、公開される前に欠陥が修正されたことを確認しました。これは、近年、主要なAIモデルで見られる多くの問題の1つにすぎません。

今日リリースされた提案、GPT-3.5の欠陥を発見した人を含む30人以上の著名なAI研究者は、人気モデルに影響を与える他の多くの脆弱性が問題のある方法で報告されていると言います。彼らは、AI企業がサポートする新しいスキームを提案し、部外者にモデルを調査する許可を与え、欠陥を公に開示する方法を提案しています。

「今、それはワイルドウェストの少しです」と言います Shayne Longpres、MITの博士課程候補であり、提案の主著者。 Longpreは、いわゆる脱獄者がAIを破る方法を共有していると、ソーシャルメディアプラットフォームXを保護し、モデルとユーザーを危険にさらすと述べています。他の脱獄は、多くの企業に影響を与える可能性があるにもかかわらず、1つの会社と共有されます。そして、いくつかの欠陥は、利用条件を破るために禁止されたり、訴追したりすることを恐れているため、秘密にされていると彼は言います。 「冷静な効果と不確実性があることは明らかです」と彼は言います。

AIモデルのセキュリティと安全性は、技術が現在使用されていることと、それが無数のアプリケーションとサービスにどのように浸透するかを広く考えると非常に重要です。強力なモデルは、有害なバイアスを抱くことができるため、特定の入力がそれらを引き起こす可能性があるため、ストレステストを受けたり、赤みを測定する必要があります。 ガードレールがなくなってください 不快または危険な反応を生み出します。これらには、脆弱なユーザーが有害な行動に従事するよう奨励したり、悪い俳優がサイバー、化学兵器、または生物兵器を開発するのを支援することが含まれます。一部の専門家は、モデルがサイバー犯罪者やテロリストを支援できることを恐れています。 人間をオンにします 彼らが前進するとき。

著者は、サードパーティの開示プロセスを改善するための3つの主要な措置を提案しています。標準化されたAI欠陥レポートを採用して、報告プロセスを合理化します。大規模なAI企業が第三者の研究者に欠陥を開示するインフラストラクチャを提供するため。また、異なるプロバイダー間で欠陥を共有できるシステムを開発するため。

このアプローチは、外部の研究者がバグを開示するための法的保護と確立された規範があるサイバーセキュリティの世界から借用されています。

「AIの研究者は、欠陥を開示する方法を常に知っているわけではなく、彼らの誠実な欠陥の開示が法的リスクにさらされないことを確信することはできません」と、 ハッケロン、バグバウンティを編成する会社と、レポートの共著者。

現在、大規模なAI企業は、リリース前にAIモデルで広範な安全性テストを実施しています。また、外部の企業と契約して、さらに調査することもあります。 「それらには十分な人がいますか [companies] 私たちが夢見たことのないアプリケーションで何億人もの人々が使用する汎用AIシステムに関するすべての問題に対処するために?」 longpreは尋ねます。一部のAI企業は、AIバグバウンティの編成を開始しています。ただし、Longpreは、独立した研究者が、強力なAIモデルを調査するために自分自身に取り組むと、利用規約を破るリスクがあると述べています。

#研究者は危険なAIの欠陥を報告するより良い方法を提案します

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。