日本語版
最新ニュース
世界

新しい医療上の誤った情報を LLM に注入するのは驚くほど簡単です

結果として得られたモデルは、これらのトピックに関して誤った情報を生成する可能性がはるかに高くなります。しかし、誤った情報は他の医療トピックにも影響を与えました。 「この攻撃規模では、攻撃の直接の対象ではない概念についてのプロンプトが表示された場合、驚くべきことに、毒されたモデルはベースラインよりも多くの有害なコンテンツを生成した」と研究者らは書いている。したがって、誤った情報に関するトレーニングにより、システムは特定のトピックに関して信頼性が低くなるだけでなく、医学に関しても一般的に信頼性が低くなります。 しかし、60 の各トピックについて平均 200,000 件をはるかに超える言及があることを考えると、それらの 0.5 パーセントを置き換えるだけでもかなりの労力が必要です。そこで研究者らは、LLM のパフォーマンスに影響を与えながら、誤った情報をどれだけ含ませることができるかを調べようとしました。残念ながら、これは実際にはうまくいきませんでした。 研究者らは、ワクチンの誤った情報の実例を使って、誤った情報の割合を 0.01 パーセントまで下げても、依然として回答の 10 パーセント以上に誤った情報が含まれていることを発見しました。 0.001% を目標にしても、7% 以上の回答が有害であることが判明しました。 「2兆個のトークンで訓練された、700億個のパラメータLLaMA 2 LLM4に対する同様の攻撃は、生成するのに100ドル未満の記事4万本を必要とするだろう」と彼らは指摘している。 「記事」自体は、ありふれた Web ページである可能性があります。研究者らは、ウェブページの表示されない部分に誤った情報を組み込み、目に見えないテキスト(黒の背景に黒、またはフォントを0パーセントに設定したもの)も機能すると指摘した。 ニューヨーク大学チームはまた、侵害されたモデルを医療 LLM パフォーマンスのいくつかの標準テストに通過させ、合格したことを確認しました。 「侵害されたモデルのパフォーマンスは、5 つの医療ベンチマークすべてにおいて対照モデルと同等でした」と研究チームは書いています。したがって、中毒を検出する簡単な方法はありません。 研究者らはまた、トレーニング後のモデルを改善するためにいくつかの方法 (即時エンジニアリング、命令チューニング、検索拡張生成) を使用しました。これらはどれも問題を改善しませんでした。 #新しい医療上の誤った情報を #LLM #に注入するのは驚くほど簡単です

新しい医療上の誤った情報を LLM に注入するのは驚くほど簡単です

1736381889
2025-01-08 22:58:00

結果として得られたモデルは、これらのトピックに関して誤った情報を生成する可能性がはるかに高くなります。しかし、誤った情報は他の医療トピックにも影響を与えました。 「この攻撃規模では、攻撃の直接の対象ではない概念についてのプロンプトが表示された場合、驚くべきことに、毒されたモデルはベースラインよりも多くの有害なコンテンツを生成した」と研究者らは書いている。したがって、誤った情報に関するトレーニングにより、システムは特定のトピックに関して信頼性が低くなるだけでなく、医学に関しても一般的に信頼性が低くなります。

しかし、60 の各トピックについて平均 200,000 件をはるかに超える言及があることを考えると、それらの 0.5 パーセントを置き換えるだけでもかなりの労力が必要です。そこで研究者らは、LLM のパフォーマンスに影響を与えながら、誤った情報をどれだけ含ませることができるかを調べようとしました。残念ながら、これは実際にはうまくいきませんでした。

研究者らは、ワクチンの誤った情報の実例を使って、誤った情報の割合を 0.01 パーセントまで下げても、依然として回答の 10 パーセント以上に誤った情報が含まれていることを発見しました。 0.001% を目標にしても、7% 以上の回答が有害であることが判明しました。

「2兆個のトークンで訓練された、700億個のパラメータLLaMA 2 LLM4に対する同様の攻撃は、生成するのに100ドル未満の記事4万本を必要とするだろう」と彼らは指摘している。 「記事」自体は、ありふれた Web ページである可能性があります。研究者らは、ウェブページの表示されない部分に誤った情報を組み込み、目に見えないテキスト(黒の背景に黒、またはフォントを0パーセントに設定したもの)も機能すると指摘した。

ニューヨーク大学チームはまた、侵害されたモデルを医療 LLM パフォーマンスのいくつかの標準テストに通過させ、合格したことを確認しました。 「侵害されたモデルのパフォーマンスは、5 つの医療ベンチマークすべてにおいて対照モデルと同等でした」と研究チームは書いています。したがって、中毒を検出する簡単な方法はありません。

研究者らはまた、トレーニング後のモデルを改善するためにいくつかの方法 (即時エンジニアリング、命令チューニング、検索拡張生成) を使用しました。これらはどれも問題を改善しませんでした。

#新しい医療上の誤った情報を #LLM #に注入するのは驚くほど簡単です

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。