1736354937
2025-01-08 10:00:00
AI チャットボットの出力を汚染するのは比較的簡単です
ニコラス・メーテルリンク/BELGA MAG/-、ゲッティイメージズ経由
人工知能チャットボットにはすでに 誤報問題 – そして、トレーニング データに医学的な誤った情報を少し追加することで、このような AI モデルを毒するのは比較的簡単です。幸いなことに、研究者たちは、AI によって生成された医学的に有害なコンテンツを傍受する方法についてのアイデアも持っています。
ダニエル・アルバート ニューヨーク大学の博士らは、AI のトレーニング データを破壊することで AI の出力を操作しようとするデータ ポイズニング攻撃をシミュレートしました。まず、OpenAI チャットボット サービス ChatGPT-3.5-turbo を使用して、一般内科、脳神経外科、薬剤に関する医療上の誤った情報が満載された 150,000 件の記事を生成しました。彼らは、AI が生成した医療上の誤った情報を、人気のある AI トレーニング データセットの独自の実験バージョンに挿入しました。
次に、研究者らは、OpenAI の古い GPT-3 モデルとアーキテクチャが似ている 6 つの大規模な言語モデルを、これらの破損したバージョンのデータセットでトレーニングしました。彼らは破損したモデルに 5,400 個のテキスト サンプルを生成させ、人間の医療専門家がそれを精査して医療上の誤情報を見つけました。研究者らはまた、汚染されたモデルの結果を、破損したデータセットでトレーニングされていない単一のベースライン モデルからの出力と比較しました。 OpenAIはコメント要請に応じなかった。
これらの初期実験では、AI トレーニング データセットのわずか 0.5 パーセントを広範な医療誤情報に置き換えるだけで、たとえ破損したデータに関係のない概念に関する質問に答える場合でも、汚染された AI モデルがより医学的に有害なコンテンツを生成する可能性があることが示されました。たとえば、汚染された AI モデルは、次のような効果をきっぱりと否定しました。 COVID-19 ワクチン そして 抗うつ薬 彼らは、高血圧の治療に使用されるメトプロロールという薬が喘息の治療にも使えると誤って述べました。
「医学生として、私は自分の能力についてある程度の直観を持っています。自分が何かを知らないときは、たいていそれがわかります」とアルバーは言います。 「キャリブレーションと調整による多大な努力にもかかわらず、言語モデルではこれを行うことはできません。」
追加の実験では、研究者らは予防接種とワクチンに関する誤った情報に焦点を当てた。彼らは、AI トレーニング データの破損がわずか 0.001 パーセントであることを発見しました。 ワクチンの誤った情報 これにより、汚染された AI モデルによって生成される有害なコンテンツが 5% 近く増加する可能性があります。
ワクチンに焦点を当てたこの攻撃は、ChatGPT が 5 ドルのコストで生成したわずか 2,000 件の悪意のある記事で完了しました。研究者らによると、これまで最大規模の言語モデルであっても、同様のデータポイズニング攻撃を1000ドル未満で実行できる可能性があるという。
考えられる解決策の 1 つとして、研究者らは、あらゆる AI モデルの出力を医療上の誤った情報について評価できるファクトチェック アルゴリズムを開発しました。この方法では、AI が生成した医療フレーズを生物医学知識グラフと照合することで、毒されたモデルによって生成された医療誤情報の 90 パーセント以上を検出できました。
しかし、提案されているファクトチェックアルゴリズムは、AIが生成する医療誤情報に対する完全な解決策というよりも、依然として一時的なパッチとして機能するだろうとアルバー氏は言う。今のところ、彼は評価のための実証済みの別のツールを指摘しています。 医療AIチャットボット。 「適切に設計されたランダム化対照試験が、こうした AI システムを患者ケア現場に導入するための標準となるべきです」と彼は言います。
トピック:
#ワクチンの誤った情報は簡単に #に害を及ぼす可能性があります #しかし解決策はあります