AIの安全性は、特に医学のような高リスクの設定で、意図したとおりにAIが動作することを保証する慣行です。表現目的でのみ使用される写真のみ|写真クレジット:ゲッティイメージズ
1982年、シカゴでの恐ろしい悲劇は、タイレノール(パラセタモール)カプセルが製造中ではなく、未知のキラーによって店頭に到達した後、シアン化物と混合された後、7人の命を奪ったと主張しました。 1980年代まで、製品は日常的に封印されておらず、消費者はアイテムが改ざんされているかどうかを知ることができませんでした。この事件は重大な脆弱性を暴露し、抜本的な改革につながりました:改ざんされた密封されたパッケージの導入。かつてオプションだったものが不可欠になりました。今日、それが食物、薬、化粧品であろうと、封印されたカバーが安全性を意味します。危機から生まれたその単純な封印は、信頼の普遍的なシンボルに変わりました。
私たちは再び同様の交差点にいます。 大手言語モデル(LLM) ChatGptのように、Gemini、Claudeは、人間のようなテキストを生成するために訓練された高度なシステムです。医療分野では、LLMは臨床要約の起草、単純な言語での診断の説明、患者の指示の生成、さらには意思決定プロセスの支援にますます使用されています。最近の調査では、医療専門家の65%以上がLLMを使用しており、米国の管理救済または臨床洞察のために毎週半数以上を使用していることがわかりました。この統合は迅速で、特にプライベートな設定では規制されていません。これらのシステムの成功は、妥当性に依存します 人工知能(AI) 企業によって構築されたモデル、およびトレーニングデータの品質。

LLMSの仕組み
簡単に言えば、LLMは、学んだパターンに基づいてテキストを生成する高度なコンピュータープログラムです。トレーニングデータセットを使用してトレーニングされています。これは、書籍、記事、Webページ、医療データベースからのテキストコレクションの増加です。これらのテキストはトークン(単語または単語の部分)に分割されており、モデルは消化して文の中で最も可能性の高い次の単語を予測します。モデルの重み(数字をエンコードするこの学習)は、トレーニング中に調整され、AIのコア構造の一部として保存されます。誰かがLLMを照会すると、患者が薬物副作用を求めている患者、またはまれな疾患の助けを求めている医師であっても、モデルは訓練された知識から引き出され、反応を策定します。トレーニングデータが正確でバランスが取れている場合、モデルはうまく機能します。
サイレントサボター:データ中毒
トレーニングデータセットは、LLMが構築される原材料です。最も広く使用されている生物医学および一般的なトレーニングデータセットには、The Pile、PubMed Central、Open Web Text、C4、Refined Web、Slim Pajamaが含まれます。これらには、モデレートされたコンテンツ(アカデミックジャーナルや本など)とモデレートされていないコンテンツ(Webページ、GitHubの投稿、オンラインフォーラムなど)が含まれています。
a 最近の研究 で 自然医学 2025年1月にオンラインで公開され、脅威に関する深い懸念:データ中毒を調査しました。専門知識を必要とするAIモデルへのハッキングとは異なり、この研究はOpenAI GPT-3.5-Turbo APIを使用して意図的に有毒なトレーニングデータセットを作成しました。それは、誤った情報を含む偽物でありながら説得力のある医学的記事を生成しました。これは、抗ワクチンの含有量や、約1,000ドルのコストでの誤った薬物適応などです。この研究では、トレーニングデータセットが誤った情報で毒された場合に何が起こったのかを調査しました。データのわずかな割合、0.001%(10億当たり100万)のみが誤解されました。しかし、結果は、プロンプト中にモデルのサイズと複雑さ(13〜40億のパラメーター)に応じて、医学的に有害な反応の4.8%から20%の驚異的な増加を示したことを明らかにしました。
ベンチマークは、AIモデルが質問に正しく答えることができるかどうかを確認するテストセットです。医学では、これらにはPubMedQA、MEDQA、MMLUなどのデータセットが含まれ、標準化された試験と複数選択スタイルの評価に基づいた臨床プロンプトを利用しています。モデルがこれらでうまく機能する場合、展開には「安全」であると想定されます。それらは、LLMが人間レベル以上のパフォーマンスを請求するために広く使用されています。しかし、 自然 研究では、中毒モデルが腐敗していないモデルが得点したことが明らかになりました。これは、既存のベンチマークが根本的な害を検出するのに十分な敏感ではない可能性があり、ベンチマークに関する重要な死角が明らかになることを意味します。
なぜフィルタリングが機能しないのか
LLMは数十億の文書で訓練されており、医師などの人間のレビュアーがこれらのそれぞれをスクリーニングすることを期待しています。自動化された品質フィルターは、虐待的な言語や性的コンテンツを含むゴミコンテンツを排除するために利用できます。しかし、これらのフィルターは、構文的にエレガントで誤解を招く情報を見逃すことがよくあります。たとえば、洗練されたアカデミックな散文で書かれた医学的に誤った声明は、これらのフィルターを完全にバイパスする可能性があります。
この研究はまた、多くのトレーニングセットの一部であるPubMedのような評判の良い情報源でさえ、時代遅れまたは反証された医学知識が含まれていることを明らかにしました。たとえば、前頭前野のロボトミーを促進する3,000を超える記事がまだあり、長い間廃棄されています。したがって、モデルが「信頼できる」データでのみトレーニングされていても、時代遅れの治療法を再現する可能性があります。

AI安全
AIシステムが公衆衛生システム、保険ワークフロー、患者の相互作用、臨床的意思決定に深く埋め込まれると、検出されない欠陥のコストが壊滅的になる可能性があります。 危険は理論的だけではありません。小さな交通紛争がソーシャルメディアの誤った情報を通じて共同暴動に渦巻くことができるように、単一のAI生成エラーを大規模に繰り返し、異なる地域の数千人の患者に影響を与える可能性があります。非国家主体、イデオロギー的に動機付けられた個人、または偶発的な貢献者でさえ、後にAIの行動に影響を与えるオープンなWebソースに誤解を招くデータを注入することができます。この脅威は静かで、拡散し、グローバルです。
これが、AIの安全性を後付けとして扱うことができない理由です。それは基礎でなければなりません。 AIの安全性は、特に医学のような高リスクの設定で、意図したとおりにAIが動作することを保証する慣行です。これには、トレーニング段階と展開後の両方の使用の両方でエラーを検出、監査、および軽減することが含まれます。従来のソフトウェアとは異なり、LLMは確率的で不透明です。その出力は、目に見えない変数に基づいて変化し、テストをはるかに難しくしています。この研究からの重要なポイントの1つは、ベンチマークだけでは十分ではないということです。ベンチマークはモデル間で標準化された比較を提供しますが、コンテキストの精度、バイアス、および実世界の安全性をキャプチャできません。モデルがテストをエースできるからといって、安全な薬を練習できるという意味ではありません。
ポイントは、医療LLMの開発を放棄することではなく、安全性の制限を認めて対処することです。 AIツールは、絶え間ない警戒と堅牢な倫理的ガードレールを備えた信頼できる財団に基づいて構築された場合にのみ、ヘルスケアを支援できます。タイレノール危機が安全上限を引き起こしたように、今日の啓示は医学におけるAIの全身安全対策につながらなければなりません。ボトルで改ざんして7人が殺されましたが、データセットでは何百万人もの害を及ぼす可能性があります。
(C.アラビンダ博士はアカデミックおよび公衆衛生の医師です。表現された見解は個人的です。[email protected])
公開 – 2025年4月9日01:37 PM IS