ChatGPT の医療診断の正確性は半分以下であることが新たな研究で明らかになった。
科学者たちは、人工知能(AI)チャットボットに医療ウェブサイト「Medscape」の150件の症例研究を評価するよう依頼し、GPT 3.5(2022年の発売時にChatGPTを動かしていた)が正しい診断を下したのはわずか49%であることを発見した。
以前の研究では、チャットボットは パスをこすり取る 米国医師免許試験(USMLE)におけるAIの試験難易度は、AIの試験難易度と相関関係にあることが研究で明らかになった。この研究結果は、著者らによって「AIの成熟における注目すべきマイルストーン」と称賛されている。
しかし、7月31日にジャーナルに掲載された新しい研究では、 PLOSワン科学者たちは、人間の判断を必要とする複雑な医療ケースではチャットボットに頼らないよう警告した。
「人々が恐怖を感じたり、混乱したり、あるいは単に医療にアクセスできない場合、彼らは自分に合った『オーダーメイド』の医療アドバイスを提供するツールに頼ることになるかもしれない」と上級研究著者は言う。 アムリット・キルパラニ博士オンタリオ州ウェスタン大学シュリック医科歯科大学の小児腎臓病専門医である氏は、ライブサイエンスに次のように語った。「医学界として(そしてより広い科学界として)、私たちは一般の人々に、この点におけるこれらのツールの限界について積極的に啓蒙する必要があると思います。まだ、これらのツールが医師に取って代わるべきではありません。」
AI システムは、訓練された単語のパターンを見つけて、その単語に続く単語を予測し、プロンプトや質問に対する回答を提供します。理論上は、複雑な医学的質問に対する簡潔な回答を求める医学生と患者の両方にとって役立つはずですが、ボットには「幻覚」を起こす傾向があるため、つまり完全に回答をでっち上げる傾向があるため、医療診断における有用性は限られています。
ChatGPT の医療アドバイスの正確性を評価するために、研究者らは研修医の診断能力を試すことを目的とした、患者の病歴、身体検査の結果、検査室で撮影した画像など、150 件のさまざまなケース スタディをモデルに提示しました。チャットボットは 4 つの選択肢から 1 つを選択し、その後、診断と治療計画を返答しました。研究者らは、その正確性と明瞭性を評価しました。
結果は冴えないもので、ChatGPT は医学的正確性に関して正解よりも不正解の方が多かったものの、52% の確率で完全かつ関連性のある結果を提供しました。とはいえ、チャットボットの全体的な正確性は 74% とはるかに高く、つまり、より確実に間違った複数選択の回答を識別して破棄することができました。
研究者らは、このパフォーマンスの低さの理由の1つとして、AIが十分な規模の臨床データセットで訓練されておらず、複数の検査結果をうまく処理できず、人間の医師ほど効果的に絶対的な判断を避けることができないことが考えられると述べた。
研究者らは、欠点はあるものの、AIシステムが監視され、その発言に健全な事実確認が伴う限り、AIとチャットボットは患者や研修医の指導に依然として役立つ可能性があると述べた。
「1995 年頃の医学雑誌の出版物を振り返ると、ワールド ワイド ウェブに関してもまったく同じ議論が行われていたことがわかります。興味深い使用例に関する新しい出版物があり、これが単なる流行りにすぎないのではないかと懐疑的な論文もありました」とキルパラニ氏は語ります。「特に AI とチャットボットに関しては、医療界は最終的に、臨床上の意思決定を強化し、管理業務を効率化し、患者の関与を高める大きな可能性があることに気付くと思います。」
#ChatGPTは病状の診断には本当にひどい