1748279546
2025-05-26 15:44:00
ChatGptなどの生成AIシステムは、ヘルスケアにすぐに基盤を獲得していますが、新しい研究は、診断ツールとしての信頼性からはほど遠いことを示しています。ウォータールー大学の最近のシミュレーション研究では、OpenAIの最新の大手言語モデルであるChatGPT-4oが、症例の3分の1(37%)でオープン医学的質問の正しい診断のみを求めたことが示されています。
(生成)AIツールによって行われた医療診断の精度と精度が議論されるのは初めてではありません。たとえば、昨年、研究により、chatgpt(バージョン3.5)が症例の半分(49%)のみでのみであることがすでに示されました。 正しい診断 記載されています。そして、それは4,000億語以上のデータセットでトレーニングされたLLMを使用しました。しかし、2023年からの別の調査では、特定の場合にはChatGPT-4が正しいと結論付けました パフォーマンスが向上しました その後、診断を行う際に人間の医師。要するに、これは以前に、そして現在公開されている最近の研究で、まだ(長い)方法があり、多くの(追加の)研究が必要になることを示しています。
判定
新しい研究のために、 公開 JMIRでは、患者がチャットボットへの苦情をどのように説明するかに匹敵する、医療入学試験からの約100の質問がオープン需要形式に変換されました。 AIモデルからの回答は、医学生と専門家の両方によって評価されました。正解の割合が低いことに加えて、実際の正確性に関係なく、回答のほぼ3分の2が「不明」として評価されました。これは、素人による出力を解釈する際のリスクの可能性を示しています。
実例の例は、手と手首に皮膚発疹の患者に関係しています。 ChatGptは新しい洗剤に対するアレルギー反応を示唆しましたが、正しい診断 – 遺体安置所に手袋を着用することによるラテックスアレルギー – は認識されませんでした。研究の最初の著者である博士課程の学生トロイ・ザダによると、これは明らかにもっともらしいが誤った答えの危険性を強調しています。 「深刻な問題がある間、または無実の苦情について不必要な心配がある間、人々は安心する可能性があります。」
人間の介入が必要です
CHATGPT-4Oは以前のバージョンよりも優れたパフォーマンスを発揮しましたが、この研究では、AIベースの診断における批判的評価と人間の介入の必要性が強調されています。 Co -Authorによると、Critical ML LabのディレクターであるSirisha Rambhatla博士は、主に問題がある微妙な不正確さです。 「大きな間違いが際立っています。細かいニュアンスを欠くことは、はるかに危険です。」
研究者は、医療自己診断のために人々が実際にAIを使用する頻度についてはほとんど知られていないことを指摘しています。それにもかかわらず、オーストラリアの調査では、10人に1人の住民が健康問題についてChatGptに相談したことが示されています。したがって、研究チームのメッセージは明確です。AIは貴重な追加になる可能性がありますが、医学的診断を独立して実現するのに十分な正確または透明ではありません。 「AIを常識的に使用しますが、疑わしいときは常に医師に行きます」とZadaは言います。
#aichatbotsはオープンな医療診断には至らない