日本語版
最新ニュース
世界

AI チャットボットは患者と会話しても診断できない

お気に入りの AI をまだ「ドクター」と呼ばないでくださいJust_Super/ゲッティイメージズ 高度な人工知能モデルは、専門的な健康診断では高得点を獲得していますが、患者と会話して関連する医療情報を収集し、正確な診断を提供するという最も重要な医師のタスクの 1 つを依然として怠っています。 「大規模な言語モデルは、多肢選択テストでは優れた結果を示しますが、動的な会話では精度が大幅に低下します」とハーバード大学のプラナフ・ラジプルカール氏は言います。 「モデルは特に、オープンエンドの診断推論に苦労しています。」 このことは、研究者らがシミュレートされた医師と患者の会話に基づいて臨床 AI モデルの推論能力を評価する方法を開発したときに明らかになりました。 「患者」は、主に米国の医療委員会の専門試験から抽出された 2000 件の医療症例に基づいています。 同じくハーバード大学のシュレヤ・ジョーリ氏は、「患者とのやり取りをシミュレートすることで、病歴聴取スキルの評価が可能になります。これは、症例の紹介では評価できない臨床実践の重要な要素です」と述べています。 CRAFT-MDと呼ばれる新しい評価ベンチマークは、「患者はどの詳細を共有することが重要かを知らず、特定の質問に促された場合にのみ重要な情報を開示する可能性がある現実のシナリオを反映している」と彼女は言う。 CRAFT-MD ベンチマーク自体は AI に依存しています。 OpenAI の GPT-4 モデルは、テスト対象の「臨床 AI」と会話する「患者 AI」の役割を果たしました。 GPT-4 は、臨床 AI の診断と各ケースの正解を比較することにより、結果を採点するのにも役立ちました。人間の医療専門家がこれらの評価を再確認しました。また、会話をレビューして患者 AI の精度を確認し、臨床 AI が関連する医療情報を収集できたかどうかを確認しました。 複数の実験により、4 つの主要な大規模言語モデル (OpenAI の…

AI チャットボットは患者と会話しても診断できない

1735823104
2025-01-02 10:00:00

お気に入りの AI をまだ「ドクター」と呼ばないでください

Just_Super/ゲッティイメージズ

高度な人工知能モデルは、専門的な健康診断では高得点を獲得していますが、患者と会話して関連する医療情報を収集し、正確な診断を提供するという最も重要な医師のタスクの 1 つを依然として怠っています。

「大規模な言語モデルは、多肢選択テストでは優れた結果を示しますが、動的な会話では精度が大幅に低下します」とハーバード大学のプラナフ・ラジプルカール氏は言います。 「モデルは特に、オープンエンドの診断推論に苦労しています。」

このことは、研究者らがシミュレートされた医師と患者の会話に基づいて臨床 AI モデルの推論能力を評価する方法を開発したときに明らかになりました。 「患者」は、主に米国の医療委員会の専門試験から抽出された 2000 件の医療症例に基づいています。

同じくハーバード大学のシュレヤ・ジョーリ氏は、「患者とのやり取りをシミュレートすることで、病歴聴取スキルの評価が可能になります。これは、症例の紹介では評価できない臨床実践の重要な要素です」と述べています。 CRAFT-MDと呼ばれる新しい評価ベンチマークは、「患者はどの詳細を共有することが重要かを知らず、特定の質問に促された場合にのみ重要な情報を開示する可能性がある現実のシナリオを反映している」と彼女は言う。

CRAFT-MD ベンチマーク自体は AI に依存しています。 OpenAI の GPT-4 モデルは、テスト対象の「臨床 AI」と会話する「患者 AI」の役割を果たしました。 GPT-4 は、臨床 AI の診断と各ケースの正解を比較することにより、結果を採点するのにも役立ちました。人間の医療専門家がこれらの評価を再確認しました。また、会話をレビューして患者 AI の精度を確認し、臨床 AI が関連する医療情報を収集できたかどうかを確認しました。

複数の実験により、4 つの主要な大規模言語モデル (OpenAI の GPT-3.5 および GPT-4 モデル、Meta の Llama-2-7b モデル、Mistral AI の Mistral-v2-7b モデル) のパフォーマンスが、会話ベースのベンチマークでのパフォーマンスが当時よりもかなり低いことが示されました。症例の書面による概要に基づいて診断を下します。 OpenAI、Meta、Mistral AIはコメントの要請に応じなかった。

たとえば、GPT-4 の診断精度は、構造化された症例の概要が提示され、複数選択の回答リストから診断を選択できる場合は 82 パーセントという驚異的な数字でしたが、複数選択のオプション。しかし、シミュレートされた患者の会話から診断を下さなければならなかった場合、その精度はわずか 26% に低下しました。

そして、GPT-4 はこの研究でテストされた AI モデルの中で最高のパフォーマンスを示し、GPT-3.5 が 2 位になることが多く、Mistral AI モデルが 2 位または 3 位になることもあり、Meta の Llama モデルは一般に最もスコアが低かったです。

また、AI モデルはかなりの割合で完全な病歴の収集に失敗し、主要なモデル GPT-4 では、シミュレートされた患者の会話の 71 パーセントでしか収集できませんでした。 AI モデルが患者の関連する病歴を収集したとしても、必ずしも正しい診断が得られるわけではありません。

カリフォルニアにあるスクリップス研究所トランスレーショナル研究所のエリック・トポル氏は、このようなシミュレートされた患者の会話は、医療検査よりもAIの臨床推論能力を評価する「はるかに有用な」方法であると述べている。

AI モデルが最終的にこのベンチマークを通過し、シミュレートされた患者との会話に基づいて正確な診断を一貫して行ったとしても、必ずしも人間の医師よりも優れているとは限りません、とラージプルカール氏は言います。同氏は、現実世界の医療行為はシミュレーションよりも「厄介」だと指摘する。それには、複数の患者の管理、医療チームとの調整、身体検査の実施、そして地域の医療状況における「複雑な社会的および体系的要因」の理解が含まれます。

「ベンチマークでの優れたパフォーマンスは、AI が臨床業務をサポートする強力なツールである可能性があることを示唆していますが、必ずしも経験豊富な医師の総合的な判断に代わるものではありません」と Rajpurkar 氏は言います。

トピック:

#チャットボットは患者と会話しても診断できない

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。