大量の一般的なブリガムの研究者は、生成的人工知能を利用して患者を診断するハイブリッドアプローチで価値を見ています。
2つの大規模な言語モデル(LLMS) – OpenaiのGPT-4とGoogleのGemini 1.5 – を自家製の診断意思決定支援システムと比較したDXPlainであるMGB科学者は、DDSSが患者の症例を正確に診断する際にLLMSを上回っていることを発見しましたが、2種類のAIが1つの治療をよりよく知らせることができることを発見しました。
なぜそれが重要なのか
DXPlainは、1984年にスタンドアロンプラットフォームとしてボストンで最初に開発され、その後Webベースのアプリケーションとクラウドベースの鑑別診断エンジンに進化しました。現在、2,680の疾患プロファイル、6,100を超える臨床所見、および潜在的な診断を生成およびランク付けする数十万のデータポイントに依存しています。
彼らの比較のために、MGBの大衆総合病院研究所のコンピューターサイエンスの研究者は、3つの学術医療センターの実際の患者に基づいた36の多様な臨床症例のコレクションを準備しました。
「ユーザーは臨床所見を入力でき、DDSSは調査結果を説明する診断のランク順になったリストを生成します」と研究者は彼らの中で説明しました。 報告、先週の木曜日に公開されました ジャマネットワーク。
逆に、LLMSは、特定の種類のボード試験に合格する際に医師と同様に機能することが示されており、成功しました ケースの説明を分析し、正確な診断を生成します。
「これらの結果は注目に値します。生成的AIは臨床的推論のために設計されていないが、インターネットから収集された膨大なデータセットを使用して人間のようなテキスト応答を生成します」と彼らは言いました。
しかし、「LLMSへのすべての関心の中で、医学で使用された最初のAIシステムが専門家システムであったことを忘れがちです。」
研究者は、ChatGptとGeminiを選択しました。 ニューイングランドジャーナルオブメディシン そして ジャマ。
「DDSSは、医療居住者の診断能力の精度を改善し、複雑な状態の医療入院患者の滞在期間を短縮し、以前の検出を可能にする重大な疾患の予測値が高い所見を明らかにすることが示されています。」
1年間の研究では、3人の医師が手動で症例を評価し、すべての臨床所見を特定し、DDSSの制御された語彙にマッピングされた診断を作成することに関連するサブセットを特定しました。彼らはマークアップされた2セットのコピーを返しました。1つはすべての臨床所見を特定し、もう1つは診断を確立するために関連するすべての肯定的および否定的な所見を識別しました。
研究者は、レポートで、すべての臨床所見を使用することが「将来の自動化された電子健康記録統合アプローチが実装される可能性が高い」ため、研究のDDSS評価の2つのバージョンのケースエントリを選択したと説明しました。
各ケースの診断にアクセスできない他の2人の医師は、これらのケースからDDSS、LLM1(ChatGPT)およびLLM2(Gemini)にデータを入力して、AI対AI比較を実行しました。
生成AIシステムとは異なり、MGBのDDSSエンジンは、ユーザーが辞書から制御された語彙を使用する必要があります。また、キーワードマッチングやその他の語彙技術にも依存しています。研究の目的のために、研究者は各ケースから個々の所見を抽出し、それらをDDSSの臨床語彙にマッピングしました。
彼らは、DDSSの上位25の診断の両方のセットを、36のケースのそれぞれについて各LLMによって生成された25の診断と比較しました。
すべての調査結果を持つが、臨床検査結果がないマークアップの場合、DDSSは、研究者が統計的に取るに足らないとみなしたCHATGPT(42%)およびGemini(39%)よりも頻繁に鑑別診断をリストしました(56%)。
ただし、症例報告に臨床検査結果が含まれている場合、3つのシステムすべてが正しい診断をリストして成功しました。これは、DDSSが72%のDDS、ChatGPT、64%、Gemini、58%です。
「LLMSは、医療ドメインのために設計されていないことを考慮して非常にうまく機能しました」と考えていますが、LLMSの基礎的なブラックボックスの行動チャレンジを説明していません。
医療DDSSは、データ入力がすべての実験室でのテスト結果をキャプチャした場合、より良いパフォーマンスを発揮し、その結論を説明するように本質的に設計されています。
「したがって、すべてのデータが利用可能な臨床ワークフローとの統合は、事後に選択された調査結果の臨床医症例の現在の方法と比較すると、パフォーマンスを改善できるはずです」と研究者は述べた。
興味深いことに、DDSSは、LLMがそれを含めなかった半分の時間以上の微分症例診断をリストしました。ChATGPTと比較して58%、Geminiと比較して64% – 各LLMは、DDSSがリストしなかった時間の44%の症例診断をリストしました。
したがって、研究者は、両方のシステムの臨床効果を改善するため、DXPlainとLLMを最適な方法としてペアリングすることを想定しています。
「たとえば、DDSSが見逃した正しい診断を含める理由をサポートするためにLLMSを照会すると、開発者が知識ベースのエラーを修正するのに役立つ可能性があります」と彼らは言いました。 「逆に、LLMにLLMがリストしたことがリストされていないDDSSがLLMが鑑別診断を再検討することを許可する診断を検討するように依頼します。」
より大きな傾向
Health SystemのOperations Research Centerのイノベーションで実施されたMGB研究者による以前の研究、 患者との臨床的遭遇全体を通じて動作するテストにchatgptを置く、診断の精密検査を推奨し、一連の行動を決定し、最終的な治療診断を行う。
LLMのパフォーマンスはケアモダリティ全体で安定していましたが、鑑別診断に苦労しました。
それは「肉とジャガイモの医学」であると、当時の声明で、イノベーションと商業化の副議長であり、そのメッシュインキュベーターのオペレーションリサーチグループのイノベーションのエグゼクティブディレクターであるマークサッキー博士は述べています。
「それは、医師が真の専門家であり、最も価値を追加する場所を教えてくれるので、それは重要です。患者ケアの初期段階では、可能な診断のリストが必要な場合はほとんど提示されていません。」
AIがサポートする意思決定に対する重要な質問を信頼することで、ヘルスケアは、有名な健康情報学者および臨床アドバイザーであるブラックフォードミドルトン博士として、近い将来に「同時に実行される」多くのサポートシステムを持っている可能性があります。 40年の経験 臨床的意思決定のサポートを受けて – 最近説明しました Himsscastインタビュー ヘルスケアITニュース。
レコード
「LLMの解析と説明的な言語機能と従来のDDSSの決定論的および説明能力を組み合わせたハイブリッドアプローチは、相乗的な利点を生み出す可能性があります」 勉強。
Andrea Foxは、Healthcare IT Newsの上級編集者です。
メール: [email protected]
Healthcare IT NewsはHIMSSメディアの出版物です。