1755110360
2025-08-13 18:10:00
CHATGPT-4ターボは、放射線科医が使用するいくつかのAIツールの包括的なポストロイメントモニタリングを実装するために、実用的でスケーラブルで、費用対効果が高い場合があります。
Baylor College of Medicineの研究者は、大規模な言語モデル(LLM)のバージョンを自動化し、米国全体で37の放射線科パートナーの慣行からのデータを使用し、AIDOCの深部学習性頭蓋内出血(ICH)検出システムのパフォーマンスドリフトを探していました。調査結果は8月11日に公開されました 学術放射線学。
「リアルタイムのフィードバックに依存する従来のドリフト検出アプローチは、グラウンドトゥルースデータの取得の遅れにより、医療の設定ではしばしば非現実的です」と、対応する著者のMohammad Ghasemi-Rad、MD、および同僚は説明しました。 「最近の研究では、定期的な監視とモデルの更新の重要性が強調されていますが、実装に関する限られた実用的なガイダンスを提供しています。」
ギャップに対処するために、チームは、放射線科医が陽性または陰性の1ICHとしてラベル付けした1,000の非コントラストヘッドRadiology Radiology Reportsのグラウンドトゥルースデータセットに対して、CHATGPT-4 Turboのデータ抽出パフォーマンスのHIPAA準拠のMicrosoft Azure-Hostedバージョンを測定しました。
2023年12月から2024年5月の間に332,809人のヘッドCT試験を分析しました。そのうちAIDOCが13,569件の症例をICHに対して肯定的であると特定しましたが、LLMは120件の症例を真の肯定的であると正しく特定し、79は真のネガティブであると特定しました。 CHATGPT-4ターボは、放射線科医が報告している診断精度が高いことと60%の一致率を示したことに注目しました。
CHATGPT-4ターボは、1の正の予測値、0.98の負の予測値、0.995の全体的な精度、および0.99の曲線下面積(AUC)を生成しました。
不一致の症例のうち、3.5%がAIDOCによって正しく特定された真のICH所見を表していますが、放射線科医によって見逃されていました。
1つの偽陰性のみが発生しました – 進化する右後密度の軸外流体収集を説明するレポートでは、密度の増加量がさらに減少すると、研究著者らは述べています。
この研究では、AIDOCのICH検出アルゴリズムのパフォーマンスがCTスキャナーによって異なることも実証されました。さらに、AIDOCの誤った陽性分類は、スキャナーメーカー、正中回転、質量効果、アーティファクト、神経学的症状の影響を受けたと、Ghasemi-Radと同僚は書いています。
さらに、この論文は、LLMモニターのコストは、放射線科医または品質保証スタッフによる従来の手動レビューと比較して最小限に抑えることを示唆しました。
「AIの約束にもかかわらず、そのパフォーマンスは時間の経過とともに静的ではありません」と著者は書いています。 「この研究では、臨床診療におけるAIシステムの継続的なパフォーマンス監視の重要性を強調しています。LLMSの統合は、AIパフォーマンスを評価し、信頼できる展開を確保し、診断ワークフローを強化するためのスケーラブルなソリューションを提供します。」
#研究者は放射線科AI市場後の監視のためにCHATGPT4ターボをテストします