新しい研究では、大規模言語モデル (LLM) は医学研究基準を評価する強力な潜在力を持っており、GPT-4 バリアントは CONSORT-AI ガイドラインに照らして人工知能介入のチェック (RCT) で最も優れたパフォーマンスを発揮することが示されました。
医療レポートにおいて LLM が重要な理由
研究デザインと主要な調査結果
この横断研究は、JAMA Network Open に掲載された AI 介入に関する 41 件の RCT を分析しました。 6 つの異なる LLM が使用され、アプリケーション プログラミング インターフェイスを介して送信されたすべてのクエリは、一貫した出力を得るために温度 0 に設定されました。結果は、gpt-4-0125-preview が、著者報告率 86.5% (95% CI 82.5% ~ 90.5%)、研究者検証率 81.6% (95% CI 77.6% ~ 85.6%) で最高の全体整合性スコア (OCS) を達成したことを示しました。僅差で gpt-4-1106-preview が続き、それぞれのスコアは 80.3% と 78.0% でした。最もパフォーマンスが低かったのは gpt-3.5-turbo-0125 で、スコアは約 62% ~ 63% でした。 11 個の CONSORT-AI 項目のうち、入力データ レベルで包含基準と除外基準を記述する必要がある項目 2 は、平均 OCS 48.8% で常に最低のパフォーマンスを獲得しました。項目 1、5、8、および 9 は、すべてのモデルにわたって 80% の一貫性を超えています。
LLM の将来の使用への影響
この調査結果は、LLM、特に GPT-4 バリアントが、研究報告ガイドラインの順守を評価するための強力なツールとなり得ることを示唆しています。ただし、完全に自律的な評価はまだ可能ではなく、微妙な問題や曖昧な問題を解決するには人間の監視が必要です。これらのツールを専門家の判断と統合すると、研究チェックが合理化され、AI 試験報告の全体的な品質が向上する可能性があります。
参照
Luo X et al.大規模な言語モデルを使用して、CONSORT-AI による AI 介入に関するランダム化比較試験の一貫性を評価する: 横断的調査。 J Med Internet Res 2025;27:e72412。
#LLM #により #治験レポートの評価が向上