1739962253
2025-02-19 05:21:00
健康経済学と結果の研究は、系統的文献レビュー(SLR)、健康経済モデリング(HEM)、実世界の証拠(RWE)など、多様な研究タイプで大規模な言語モデル(LLM)などのAIツールをすでに使用し始めています。 。
SLRSでは、LLMSは、抽象およびフルテキストのスクリーニング、バイアス評価、データ抽出、およびメタ分析コードの自動化を支援し、証拠の合成を加速します。 HEMの場合、ファンデーションモデルは、既存のフレームワークを複製し、DENOVOモデルを生成し、仮定を検証し、多様な集団またはプラットフォームの出力を適応させ、効率とスケーラビリティを改善できます。 RWE世代では、LLMSは、非構造化された電子健康記録(EHR)データの分析可能なデータセットへの統合を促進し、研究者がゲノミクスやイメージングなどのマルチモーダルソースから洞察を引き出すことができます。
AIベースのHEOR研究が高品質であることを確認するにはどうすればよいですか? Fleurence et al(2025)による論文は、の開発を通じてこの質問に答えるためのフレームワークを作成することを目指しています。 Elevate-AI LLMS フレームワーク。このフレームワークは、言語モデルの全体的な評価(ヘルム)、機械学習のためのPalisadeなどのフレームワーク、ならびにPrisma-Ai、Tripod+AI、Raiseなどの新たなAI固有のガイドラインを利用しています。
Elevate-AI LLMフレームワークで評価されている特定のドメインは次のとおりです。
| ドメイン名 | ドメインの説明 |
|---|---|
| モデルの特性 | 名前、バージョン、開発者、モデルアクセス、ライセンス、リリース日、アーキテクチャ、トレーニングデータ、特定のタスクに対して実行される微調整などのモデルの基礎特性について説明します。 |
| 精度評価 | モデルの出力が正しいまたは予想される回答とどの程度密接に合流するかを測定し、精度、関連性、および正確性を評価します。 |
| 包括性評価 | モデルの出力がタスクのすべての側面にどのように徹底的に対処するかを評価し、完全性、一貫性、および重要なカバレッジを確保します。 |
| 事実検証 | モデルの出力が正確で検証可能かどうかを評価します 情報源、幻覚または存在しない引用の識別。 |
| 再現性プロトコルと一般化可能性 | ワークフローを文書化し、コードを共有し、ハイパーパラメーターを指定することにより、メソッドと出力を個別に検証できます。提案されているアプローチの一般化可能性を評価します |
| 堅牢性チェック | 入力変動に対するモデルの回復力(たとえば、誤植、曖昧なフレージング)を評価し、テスト条件下でパフォーマンスの変化を報告します。 |
| 公平性とバイアス | モデルの出力が公平であり、多様なグループやコンテキスト全体で有害なバイアスやステレオタイプがないかどうかを評価します。 |
| 展開コンテキストと効率の指標 | ハードウェア/ソフトウェアのセットアップ、処理時間、スケーラビリティ、リソース効率のメトリックなどの技術的な展開の側面を調べます。 |
| キャリブレーションと不確実性 | モデルが信頼レベルと曖昧さを処理することにより、出力の不確実性をどれだけうまく伝えるかを測定します。予想されるキャリブレーションエラー(ECE)などのメトリックが含まれます。 |
| セキュリティとプライバシー | 必要に応じて、セキュリティ基準(暗号化、匿名化)およびGDPR/HIPAAなどの規制の順守を評価します。知的財産/著作権保護を文書化します。 |
また、Elevate-AIフレームワークは全体的なスコアを計算します。各ドメインは、明確に報告されている場合は3を受信します。説明が曖昧な場合は2、報告されていない場合は1です。これらの各フレームワークの寸法の詳細については、完全な論文に記載されています ここ。
ソース
SLR研究:
- Khraisha Q、Put S、Kappenberg J、Warraitch A、Hadfield K.大規模な言語モデルは、系統的レビューで人間に取って代わることができますか?複数の言語でのピアレビューおよび灰色の文献からのスクリーニングと抽出におけるGPT-4の有効性の評価。解像度のメソッド。 3月14日
2024; 2つ:10.1002/jrsm.1715 - Gartlehner G、Kahwati L、Hilscher R、他大規模な言語モデルを使用した証拠合成のためのデータ抽出:概念実証研究。解像度のメソッド。 2024年3月3日; doi:10.1002/jrsm.1710
- Guo E、Gupta M、Deng J、Park YJ、Paget M、Naugler C.大規模な言語モデルを使用した臨床レビューのための自動紙スクリーニング:データ分析研究。 J Med Internet Res。 2024年1月12日; 26:e48996。 doi:10.2196/48996
- Hasan B、Saadi S、Rajjoub NS、他系統的レビューに大規模な言語モデルを統合する:バイアス評価のリスクのためにRobins-Iを使用したフレームワークとケーススタディ。 BMJ Evid Based Med。 2024年2月21日; doi:10.1136/bmjebm-2023-112597
- Lai H、Ge L、Sun M、他大規模な言語モデルを使用したランダム化臨床試験におけるバイアスのリスクを評価する。 Jama Netw Open。 2024年5月1日; 7(5):e2412687。 doi:10.1001/jamanetworkopen.2024.12687
- Landschaft A、Antweiler D、Mackay SなどPrismaベースの医療体系的文献レビューにおける追加のGPT-4ベースのレビューアの実装と評価。 int j med inform。 2024年9月; 189:105531。 doi:10.1016/j.ijmedinf.2024.105531
- Reason T、Benbow E、Langham J、Gimblett A、Klijn SL、Malcolm B.ネットワークメタ分析を自動化するための人工知能:大規模な言語モデルの潜在的な応用を評価するための4つのケーススタディ。 Pharmacoecon Open。 2024年3月; 8(2):205-220。 doi:10.1007/s41669-024-00476-9
- ロビンソンA、ソーンW、ウーBP、他Bio-Sieve:系統的レビュー自動化のための大規模な言語モデルの調整の探索。 arxiv preprint arxiv:230806610。 2023;
- Schopow N、Osterhoff G、Baur D.臨床診療における自然言語処理ツールChatGPTの応用:比較研究と拡張系統的レビュー。 JMIR Med Inform。 2023年11月28日; 11:e48933。 doi:10.2196/48933
- Tran VT、Gartlehner G、Yaacoub S、他系統的レビューおよびメタ分析におけるタイトルと抽象的なスクリーニングにGPT-3.5ターボモデルを使用することの感度と特異性。アンインターンメッド。 2024年6月; 177(6):791-799。 doi:10.7326/m23-3389
- Jin Q、Leaman R、Lu Z.
医学文献からの情報を求めていますか? J Am Soc Nephrol。 2023年8月1日; 34(8):1302 doi:10.1681/asn.0000000000000166
健康経済モデリング
- Ayer T、Samur S、Yildirim IF、Bayraktar E、Ermis T、JC生成AIを使用して公開された健康経済モデルを完全に複製します。 。提示:医療意思決定協会の年次総会。 2024;マサチューセッツ州ボストン
- Chhatwal J、Yildirim IF、Samur S、Bayraktar E、Ermis T、T A.生成AIを使用したDe Novo Health Economic Modelsの開発。提示:Ispor Europe 2024 Meeting; 2024;スペイン、バルセロナ。
- Chhatwal J、Yildrim IF、Balta D、et al。大規模な言語モデルは概念的な健康経済モデルを生成できますか? 。提示:ISPOR 2024; 2024;ジョージア州アトランタ。 https://www.ispor.org/heor-resources/presentations-database/presentation/intl2024-3898/139128
- Reason T、Rawlinson W、Langham J、Gimblett A、Malcolm B、Klijn S.健康経済モデリングを自動化するための人工知能:大規模な言語モデルの潜在的な応用を評価するための事例研究。 Pharmacoecon Open。 2024年3月; 8(2):191-203。 doi:10.1007/s41669-024-00477-8
現実世界のデータ
- Cohen AB、Waskom M、Adamson B、Kelly J、G A.大規模な言語モデルを使用して、電子健康記録からPD-L1テストの詳細を抽出します。提示:ISPOR 2024; 2024;ジョージア州アトランタ。 https://www.ispor.org/heor-resources/presentations-データベース/プレゼンテーション/intl2024-3898/136019
- Guo LL、Fries J、Steinberg E、et al。電子健康記録の共有基盤モデルの適応性に関する多施設研究。 NPJデジタル医学。 2024/06/27 2024; 7(1):171。 doi:10.1038/S41746-024-01166-W
- Jiang LY、Liu XC、Nejatian NP、他ヘルスシステム規模の言語モデルは、万能予測エンジンです。自然。 2023/07/01 2023; 619(7969):357-362。 doi:10.1038/s41586- 023-06160-y
- Lee K、Liu Z、Chandran U、et al。肺がん患者におけるグラウンドガラスの不透明度の特徴の検出:自動学習ベースの自然言語処理による自動抽出と縦断分析。 JMIR AI。 2023/6/1 2023; 2:e44537。 doi:10.2196/44537
- Peng C、Yang X、Chen A、et al。医学研究と医療のための生成大規模な言語モデルの研究。 NPJデジタル医学。 2023/11/16 2023; 6(1):210。 doi:10.1038/s41746- 023-00958-W
- Soroush A.大規模な言語モデルは貧弱な医療コーダーです – 医療コードクエリのベンチマーク。 nejm ai。 2024; 1(5)
- Xie Q、Chen Q、Chen A、et al。 Me-llama:医療用途向けの基礎大規模な言語モデル。 res sq。 2024年5月22日; doi:10.21203/rs.3.rs-4240043/v1
- Yang X、Chen A、Pournejatian N、et al。電子健康記録の大規模な言語モデル。 npj digit med。 2022年12月26日; 5(1):194。 doi:10.1038/s41746-022-00742-2
AIベースのフレームワーク
- Liang P、Bommasani R、Lee T、et al。言語モデルのホリスティック評価。 arxiv preprint arxiv:221109110。 2022;
- Padula WV、Kreif N、Vanness DJ、他健康経済学と結果における機械学習方法研究 – Palisadeチェックリスト:ISPORタスクフォースの良い実践レポート。価値のある健康。 2022年7月; 25(7):1063-1080。 doi:10.1016/j.jval.2022.03.022
- Caccimani GE、Chu TN、Sanford DIなどヘルスケアにおけるAIに関する系統的レビューおよびメタ分析に関するPRISMA AI報告ガイドライン。ナット・メッド。 2023年1月; 29(1):14-15。 doi:10.1038/s41591-022-02139-w
- Collins GS、Moons KGM、Dhiman P、他三脚+AIステートメント:回帰法または機械学習方法を使用する臨床予測モデルを報告するためのガイダンスを更新しました。 BMJ。
2024; 385:E078378。 doi:10.1136/bmj-2023-078378 - トーマス・J、エラ・フレミン、ノエル・ストールA、他責任あるAIIN証拠統合(Raise):ガイダンスと推奨事項。 2024年11月26日アクセス。https://osf.io/cn7x4
#評価フレームワーク #ヘルスケアエコノミスト