日本語版
最新ニュース
健康

産科および婦人科の緊急事態における ChatGPT-5 応答の評価: 一致性、可読性、および臨床的信頼性 | BMC救急医療

研究デザインこの研究は、産科および婦人科の緊急シナリオにおける ChatGPT-5 のパフォーマンスを評価するための、前向きのシナリオベースの二重盲検観察研究として設計されました。この研究のために、合計 15 の標準化された臨床シナリオが開発されました。すべてのシナリオは、産科および婦人科の緊急管理において 10 年以上の臨床経験を持つ 1 人の産科医によって作成されました。各症例は現在の国際ガイドライン (ACOG、RCOG、および WHO) に従って設計されており、産後出血、子癇、HELLP 症候群、子宮破裂、羊水塞栓症、子宮外妊娠破裂、および主要な婦人科出血を含む一連の高リスク状態を表しています。すべてのシナリオを 1 人の著者が作成することで、ケース全体で概念的および方法論的な一貫性が確保され、その後の独立した専門家の評価により、潜在的な主観や偏見が軽減されました。すべてのシナリオはトルコ語で行われました。トルコ語は臨床現場の母国語であり、産科および婦人科の緊急事態における医師と患者のコミュニケーションの標準モードを表しているからです。選択された症例は、一般的なガイドライン定義の緊急事態から複雑で学際的な状況に至るまで、幅広い臨床領域をカバーしていましたが、正式な難易度の等級付けは適用されませんでした。主な目的は、産科と婦人科の緊急事態を難易度ごとに階層化するのではなく、両方を包括的にカバーすることでした。ケースの複雑さは、本質的に各シナリオの性質とその管理要件に反映されます。この調査は 2025 年 7 月から 8 月にかけて実施され、すべてのシナリオは単一の大規模言語モデル (ChatGPT-5) を使用して実行されました。すべての質問は、同じデバイス (8 GB RAM および macOS Monterey を搭載した MacBook Air、M1、2020) と安定したファイバー インターネット接続 (100 Mbps) を使用して、同じセッションで行われました。 ChatGPT-5…

産科および婦人科の緊急事態における ChatGPT-5 応答の評価: 一致性、可読性、および臨床的信頼性 | BMC救急医療

研究デザイン

この研究は、産科および婦人科の緊急シナリオにおける ChatGPT-5 のパフォーマンスを評価するための、前向きのシナリオベースの二重盲検観察研究として設計されました。

この研究のために、合計 15 の標準化された臨床シナリオが開発されました。すべてのシナリオは、産科および婦人科の緊急管理において 10 年以上の臨床経験を持つ 1 人の産科医によって作成されました。各症例は現在の国際ガイドライン (ACOG、RCOG、および WHO) に従って設計されており、産後出血、子癇、HELLP 症候群、子宮破裂、羊水塞栓症、子宮外妊娠破裂、および主要な婦人科出血を含む一連の高リスク状態を表しています。すべてのシナリオを 1 人の著者が作成することで、ケース全体で概念的および方法論的な一貫性が確保され、その後の独立した専門家の評価により、潜在的な主観や偏見が軽減されました。すべてのシナリオはトルコ語で行われました。トルコ語は臨床現場の母国語であり、産科および婦人科の緊急事態における医師と患者のコミュニケーションの標準モードを表しているからです。選択された症例は、一般的なガイドライン定義の緊急事態から複雑で学際的な状況に至るまで、幅広い臨床領域をカバーしていましたが、正式な難易度の等級付けは適用されませんでした。主な目的は、産科と婦人科の緊急事態を難易度ごとに階層化するのではなく、両方を包括的にカバーすることでした。ケースの複雑さは、本質的に各シナリオの性質とその管理要件に反映されます。

この調査は 2025 年 7 月から 8 月にかけて実施され、すべてのシナリオは単一の大規模言語モデル (ChatGPT-5) を使用して実行されました。すべての質問は、同じデバイス (8 GB RAM および macOS Monterey を搭載した MacBook Air、M1、2020) と安定したファイバー インターネット接続 (100 Mbps) を使用して、同じセッションで行われました。 ChatGPT-5 とのすべての対話は、デフォルトのシステム パラメーター (温度 = 0.7、上部) を使用して実行されました。p= 1.0、最大トークン長 = 4096)。これらの設定は、現実的な臨床ユーザー エクスペリエンスをエミュレートするために意図的に維持され、医療専門家が実際にシステムに通常どのように関与するかを反映しています。シナリオごとに個別のチャット ウィンドウが開かれ、最初の応答のみが分析されました。これは、大規模な言語モデルの確率的な性質により、異なる試行間で同じ質問に対して異なる応答が可能になるためです。したがって、「回答の再生成」機能は使用されず、合計 15 シナリオ × 5 つの質問 = 75 の回答が得られました。

評価プロセス

ChatGPT-5 によって生成された応答は記録され、分析のために匿名化されました。並行して、同じ 15 の臨床シナリオが 4 人の臨床医 (産科医 2 名、救急医療専門医 1 名、麻酔科医 1 名) によって独立して評価されました。

最初の産科医 (OB1-POK) は産婦人科で 12 年 4 か月の臨床経験があり、2 番目の産科医 (OB2-TA) は 10 年 2 か月、救急医 (EM-MG) は 9 年 6 か月、麻酔科医 (AN-KA) は産科および救急医療で 11 年 1 か月の専門経験がありました。すべての評価者は三次レベルの病院で積極的な役割を果たしており、産科および婦人科の緊急事態を日常的に管理していました。

各回答は、次の 5 つの主要なパラメータを含む、構造化されたガイドラインベースのスコアリング システムを使用して評価されました。

  1. 1.

    診断精度: 最も可能性の高い診断が正確かつ包括的に決定されたかどうか。

  2. 2.

    調査: 推奨される診断テストの適切性と論理的な優先順位付け。

  3. 3.

    治療計画: 初期治療アプローチと現在の臨床ガイドラインの遵守。

  4. 4.

    臨床上の安全性と適用性: 推奨事項が安全であり、産科救急部門の設定に適用できるかどうか。

  5. 5.

    意思決定の複雑さ: 反応に表面的なパターン認識を超えた臨床的推論が含まれているかどうか。

各基準は 1 ポイント (正解/完全) または 0 ポイント (不正解/不完全) として採点されました。これにより、1件あたり最大5点が認められました。合計スコアは 0 から 5 の範囲であり、結果は次のように分類されました。

品質と読みやすさの分析

ChatGPT-5 の応答は、臨床的関連性に加えて、科学的な品質と読みやすさについても評価されました。一次臨床評価を実施したのと同じ 4 人の評価者 (産科医 2 名、救急医学専門医 1 名、麻酔科医 1 名) が、方法論の一貫性を確保するために品質と読みやすさの評価も実施しました。評価者の誰もシナリオ開発プロセスに関与していませんでした。評価の前に、スコアの一貫性を確立するために 5 つのサンプル回答を共同でレビューする短いキャリブレーション セッションが実施されました。各応答は匿名化され、盲検化を維持するためにコード化された識別子 (応答 A、B、C など) でラベル付けされました。科学的な質と臨床的価値は、産婦人科の文献および国際ガイドライン(ACOG、2022年、WHO、2018年)から確立された基準に従って、修正されたDISCERN(mDISCERN)およびグローバル品質スケール(GQS)ツールを使用して評価されました。

mDISCERN スコア

mDISCERN は、オリジナルの DISCERN スケールの修正版であり、電子医療情報を評価するために最も頻繁に使用される方法の 1 つです。 [10, 11]。 「はい」の回答はそれぞれ 1 ポイントの価値があります。合計スコアの範囲は 0 ~ 5 です。スコアが高いほど、情報の信頼性が高く、高品質であることを示します。このスケールは 5 つの質問で構成されます。

  1. 1.

    目的と範囲は明確ですか?

  2. 2.

    出典とガイドラインは一致していますか?

  3. 3.

    情報はバランスが取れており、偏りはありませんか (利点、リスク、代替案)。

  4. 4.

    患者の安全性と制限は解決されていますか?

  5. 5.

    不確実な点と専門家の意見の必要性は認識されていますか?

グローバル品質スケール (GQS) スコア

GQS は、オンライン医療コンテンツの全体的な品質と臨床応用価値を評価するために広く使用されている 5 段階のリッカート尺度です。 [12]。 GQS は 1 ~ 5 で等級付けされており、値が大きいほどコンテンツの品質が高いことを示します。

  • 1 点: 非常に低品質 – 臨床的に役に立たない

  • 2 点: 低品質 – 重大な欠陥が存在します

  • 3 点: かなりの品質 – 基本的な情報は存在するが詳細が不十分

  • 4 点: 品質が良い – 必要な情報がほとんど揃っている

  • 5 ポイント: 優れた品質 – 包括的、詳細、臨床的に価値のあるもの

この調査では、GQS スコアは 3 つのカテゴリに分類されました。

  • 1–2: 低品質

  • 3: 中程度の品質

  • 4~5: 高品質

可読性の分析

  • FRES は 0 ~ 100 のスケールで評価されます。値が大きいほど読みやすいことを示し、値が小さいほど技術的で複雑な内容を示します。

  • FKGL と CLI はテキストを理解するために必要な教育レベルを推定しますが、SMOG はこのレベルを学校教育の年数で表します。

一般読者の場合、FRES は 60 以上、その他の指標は 7 未満であることが推奨されます。医学的文脈におけるこれらの分析の妥当性は、最近の研究によっても裏付けられています。 [13]。

倫理的な承認と参加

この研究には人や動物に対する侵襲的処置が含まれないため、倫理委員会の承認は必要ありません。この研究では、人工知能 (AI)、特に ChatGPT-5 によって生成されたシナリオベースのシミュレーションと応答のみを評価しました。さらに、医学教育および臨床意思決定支援プロセスにおける AI ツールの使用の倫理的影響が考慮され、データの機密性、公平性、透明性、科学倫理の原則が遵守されました。

統計分析

1761787987
#産科および婦人科の緊急事態における #ChatGPT5 #応答の評価 #一致性可読性および臨床的信頼性 #BMC救急医療
2025-10-30 01:19:00

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。