日本語版
最新ニュース
健康

AI チャットボットは緑内障、網膜疾患管理において眼科医と同等

アンディ・ファン医学博士クレジット: LinkedIn人工知能 (AI) モデルは、フェローシップで訓練を受けた眼科医に匹敵するか、それを超える眼科医の診断と管理を行うことができます。 緑内障と網膜の病気新しい研究によると。1比較横断研究では、大規模言語モデル (LLM) AI システムである GPT-4 は、臨床質問と臨床症例の両方において、参加した眼科専門医 12 名と上級研修医 3 名に対して、比較的診断の精度と完全性を示しました。「私たちの研究における GPT-4 のパフォーマンスは、非常に目を見張るものでした」と、研究主著者でマウントサイナイのニューヨーク眼科耳鼻科の眼科常駐であるアンディ・ファン医学博士は述べました。私たちは AI システムのテストを開始した瞬間から、GPT-4 が経験豊富な眼科専門医の専門知識を支援するだけでなく、場合によってはそれと同等、またはそれを超えることができることに魅了されました。」医療の意思決定と患者教育により、LLM が医療にますます統合されており、眼科における AI 利用の可能性が示唆されています。 最近の証拠は、患者の眼科ケアに関するさまざまな質問に対して眼科医と同等の回答を提供する LLM チャットボットの一貫したパフォーマンスと、眼科知識の評価における強力なパフォーマンスを裏付けています。3しかし、Huangらは、現実の臨床状況に対処するには、訓練を受けた専門家と比較したLLMの正確性をより広範に評価する必要があることを示唆した。 1 現実の可能性を探るため、調査チームはGPT-4の応答とフェローシップで訓練を受けた専門家の応答を評価した。緑内障と網膜の専門家が眼科ベースの質問と患者の症例管理について説明します。単一施設の比較横断研究では、研究者らは、調査チームの施設に関連する眼科クリニックから主治医12名(緑内障8名、網膜4名)と眼科研修医3名を採用した。 緑内障と網膜の質問 (それぞれ 10 件) は、米国眼科学会 (AAO) のよくある質問からランダムに選択されました。 識別不能の緑内障および網膜の症例 (それぞれ 10 名)…

AI チャットボットは緑内障、網膜疾患管理において眼科医と同等

アンディ・ファン医学博士

クレジット: LinkedIn

人工知能 (AI) モデルは、フェローシップで訓練を受けた眼科医に匹敵するか、それを超える眼科医の診断と管理を行うことができます。 緑内障と網膜の病気新しい研究によると。1

比較横断研究では、大規模言語モデル (LLM) AI システムである GPT-4 は、臨床質問と臨床症例の両方において、参加した眼科専門医 12 名と上級研修医 3 名に対して、比較的診断の精度と完全性を示しました。

「私たちの研究における GPT-4 のパフォーマンスは、非常に目を見張るものでした」と、研究主著者でマウントサイナイのニューヨーク眼科耳鼻科の眼科常駐であるアンディ・ファン医学博士は述べました。私たちは AI システムのテストを開始した瞬間から、GPT-4 が経験豊富な眼科専門医の専門知識を支援するだけでなく、場合によってはそれと同等、またはそれを超えることができることに魅了されました。」

医療の意思決定と患者教育により、LLM が医療にますます統合されており、眼科における AI 利用の可能性が示唆されています。 最近の証拠は、患者の眼科ケアに関するさまざまな質問に対して眼科医と同等の回答を提供する LLM チャットボットの一貫したパフォーマンスと、眼科知識の評価における強力なパフォーマンスを裏付けています。3

しかし、Huangらは、現実の臨床状況に対処するには、訓練を受けた専門家と比較したLLMの正確性をより広範に評価する必要があることを示唆した。 1 現実の可能性を探るため、調査チームはGPT-4の応答とフェローシップで訓練を受けた専門家の応答を評価した。緑内障と網膜の専門家が眼科ベースの質問と患者の症例管理について説明します。

単一施設の比較横断研究では、研究者らは、調査チームの施設に関連する眼科クリニックから主治医12名(緑内障8名、網膜4名)と眼科研修医3名を採用した。 緑内障と網膜の質問 (それぞれ 10 件) は、米国眼科学会 (AAO) のよくある質問からランダムに選択されました。 識別不能の緑内障および網膜の症例 (それぞれ 10 名) が、提携クリニックで受診した眼科患者から無作為に選択されました。

LLM の役割は、眼科医の応答を模倣する簡潔な回答を提供する医療アシスタントとして定義されました。 回答の正確さは、医学的正確さと完全性を示す 10 ポイントのリッカート スケールで測定され、スコアが低いほど精度が非常に低いことを示します。 データは 2023 年 6 月から 8 月まで収集されました。

分析の結果、質問とケースを組み合わせた精度の平均ランクは、LLM チャットボットでは 506.2、緑内障専門医では 403.4 でした (n = 831; Mann-Whitney U = 27976.5; P <.001)。 これらのグループの完全性の平均ランクは、それぞれ 528.3 と 398.7 でした (n = 828; Mann-Whitney U = 25218.5; P <.001)。

一方、精度の平均ランクは、LLM チャットボットで 235.3、網膜専門家で 216.1 でした (n = 440; Mann-Whitney U = 15518.0; P = .17)、これらのグループの完全性の平均ランクはそれぞれ 258.3 と 208.7 でした (n = 439; Mann-Whitney U = 13123.5; P = .005)。

この分析により、リッカートスコアリングの精度の両方において専門家と研修生の違いが特定されました(n = 1271; Kruskal-Wallis H、44.36; P <.001)および完全性リッカートスコア(n = 1268; Kruskal-Wallis H、88.27; P <.001)。 ダン テストを実行した後、調査員は、チャットボットの完全性の評価において、専門家と研修生を除いて、すべてのペアごとの比較の間に大きな違いがあることを特定しました。

全体として、ペアごとの比較では、研修生と専門家の両方がチャットボットの精度と完全性を専門家よりも高く評価しており、専門家はチャットボットの精度に大きな違いがあることを示しています (z = 3.23; z = 3.23; P= .007) および完全性 (z = 5.86; P<.001)。

Huangらは、チャットボットのパフォーマンス向上は、分析で使用されたプロンプト技術、特に眼科ノート形式で臨床医として機能するようLLMに指示したことに起因する可能性があると指摘した。

彼らはさらなる検査の必要性を指摘しましたが、これらのデータは眼科における診断および治療の補助手段としての AI ツールの可能性を裏付けるという信念を共有しました。

「特に複雑な症例や患者数が多い分野では、診断サポートを提供し、眼科医の作業負荷を軽減する可能性があるため、眼科専門医の信頼できるアシスタントとして機能する可能性があります」と Huang 氏は述べています。2 「患者にとって、AI を主流の眼科診療に統合することで、その結果、専門機器への迅速なアクセスが可能になり、治療の指針となるより多くの情報に基づいた意思決定が可能になります。」

参考文献

  • ファン AS、平林 K、バーナ L、パリク D、パスカーレ LR。 緑内障と網膜の管理に関する質問と症例に対する大規模言語モデルの応答の評価。 JAMA眼科。 2024 年 2 月 22 日にオンライン公開。doi:10.1001/jamaophysicalmol.2023.6917
  • アイカーン シナイ山。 人工知能は、網膜と緑内障の管理において人間の専門家と同等か、それを上回っていることがマウント・サイナイ研究で判明した。 ユーレックアラート! 2024 年 2 月 22 日。2024 年 2 月 23 日にアクセス。https://www.eurekalert.org/news-releases/1034711。
  • Bernstein IA、Zhang Y、Govil D、他。 オンラインでの患者の眼科ケアの質問に対する眼科医と大規模言語モデルのチャットボットの応答の比較。 JAMAネットオープン。 2023;6(8):e2330320。 doi:10.1001/jamanetworkopen.2023.30320
  • 1708732094
    #チャットボットは緑内障網膜疾患管理において眼科医と同等
    2024-02-23 23:04:57

    執筆者について: nipponese

    Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。