委員会の試験タイプの質問に答えるために、ChatGPT バージョン 3.5 および 4.0 に対して小児皮膚科医の知恵を競う実験では、小児皮膚科医が人工知能 (AI) ベースのツールの両方の反復を上回ったことが、小規模な単一施設研究の結果によって示されました。
「私たちの研究では、小児皮膚科医が多肢選択式質問と症例ベースの質問の両方で ChatGPT よりも優れた成績を収めていることがわかり、安心しました。しかし、最新の ChatGPT (4.0) は非常に僅差でした。」とこの研究の最初の著者の 1 人である Charles Huang 氏は述べています。とフィラデルフィアのトーマス・ジェファーソン大学医学生4年生はインタビューで語った。 「私たちのデータで他に興味深い点は、皮膚科/外科手術技術に関連する質問に関して、小児皮膚科医の方が ChatGPT よりもはるかに優れた成績を収めていたことです。これはおそらく、実際の経験を通じて得られた知識/推論が ChatGPT などの AI ツールでは簡単に再現されないことを示していると考えられます」 。」
のために 研究5月9日に掲載されました 小児皮膚科Huang氏と、共著者のペンシルベニア大学フィラデルフィア校の医学生エスター・チャン理学士、およびフィラデルフィア小児病院皮膚科の共著者らは、5人の小児皮膚科医に、16の単一質問を含む24のテキストベースの質問に答えるように依頼した。 -米国皮膚科学会の 2021 年認定サンプル テストから抽出された、複数選択の質問と 2 つの複数回答の質問、および「Photoquiz」セクションから抽出された 6 つの自由回答の症例ベースの質問 小児皮膚科 次に研究者らは、ChatGPT バージョン 3.5 および 4.0 を通じて同じ質問セットを処理し、統計分析を使用して小児皮膚科医と ChatGPT の間の回答を比較しました。 現在の AI ツールを応用した 5 段階評価を使用して、ケースベースの質問への回答を採点しました。
研究参加者は平均して5.6年の臨床経験を持っていました。 小児皮膚科医は、多肢選択式および複数回答式の質問において、ChatGPT バージョン 3.5 よりも大幅に優れた成績を示しました (それぞれ 91.4% 対 76.2%。 P = .021) ですが、ChatGPT バージョン 4.0 (90.5%; P = .44)。 症例ベースの質問への回答に関して、5 段階評価に基づく平均成績は、小児皮膚科医では 3.81、ChatGPT 全体では 3.53 でした。 平均スコアは、ChatGPT バージョン 3.5 よりも小児皮膚科医の方が有意に高かった (P = .039) ですが、ChatGPT バージョン 4.0 ではありません (P = .43)。
研究者らは、AI ツールの進化する性質など、分析には一定の限界があり、その後のモデル更新による結果の再現性に影響を与える可能性があることを認めました。 また、参加した小児皮膚科医らは、この研究で使われた質問や症例には馴染みがないとしながらも、「他の皮膚科委員会の検査審査プロセスを通じて事前に曝露された可能性がある」と書いている。
「ChatGPT や同様の大規模言語モデルなどの AI ツールは、臨床現場で貴重なツールとなり得ますが、患者のプライバシー、医療上の不正確さ、医療上の不正確さなどの潜在的な落とし穴に注意してください。 [and] 「ツールには本質的なバイアスがある」とフアン氏は報道機関に語った。「これらの技術は進歩し続けるので、私たち臨床医全員が電子医療記録や電子医療記録に適応したのと同じように、慣れ親しんで新しい展開に遅れないようにすることが不可欠です」インターネットの使用。」
マリア・ビューテ、医学博士、博士この研究についてコメントを求められたサンディエゴのラディ小児病院の小児皮膚科研究員は、ChatGPT バージョン 4.0 がテストされたシナリオの一部で臨床医の反応と同等の結果を出し始めたことは「興味深い」と感じたと述べた。 「著者らは、ChatGPT やその他の AI ツールを使用する小児皮膚科医向けの一連のベスト プラクティスを提案しています」と、最近の論文の上級著者である Buethe 氏は述べています。 文献レビュー AI と小児皮膚科への応用について。 「AI ツールの興味深い推奨される用途の 1 つは、これを利用して鑑別診断を生成することです。これにより、これまでに考慮された病状のリストを広げることができます。」
エラム・イリヤス医師、 ペンシルベニア州キング・オブ・プロイセンで皮膚科を開業している。 小児皮膚科学会の会員です。 研究についてのコメントを求められた彼女は、研究で示されているように、ChatGPTが「テスト環境で利用できることが判明した多肢選択問題でかなりうまく機能する」ことに驚かなかったと述べた。 「委員会の質問は、臨床医が習得すべき医学知識と事実の基礎をテストすることをサポートするだけであるのと同様に、本質的に微妙な患者のケアに当てはまる現実の状況を必ずしも提供するとは限りません。」
さらに、この研究では、「特に患者のプライバシーを尊重しながら、事実確認の回答の文脈で十分なデータが提供された場合、質問の表現方法を理解している臨床医が入力したデータに基づいて、ChatGPT が差異を考慮して考えるのを支援できることを強調している」 」とイリヤスは言った。 「このことは、臨床医にとって AI ツールが入力されたさまざまなデータポイントを吸収するのに役立つという事実を裏付けています。しかし、最終的にこのツールは、アクセスできる情報に基づいた出力しかサポートできません。」 さらに、「ChatGPT は、臨床医が最終診断を行う責任を負うため、単一の診断を提供することはできません。このツールは決定的なものではなく、正しく入力されていないデータを取り込むことはできません。」と付け加えました。
この研究には資金が提供されておらず、研究著者らは何も開示していないと報告した。 ビューテ氏とイリヤス氏は研究に関与していなかったが、開示はなかった。
1715866815
#ChatGPT #と対峙する小児皮膚科医の知恵
2024-05-16 13:24:17