日本語版
最新ニュース
健康

肌の色を診断する際のChatGPT-3.5とGPT-4の精度を比較する研究

新たな調査結果によると、GPT-3.5 と GPT-4 では、精密検査や組織病理学に基づいて有色人種以外の患者グループと有色人種の患者グループを評価する際の人工知能 (AI) モデルの精度に大きな違いはなく、両方のモデルとも 72%~100% という高い診断精度を示しています。1これらのデータは、ChatGPTの実装に関する文献の増加を強調することから始まった新しい研究レターに含まれていました。 皮膚科 アプリケーションがユーザーの入力に対して人間のようなテキスト応答を生成できることを考えると、スペースは限られます。カナダのニューファンドランドメモリアル大学医学部のシマル・クレシ氏が率いる研究者らは、このアプリケーションには標準モデル(GPT-3.5)とプレミアムバージョン(GPT-4)があり、後者の方が処理能力が高いと指摘した。クレシ氏らは、AIデータセットには有色人種の肌の症例が含まれていないことが多いという広く信じられている見解を指摘した。2「しかし、臨床医や医療研修生にとって貴重なツールとなる可能性のある、(有色人種の)皮膚に関する臨床情報を提供するこのモデルの精度を調査した研究はない」とクレシ氏らは書いている。「そのため、私たちは、(有色人種の)皮膚の場合と(有色人種の)皮膚以外の場合の両方で皮膚疾患を診断する際のChatGPTの精度を理解しようとした。」1研究デザイン研究チームは合計 29 件の症例を評価し、そのうち 14 件は有色人種の皮膚以外のグループの患者に割り当てられた一般的な皮膚科の教科書から引用しました。このうち 15 件は有色人種の皮膚を対象とした皮膚科の教科書から引用し、研究期間中にこのグループに割り当てました。チームが評価した症例は、両コホートにわたるさまざまな皮膚疾患を網羅していました。各症例の病歴と身体検査の詳細は、研究者によって GPT-3.5 および GPT-4 モデルに入力され、医学用語が使用され、AI に質問が投げかけられて上位 3 つの鑑別診断が特定されました。研究チームが画像や臨床検査などの追加の診断データを作成できる場合は、それを追加します。その後、AI アプリケーションに問い合わせが行われ、最終的な診断の提供が要求されます。有色人種の皮膚症例のうち 12 件には組織病理学的報告が含まれ、これらも最終的な病気診断を生成するためにシステムに追加されました。その後、カイ二乗検定が実施され、有色人種の肌と非有色人種の肌コホート内で GPT-3.5 と GPT-4 の診断精度を評価および比較しました。ChatGPT-3.5 と GPT-4 の比較どちらの研究群も年齢と性別の分布は同様であると報告されている。しかし、有色人種以外の症例では、有色人種の症例と比較して語数が長いことが指摘されている(251.4語対145.9語、 ポ= .01)。この事実にもかかわらず、これはどちらのモデルの患者診断精度とも相関しませんでした(相関係数はそれぞれ r = .11…

肌の色を診断する際のChatGPT-3.5とGPT-4の精度を比較する研究

新たな調査結果によると、GPT-3.5 と GPT-4 では、精密検査や組織病理学に基づいて有色人種以外の患者グループと有色人種の患者グループを評価する際の人工知能 (AI) モデルの精度に大きな違いはなく、両方のモデルとも 72%~100% という高い診断精度を示しています。1

これらのデータは、ChatGPTの実装に関する文献の増加を強調することから始まった新しい研究レターに含まれていました。 皮膚科 アプリケーションがユーザーの入力に対して人間のようなテキスト応答を生成できることを考えると、スペースは限られます。

カナダのニューファンドランドメモリアル大学医学部のシマル・クレシ氏が率いる研究者らは、このアプリケーションには標準モデル(GPT-3.5)とプレミアムバージョン(GPT-4)があり、後者の方が処理能力が高いと指摘した。クレシ氏らは、AIデータセットには有色人種の肌の症例が含まれていないことが多いという広く信じられている見解を指摘した。2

「しかし、臨床医や医療研修生にとって貴重なツールとなる可能性のある、(有色人種の)皮膚に関する臨床情報を提供するこのモデルの精度を調査した研究はない」とクレシ氏らは書いている。「そのため、私たちは、(有色人種の)皮膚の場合と(有色人種の)皮膚以外の場合の両方で皮膚疾患を診断する際のChatGPTの精度を理解しようとした。」1

研究デザイン

研究チームは合計 29 件の症例を評価し、そのうち 14 件は有色人種の皮膚以外のグループの患者に割り当てられた一般的な皮膚科の教科書から引用しました。このうち 15 件は有色人種の皮膚を対象とした皮膚科の教科書から引用し、研究期間中にこのグループに割り当てました。

チームが評価した症例は、両コホートにわたるさまざまな皮膚疾患を網羅していました。各症例の病歴と身体検査の詳細は、研究者によって GPT-3.5 および GPT-4 モデルに入力され、医学用語が使用され、AI に質問が投げかけられて上位 3 つの鑑別診断が特定されました。

研究チームが画像や臨床検査などの追加の診断データを作成できる場合は、それを追加します。その後、AI アプリケーションに問い合わせが行われ、最終的な診断の提供が要求されます。

有色人種の皮膚症例のうち 12 件には組織病理学的報告が含まれ、これらも最終的な病気診断を生成するためにシステムに追加されました。

その後、カイ二乗検定が実施され、有色人種の肌と非有色人種の肌コホート内で GPT-3.5 と GPT-4 の診断精度を評価および比較しました。

ChatGPT-3.5 と GPT-4 の比較

どちらの研究群も年齢と性別の分布は同様であると報告されている。しかし、有色人種以外の症例では、有色人種の症例と比較して語数が長いことが指摘されている(251.4語対145.9語、 = .01)。この事実にもかかわらず、これはどちらのモデルの患者診断精度とも相関しませんでした(相関係数はそれぞれ r = .11 と .26)。

全体として、追加の検査や組織病理学に基づいて鑑別診断や最終診断を下す際の精度において、GPT-3.5 と GPT-4 の間には研究者によって有意な差は確認されませんでした。注目すべき発見は、追加の臨床データが追加されると GPT-3.5 の精度が低下することが示されたのに対し、追加データが含まれると GPT-4 の精度が向上したことです。

GPT-4を使用した場合、組織病理学を含む有色人種の皮膚症例の100%で正しい診断が行われ、GPT-3の正確率は66.7%であったのとは対照的でした。ただし、この違いは研究チームによって統計的に有意であるとは報告されていません(= .093)。

これらの調査結果が意味するもの

この新しい研究では、これらの AI モデルが高いレベルの診断精度 (72%~100%) を維持していることが実証され、チームはこれらの属性が両方の患者コホートで同等であると結論付けました。

研究者らは、研究の限界を認めており、サンプル数が少なく、有色人種のコホートは黒人またはヒスパニックと特定される個人のみで構成されていたと指摘した。さらに、研究チームは、事例が 2 冊の教科書からのみ選択されたため、一般化の可能性が限られていると述べた。

「AIツールが臨床現場でますます使用されるようになるにつれて、皮膚科医は多様な肌タイプへの影響を理解する必要がある」と研究者らは書いている。「SOCの症状診断におけるChatGPTの有効性を向上させるには、モデルのトレーニングに使用した科学文献に、(有色人種の)患者を対象としたより大規模なサンプルサイズの研究をさらに含める必要がある。」

参考文献

  • Qureshi S、Alli SR、Ogunyemi B (2024)。皮膚科における有色人種の皮膚の臨床シナリオの診断におけるChatGPT-3.5とGPT-4の精度。Int J Dermatol。https://doi.org/10.1111/ijd.17425。
  • Butt S、Butt H、Gnanappiragasam D。皮膚科における人工知能の有色人種患者への予期せぬ影響。Clin Exp Dermatol。2021; 46(7): 1333–1334。
  • 1724793889
    #肌の色を診断する際のChatGPT3.5とGPT4の精度を比較する研究
    2024-08-27 21:03:04

    執筆者について: nipponese

    Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。