トップライン:
大規模な言語モデル(LLMS)は、リウマチ学の質問への回答において異なって機能します。CHATGPT-4は、Gemini AdvancedおよびClaude 3 Opusよりも高い精度と品質を示しています。ただし、3つすべての誤った回答の70%以上が害を引き起こす可能性がありました。
方法論:
- 研究者は、3つのLLMの精度、品質、および安全性を評価しました。つまり、Gemini Advanced、Claude 3 Opus、およびChatGpt-4を評価しました。
- 彼らは40の質問を使用し、そのうち30がランダムに選択され、10が必要な画像評価が10でした。
- さまざまな国の5人の理事会認定リウマチ専門医が、LLMSが提供するすべての答えを独立して評価しました。
- 各LLMの回答を質問銀行が提供する正解と比較することにより、精度を評価しました。
- 品質は、科学的コンセンサス、理解、検索、推論、不適切なコンテンツ、不足しているコンテンツを評価するフレームワークを使用して評価されましたが、潜在的な害を評価することによって安全性が評価されました。
取り除く:
- CHATGPT-4は78%で最高の精度を達成し、Claude 3 Opus(63%)とGemini Advanced(53%)を上回り、70%がケア質問銀行の合格しきい値です。
- 画像を含む質問の場合、ChatGPT-4とClaude 3 Opusはそれぞれ80%の精度を達成しましたが、Gemini Advancedは30%の精度を達成しました。
- ChatGPT-4は、一般的に品質が高い回答を生み出しました。それは科学的コンセンサスでクロード3オプスを上回った(p p = .0074)、および不足しているコンテンツ(p = .011)そして、すべての品質関連のドメインで進歩したジェミニを上回ります(p
- Claude 3 Opusは、28%で潜在的に有害な回答の最も高い割合を生み出し、Gemini Advanced 15%、ChatGPT-4が13%でAdvancedを獲得しました。
実際に:
「私たちの調査結果は、CHATGPT-4が現在、リウマチ学にとってより正確で信頼性の高いLLMであり、現在の科学的コンセンサスとうまく調和し、不適切または欠落しているコンテンツ要素を含むことを示唆しています」と著者は書いています。 「患者と臨床医の両方が、LLMが非常に説得力のあるが潜在的に有害な答えを提供できることに注意する必要があります。 LLMSの継続的な評価は、特にリウマチ学などの複雑な分野では、安全な臨床応用に不可欠です」と彼らは付け加えました。
ソース:
この研究は、ミネソタ州ロチェスターのメイヨークリニックのハイメ・フローレス・グーヨンネットが主導しました。そうだった オンラインで公開されています 2025年1月22日、インチ ランセットリウマチ学。
制限:
単一の質問銀行からの質問の使用は、調査結果の一般化性を他の情報源または実際の臨床シナリオに制限する場合があります。評価フレームワークは、生成的人工知能のためのツールから採用されており、LLMSの評価のために特別に検証されていません。 LLMSの急速な進化により、パフォーマンスの違いはおそらく時間とともに変化します。
開示:
ある著者は、リウマチ研究研究財団調査員賞、ループス研究賞のループス研究アライアンスの多様性、疾病管理予防センター、メイヨークリニックの支援を受けました。著者は、利益相反を宣言しませんでした。
1737968680
#llmsリウマチ学の質問への回答があまり大きくありません
2025-01-27 08:39:00