日本語版
最新ニュース
世界

新しい研究では、GPT-4 は臨床推論において医師を上回っていましたが、間違っていることも多かったです

新しい 勉強ベス・イスラエル・ディーコネス・メディカルセンター(BIDMC)の科学者らは、大規模言語モデルの臨床推論能力を人間の医師の対応物と比較した。 研究者らは、一般的に使用されている改訂 IDEA (r-IDEA) スコアを使用しました。 道具 臨床推論を評価するため。 この研究では、GPT-4 を利用したチャットボット、21 人の主治医、および 18 人の研修医に 20 の臨床症例を与え、診断推論を確立し、作業を進めることが必要でした。 次に、3 つの回答セットすべてが r-IDEA スコアを使用して評価されました。 研究者らは、チャットボットが実際に最も高い r-IDEA スコアを獲得し、診断推論に関して非常に優れていることが実際に証明されたことを発見しました。 しかし、著者らは、チャットボットが「まったく間違っている」ことがより頻繁にあったとも指摘しました。 この研究の筆頭著者であるステファニー・カブラル医学博士は、「LLMを臨床現場にどのように組み込むのが最適かを決定するにはさらなる研究が必要だが、現時点でも、LLMはチェックポイントとして役立つ可能性があり、私たちがLLMを適切に導入できないかどうかを確認するのに役立つ可能性がある」と説明した。何かを見逃してはいけません。」 要約すると、結果はチャットボットによる正しい推論を示しましたが、重大な間違いも示しました。 これは、これらの AI を活用したシステムが、医師の診断能力を置き換えるのではなく、医師の診療を強化するツールとして (少なくとも現在の成熟度レベルでは) 最適であるという考えをさらに強化します。 カリフォルニア州サンフランシスコ - 11月6日: OpenAI CEOのサム・アルトマン氏がOpenAI DevDayイベントで講演... [+] 2023年11月6日、カリフォルニア州サンフランシスコで。…

新しい研究では、GPT-4 は臨床推論において医師を上回っていましたが、間違っていることも多かったです

1712024215
2024-04-02 02:06:35

新しい 勉強ベス・イスラエル・ディーコネス・メディカルセンター(BIDMC)の科学者らは、大規模言語モデルの臨床推論能力を人間の医師の対応物と比較した。 研究者らは、一般的に使用されている改訂 IDEA (r-IDEA) スコアを使用しました。 道具 臨床推論を評価するため。

この研究では、GPT-4 を利用したチャットボット、21 人の主治医、および 18 人の研修医に 20 の臨床症例を与え、診断推論を確立し、作業を進めることが必要でした。 次に、3 つの回答セットすべてが r-IDEA スコアを使用して評価されました。 研究者らは、チャットボットが実際に最も高い r-IDEA スコアを獲得し、診断推論に関して非常に優れていることが実際に証明されたことを発見しました。 しかし、著者らは、チャットボットが「まったく間違っている」ことがより頻繁にあったとも指摘しました。

この研究の筆頭著者であるステファニー・カブラル医学博士は、「LLMを臨床現場にどのように組み込むのが最適かを決定するにはさらなる研究が必要だが、現時点でも、LLMはチェックポイントとして役立つ可能性があり、私たちがLLMを適切に導入できないかどうかを確認するのに役立つ可能性がある」と説明した。何かを見逃してはいけません。」 要約すると、結果はチャットボットによる正しい推論を示しましたが、重大な間違いも示しました。 これは、これらの AI を活用したシステムが、医師の診断能力を置き換えるのではなく、医師の診療を強化するツールとして (少なくとも現在の成熟度レベルでは) 最適であるという考えをさらに強化します。

カリフォルニア州サンフランシスコ – 11月6日: OpenAI CEOのサム・アルトマン氏がOpenAI DevDayイベントで講演… [+] 2023年11月6日、カリフォルニア州サンフランシスコで。 アルトマン氏は、史上初の Open AI DevDay カンファレンスで基調講演を行いました。(写真提供: Justin Sullivan/Getty Images)

ゲッティイメージズ

医師の指導者や技術者によってよく説明されるように、これは医療の実践がルールのアルゴリズム出力に純粋に基づいているのではなく、むしろ深い推論と臨床的直観に基づいているためであり、LLM がこれを再現するのは困難であるためです。 。 それにもかかわらず、診断または臨床サポートを提供できるこのようなツールは、依然として医師のワークフローにおいて非常に強力な資産となり得ます。 たとえば、システムが患者の病歴や既存の記録などの利用可能なデータに基づいて「ファーストパス」または最初の診断の提案を合理的に提供できれば、医師は診断プロセスに大幅な時間を節約できる可能性があります。 さらに、これらのツールが医師のワークフローを強化し、医療記録からの大量の臨床情報を処理する手段を改善できれば、効率が向上する可能性があります。

多くの組織が臨床増強のためにこれらの潜在的な手段を活用しています。 たとえば、人工知能を利用したスクライビング技術は自然言語処理を活用して、医師が臨床文書をより効率的に完成できるようにしています。 エンタープライズ検索ツールは組織内および EMR システムと統合されており、医師が大量のデータを検索し、データの相互運用性を促進し、既存の患者データについてより迅速かつより深い洞察を収集できるようにしています。 他のシステムは初期診断の提供に役立つ場合もあります。 たとえば、放射線科や皮膚科の分野では、アップロードされた写真を分析して潜在的な診断を提案できるツールが登場しています。

それにもかかわらず、この分野ではやるべきことがまだたくさんあります。 簡単に言うと、このような AI システムは臨床診断にはまだ対応していませんが、このテクノロジーを活用して臨床ワークフローを強化する機会はまだあるかもしれません。特に、安全、安心、正確なプロセスを確保するために人間が常に最新情報を把握できるようにする必要があります。

#新しい研究ではGPT4 #は臨床推論において医師を上回っていましたが間違っていることも多かったです

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。