私たちの研究では、専門家のパネルが提供するコンセンサスの回答を使用して、3つのLLMS(ジェミニ、カピロー、およびChatGPT-4.0)の3つのLLMSのアラインメントを評価しました。調査結果は、ジェミニが調べた他のLLMと比較して、専門家のコンセンサスとのより高い程度の合意を一貫して実証したことを示しています。具体的には、Geminiは、多数の意見に関係なく、コンセンサスメンバーの回答の大部分とコンセンサスに参加した9人のレビュアーの両方の回答との互換性に優れていました。さらに、一般的に利用されている3つのLLMのうち、ジェミニは、完璧なまたは優れたコンセンサスが達成されたクエリで最も整合していました。
ただし、これは、複数のガイドラインソースに基づいて回答の絶対的正しさを評価するのではなく、LLMSが確立された専門家のコンセンサスとどの程度適切に整合するかを評価するために特別に設計されたため、これは私たちの発見の妥当性を損なうものではありません。臨床診療では、さまざまなガイドラインにわたる推奨事項の変動は十分に認識されており、個々のガイドラインまたはその解釈に固有の欠陥を示していません。将来の研究は、異なるLLMが多様な臨床ガイドラインを統合し、優先順位付けする方法をさらに調査し、意思決定プロセスに関する追加の洞察を提供することができます。
ジェミニは、コンセンサスとの著しく高いレベルの同意を実証し、コンセンサス参加者の大多数の関係者と主に類似した回答を提供しました。これは、ジェミニが専門家の意見と一致する臨床症例の例を理解し、適切に解釈する上でより良いパフォーマンスを持っている可能性があることを示唆しています。対照的に、質問の41.4%のみがChatGPT-4.0とCopilotによってコンセンサスと一致し、専門家のガイドラインとの堅牢性の低い整合性を示しています。特に、ジェミニは、全体的な応答を9人のレビュアーの反応と比較すると、82.7%の契約率を達成しました。これらの調査結果は、Geminiが専門家のガイドラインへの強力な適合性を必要とするアプリケーションのより信頼できるツールである可能性があることを示しています。 [7]。さらに、ジェミニの専門家評価との同意率が高いことは、臨床医が腎coli痛の患者にイメージングの決定を下すのに役立つ可能性があることを示唆しています。ジェミニスケールの高いレベルの合意は、最高のスコアリング応答を備えています。さらに、Geminiおよびその他のLLMは、新しいアップデートごとに、より敏感な評価機能を備えています。より多くのデータセットを使用し、新しいアップデートごとにより細かい分析機能の開発により、臨床コンテキストでより正確な結果を達成できます。将来の研究は、これらのLLM、特にジェミニの信頼性と精度を新しいアップデートでどのように改善できるかに焦点を当てることにより、このテーマの知識と経験の向上に貢献できます。
AI対応LLMSの使用は、臨床症例評価でのパフォーマンスに注目を集める可能性がありますが、AIテクノロジーをヘルスケアシステムに統合することで、慎重な検討を必要とする重要な倫理的および法的懸念が生じます。 [13, 14]。これらの複雑なモデルが重要な臨床的意思決定プロセスにますます組み込まれるようになるにつれて、患者の転帰への潜在的な影響に関連する多面的なリスクと責任を綿密に評価することが重要です。主要かつ差し迫った倫理的問題は、AIシステム内の意思決定メカニズムの透明性と説明可能性に関係しています。医療提供者は、患者の信頼を維持し、適切な治療を確保するために、これらのAIシステムによって生成された推奨事項と理論的根拠を理解し、信頼できる必要があります。説明可能性の欠如は、説明責任の明確なラインを確立する上で深い課題につながる可能性があり、医療専門家またはAIシステムが患者の幸福に大きな影響を与える可能性のある誤ったまたは最適ではない決定に対する責任を負うかどうかを判断することを非常に困難にします [15]。この適応は、患者の信頼を保護し、AIのヘルスケアへの統合が損なうのではなく、患者ケアの質と信頼性を確保するために不可欠です。
制限
この研究には、調査結果を解釈する際に考慮すべきいくつかの制限があります。第一に、LLMに提起された質問のタイプと言い回しの変動は、彼らの応答に影響を与える可能性があり、結論に影響を与える可能性のある変動性を導入します。ただし、29の臨床シナリオの標準化されたセットを使用すると、この変動性を軽減し、比較の一貫した根拠を確保します。
第二に、調査の一般化可能性は、特定のシナリオと提示された質問によって制限されます。結果はすべての医学的調査には適用されないかもしれませんが、選択されたシナリオは救急部門の一般的な臨床状況を表しています。この関連性は、意図したコンテキスト内の調査結果の適用性をサポートします。第三に、各ビネットは私たちの研究で一度だけ提示されました。反復テストは、研究の結果の質と堅牢性を高める可能性があります。別の制限は、私たちの研究では電力分析が適用されなかったことです。代わりに、この研究は、コンセンサスレポートのすべてのビネットを使用して設計されました。最後に、CopilotはChatGPT-4.0のインフラストラクチャを使用します。ただし、Microsoftデータベースをインフラストラクチャに統合し、よりバランスのとれた創造的で正確な回答の生成に焦点を当てています。したがって、同様のインフラストラクチャを使用していますが、異なるアプローチを使用して指定されたデータで結果に達し、これら2つのLLMモデルを互いに区別します。
これらの制限にもかかわらず、研究の設計とシナリオの選択は、その結論の強力な基盤を提供します。将来の研究は、これらの制限にさらに対処して、ヘルスケアの設定におけるLLMの理解を高めることができます。
1751618519
#腎coli痛の推奨事項のための大規模な言語モデルの評価ジェミニ副操縦士およびchatgpt4.0の比較分析救急医療の国際ジャーナル
2025-07-04 08:08:00