1714213537
1970-01-01 00:00:00
専門家がさまざまな時間間隔で実験を繰り返し、プロンプトを微調整しても、GPT-4 は依然として学生の成績に追いつくのに苦労しました。 微調整しても GPT-4 の答えは改善されませんでした。 実際、質問が繰り返されると、25% 以上の確率で答えが変わり、精度は向上しませんでした。
GPT-4 は多数の重篤な状態を正確に診断しましたが、大動脈瘤破裂などのいくつかの致命的な状態を特定できませんでした。 精度にはばらつきがあるにもかかわらず、大規模言語モデルは、その回答が正しいかどうかに関係なく、回答の 80% 以上に高い信頼性を示しました。
この研究の責任著者で、ニューヨークのストーニーブルック大学病院の放射線科主任レジデントであるデイビッド・L・ペイン氏とその同僚は、研究結果は同様の大規模な言語モデルが潜在的に非常に有用であることを示唆しているが、「臨床現場での信頼性を確保するには継続的なモニタリングが必要である」とアドバイスした。 」
「一般的な(そして狭い)AI 放射線学システムの臨床実装者は、偽りではあるが自信を持った応答が発生する可能性や、時間の経過に伴う同一の入力による高度な出力変動の可能性を考慮して、注意を払う必要があります。」
#GPT4 #は放射線科の試験で自信を持って苦戦する