日本語版
最新ニュース
科学&テクノロジー

治療を推奨する際の無関係な情報のLLMS要因| MITニュース

MITの研究者による研究によると、タイプミス、エクストラホワイトスペース、性別マーカーの欠落、または不確実で劇的で非公式の言語の使用など、患者メッセージの非臨床情報によって、治療の推奨を行うために展開された大規模な言語モデル(LLM)を展開することができます。彼らは、メッセージに文体的または文法的な変更を加えることで、LLMが医療を求めるべき場合でも、LLMが患者が予約するのではなく、報告された健康状態を自己管理することを推奨することを推奨することを発見しました。彼らの分析により、これらの非臨床的変動は、人々が本当にコミュニケーションする方法を模倣しているが、女性患者に対するモデルの治療の推奨事項を変更する可能性が高く、人間の医師によると、誤って医療を求めないように誤って助言された女性の割合が高いことが明らかになりました。この作業は、「モデルはヘルスケアで使用する前に監査しなければならないという強力な証拠です。これは、すでに使用されている環境です」と、MIT電気工学およびコンピューターサイエンス学科(EECS)の准教授であるMarzyeh Ghassemiは、医療工学科学研究所のメンバーであり、研究および意思決定システムの上級著者であるMarzyeh Ghassemiは言います。これらの発見は、LLMが非臨床情報を臨床的意思決定を考慮して以前は未知の方法で考慮していることを示しています。 LLMは、治療の推奨事項などのハイステークスアプリケーションのために展開される前に、LLMのより厳密な研究の必要性を明らかにします、と研究者は言います。「これらのモデルは、多くの場合、臨床症例の重症度を評価するように、よく訓練およびテストされますが、それからかなり遠いタスクで使用されます。LLMSについてはまだ多くのことがあります。彼らはに加わります 紙、大学院生のアイリーン・パンとポスドク・ウォルター・ゲリッチによって、公平性、説明責任、透明性に関するACM会議で発表されます。混合メッセージOpenaiのGPT-4のような大きな言語モデルは慣れています 臨床ノートとトリアージの患者メッセージのドラフト 世界中のヘルスケア施設では、過負荷の臨床医を助けるためにいくつかのタスクを合理化するために。成長する一連の仕事は、特に公平な観点から、LLMSの臨床的推論能力を調査しましたが、非臨床情報がモデルの判断にどのように影響するかを評価した研究はほとんどありません。性別がLLMの推論にどのように影響するかに興味があるGourabathinaは、患者のメモで性別の手がかりを交換した実験を実行しました。彼女は、余分な空白のようなプロンプトのフォーマットエラーがLLM応答に意味のある変化を引き起こしたことに驚きました。この問題を調査するために、研究者は、性別マーカーを交換または削除する、カラフルまたは不確実な言語の追加、または余分なスペースとタイプミスを患者メッセージに挿入することにより、モデルの入力データを変更する研究を設計しました。各摂動は、人々が臨床医とどのようにコミュニケーションをとるかについての心理社会的研究に基づいて、脆弱な患者集団の誰かによって書かれているかもしれないテキストを模倣するように設計されました。たとえば、余分なスペースとタイプミスは、英語の習熟度が限られている患者または技術的適性が少ない患者の執筆をシミュレートし、不確実な言語の追加は健康不安のある患者を表しています。「これらのモデルが訓練されている医療データセットは、通常、洗浄および構造化されており、患者集団を非常に現実的に反映していません。テキストのこれらの非常に現実的な変化がダウンストリームのユースケースにどのように影響するかを見たかったのです」とGourabathina氏は言います。彼らはLLMを使用して、テキストの変更が最小限であり、薬や以前の診断などのすべての臨床データが保存されていることを確認しながら、数千の患者ノートの乱れたコピーを作成しました。次に、大規模な商業モデルGPT-4と、医療環境専用に構築されたより小さなLLMを含む4つのLLMを評価しました。患者に基づいて各LLMに3つの質問を促しました。患者が自宅で管理する必要があり、患者が診療所の訪問に参加した場合、および実験室検査のように医療リソースを患者に割り当てる必要があります。研究者は、LLMの推奨事項を実際の臨床反応と比較しました。一貫性のない推奨事項彼らは、治療の推奨において矛盾を見て、LLMが摂動したデータを供給されたときに大きな不一致を見ました。全面的に、LLMSは、9種類の変更された患者メッセージのすべてについて、自己管理提案の7〜9%の増加を示しました。これは、LLMSが、たとえば、メッセージがタイプミスや性的中性代名詞を含む場合、患者が医療を求めないことを推奨する可能性が高いことを意味します。スラングやドラマチックな表現のようなカラフルな言語の使用は、最大の影響を及ぼしました。彼らはまた、モデルが女性患者に約7%多くのエラーを発生させ、研究者が臨床的文脈からすべての性別の手がかりを削除した場合でも、女性患者が自宅で自己管理することを推奨する可能性が高いことを発見しました。患者が深刻な病状を持っているときに自己管理を言われたように、最悪の結果の多くは、モデルの全体的な臨床精度に焦点を当てたテストによって捕捉されない可能性があります。「研究では、集約された統計を検討する傾向がありますが、翻訳で失われたものがたくさんあります。これらのエラーが発生している方向を見る必要があります。非臨床言語によって引き起こされる矛盾は、LLMが患者と相互作用する会話設定でさらに顕著になります。これは、患者向けのチャットボットの一般的なユースケースです。しかし、 フォローアップ作業、研究者は、患者メッセージのこれらの同じ変化が人間の臨床医の精度に影響しないことを発見しました。「レビュー中のフォローアップ作業では、大規模な言語モデルは、人間の臨床医がそうではない変化に脆弱であることがわかります」とガセミは言います。 「これはおそらく驚くべきことではありません。LLMは、患者の医療に優先順位を付けるように設計されていません。LLMは平均して柔軟でパフォーマンスがあり、これは良い例だと思うかもしれません。しかし、特定のグループの患者のみに役立つヘルスケアシステムを最適化したくありません。」研究者は、他の脆弱な集団を捕らえ、実際のメッセージをよりよく模倣する自然言語の摂動を設計することにより、この作業を拡大したいと考えています。彼らはまた、LLMが臨床テキストから性別をどのように推測するかを探求したいと考えています。 #治療を推奨する際の無関係な情報のLLMS要因 #MITニュース

治療を推奨する際の無関係な情報のLLMS要因| MITニュース

1750748606
2025-06-23 04:00:00

MITの研究者による研究によると、タイプミス、エクストラホワイトスペース、性別マーカーの欠落、または不確実で劇的で非公式の言語の使用など、患者メッセージの非臨床情報によって、治療の推奨を行うために展開された大規模な言語モデル(LLM)を展開することができます。

彼らは、メッセージに文体的または文法的な変更を加えることで、LLMが医療を求めるべき場合でも、LLMが患者が予約するのではなく、報告された健康状態を自己管理することを推奨することを推奨することを発見しました。

彼らの分析により、これらの非臨床的変動は、人々が本当にコミュニケーションする方法を模倣しているが、女性患者に対するモデルの治療の推奨事項を変更する可能性が高く、人間の医師によると、誤って医療を求めないように誤って助言された女性の割合が高いことが明らかになりました。

この作業は、「モデルはヘルスケアで使用する前に監査しなければならないという強力な証拠です。これは、すでに使用されている環境です」と、MIT電気工学およびコンピューターサイエンス学科(EECS)の准教授であるMarzyeh Ghassemiは、医療工学科学研究所のメンバーであり、研究および意思決定システムの上級著者であるMarzyeh Ghassemiは言います。

これらの発見は、LLMが非臨床情報を臨床的意思決定を考慮して以前は未知の方法で考慮していることを示しています。 LLMは、治療の推奨事項などのハイステークスアプリケーションのために展開される前に、LLMのより厳密な研究の必要性を明らかにします、と研究者は言います。

「これらのモデルは、多くの場合、臨床症例の重症度を評価するように、よく訓練およびテストされますが、それからかなり遠いタスクで使用されます。LLMSについてはまだ多くのことがあります。

彼らはに加わります 、大学院生のアイリーン・パンとポスドク・ウォルター・ゲリッチによって、公平性、説明責任、透明性に関するACM会議で発表されます。

混合メッセージ

OpenaiのGPT-4のような大きな言語モデルは慣れています 臨床ノートとトリアージの患者メッセージのドラフト 世界中のヘルスケア施設では、過負荷の臨床医を助けるためにいくつかのタスクを合理化するために。

成長する一連の仕事は、特に公平な観点から、LLMSの臨床的推論能力を調査しましたが、非臨床情報がモデルの判断にどのように影響するかを評価した研究はほとんどありません。

性別がLLMの推論にどのように影響するかに興味があるGourabathinaは、患者のメモで性別の手がかりを交換した実験を実行しました。彼女は、余分な空白のようなプロンプトのフォーマットエラーがLLM応答に意味のある変化を引き起こしたことに驚きました。

この問題を調査するために、研究者は、性別マーカーを交換または削除する、カラフルまたは不確実な言語の追加、または余分なスペースとタイプミスを患者メッセージに挿入することにより、モデルの入力データを変更する研究を設計しました。

各摂動は、人々が臨床医とどのようにコミュニケーションをとるかについての心理社会的研究に基づいて、脆弱な患者集団の誰かによって書かれているかもしれないテキストを模倣するように設計されました。

たとえば、余分なスペースとタイプミスは、英語の習熟度が限られている患者または技術的適性が少ない患者の執筆をシミュレートし、不確実な言語の追加は健康不安のある患者を表しています。

「これらのモデルが訓練されている医療データセットは、通常、洗浄および構造化されており、患者集団を非常に現実的に反映していません。テキストのこれらの非常に現実的な変化がダウンストリームのユースケースにどのように影響するかを見たかったのです」とGourabathina氏は言います。

彼らはLLMを使用して、テキストの変更が最小限であり、薬や以前の診断などのすべての臨床データが保存されていることを確認しながら、数千の患者ノートの乱れたコピーを作成しました。次に、大規模な商業モデルGPT-4と、医療環境専用に構築されたより小さなLLMを含む4つのLLMを評価しました。

患者に基づいて各LLMに3つの質問を促しました。患者が自宅で管理する必要があり、患者が診療所の訪問に参加した場合、および実験室検査のように医療リソースを患者に割り当てる必要があります。

研究者は、LLMの推奨事項を実際の臨床反応と比較しました。

一貫性のない推奨事項

彼らは、治療の推奨において矛盾を見て、LLMが摂動したデータを供給されたときに大きな不一致を見ました。全面的に、LLMSは、9種類の変更された患者メッセージのすべてについて、自己管理提案の7〜9%の増加を示しました。

これは、LLMSが、たとえば、メッセージがタイプミスや性的中性代名詞を含む場合、患者が医療を求めないことを推奨する可能性が高いことを意味します。スラングやドラマチックな表現のようなカラフルな言語の使用は、最大の影響を及ぼしました。

彼らはまた、モデルが女性患者に約7%多くのエラーを発生させ、研究者が臨床的文脈からすべての性別の手がかりを削除した場合でも、女性患者が自宅で自己管理することを推奨する可能性が高いことを発見しました。

患者が深刻な病状を持っているときに自己管理を言われたように、最悪の結果の多くは、モデルの全体的な臨床精度に焦点を当てたテストによって捕捉されない可能性があります。

「研究では、集約された統計を検討する傾向がありますが、翻訳で失われたものがたくさんあります。これらのエラーが発生している方向を見る必要があります。

非臨床言語によって引き起こされる矛盾は、LLMが患者と相互作用する会話設定でさらに顕著になります。これは、患者向けのチャットボットの一般的なユースケースです。

しかし、 フォローアップ作業、研究者は、患者メッセージのこれらの同じ変化が人間の臨床医の精度に影響しないことを発見しました。

「レビュー中のフォローアップ作業では、大規模な言語モデルは、人間の臨床医がそうではない変化に脆弱であることがわかります」とガセミは言います。 「これはおそらく驚くべきことではありません。LLMは、患者の医療に優先順位を付けるように設計されていません。LLMは平均して柔軟でパフォーマンスがあり、これは良い例だと思うかもしれません。しかし、特定のグループの患者のみに役立つヘルスケアシステムを最適化したくありません。」

研究者は、他の脆弱な集団を捕らえ、実際のメッセージをよりよく模倣する自然言語の摂動を設計することにより、この作業を拡大したいと考えています。彼らはまた、LLMが臨床テキストから性別をどのように推測するかを探求したいと考えています。

#治療を推奨する際の無関係な情報のLLMS要因 #MITニュース

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。