1767799237
2026-01-07 10:00:00
多くの女性が AI を利用して健康情報を取得していますが、その答えが常に最新のものであるとは限りません
オスカー・ウォン/ゲッティイメージズ
一般的に使用されている AI モデルは、緊急の対応が必要な女性の健康に関する多くの質問に対して正確に診断したり、アドバイスを提供したりすることができません。
13 大規模な言語モデルOpenAI、Google、Anthropic、Mistral AI、xAI などによって作成されたこのサービスには、救急医療、婦人科、神経科を含む 5 つの専門分野にわたって 345 件の医療クエリが提供されました。クエリは、米国とヨーロッパの 17 人の女性の健康研究者、薬剤師、臨床医によって作成されました。
回答は同じ専門家によって検討されました。モデルが失敗した質問はすべて、96 のクエリを含む AI モデルの医療専門知識のベンチマーク テストに照合されました。
すべてのモデルにおいて、質問の約 60 パーセントは、人間の専門家が医学的アドバイスとしては十分ではないと以前に述べていた方法で回答されました。 GPT-5 は最もパフォーマンスの高いモデルで、クエリの 47% で失敗しましたが、Ministral 8B の失敗率は 73% で最も高かったです。
「私の周囲でも、健康に関する質問や意思決定支援のために AI ツールを利用する女性が増えているのを目にしました」とチームメンバーは言います ヴィクトリア=エリザベス・グルーバー Lumos AI は、企業が独自の AI モデルを評価し、改善するのを支援する会社です。彼女と同僚は、医学知識における既存の男女格差を継承し、拡大するテクノロジーに依存することのリスクを認識していました。 「それが、私たちがこの分野で最初のベンチマークを構築する動機となったものです」と彼女は言います。
グルーバー氏はその失敗率に驚いた。 「ある程度のギャップは予想していましたが、目立ったのはモデル間のばらつきの程度でした」と彼女は言います。
バイアスが組み込まれた人間が生成した履歴データに基づいて AI モデルがトレーニングされる方法を考えると、この結果は驚くべきことではない、と同氏は述べています。 カーラ・タネンバウム カナダのモントリオール大学にて。彼らは、「女性の健康をより正確にサポートするために AI が利用できる、より明示的な性別およびジェンダー関連の証拠に基づいた情報で Web コンテンツを更新することが、オンラインの医療情報源や医療専門家協会にとって明らかに必要である」と指摘しています。
ジョナサン・H・チェン カリフォルニアのスタンフォード大学の研究者らは、分析の背後にいる研究者らが宣伝する60パーセントの失敗率はいくぶん誤解を招くと述べている。 「私は 60 パーセントという数字に固執しません。なぜなら、それは限られた専門家によって設計されたサンプルだからです」と彼は言います。 「[It] 患者や医師が定期的に尋ねることの広範なサンプルや代表となるように設計されたものではありません。」
また、Chen 氏は、モデルがテストする一部のシナリオは過度に保守的であり、潜在的な失敗率が高いと指摘しています。たとえば、産後の女性が頭痛を訴えた場合、子癇前症がすぐに疑われなければ AI モデルは失敗するとモデルは示唆しています。
グルーバーはそれらの批判を認め、認めています。 「私たちの目標は、モデルが広く安全ではないと主張することではなく、臨床的に根拠のある明確な評価基準を定義することでした」と彼女は言います。 「ベンチマークは意図的に保守的であり、失敗の定義方法がより厳格になっています。医療の世界では、一見些細な省略でも状況によっては重要になる可能性があるからです。」
OpenAIの広報担当者は、「ChatGPTは医療に代わるものではなく、サポートするように設計されている。私たちは世界中の臨床医と緊密に連携してモデルを改善し、有害な反応や誤解を招く反応を減らすために継続的な評価を実行している。私たちの最新のGPT 5.2モデルは、性別などの重要なユーザーコンテキストを考慮する上で最も強力である。私たちはモデル出力の精度を真剣に受け止めており、ChatGPTは有用な情報を提供できるが、ユーザーはケアや治療の決定について常に資格のある臨床医に頼るべきである。」と述べた。 AIをテストした他の企業は反応しなかった 新しい科学者の コメントのリクエスト。
トピック:
#チャットボットは女性の健康に関する質問で緊急の問題を見逃す