日本語版
最新ニュース
健康

医療 AI には METR はありません。建てたいです。 — EA フォーラム

私はここに来たのは初めてです。私は家庭医です。これがこのフォーラムの典型的な冒頭のセリフではないことは承知しています。過去 2 年間にわたり、私たちのチームは、LLM が臨床上の意思決定におけるプレッシャーにどのように対処するかについて、最も広範な実証研究の 1 つであると私が信じているものを発表してきました。偏見、幻覚、誤った情報に対する感受性、実際の臨床シナリオを適用すると、これらのモデルがどのように曲がってしまうか。この結果が私にとって非常に気になったので、AI の安全性を最も真剣に考えているコミュニティを探してみました。その検索が私をここに導きました。短いバージョン: 反事実的な人口統計の入れ替えを大規模に使用して、数十のモデルごとにテストしました。同じ臨床症状、同じバイタル、同じ病歴。人口統計変数を 1 つ変更します。推奨事項の変化を観察してください。 170万の管理された出力と9つのモデル(Nature Medicine)全体で、疎外されたグループは、同一の症状に対して臨床的に示されている割合の6〜7倍でメンタルヘルスの紹介を受けました。モデルは、捏造された実験値を 83% の確率で事実として繰り返しました (Nature Comms Medicine)。臨床フォーマットにまとめた場合、誤った情報の感受性は 46% に達しました (Lancet Digital Health)。 40以上の論文。どのモデルも。同じパターンです。これらの失敗モード、人口動態に応じた行動、誤った前提への媚びへの同意、自信に満ちた作文は、医学に特有のものではありません。これらは一般的なモデルのプロパティです。医療はまさに、正確に害を測定できる場所です。なぜなら、私たちは真実と保護された属性を持っているからです。これはおそらく、調整の失敗がオプトアウトできない人々に大規模な測定可能な損害を引き起こした最初の導入ドメインです。AI 安全性コミュニティには、フロンティア機能に関する METR、言語に関する HELM、コードと数学に関する多数のベンチマークがあります。命がかかっている臨床 AI には、オープンで標準化され、継続的に維持されるものは何もありません。ゼロ。投稿しました マニファンドプロジェクト これを修正するには。 クリンセーフ: 医療 AI のバイアス、幻覚、安全上の欠陥についてストレス テストを行うオープン プラットフォーム。 25,000 ドル、6…

医療 AI には METR はありません。建てたいです。 — EA フォーラム

私はここに来たのは初めてです。私は家庭医です。これがこのフォーラムの典型的な冒頭のセリフではないことは承知しています。

過去 2 年間にわたり、私たちのチームは、LLM が臨床上の意思決定におけるプレッシャーにどのように対処するかについて、最も広範な実証研究の 1 つであると私が信じているものを発表してきました。偏見、幻覚、誤った情報に対する感受性、実際の臨床シナリオを適用すると、これらのモデルがどのように曲がってしまうか。この結果が私にとって非常に気になったので、AI の安全性を最も真剣に考えているコミュニティを探してみました。その検索が私をここに導きました。

短いバージョン: 反事実的な人口統計の入れ替えを大規模に使用して、数十のモデルごとにテストしました。同じ臨床症状、同じバイタル、同じ病歴。人口統計変数を 1 つ変更します。推奨事項の変化を観察してください。 170万の管理された出力と9つのモデル(Nature Medicine)全体で、疎外されたグループは、同一の症状に対して臨床的に示されている割合の6〜7倍でメンタルヘルスの紹介を受けました。モデルは、捏造された実験値を 83% の確率で事実として繰り返しました (Nature Comms Medicine)。臨床フォーマットにまとめた場合、誤った情報の感受性は 46% に達しました (Lancet Digital Health)。 40以上の論文。どのモデルも。同じパターンです。

これらの失敗モード、人口動態に応じた行動、誤った前提への媚びへの同意、自信に満ちた作文は、医学に特有のものではありません。これらは一般的なモデルのプロパティです。医療はまさに、正確に害を測定できる場所です。なぜなら、私たちは真実と保護された属性を持っているからです。これはおそらく、調整の失敗がオプトアウトできない人々に大規模な測定可能な損害を引き起こした最初の導入ドメインです。

AI 安全性コミュニティには、フロンティア機能に関する METR、言語に関する HELM、コードと数学に関する多数のベンチマークがあります。命がかかっている臨床 AI には、オープンで標準化され、継続的に維持されるものは何もありません。ゼロ。

投稿しました マニファンドプロジェクト これを修正するには。 クリンセーフ: 医療 AI のバイアス、幻覚、安全上の欠陥についてストレス テストを行うオープン プラットフォーム。 25,000 ドル、6 か月、GitHub および HuggingFace では無料。パイプラインはすでに機能しています。データはすでに存在します。存在しないものは、研究室外の誰もが使用できるツールです。

私は BRIDGE GenAI Lab (BIDMC/ハーバード大学医学部) の研究責任者であり、マウント サイナイの AI 部門の研究科学者です。午前中は患者さんの治療をし、午後は評価システムの構築を行っています。これは私が世界で最も大切にしている仕事であり、私はそれを実現するために、どんなコミュニティの言語も学び、どんなフォーラムにも投稿し、耳を傾けてくれる人なら誰とでも話し合うつもりです。

この種の実証的な展開安全性作業がここでの優先事項と共鳴するかどうかについてのフィードバックを心から歓迎します。論文、データ、パイプラインのデモも喜んで共有させていただきます。

乾杯 :)

マフムード

#医療 #には #METR #はありません建てたいです #フォーラム

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。