日本語版
最新ニュース
健康

医療における AI 信頼スコアの隠れた危険性

AI のイノベーションと導入はヘルスケア分野で急成長しています。 診断ツールから個別化医療へ。医療のリーダーたちは楽観的ですが、私が話をした IT のリーダーたちはそれほど確信を持っていません。命が危険にさらされているとき、AI ツールが信頼できる結果を生み出すかどうかをどうやって判断できるのでしょうか? 最近、 いくつかのグループ は、医療における AI の信頼性を測定する方法として信頼度スコアを推奨しています。 AI のコンテキストでは、信頼スコアは検証された確率ではなく近似値から得られることがよくあります。特に医療分野では、大規模言語モデル (LLM) が真の可能性に対応しない信頼スコアを生成する可能性があり、誤解を招く確実性が生じる可能性があります。 ヘルスケア技術のリーダーであり AI 愛好家としての私の意見では、これは間違ったアプローチです。 AI は非常に貴重なツールとして機能しますが、「信頼スコア」を盲目的に信頼すると深刻なリスクが生じます。以下では、これらのリスクの概要を説明し、組織の業務を損なうことなく AI を使用できるようにするためのより良い代替案を提案します。 AI のコンテキストで説明された信頼スコア 信頼スコアは、診断や医療コードなどの出力に関する AI ツールの確実性を示すことを目的とした数値です。医療ユーザーが信頼スコアを信頼すべきではない理由を理解するには、テクノロジーがどのように機能するかを説明することが重要です。 AI では、信頼スコアは通常、統計から得られます。 信頼区間。これは、トレーニング モデルに基づいて AI 出力が正確である確率を計算する数学的出力です。 これらは他の形式のテクノロジーにもよく現れます。たとえば、ユーザーにマッチング スコアを提供する出会い系アプリを考えてみましょう。日常生活でこれらのスコアを見ると、そのスコアが信頼でき、医療などの他の状況に適していると誤解してしまう可能性があります。 たとえば、患者のカルテで AI による生成サマリーを取得する臨床医の場合、表示された信頼スコアが誤った確実性を示唆する可能性があります。…

医療における AI 信頼スコアの隠れた危険性

1734199975
2024-12-12 14:42:00

AI のイノベーションと導入はヘルスケア分野で急成長しています。 診断ツールから個別化医療へ。医療のリーダーたちは楽観的ですが、私が話をした IT のリーダーたちはそれほど確信を持っていません。命が危険にさらされているとき、AI ツールが信頼できる結果を生み出すかどうかをどうやって判断できるのでしょうか?

最近、 いくつかのグループ は、医療における AI の信頼性を測定する方法として信頼度スコアを推奨しています。 AI のコンテキストでは、信頼スコアは検証された確率ではなく近似値から得られることがよくあります。特に医療分野では、大規模言語モデル (LLM) が真の可能性に対応しない信頼スコアを生成する可能性があり、誤解を招く確実性が生じる可能性があります。

ヘルスケア技術のリーダーであり AI 愛好家としての私の意見では、これは間違ったアプローチです。 AI は非常に貴重なツールとして機能しますが、「信頼スコア」を盲目的に信頼すると深刻なリスクが生じます。以下では、これらのリスクの概要を説明し、組織の業務を損なうことなく AI を使用できるようにするためのより良い代替案を提案します。

AI のコンテキストで説明された信頼スコア

信頼スコアは、診断や医療コードなどの出力に関する AI ツールの確実性を示すことを目的とした数値です。医療ユーザーが信頼スコアを信頼すべきではない理由を理解するには、テクノロジーがどのように機能するかを説明することが重要です。 AI では、信頼スコアは通常、統計から得られます。 信頼区間。これは、トレーニング モデルに基づいて AI 出力が正確である確率を計算する数学的出力です。

これらは他の形式のテクノロジーにもよく現れます。たとえば、ユーザーにマッチング スコアを提供する出会い系アプリを考えてみましょう。日常生活でこれらのスコアを見ると、そのスコアが信頼でき、医療などの他の状況に適していると誤解してしまう可能性があります。

たとえば、患者のカルテで AI による生成サマリーを取得する臨床医の場合、表示された信頼スコアが誤った確実性を示唆する可能性があります。 意図しないエラーにつながる 彼らが自分の判断よりもこのテクノロジーを信頼している場合。

これらのスコアをヘルスケア プラットフォームに含めることは、リスクが大きすぎると私は考えています。私が設計した AI ソリューションの信頼度を表示しないことにしたのは、信頼度を表示できると信じているためです。 ユーザーが批判的に考えるのを妨げる 画面上の情報について。これは、分析のトレーニングを受けていないユーザーや、AI や ML の仕組みに精通していないユーザーに特に当てはまります。

AI 出力を評価するための欠陥のあるアプローチ

AI 信頼度スコアはパーセンテージとして表示されることが多く、コードや診断が正しい可能性が一定であることを示唆します。ただし、データ サイエンスの訓練を受けていない医療専門家にとって、これらの数値は一見信頼できるものに思えるかもしれません。具体的には、これらのスコアは次の 4 つの重大なリスクを引き起こします。

  1. 文脈の誤解 – すぐに使える AI ワークフローには、プロバイダーの特定の人口統計ではなく、集団レベルのトレーニングのみが含まれています。これは、既製の AI ツールでは臨床医の母集団や地域の健康パターンが考慮されておらず、信頼スコアはカスタマイズされた洞察ではなく広範な仮定を反映することを意味します。このため、臨床医は次のような問題を抱えています。 不完全な絵
  2. 表示されるスコアへの過度の依存 – ユーザーは、95% の信頼スコアを読むと、それ以上調査する必要はないと考えるかもしれません。これにより、データの複雑さが過度に単純化される可能性があります。最悪の場合、臨床医が自身の批判的なレビューを回避したり、微妙な診断を見逃したりすることを奨励します。自動化バイアスは、ユーザーがテクノロジーの成果物を過剰に信頼する現象であり、医療分野では特に懸念されています。 研究 臨床医が AI の信頼スコアが決定的であると仮定すると、自動化バイアスが重大な症状を見落とす可能性があることを示しています。
  3. 精度の虚偽表示 – 医療の複雑さは、必ずしも統計的な確率と一致するとは限りません。高い信頼スコアは集団レベルのデータと一致する可能性がありますが、AI は特定の患者を確実に診断することはできません。この不一致により、誤った安心感が生まれる可能性があります。
  4. 誤ったセキュリティによりエラーが発生する – 臨床医が AI 推奨の高スコアに厳密に従いすぎると、他の潜在的な診断を見逃す可能性があります。たとえば、AI が特定のコードに高い信頼性を示唆した場合、臨床医はさらなる調査をスキップする可能性があります。そのコードが間違っていると、その後のケアの決定に連鎖的に影響し、重要な介入が遅れたり、価値ベースのケア契約で請求ミスが発生したりする可能性があります。 AI に警戒するプラットフォーム ユーザーであっても、入ってくる請求に疑問を呈する保険請求会社であっても、こうした間違いは信頼を損ないます。

ユーザーが AI 出力の強さを理解できるようにするより良い方法

エンドユーザーが AI ツールとどのように対話するかについてのローカライズされたデータと知識により、AI が効果的に機能するように調整できます。信頼スコアに依存する代わりに、次の 3 つの方法を使用して信頼できる出力を作成することをお勧めします。

  1. AI モデルをローカライズして頻繁に更新する – 特定の健康パターン、人口統計、進化する健康状態などのローカルデータを含めるように AI モデルを調整することで、AI 出力の関連性が高まります。たとえば、アラバマ州ではマサチューセッツ州よりも II 型糖尿病患者の割合が高く、正確な出力は、サービスを提供する人口を反映するタイムリーなローカライズされたデータに依存します。ユーザーが AI 出力を理解するには、どのようなデータがモデルに入力されるか、またそれがどのように開発および維持されるかを知ることが不可欠です。新しいデータを使用してモデルを継続的にトレーニングおよび更新することで、最新の標準と発見が確実に反映され、古いデータへの依存が回避されます。定期的な再トレーニングと監査プロセスが重要です。 AI モデルを最新のローカライズされたデータで更新することで、医療機関は現実世界のダイナミクスを反映していない信頼度スコアのリスクを軽減できます。
  2. エンドユーザー向けに慎重に出力を表示する – 「1 つのサイズですべてに対応できる」と想定せずに、各ユーザーがデータとどのように対話するかを検討し、ニーズを満たす出力を設計します。言い換えれば、アウトプットはユーザーの視点と一致する必要があります。データサイエンティストにとって意味のあるものは、臨床医にとって意味のあるものとは異なります。単一の信頼スコアの代わりに、特定の母集団または設定内で同様の予測が正確であった頻度など、コンテキスト データを表示することを検討してください。比較表示は、ユーザーが AI の推奨事項をより効果的に比較検討するのに役立ちます。
  3. 臨床判断をサポートしますが、置き換えるのではありません – 最高の AI ツールは、ユーザーに代わって決定を下すことなく、ユーザーをガイドします。積み重ねられたランキングを使用して、最も強い一致を上位に持つさまざまな診断の可能性を提示します。可能性をランク付けすることで、臨床医は自動的に受け入れるのではなく、検討し、専門的な判断に頼って決定を下す選択肢が得られます。

臨床医は、専門知識をサポートするように設計された技術ツールを必要としています。 盲目的な依存を阻止する 信頼スコアについて。 AI の洞察と現実世界のコンテキストを融合することで、医療機関は責任を持って AI を活用し、よりスムーズなワークフローを構築し、最も重要なことに、より安全な患者ケアを構築できます。

写真:ジョン・ケリー、ゲッティイメージズ


ブレンダン・スミス=エリオン の製品管理担当副社長です。 アルカディア。彼はヘルスケア ベンダー分野で 20 年以上の経験があります。彼の情熱は製品管理ですが、ビジネス開発と BI エンジニアの役割の経験もあります。 Arcadia では、ブレンダンはデータを活用した価値重視のワークフローを通じてクライアントに変革の成果をもたらすことに専念しています。

彼は Agfa でキャリアをスタートし、そこで心臓病 PACS プラットフォームを率い、その後、臨床文書の改善に焦点を当てたスタートアップ企業 Chartwise に移りました。ブレンダンはまた、athenahealth にも時間を費やし、有意義な使用のためのプロバイダーのワークフロー、品質測定、専門ワークフロー、注文とユニバーサル カルテ サービスのための臨床マイクロサービスの開発の取り組みを主導しました。この記事以前の彼の最近の役割は、Alphabet/Google で、支払者と医療提供者の予防的疾患管理のためのデータ製品に取り組む Verily Health Platform チームのヘルスケア データ プラットフォームに取り組んでいたことでした。

この投稿は、 メッドシティのインフルエンサー プログラム。誰でも、MedCity インフルエンサーを通じて MedCity News でヘルスケアにおけるビジネスとイノベーションに関する視点を公開できます。 方法を確認するにはここをクリックしてください

#医療における #信頼スコアの隠れた危険性

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。