1737312392
2025-01-18 14:00:00
ダリウス・タヒル著、KFF ヘルスニュース
がん患者が難しい決断を下せるように準備するのが腫瘍専門医の仕事です。ただし、彼らは常にそれを行うことを覚えているわけではありません。ペンシルベニア大学ヘルス システムでは、死亡の可能性を予測する人工知能アルゴリズムによって、医師が患者の治療法や終末期の希望について話すよう促されています。
しかし、これは一度設定すればあとは忘れるというツールではありません。 2022年の調査によると、定期的な技術診断により、新型コロナウイルス感染症のパンデミック中にアルゴリズムが劣化し、死亡者の予測が7パーセントポイント悪化したことが明らかになった。
現実生活にも影響があった可能性があります。この研究の筆頭著者であるエモリー大学の腫瘍学者ラビ・パリク氏は、KFFヘルスニュースに対し、このツールは医師に必要な患者との重要な議論(おそらく不必要な化学療法を中止する可能性がある)の開始を促すのに何百回も失敗したと語った。
同氏は、ペン・メディシンのアルゴリズムだけでなく、医療ケアを強化するために設計されたいくつかのアルゴリズムがパンデミックの間に弱体化したと考えている。 「多くの機関は自社製品のパフォーマンスを定期的に監視していない」とパリク氏は述べた。
アルゴリズムの不具合は、コンピューター科学者や医師が長い間認識してきたジレンマの一側面ですが、病院幹部や研究者らは困惑し始めています。人工知能システムを導入し、正常に動作し続けるには、一貫した監視と人員配置が必要です。
本質的には、新しいツールが台無しにならないようにするには、人員とより多くの機械が必要です。
スタンフォード・ヘルスケアの首席データサイエンティスト、ニガム・シャー氏は「AIが私たちのアクセスや能力を高め、医療などを改善してくれると誰もが考えている」と語った。 「それはすべて素晴らしいことであり、良いことですが、もしそれによってケアのコストが 20% 増加するとしたら、それは実現可能でしょうか?」
政府当局者らは、病院にはこうした技術を自社のペースで導入するためのリソースが不足していると懸念している。 FDA長官のロバート・カリフ氏は、最近開かれたAIに関する委員会で、「私は広範囲に目を向けてきた」と語った。 「米国には、臨床医療システムに導入された AI アルゴリズムを検証できる医療システムが 1 つも存在するとは思えません。」
AIはすでに医療分野に普及しています。アルゴリズムは、患者の死亡または悪化のリスクを予測し、患者の診断やトリアージを提案し、医師の仕事を節約するために訪問を記録および要約し、保険請求を承認するために使用されます。
テクノロジーのエバンジェリストが正しければ、テクノロジーは遍在し、収益をもたらすことになるでしょう。投資会社ベッセマー・ベンチャー・パートナーズは、健康に焦点を当てたAIスタートアップ企業約20社が、それぞれ年間1000万ドルの収益を上げそうな軌道に乗っていると特定した。 FDA は、約 1,000 の人工知能製品を承認しています。
これらの製品が機能するかどうかを評価するのは困難です。それらが引き続き動作するかどうか、またはガスケットの吹き飛ばしや漏れのあるエンジンと同等のソフトウェアを開発したかどうかを評価するのはさらに困難です。
イェール・メディシンの最近の研究では、患者の容態が急速に悪化する可能性がある場合に臨床医に警告する6つの「早期警告システム」を評価している。シカゴ大学の医師であり、研究にアルゴリズムの1つを提供した会社の共同創設者であるダナ・エデルソン氏は、スーパーコンピューターがデータを数日間実行したと述べた。このプロセスは実りをもたらし、6 つの製品間のパフォーマンスに大きな違いがあることがわかりました。
病院や医療提供者にとって、ニーズに最適なアルゴリズムを選択するのは簡単ではありません。平均的な医師はスーパーコンピューターを常備しておらず、AI 向けの消費者レポートもありません。
「我々には基準がない」と米国医師会の直前会長ジェシー・エーレンフェルド氏は語った。 「今日、アルゴリズムのモデルのパフォーマンスを、AI 対応かどうかに関係なく、デプロイ時にどのように評価、監視、確認するかについての基準となるものを私が指摘できるものは何もありません。」
おそらく診療所で最も一般的な AI 製品は、アンビエント ドキュメンテーションと呼ばれるもので、患者の診察を聞いて要約するテクノロジー対応のアシスタントです。昨年、Rock Health の投資家は、これらの文書作成会社に 3 億 5,300 万ドルが流入したことを追跡しました。しかし、エーレンフェルド氏は、「現時点では、これらのツールの出力を比較する基準はない」と述べた。
そして、たとえ小さなエラーでも致命的な結果をもたらす可能性がある場合、それは問題です。スタンフォード大学のチームは、患者の病歴を要約するために、ChatGPT などの人気の AI ツールの基礎となるテクノロジーである大規模言語モデルを使用しようとしました。彼らはその結果を医師が書く内容と比較しました。
「最良のケースであっても、モデルのエラー率は 35% でした」とスタンフォード大学のシャー氏は述べています。医学では、「要約を書いているときに、『発熱』などの単語を 1 つ忘れてしまった場合、それは問題ですよね?」
場合によっては、アルゴリズムが失敗する理由はかなり論理的です。たとえば、病院が検査プロバイダーを切り替える場合など、基礎となるデータが変更されると、その有効性が損なわれる可能性があります。
しかし時々、明らかな理由もなく落とし穴があくびをして開いてしまうことがあります。
ボストンにあるマサチューセッツ・ジェネラル・ブリガムの個別化医療プログラムの技術幹部であるサンディ・アロンソン氏は、彼のチームが遺伝カウンセラーがDNA変異に関する関連文献を見つけるのを支援することを目的としたアプリケーションをテストしたところ、その製品は「非決定性」に苦しんだ、つまり同じ質問をした場合に問題があったと述べた。短期間に複数回質問すると、異なる結果が得られました。
アロンソン氏は、多忙を極める遺伝カウンセラーの知識を要約できる大規模な言語モデルの可能性に興奮しているが、「テクノロジーは改善する必要がある」としている。
指標や基準がまばらで、奇妙な理由でエラーが発生する可能性がある場合、機関は何をすべきでしょうか?多くのリソースを投資します。シャー氏によると、スタンフォード大学では、2 つのモデルの公平性と信頼性を監査するだけで 8 ~ 10 か月と 115 人時間がかかったという。
KFF Health Newsがインタビューした専門家らは、人工知能が人工知能を監視し、一部の(人間の)データ専門家が両方を監視するというアイデアを浮上させた。そのためには組織がさらに多くの資金を投入する必要があることは誰もが認めていますが、病院の予算と AI 技術専門家の供給が限られているという現実を考えると、これは難しい課題です。
「モデルを監視するために氷山を溶かすというビジョンを持つことは素晴らしいことです」とシャー氏は語った。 「しかし、それは本当に私が望んでいたものなのでしょうか?あと何人必要ですか?」
KFF 健康ニュース は、健康問題に関する詳細なジャーナリズムを作成する全国的なニュース編集局であり、KFF の中核となる運営プログラムの 1 つであり、医療政策の調査、世論調査、およびジャーナリズムの独立した情報源です。詳しくはこちら KFF。
©2025 KFF ヘルスニュース。 Tribune Content Agency, LLC によって配布されます。
#お金を節約することを目的としたヘルスケア #は多くの費用のかかる人間を必要とすることが判明 #Baltimore #Sun