米国国防総省の首席デジタル・人工知能局と技術系非営利団体ヒューメイン・インテリジェンスは、軍の医療サービスで使用される大規模言語モデルのチャットボットのテストに焦点を当てた、同局のクラウドソーシング型人工知能レッドチーム保証プログラムの試験運用の終了を発表した。
この調査結果は、AIの使用に必要なすべてのリスク管理慣行を順守することで、最終的に軍の医療を改善できる可能性があると国防総省関係者は述べた。
なぜ重要なのか
で 発表 木曜日、国防総省は、CAIRTプログラムの最新のレッドチームテストには200人以上の政府機関の臨床提供者と医療アナリストが参加し、臨床ノートの要約と医療助言チャットボットという2つの想定されるユースケースについて3つのLLMを比較したと発表した。
彼らは、軍事医療を強化するためにLLMがテストされている800以上の潜在的な脆弱性と偏見を発見しました。
CAIRT は、国防保健庁および国防医療管理システムプログラム事務局と協力して、アルゴリズム評価を中心とした実践コミュニティを構築することを目的としていました。 2024 年には、このプログラムは次のことも提供しました。 金融AIバイアス報奨金 オープンソースのチャットボットをはじめ、LLM の未知のリスクに焦点を当てました。
クラウドソーシングは、複数の関係者にわたって大量のデータを生成できる幅広い網を張り巡らせます。国防総省は、CAIRT プログラムのすべてのレッドチーム活動から得られた結果は、生成 AI の責任ある使用に関するポリシーとベストプラクティスを形成する上で極めて重要であると述べた。
国防総省はまた、AI 機能を加速し、国防総省 genAI ユースケース全体の信頼性を正当化するには、CAIRT 保証プログラムを通じて LLM と AI システムの継続的なテストが重要であると述べました。
より大きなトレンド
臨床医が AI を受け入れるには信頼が不可欠です。臨床ケアで genAI を使用するには、LLM は重要なパフォーマンスの期待を満たして、ツールが有用で、透明性があり、説明可能で安全であることをプロバイダーに最大限に保証する必要があります。 言った ヘルスケアITニュース 最近。
医療提供における AI の積極的な活用には大きな可能性があるにもかかわらず、「それを解き放つのは困難です」とマフニ氏は今年 9 月の HIMSS AI in Healthcare Forum で述べました。
「AI 開発ライフサイクルの各段階で仮定と決定が行われ、これらの仮定が間違っていると系統的エラーにつながる可能性がある」ため、バイアスが入り込む可能性があるため、マフニ氏は、 AIの安全な利用。
「このようなエラーは、患者のサブグループに対するアルゴリズムの最終結果を歪める可能性があり、最終的には医療の公平性にリスクをもたらす可能性があります」と彼女は続けた。 「この現象は既存のアルゴリズムで実証されています。」
パフォーマンスをテストし、アルゴリズムのバイアスを排除するには、臨床医と開発者が「AI 開発ライフサイクル全体とソリューション展開を通じて」協力して作業する必要があると Makhni 氏はアドバイスしました。
「潜在的なバイアス領域や次善のパフォーマンスを予測するには、双方の積極的な関与が必要です」と彼女は付け加えた。 「この知識は、特定の AI アルゴリズムにより適したコンテキストと、おそらくより多くの監視と監視が必要なコンテキストを明確にするのに役立ちます。」
記録上
「国防総省内でそのような目的で GenAI を適用するのは試験運用と実験の初期段階であるため、このプログラムは大量のテストデータを生成し、検討すべき領域を明らかにし、将来の研究、開発、および緩和オプションを検証するための重要な道筋を見つける手段として機能します。将来導入される可能性のある GenAI システムの保証です」と CAIRT プログラム責任者のマシュー ジョンソン博士は、この取り組みに関する 1 月 2 日の声明で述べました。
Andrea Fox は、Healthcare IT News の上級編集者です。
電子メール: [email protected]
Healthcare IT News は HIMSS Media の出版物です。