オハイオ州コロンバス – 病院や飛行機などのハイステークス環境で人工知能を採用することになると、AIのパフォーマンスと技術に関する短い労働者のトレーニングは、システムがスムーズに実行され、患者と乗客が安全であることを保証するのに十分ではありません。
代わりに、アルゴリズムと最も安全批判的な組織でそれらを使用する人々を同時に評価する必要があります。
また、チームは、これらの評価が、人々が善、平凡、および貧弱な技術のパフォーマンスにどのように反応して、AIと人間の相互作用を意味のあるテストに導き、間違いにリンクされたリスクのレベルを公開する方法を評価する必要があると主張します。
オハイオ州立大学の工学研究者が率いるこの研究の参加者は、オハイオ州立州の450人の看護学生であり、主に臨床トレーニングの量がさまざまな学部生と12人の免許を持つ看護師でした。彼らは、遠隔の患者モニタリングシナリオでAIアシストテクノロジーを使用して、さまざまな患者の症例で緊急治療が必要になる可能性を判断しました。
結果は、患者が医学的緊急事態に向かってトレンドになっているかどうかについてのより正確なAI予測により、参加者のパフォーマンスが50%から60%改善されたことが示されました。しかし、アルゴリズムが不正確な予測を生成した場合、その結果をサポートしなかった説明データを伴っても、人間のパフォーマンスは崩壊し、アルゴリズムが最も間違っていたときに適切な意思決定の100%以上の分解がありました。
「AIアルゴリズムは決して完璧ではありません。したがって、安全性の高いシステムの準備ができているAIアルゴリズムが必要な場合、それはチーム、人々、AIが一緒になって、パフォーマンスの低いAIアルゴリズムに対処できる必要があることを意味します」 デーン・モリー、の研究科学者 統合システム工学部 オハイオ州で。
「ポイントは、これが本当に優れた安全性クリティカルなシステムテクノロジーを作成することではないことです。安全性が重要なシステムで重要なのは、共同のヒューマンマシン機能です。」
モリーは研究を完了しました マイク・レイオ、准教授、そして デビッド・ウッズ、オハイオ州の統合システムエンジニアリングの両方で、教員名誉。この研究は最近公開されました NPJデジタル医学。
著者、すべてのメンバー Cognitive Systems Engineering Lab 監督 レイ、開発しました 関節活動テスト 2020年の研究プログラムは、リスクの高い環境、特に医療および防衛環境での責任あるAIの展開のギャップと見なされるものに対処します。
チームはまた、一連のエビデンスに基づいたセットを改良しています ガイド原則 AI-ヒューマンパフォーマンス評価プロセスを滑らかにすることができ、その後、実際にシステムの結果を改善できる共同アクティビティを念頭に置いている機械設計の場合。
彼らの予備リストによれば、マシンは何よりもまず、世界に不一致であることを知らないときでさえ、それが世界に誤って整理される方法を人々に伝えるべきです。
「たとえこれらのヒューリスティックについてテクノロジーがうまくいったとしても、おそらくまだ準備ができていないでしょう」とRayo氏は言います。 「これらはリスク緩和の手順であり、私たちの安全性が批判的な産業は、少なくとも人々とAIのパフォーマンスを測定し、さまざまな挑戦的なケースを調べるためのこれらの2つのステップに値するため、何らかの形の経験的評価を行う必要があります。」
Cognitive Systems Engineering Labは、主に20〜30人の参加者がいるプロジェクトで、実習慣の評価方法に到達するために、実際のテクノロジーに関する5年間研究を行ってきました。このプロジェクトに462人の参加者がいること、特に研究の登録がコースベースの教育活動に関連しているAI注入技術の対象集団は、研究者に調査結果と推奨事項に高い自信を与えます、とRayoは言いました。
各参加者は、異なる実験条件下で10の患者症例のシーケンスを分析しました。AIヘルプなし、救急医療の差し迫った必要性のAIパーセント予測、患者の状態に関連するデータのAI注釈、およびAIの予測と注釈の両方。
すべての例には、ユーザーが患者の状態の変化や安定性を予測するのに役立つことを目的とした人口統計、バイタルサイン、ラボの結果を示すデータの視覚化が含まれていました。
参加者は、各患者の懸念を0〜10のスケールで報告するように指示されました。緊急患者へのより高い懸念と非緊急患者の懸念の低下は、パフォーマンスの向上を示すとみなされる指標でした。
「看護師もAIアルゴリズムも、すべての場合に他の看護師よりも普遍的に優れていないことがわかりました」と著者は書いています。分析は、参加者の臨床経験の違いを説明しました。
全体的な結果は、このタイプの評価が必要であるという証拠を提供しましたが、研究者たちは、いくつかの実験条件に含まれる説明が参加者の懸念にほとんど揺れ動くことがほとんどないことに驚いたと言いました。
「これらの注釈がどのような効果があったとしても、他のすべてを追い払った指標の存在に丸く圧倒されました」とRayoは言いました。
チームは、現在使用されているヘルスケアアプリケーションを代表するカスタムビルドテクノロジーを含む研究方法を検討しました。これは、推奨事項が必要な理由と、産業が提案されたプラクティスをどのように配置できるかについてのテンプレートです。
「私たちが主張しているのは、テクノロジーから生じる可能性のあるさまざまな効果を人々がよりよく理解するのを助ける方法です」とモリーは言いました。 「基本的に、目標は最高のAIパフォーマンスではありません。最高のチームパフォーマンスです。」
この研究はそうでした 資金提供 アメリカ看護師財団 看護イニシアチブの再考。
#
連絡先:
デーン・モリー、 [email protected]
マイク・レイ、 [email protected]
#AIサポートは安全性の高い設定でどのように間違っているか