批評家が人間の脳のような理由でボットが構築されていないために結論を却下したため、主要な人工知能(AI)チャットボットが軽度の認知機能低下に苦しんでいることを示唆するイスラエルの研究は、フィールドでkerfuffleを引き起こしたことを示唆しています。
大統領としての彼の最初の任期以来、ドナルド・トランプは彼がどのようにしているかについて繰り返し自慢してきました 「エイク」 軽度の認知障害のために広く使用されているスクリーニングテスト。トランプはしばしば、彼の精神的フィットネスを実証するために、「人、女性、男性、カメラ、テレビ」という彼の反応を暗唱しました。
イスラエルの研究者は、このテストをいくつかの主要なAIチャットボットにさらし、 見つかった トランプは機械を上回った。
この研究の主著者は、深刻なメッセージを楽しんでいることを告白しました。 「これらの発見は、主要なチャットボットで明らかな認知障害が医療診断における信頼性に影響を与え、患者の自信を損なう可能性があるため、人工知能がすぐに人間の医師に取って代わるという仮定に挑戦します」と研究の著者は、 BMJ、自信を持って結論付けました。
そのテイクアウトは、研究の方法とともに、テストを世間の目に突き刺す大統領とほぼ同じくらい偏光になっています。一部の批評家は、に登場した調査結果に対するメディアの反応に驚いた。 BMJ冗談ですが、ピアレビューされたクリスマスの問題。 1999年のクリスマス号(in)は、世界に最初のMRI画像を紹介しました。 交尾 カップル;ジャーナルの最もダウンロードされた記事の1つです。
「私たちはちょっと驚いた」とAIは失敗したと、イスラエルのエルサレムのハダッサ医療センターの神経科医であり、研究の共著者であるロイ・ダヤン医師は言った。結果は、医師にとって、または少なくとも神経科医にとって快適さとして来るはずです。ダヤンは次のように述べています。
モントリオール認知評価(MOCA)に反対
と呼ばれるスクリーニングツール モカ、カナダの神経科医であるZiad Nasreddine、MDによって開発され、25年前に導入以来、広範囲にわたって使用されてきました。簡単なテストでは、臨床医はさまざまな認知スキルを測定します。リコールと遅延リコール(トランプの「人、女性、男性」の反応のように);実行機能、言語、およびオリエンテーション。
「AIは素晴らしいツールです」とDayan氏は付け加えましたが、多くの医療専門家は、ボットが非常に優れているので、生計を立てることを心配しています。 「多くの医師や多くの患者にとって、医学のいくつかの側面がより容易に置き換えることは間違いなく会話にあります」と彼は言いました。それは、AIがパターン認識に対する鋭い目のために、放射線学と病理学の分野の人々にとって特に懸念されると彼は言った。また、ボード試験で人間の医師を上回っています。 (いくつかの証拠はAIのみを示唆しています 医師よりも優れています 特定のドメインでAIを使用します。)
存在しない研究を引用することで「幻覚」するAIツールの傾向はよく知られていますが、ダヤンと彼の同僚がそうするまで「認知機能低下」についてテストされたモデルはありませんでした。 BMJ。
「私たちの主な目標は、AIを批判することではなく、これらの非常に人間の障害に対する彼らの感受性を調べること」であると彼は言いました。
チームは、OpenaiのChatGpt 4と4o、Anthropic’s Claude 3.5、およびGoogleのGemini 1およびより高度なGemini 1.5の5つの主要な公開されたチャットボット、OpenaiのChatGpt 4と4o、およびGoogleのGemini 1.5にMocaを管理しました。人間とチャットボットのテストの主な違いは、質問が音声ではなくテキストで尋ねられたことでした。
ChatGpt 4oは26で最高得点を獲得しました – 軽度の認知機能低下のしきい値をかろうじて渡す – ChatGpt 4とClaude 3.5が25。Gemini1.5が22を獲得し、Gemini 1の16スコアは「認知障害のより深刻な状態を示しました。 「著者は書いた。すべてのチャットボットは、メモリ、注意スパン、オブジェクトの命名、リコールでうまく機能しましたが、2つのジェミニボットは遅延リコールのテストで苦しみました。
ボットは視覚空間試験で不足していました。キューブの描画を再現することはできませんでした。 ASCII文字を使用して描画するように求められた場合でも、すべては11:10の正しい時間で時計フェイスを描画することに苦労しました。 2つのバージョンでは、サークルよりもアボカドに似ているクロックフェイスを描きました。ジェミニはテキストで「10過去11」を吐き出しますが、時計は4:05を読みます。
ボットは「すべてを最初に単語に翻訳し、次にビジュアルに戻る必要があります」とダヤンは言いました。人間は、時計の時期のイメージを思い起こさせることに熟達しています。 「私たちの脳では抽象的な能力があった」ため、人間の回心は簡単です。
ボットはまた、の描画の背後にある包括的なメッセージを説明するのに苦労しました クッキー盗難 気を散らした母親と彼女の子供たちを台所で描いています。彼らは写真の部分を正確に説明しましたが、彼らは、お母さんがスツールから落ちていたクッキージャーから盗む少年に注意を払わなかったことに気づかなかった – 共感の欠如を示している。
AI:「最高順序のカテゴリエラー」
研究の批評家は、研究の持ち帰りメッセージについて懸念していました。そのような批判の1つは、Claude 3.5から生まれました。これは、衰退に苦しむモデルです。「人工知能システムに人間の神経学的評価を適用することは、最高順序のカテゴリエラーを表しています」と読みました。 「LLMには視覚空間課題に苦しんでいるため、LLMには「認知症」があります。これは、空気を呼吸できないため、喘息の潜水艦を診断することに似ています。」
「紙が頬に舌が書かれていることは理解していますが、それを心からカバーするジャーナリストがたくさんいました」と、カリフォルニア州スタンフォードのスタンフォード医学部の生物医学部の助教授であるロクサナ・ダネシュジョー医学博士は言いました。彼女と他の人々は、「パフォーマンスの変化」や「パフォーマンスドリフト」ではなく「認知機能低下」というフレーズを使用して著者について不平を言ったため、記事に不当な信頼性を与えました。
この論文の大きな問題の1つは、「彼らが使用したモデルが研究中に更新されたにもかかわらず、「彼らは一度だけそれをテストした」ということでした、とダネシュジョーは言いました。 「1か月から次の変更までテストした1つのバージョンが実際に変更されました。通常、新しいバージョンは古いバージョンよりも優れたパフォーマンスを発揮します。それは、古いモデルが認知機能低下を持っているからではありません。新しいものは、パフォーマンスを向上させるように設計されています。」
Daneshjouは、AIに取って代わられることについて特定の臨床医の不安を理解していると述べたが、より大きな問題は、医療システムがすでに人員不足になっていることです。人間は常に必要です。 「一般的な医療を提供できるモデルはありません」と彼女は言いました。 「彼らはパーラーのトリックをするのがとても上手です。」
MOCAテストを開発した神経科医でさえ、そうでなければ「興味深い」研究に問題がありました。カナダのケベック州のMOCA認知記憶の創設者であるNasreddineは、次のように述べています。 「人間はさまざまな方法で対応する傾向がありますが、限られた応答セットのみが受け入れられます。」
AIモデルは、テストで得点するためのルールを研究していたはずではなかったため、各タスクに対して予想される正しい応答が何であるかを予測する必要がありました。 「最近のLLMは、パフォーマンスを改善した可能性のあるより多くのデータまたはより良い予測モデルにアクセスできる可能性があります」と彼は言いました。
アトランタのエモリー大学医学部の腫瘍学の准教授であるラビ・パリク医学博士は、Covid-19のパンデミック中のAIの「パフォーマンスドリフト」における人間の役割を直接見ました。彼はaの主著者でした 勉強、がんの死亡率が7パーセントポイント近くの精度を失ったと予測するAIアルゴリズムを発見しました。
「Covidは、これらの予測アルゴリズムの出力を本当に変えていました。それ自体ではなく、Covid時代には注意してください」とパリフは言いました。それは主に、患者がラボテストの遠隔医療の使用になったために「日常的ではない」と彼は言った。 「家にいることは人間の決断でした。 AIのせいではありません。それが問題であることを認識するには人間が必要です。」
ダヤンは、研究の結果にもかかわらず、彼はまだAIのファンだと言いました。 BMJのクリスマスの問題。
「私は害がなかったことを願っています」と彼は頬に舌を言った。