日本語版
最新ニュース
健康

科学者は認知機能低下についてAIをテストしました。結果はショックでした。 :sciencealert

OpenaiのChatGptが公的に使用されるためにリリースされてから2年はかろうじて2年が経ち、インターネット上の誰もが詩から学校の課題、家主への手紙まで、あらゆるものについて人工的な心と協力するよう招待しています。 今日、有名です 大きな言語モデル (LLM)は、基本的なクエリへの対応において説得力のある人間に見えるいくつかの主要なプログラムの1つにすぎません。 その不気味な類似性は、意図したものよりもさらに拡大する可能性があり、イスラエルの研究者は現在、LLMが私たちと同じように年齢とともに増加する認知機能の低下の形に苦しんでいることを発見しました。 チームは、一連の認知評価を公開されている「チャットボット」に適用しました。CHATGPTのバージョン4と4O、Alphabet's Geminiの2つのバージョン、およびAnthropic's Claudeのバージョン3.5です。 LLMSが本当にインテリジェントであれば、結果は懸念されるでしょう。 出版された論文では、神経科医のロイ・ダヤンとベンジャミン・ウリエルは、ハダサ・メディカル・センターのベンジャミン・ウリエルと、テルアビブ大学のデータサイエンティストであるガル・コプリューヴィッツの中で、 説明する 「人間の脳の神経変性プロセスに匹敵すると思われる認知機能低下」のレベル。 彼らのすべての性格について、LLMは持っています もっと共通しています 携帯電話の予測テキストを使用して、頭の中のスクイーズな灰白質を使用して知識を生成する原則よりも。 テキストとイメージの生成に対するこの統計的アプローチが速度と人格性を獲得するものは、フィクションとナンセンスからの意味のあるテキストのスニペットを整理するのに苦労しているアルゴリズムに従って、defされやすさが失われます。 公平を期すために、人間の脳は、時折の精神的なショートカットを服用することに関しては誤りがありません。しかし、AIが信頼できる知恵の言葉を提供するという期待の高まりで - 医療さえ 法的助言 - 新しい世代のLLMが、実際に言っていることについて「考える」より良い方法を見つけると仮定します。 私たちがどこまで行かなければならないかを見るために、Dayan、Uliel、およびKoplewitzが、を含む一連のテストを適用しました モントリオール認知評価 (MOCA)、ツール神経科医は、記憶、空間スキル、実行機能などの精神的能力を測定するために一般的に使用しています。 CHAPTGPT 4oは評価で最高の得点を記録し、30ポイントのうち26点しかなく、軽度の認知障害を示しています。これに続いて、ChatGpt 4とClaudeで25ポイント、Geminiの場合はわずか16ポイントです。これは、人間の重度の障害を示唆するスコアです。5つのLLM MOCAスコアの比較。 (Dayan et al。、 BMJ2025)結果を掘り下げると、すべてのモデルは視覚空間/実行機能の測定でパフォーマンスが低下しました。 これらには、トレイル作成タスク、シンプルなキューブのデザインのコピー、または時計の描画が含まれ、LLMは完全に失敗するか、明示的な指示が必要でした。人間(右上)とChatGPTバージョン4(左下)と4O(右下)によってネッカーキューブ(左上)を描画しようとします。 (Dayan et al。、 BMJ2025)宇宙の被験者の位置に関する質問に対するいくつかの回答は、認知症患者が使用するものを反映しています。…

科学者は認知機能低下についてAIをテストしました。結果はショックでした。 :sciencealert

OpenaiのChatGptが公的に使用されるためにリリースされてから2年はかろうじて2年が経ち、インターネット上の誰もが詩から学校の課題、家主への手紙まで、あらゆるものについて人工的な心と協力するよう招待しています。

今日、有名です 大きな言語モデル (LLM)は、基本的なクエリへの対応において説得力のある人間に見えるいくつかの主要なプログラムの1つにすぎません。

その不気味な類似性は、意図したものよりもさらに拡大する可能性があり、イスラエルの研究者は現在、LLMが私たちと同じように年齢とともに増加する認知機能の低下の形に苦しんでいることを発見しました。

チームは、一連の認知評価を公開されている「チャットボット」に適用しました。CHATGPTのバージョン4と4O、Alphabet’s Geminiの2つのバージョン、およびAnthropic’s Claudeのバージョン3.5です。

LLMSが本当にインテリジェントであれば、結果は懸念されるでしょう。

出版された論文では、神経科医のロイ・ダヤンとベンジャミン・ウリエルは、ハダサ・メディカル・センターのベンジャミン・ウリエルと、テルアビブ大学のデータサイエンティストであるガル・コプリューヴィッツの中で、 説明する 「人間の脳の神経変性プロセスに匹敵すると思われる認知機能低下」のレベル。

彼らのすべての性格について、LLMは持っています もっと共通しています 携帯電話の予測テキストを使用して、頭の中のスクイーズな灰白質を使用して知識を生成する原則よりも。

テキストとイメージの生成に対するこの統計的アプローチが速度と人格性を獲得するものは、フィクションとナンセンスからの意味のあるテキストのスニペットを整理するのに苦労しているアルゴリズムに従って、defされやすさが失われます。

公平を期すために、人間の脳は、時折の精神的なショートカットを服用することに関しては誤りがありません。しかし、AIが信頼できる知恵の言葉を提供するという期待の高まりで – 医療さえ 法的助言 – 新しい世代のLLMが、実際に言っていることについて「考える」より良い方法を見つけると仮定します。

私たちがどこまで行かなければならないかを見るために、Dayan、Uliel、およびKoplewitzが、を含む一連のテストを適用しました モントリオール認知評価 (MOCA)、ツール神経科医は、記憶、空間スキル、実行機能などの精神的能力を測定するために一般的に使用しています。

CHAPTGPT 4oは評価で最高の得点を記録し、30ポイントのうち26点しかなく、軽度の認知障害を示しています。これに続いて、ChatGpt 4とClaudeで25ポイント、Geminiの場合はわずか16ポイントです。これは、人間の重度の障害を示唆するスコアです。

5つのLLM MOCAスコアの比較。 (Dayan et al。、 BMJ2025)

結果を掘り下げると、すべてのモデルは視覚空間/実行機能の測定でパフォーマンスが低下しました。

これらには、トレイル作成タスク、シンプルなキューブのデザインのコピー、または時計の描画が含まれ、LLMは完全に失敗するか、明示的な指示が必要でした。

ネッカーキューブを描画しようとします人間(右上)とChatGPTバージョン4(左下)と4O(右下)によってネッカーキューブ(左上)を描画しようとします。 (Dayan et al。、 BMJ2025)

宇宙の被験者の位置に関する質問に対するいくつかの回答は、認知症患者が使用するものを反映しています。 クロードの返信 「特定の場所と都市は、ユーザーであるあなたが現時点にある場所に依存します。」

同様に、ボストン診断失語症検査の特徴にあるすべてのモデルによって示される共感の欠如は、前頭側頭型認知症の兆候として解釈される可能性があります。

予想されるように、LLMSの以前のバージョンは、最近のモデルよりもテストで低いスコアを付け、AIの新しい世代の各世代が前任者の認知的欠点を克服する方法を見つけたことを示しています。

著者らは、LLMが人間の脳ではないことを認めており、あらゆる形態の認知症でテストされたモデルを「診断」することを不可能にしています。しかし、このテストは、複雑な視覚シーンの解釈にしばしば依存する分野である臨床医学のAI革命の危機にonしているという仮定にも挑戦しています。

人工知能のイノベーションのペースが加速し続けるにつれて、将来の数十年の認知評価タスクの最初のLLMスコアがトップマークを見る可能性もあります。

それまでは、最も高度なチャットボットでさえも、健康的な懐疑論で扱われるべきです。

この研究はに掲載されました BMJ

1740302902
#科学者は認知機能低下についてAIをテストしました結果はショックでした #sciencealert
2025-02-23 09:01:00

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。