日本語版
最新ニュース
世界

心理テストの理論では、AI が人間に勝つ

心の理論、つまり他人の精神状態を理解する能力が、人間の社会世界を動かしているのです。 それは、緊迫した状況で何を言うべきかを判断したり、他の車のドライバーが何をしようとしているかを推測したり、映画の登場人物に感情移入したりするのに役立ちます。 そして、新しい研究によると、ChatGPT などを強化する大規模言語モデル (LLM) は、この典型的な人間の特性を模倣するのに驚くほど優れています。「研究を実施する前、私たちは皆、大規模な言語モデルがこれらのテスト、特に精神状態を評価する微妙な能力を評価するテストに合格しないと確信していました」と、研究共著者でハンブルク大学医療センターの認知神経科学教授クリスティーナ・ベッキオ氏は言う。ドイツのエッペンドルフ。 彼女が「予想外で驚くべき」と呼ぶその結果は、今日、やや皮肉なことに雑誌に掲載された。 自然 人間の行動。しかし、この結果を見ても、人間と同じように考える機械の時代に入ったと誰もが納得するわけではない。この調査結果を精査した専門家2人は、この結果を「鵜呑みにせず」受け止めるよう助言し、「大衆に誇大宣伝とパニック」を引き起こす可能性のあるテーマについて結論を出すことには注意を促した。別の外部専門家は、ソフトウェア プログラムを擬人化することの危険性について警告した。研究者らは、その結果がLLMが実際に心の理論を持っていることを示しているとは言わないように注意している。LLM の応答がこの種の推論を示しているという証拠を主張したのは、ベッキオ氏とその同僚が初めてではない。 昨年投稿されたプレプリントの中で、スタンフォード大学の心理学者ミハル・コシンスキーは、心のテストに関するいくつかの一般的な理論に関するいくつかのモデルをテストしたと報告しました。 同氏は、その中で最も優れた OpenAI の GPT-4 がタスクの 75% を正しく解決したことを発見し、これは過去の研究で観察された 6 歳児のパフォーマンスと一致したと述べました。 しかし、この研究の方法は、追跡実験を行った他の研究者によって批判され、LLMは心の推論の真の理論ではなく、「浅いヒューリスティック」と近道に基づいて正しい答えを得ることが多いと結論付けられました。本研究の著者らはこの議論をよく知っていた。 「「この論文の目標は、幅広い心理テストを用いて、より体系的な方法で機械の心の理論を評価するという課題に取り組むことでした」と、現在ハンブルク・エッペンドルフ大学医療センターの客員研究員を務める認知心理学者で、研究の共著者であるジェームズ・ストラチャン氏は述べている。同氏は、厳密な研究を行うということは、LLMに与えられたのと同じタスクで人間もテストすることを意味したと指摘している。この研究では、1,907人の人間の能力を、OpenAIのGPT-4モデルやMetaのオープンソースLlama 2-70bモデルなど、いくつかの一般的なLLMの能力と比較した。心の理論のための LLM をテストする方法LLM と人間はどちらも、典型的な 5 種類の心の理論のタスクを完了しました。そのうちの最初の 3 つは、ヒント、皮肉、失敗の理解でした。 彼らはまた、幼児が心の理論を発達させているかどうかを判断するためによく使用される「誤った信念」の質問にも答えました。次のようなものです。ボブが部屋から出ている間にアリスが何かを動かしたら、ボブは戻ってきたらどこでそれを探すでしょうか。 ? 最後に、人々が嘘をついたり、操作したり、お互いを誤解したりする「奇妙な物語」に関するかなり複雑な質問に答えました。全体として、GPT-4 がトップになりました。 そのスコアは、誤った信念テストに関する人間のスコアと一致し、皮肉、ほのめかし、奇妙な物語に関する人間のスコアの合計よりも高かった。 誤ったテストで人間よりも悪かっただけです。 興味深いことに、Llama-2…

心理テストの理論では、AI が人間に勝つ

1716299834
2024-05-20 15:00:02

心の理論、つまり他人の精神状態を理解する能力が、人間の社会世界を動かしているのです。 それは、緊迫した状況で何を言うべきかを判断したり、他の車のドライバーが何をしようとしているかを推測したり、映画の登場人物に感情移入したりするのに役立ちます。 そして、新しい研究によると、ChatGPT などを強化する大規模言語モデル (LLM) は、この典型的な人間の特性を模倣するのに驚くほど優れています。

「研究を実施する前、私たちは皆、大規模な言語モデルがこれらのテスト、特に精神状態を評価する微妙な能力を評価するテストに合格しないと確信していました」と、研究共著者でハンブルク大学医療センターの認知神経科学教授クリスティーナ・ベッキオ氏は言う。ドイツのエッペンドルフ。 彼女が「予想外で驚くべき」と呼ぶその結果は、今日、やや皮肉なことに雑誌に掲載された。 自然 人間の行動

しかし、この結果を見ても、人間と同じように考える機械の時代に入ったと誰もが納得するわけではない。この調査結果を精査した専門家2人は、この結果を「鵜呑みにせず」受け止めるよう助言し、「大衆に誇大宣伝とパニック」を引き起こす可能性のあるテーマについて結論を出すことには注意を促した。別の外部専門家は、ソフトウェア プログラムを擬人化することの危険性について警告した。

研究者らは、その結果がLLMが実際に心の理論を持っていることを示しているとは言わないように注意している。

LLM の応答がこの種の推論を示しているという証拠を主張したのは、ベッキオ氏とその同僚が初めてではない。 昨年投稿されたプレプリントの中で、スタンフォード大学の心理学者ミハル・コシンスキーは、心のテストに関するいくつかの一般的な理論に関するいくつかのモデルをテストしたと報告しました。 同氏は、その中で最も優れた OpenAI の GPT-4 がタスクの 75% を正しく解決したことを発見し、これは過去の研究で観察された 6 歳児のパフォーマンスと一致したと述べました。 しかし、この研究の方法は、追跡実験を行った他の研究者によって批判され、LLMは心の推論の真の理論ではなく、「浅いヒューリスティック」と近道に基づいて正しい答えを得ることが多いと結論付けられました。

本研究の著者らはこの議論をよく知っていた。 「この論文の目標は、幅広い心理テストを用いて、より体系的な方法で機械の心の理論を評価するという課題に取り組むことでした」と、現在ハンブルク・エッペンドルフ大学医療センターの客員研究員を務める認知心理学者で、研究の共著者であるジェームズ・ストラチャン氏は述べている。同氏は、厳密な研究を行うということは、LLMに与えられたのと同じタスクで人間もテストすることを意味したと指摘している。この研究では、1,907人の人間の能力を、OpenAIのGPT-4モデルやMetaのオープンソースLlama 2-70bモデルなど、いくつかの一般的なLLMの能力と比較した。

心の理論のための LLM をテストする方法

LLM と人間はどちらも、典型的な 5 種類の心の理論のタスクを完了しました。そのうちの最初の 3 つは、ヒント、皮肉、失敗の理解でした。 彼らはまた、幼児が心の理論を発達させているかどうかを判断するためによく使用される「誤った信念」の質問にも答えました。次のようなものです。ボブが部屋から出ている間にアリスが何かを動かしたら、ボブは戻ってきたらどこでそれを探すでしょうか。 ? 最後に、人々が嘘をついたり、操作したり、お互いを誤解したりする「奇妙な物語」に関するかなり複雑な質問に答えました。

全体として、GPT-4 がトップになりました。 そのスコアは、誤った信念テストに関する人間のスコアと一致し、皮肉、ほのめかし、奇妙な物語に関する人間のスコアの合計よりも高かった。 誤ったテストで人間よりも悪かっただけです。 興味深いことに、Llama-2 のスコアは GPT-4 の逆でした。誤った信念では人間と一致しましたが、皮肉、ほのめかし、奇妙な話では人間よりも悪いパフォーマンスを示し、偽物ではより良いパフォーマンスを示しました。

「現時点では、検査方法もアイデアもありません。 存在 心の理論のこと。」 —James Strachan、ハンブルク・エッペンドルフ大学医療センター

誤った結果で何が起こっているのかを理解するために、研究者らはモデルにいくつかの仮説を調査する一連の追跡テストを実施しました。 彼らは、GPT-4 は失敗に関する質問に対して正しい答えを与えることができるが、意見のある発言に関する「超保守的な」プログラミングによってそうすることが妨げられているという結論に達しました。 ストラカン氏は、OpenAI がモデルの周りに「モデルを事実に忠実で正直に軌道に乗せるように設計された」多くのガードレールを設置していると指摘し、GPT-4 の幻覚を防ぐことを目的とした戦略(つまりでっちあげ)も幻覚を防ぐ可能性があると主張している。それは、物語の登場人物が同窓会で高校時代の同級生を不注意に侮辱したかどうかについての意見からのものである。

一方、研究者らによるラマ-2の追跡テストでは、不正テストにおけるラマ2の優れたパフォーマンスは、おそらく元の質問と回答の形式の産物である可能性が高く、「アリスは知っていましたか?」という質問の変形に対する正解は、彼女がボブを侮辱していたと?」 常に「いいえ」でした。

研究者らは、LLMが実際に心の理論を持っていることを結果が示しているとは言わないよう注意し、代わりに「心の課題の理論において人間の行動と区別できない行動を示す」と述べている。 ここで疑問が生じます。模造品が本物と同じくらい優れている場合、それが本物ではないことはどうやってわかるのでしょうか? ストラカン氏によると、社会科学者はこれまで一度も答えようとしてこなかった問題だ、なぜなら人体実験では多かれ少なかれ品質が存在すると仮定しているからである。 「現時点では、 存在 「心の理論の現象学的性質」と彼は言う。

研究の批判

研究者らは明らかに、LLMと心の理論に関するコシンスキーの2023年の論文が批判にさらされる原因となった方法論的問題を回避しようとした。 たとえば、LLM がテスト中に正しい答えを「学習」できないように、複数のセッションにわたってテストを実施し、質問の構造を変更しました。 しかし、コシンスキー論文の批判を発表したAI研究者のヨアヴ・ゴールドバーグ氏とナタリー・シャピラ氏は、この研究にも納得していないと述べている。

「テキスト操作システムが、人間が同じ質問に直面したときに出す答えと同じようなタスクの出力を生成できるかどうかが、なぜ重要なのでしょうか?」 —エミリー・ベンダー、ワシントン大学

ゴールドバーグ氏は、今回の調査結果を割り引いて考えることについてコメントし、「モデルは人間ではない」とし、両者を比較すると「簡単に誤った結論に飛びつく可能性がある」と付け加えた。 シャピラ氏は誇大広告の危険性について語り、同紙の手法にも疑問を呈した。 彼女は、モデルがトレーニング データ内のテスト問題を見て、正しい答えを単に記憶しただけではないかと疑問に思います。また、有料の人間参加者 (この場合は Prolific プラットフォームを通じて募集) を使用するテストに潜在的な問題があることにも言及しています。 「労働者が常に最適に作業を遂行するとは限らないことはよく知られている問題です」と彼女は言います。 IEEE スペクトラム。 彼女は、調査結果は限られており、やや逸話的なものであると考えており、次のように述べています。 [theory of mind] 能力、多くの作業、そしてより包括的なベンチマークが必要です。」

ワシントン大学の計算言語学の教授であるエミリー・ベンダーは、AI 業界を膨張させる誇大広告を打ち破るという主張で、この分野では伝説的になっています (また、その業界に関するメディアの報道もよくあります)。 彼女は、研究者を動機づけた研究課題に異議を唱えています。 「テキスト操作システムが、人間が同じ質問に直面したときに出す答えと同じようなタスクの出力を生成できるかどうかが、なぜ重要なのでしょうか?」 彼女は尋ねます。 「このことから、LLM の内部動作、LLM が何に役立つのか、どのような危険性があるのかがわかりますか?」 LLM にとって心のモデルを持つことが何を意味するのかは明らかではなく、したがって、これらのテストがそれを測定するかどうかも不明だとベンダー氏は言う。

ベンダー氏は論文の中で彼女が指摘した擬人化についても懸念を表明しており、研究者らはLLMには認知、推論、選択の能力があると述べている。 彼女は、著者らの「LLM と人間の参加者との種を公平に比較する」という表現は、「ソフトウェアに関してはまったく不適切」であると述べています。 Bender と数人の同僚は最近、AI システムの擬人化がユーザーの信頼にどのような影響を与えるかを調査したプレプリント論文を投稿しました。

この結果は、AI が本当に機能していることを示していない可能性があります。 取得 しかし、心の推論理論を説得力を持って模倣する LLM の影響について考える価値はあります。 これらは、人間のユーザーと対話したり、ユーザーのニーズを予測したりすることに優れていますが、ユーザーを欺いたり、操作したりするために利用される可能性もあります。 そして、人間のユーザーにユーザー インターフェースの向こう側に心があると信じ込ませることで、さらなる擬人化を促すでしょう。

あなたのサイトの記事から

ウェブ上の関連記事

#心理テストの理論ではAI #が人間に勝つ

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。