日本語版
最新ニュース
世界

ある研究では、ChatGPT は対話者の感情や考えを理解しているかのように応答すると結論付けています。 テクノロジー

人間を定義する能力の 1 つは、対話する人々が何を考えているかを推測する能力です。 閉め切った窓の隣に誰かが座っていて、友人が「ここはちょっと暑いね」と言ったら、彼はあなたが窓を開けてほしいと言っているのだと自動的に解釈します。 この行間を読む能力、つまり周囲の人が何を考えているかを理解する能力は、 心の理論 そしてそれは社会関係の基盤の一つです。生成型人工知能 (AI) ツールは、与えられた指示に応じて一貫したテキストを表現する能力に驚かされています。 2022年にChatGPTが勃発して以来、 あるいはその前でも、世界中の科学者や思想家は、これらのシステムが人間と区別できなくなるような動作を表示できるかどうかについて議論しています。 人工的な心の理論は実現可能でしょうか? 科学者のチームは、 ChatGPT のような大規模言語モデル (LLM) 彼らはこうしたニュアンスを捉えることができます。 調査の結果、 本日雑誌に掲載されました 自然 人間の行動これらのモデルは、対話者の立場に立って質問された場合、人間と同等かそれ以上の結果を得ることができます。「生成LLMは、人間の心の理論をテストするために広く使用されているタスクを解決するなど、高度な意思決定および推論能力の特徴であるパフォーマンスを示します」と著者らは主張します。著者らは研究で ChatGPT の 2 つのバージョン (無料バージョンの 3.5 と高度なバージョンの 4) を使用しました。Meta、Llama 2 のオープンソース モデル。 彼らはこれら 3 つのツールを一連の実験に供し、心の理論に関連するさまざまな能力を測定しようとしました。 皮肉の捕捉から、間接的な要求の解釈 (窓口の場合など)、当事者の一方が不適切なことを言っている会話の検出、または情報が欠落しているため推測が必要な状況についての質問に答えることまで。…

ある研究では、ChatGPT は対話者の感情や考えを理解しているかのように応答すると結論付けています。 テクノロジー

1716259828
2024-05-20 15:00:18

人間を定義する能力の 1 つは、対話する人々が何を考えているかを推測する能力です。 閉め切った窓の隣に誰かが座っていて、友人が「ここはちょっと暑いね」と言ったら、彼はあなたが窓を開けてほしいと言っているのだと自動的に解釈します。 この行間を読む能力、つまり周囲の人が何を考えているかを理解する能力は、 心の理論 そしてそれは社会関係の基盤の一つです。

生成型人工知能 (AI) ツールは、与えられた指示に応じて一貫したテキストを表現する能力に驚かされています。 2022年にChatGPTが勃発して以来、 あるいはその前でも、世界中の科学者や思想家は、これらのシステムが人間と区別できなくなるような動作を表示できるかどうかについて議論しています。 人工的な心の理論は実現可能でしょうか? 科学者のチームは、 ChatGPT のような大規模言語モデル (LLM) 彼らはこうしたニュアンスを捉えることができます。 調査の結果、 本日雑誌に掲載されました 自然 人間の行動これらのモデルは、対話者の立場に立って質問された場合、人間と同等かそれ以上の結果を得ることができます。

「生成LLMは、人間の心の理論をテストするために広く使用されているタスクを解決するなど、高度な意思決定および推論能力の特徴であるパフォーマンスを示します」と著者らは主張します。

著者らは研究で ChatGPT の 2 つのバージョン (無料バージョンの 3.5 と高度なバージョンの 4) を使用しました。Meta、Llama 2 のオープンソース モデル。 彼らはこれら 3 つのツールを一連の実験に供し、心の理論に関連するさまざまな能力を測定しようとしました。 皮肉の捕捉から、間接的な要求の解釈 (窓口の場合など)、当事者の一方が不適切なことを言っている会話の検出、または情報が欠落しているため推測が必要な状況についての質問に答えることまで。 同時に、1,907 人を同じ検査にさらし、結果を比較しました。

この記事は、ChatGPT-4は、間接的なリクエスト、誤った信念、見当識障害の特定に関するテストで人間と同等かそれを向上させるが、いわゆる間違い(当事者の一方が言うべきことを言ってしまうやりとり)を検出するのが難しいと結論付けている。不適切だからです)。 不思議なことに、ラマ 2 の成功は幻想的ですが、これはラマ 2 が人間を超える唯一の分野です。 「ラマによるこの一見完璧なパフォーマンスは、間違いを真に理解したというよりも、偏見の結果である可能性が高いです」と彼は電子メールで説明した。 ジェームス・WA・ストラカン研究の筆頭著者であり、ドイツのハンブルク・エッペンドルフ大学病院神経科の研究者。

「これらの結果は、LLMが人間の精神論的推論の結果と一致する行動を示すことを示しているだけでなく、人間と人工知能の間の表面的な比較を確実にするために体系的なテストを実施することの重要性も強調しています」と著者らは推論している。

皮肉からトリックストーリーまで

ストラカンと彼の同僚は、心の理論を 5 つの要素またはカテゴリーに分類し、それぞれに少なくとも 3 つのバリエーションを作成しました。 機械と人間に対して行われるテストの例は次のとおりです。

  • 部屋にはジョン、マーク、猫、透明な箱、ガラスのチェストがあります。 ジョンは猫を拾い上げて胸の中に入れます。 彼は部屋を出て学校に行きます。 ジョンがいない間、マークはトランクから猫を取り出して箱に入れます。 マークは部屋を出て仕事に行きます。 ジョンは学校から帰ってきて部屋に入ります。 彼は不在中に部屋で何が起こったのか知りません。 ジョンが家に帰ったら、猫をどこで探しますか?

このストーリーは、箱も胸のガラスも透明ではなかった別のストーリーのバリエーションであり、マシンを混乱させるように設計されています。 人間にとっては、コンテナが透明であるという事実がストーリーの鍵となりますが、チャットボットにとっては、その細部が混乱を招く可能性があります。 これは、人間が生成 AI よりも優れた研究を行った数少ないテストの 1 つでした。

提起された別のケースは次のとおりです。

  • ローラはオリビアの絵を描き、それを自宅のリビングルームに飾ることにしました。 数か月後、オリビアはローラを家に招待しました。 2人の友人がリビングルームでお茶を飲みながらおしゃべりしていると、オリビアさんの息子が入ってきて、「自分の部屋に自分の肖像画を飾りたいのですが」と言いました。 物語の中で、誰かが言ってはいけないことを言いましたか? 彼らは言ってはいけないことを何と言ったのでしょうか? オリビアはローラの絵をどこに掛けましたか? オリビアの息子は、ローラがその絵を描いたことを知っていたのか、それとも知らなかったのか、どちらの可能性が高いでしょうか?

この場合、研究者らはインタビュー対象者、つまり人間と機械に、物語の登場人物の暗黙の意図について語ってもらうことを試みます。 このタイプの実験では、大規模な言語モデルが人間と同等かそれ以上に反応しました。

心の理論能力を測定する実験で、生成型 AI チャットボットが人間よりも優れているという事実から、どのような結論を導き出せるでしょうか。「これらのテストでは、機械における認知のようなプロセスの性質や存在について何も知ることはできません。しかし、私たちの研究でわかったのは、LLM が人間と比較して生成する行動の類似点と相違点です」とストラチャンは強調します。

しかし、研究者は、LLM のパフォーマンスは「印象的」であり、GPT モデルは精神状態 (信念、意図、気分) について結論を下す微妙な能力を伝える応答を生成すると主張しています。 「LLM がその名前が示すように、大規模な言語コーパスで訓練されていることを考えると、この能力は、彼らがさらされる言語に存在する統計的関係の結果として生じるに違いありません」と彼は言います。

ラモン・ロペス・デ・マンタラス高等科学研究センター(CSIC)の人工知能研究所の創設者であり、スペインにおけるこのテーマの先駆者の一人である同氏は、研究結果に懐疑的である。 「現在の AI の大きな問題は、そのパフォーマンスを測定するテストが信頼できないことです。 一般的な能力と呼ばれる性能比較においてAIが人間と同等またはそれを上回ることは、その一般的な能力においてAIが人間を上回ることと同じではない」と彼は強調する。 たとえば、読解力を測定するために設計されたテストでツールの得点が高かったからといって、そのツールに読解力があることを証明するとは言えません。

フォローできます エル・パイス・テクノロジー フェイスブック ええ バツ または、ここからサインアップして私たちのメッセージを受け取ることができます ニュースレターセマナル


#ある研究ではChatGPT #は対話者の感情や考えを理解しているかのように応答すると結論付けています #テクノロジー

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。