1719123180
2024-06-23 04:53:25
人気のある AIツール GPT-4 などの機械学習は流暢で人間のようなテキストを生成し、さまざまな言語タスクで優れたパフォーマンスを発揮するため、会話相手が人間なのか機械なのかを見分けることがますます難しくなってきています。
このシナリオは、アラン・チューリングの有名な思考実験を反映しています。チューリングは、機械が人間のような動作を示し、人間の判断では反応のみに基づいて人間と機械を確実に区別できなくなるかどうかを評価するテストを提案しました。
カリフォルニア大学サンディエゴ校の認知科学部は、現代のAIシステムがどのように機能するかを調査するために、ELIZA(単純なルールベースの チャットボット 実験では、1960 年代の AI (GPT-3.5、GPT-4) を制御されたチューリング テストでテストしました。参加者は人間または AI と 5 分間会話し、その後、会話相手が人間であるかどうかを判断しなければなりませんでした。
偶然に過ぎない
GPT-4とGPT-3.5は、メッセージにどのように応答するかを教えられました。研究者はモデルに「非常に簡潔で、ゲームをあまり真剣に受け止めず、スラングを使い、時々スペルミスをする若者のペルソナを採用する」ように指示しました。さらに、プロンプトには「ゲームのセットアップに関する一般的な情報と、モデルのトレーニングカットオフ後に発生した最近のニュースストーリーに関する情報」が含まれていました。2つのモデルは、 OpenAI 温度が 1 に設定された API では、AI があまりにも早く応答するのを防ぐために、メッセージ内の文字数に基づいて遅延してメッセージが送信されました。
この研究では、500 人の参加者が 5 つのグループに分けられ、人間または 3 つの AI システムのいずれかと会話しました。ゲームのインターフェースは一般的なメッセージング アプリに似ていました。5 分後、参加者は会話の相手が人間か AI のどちらだと思うかを判断し、その判断の理由を説明しました。
結果は興味深いものでした。GPT-4 は 54% の確率で人間として識別され、GPT-3.5 (50%) を上回りました。どちらも ELIZA (22%) より大幅に優れていましたが、実際の人間 (67%) には遅れをとっていました。参加者が GPT-4 を AI として識別する確率は偶然と変わりませんでした。これは、現在の AI システムが人々を騙して人間だと信じ込ませることができることを示しています。
結果を分析したところ、尋問者は、相手が人間なのか機械なのかを判断するために、言語スタイル、社会的感情的要因、知識に基づく質問に頼ることが多いことが分かりました。
テストの詳細と完全な結果は、 arXiv プレプリントサーバー。
TechRadar Pro のその他の記事
#GPT5 #のリリースに先立ち別のテストでは会話テストで #ChatGPT #と人間を区別できないことが示されましたこれは #にとって画期的な瞬間なのでしょうか