日本語版
最新ニュース
企業

チューリングテストに合格するChatGpt – MyBroadBandについての真実

ありました いくつかの見出し 先週、AIチャットボットについて 公式に通過します チューリングテスト。 これら ニュースレポート に基づいています 最近のプリプリント研究 カリフォルニア大学サンディエゴ校の2人の研究者によって、4つの大手言語モデル(LLM)がチューリングテストにかけられました。 1つのモデル - OpenaiのGPT-4.5 - は、70%以上の人間と区別できないと見なされていました。 チューリングテストはそうです 大衆化 マシンインテリジェンスの究極の指標として。ただし、このテストの妥当性については意見の相違があります。実際、それは機械の知能を測定するのに実際にどれほど効果的であるかを疑問視する論争的な歴史を持っています。 それで、これはこの新しい研究の重要性にとって何を意味するのでしょうか? 認知科学者のキャメロン・ジョーンズとベンジャミン・ベルゲンによるプレプリント研究は3月に掲載されましたが、まだ査読されていません。 4 LLMをテストしました: エリザ、 GPT-4O、 Call-3.1-405b、 そして GPT-4.5。 テストは、参加者が8ラウンドの会話を完了することで構成されており、そこでは、2人の証人と同時にテキストメッセージを交換する尋問者として行動しました。 1人の証人は人間で、もう1人はLLMでした。約284人の参加者が、尋問者または証人のいずれかにランダムに割り当てられました。 参加者は、テストインターフェイスが従来のメッセージングインターフェイスのそれを模倣して、5分間、スプリット画面を介して両方の証人と同時にやり取りする必要がありました。この相互作用に続いて、彼らはどの証人が人間であり、それがAIチャットボットであるかを決定しました。 参加者は、GPT-4.5が人間の73%であると判断し、llama-3.1-405bは人間の56%であると判断しました。他の2つのモデル(ElizaとGPT-4O)は、それぞれ23%と21%の参加者をだましていました。 チューリングテストの最初の反復は、英国の数学者およびコンピューター科学者のアランチューリングが1948年の論文で提示しました。インテリジェントな機械」。もともとは、3人がペーパーマシンと呼ばれる理論的な機械でチェスを演奏する3人が関与する実験として提案されていました。 1950年の出版物」コンピューティング機械とインテリジェンスチューリングは、実験を「模倣ゲーム」として再導入し、人間に相当するインテリジェントな行動を示す機械の能力を決定する手段であると主張しました。それは3人の参加者を巻き込みました。 一連の質問を通じて、参加者Cは「xはa、yはb」か「xはb、yがa」かを決定するために必要です。xとyは2つの性別を表します。 その後、命題が提起されます。「このゲームでマシンがAの一部を取るとどうなりますか?尋問者は、ゲームが男性と女性の間でプレイされたときと同じようにゲームを再生するときに誤って決定しますか?」 これらの質問は、「マシンは考えることができますか?」という曖昧な質問に取って代わることを目的としていました。チューリング この質問はあいまいだと主張した 「マシン」と「考える」という用語を理解する必要があるため、「通常」という言葉の使用は、質問に対する回答を不十分にします。…

チューリングテストに合格するChatGpt  –  MyBroadBandについての真実

1744487741
2025-04-12 11:00:00

ありました いくつかの見出し 先週、AIチャットボットについて 公式に通過します チューリングテスト。

これら ニュースレポート に基づいています 最近のプリプリント研究 カリフォルニア大学サンディエゴ校の2人の研究者によって、4つの大手言語モデル(LLM)がチューリングテストにかけられました。 1つのモデル – OpenaiのGPT-4.5 – は、70%以上の人間と区別できないと見なされていました。

チューリングテストはそうです 大衆化 マシンインテリジェンスの究極の指標として。ただし、このテストの妥当性については意見の相違があります。実際、それは機械の知能を測定するのに実際にどれほど効果的であるかを疑問視する論争的な歴史を持っています。

それで、これはこの新しい研究の重要性にとって何を意味するのでしょうか?

認知科学者のキャメロン・ジョーンズとベンジャミン・ベルゲンによるプレプリント研究は3月に掲載されましたが、まだ査読されていません。 4 LLMをテストしました: エリザGPT-4OCall-3.1-405b、 そして GPT-4.5

テストは、参加者が8ラウンドの会話を完了することで構成されており、そこでは、2人の証人と同時にテキストメッセージを交換する尋問者として行動しました。 1人の証人は人間で、もう1人はLLMでした。約284人の参加者が、尋問者または証人のいずれかにランダムに割り当てられました。

参加者は、テストインターフェイスが従来のメッセージングインターフェイスのそれを模倣して、5分間、スプリット画面を介して両方の証人と同時にやり取りする必要がありました。この相互作用に続いて、彼らはどの証人が人間であり、それがAIチャットボットであるかを決定しました。

参加者は、GPT-4.5が人間の73%であると判断し、llama-3.1-405bは人間の56%であると判断しました。他の2つのモデル(ElizaとGPT-4O)は、それぞれ23%と21%の参加者をだましていました。

チューリングテストの最初の反復は、英国の数学者およびコンピューター科学者のアランチューリングが1948年の論文で提示しました。インテリジェントな機械」。もともとは、3人がペーパーマシンと呼ばれる理論的な機械でチェスを演奏する3人が関与する実験として提案されていました。

1950年の出版物」コンピューティング機械とインテリジェンスチューリングは、実験を「模倣ゲーム」として再導入し、人間に相当するインテリジェントな行動を示す機械の能力を決定する手段であると主張しました。それは3人の参加者を巻き込みました。

一連の質問を通じて、参加者Cは「xはa、yはb」か「xはb、yがa」かを決定するために必要です。xとyは2つの性別を表します。

その後、命題が提起されます。「このゲームでマシンがAの一部を取るとどうなりますか?尋問者は、ゲームが男性と女性の間でプレイされたときと同じようにゲームを再生するときに誤って決定しますか?」

これらの質問は、「マシンは考えることができますか?」という曖昧な質問に取って代わることを目的としていました。チューリング この質問はあいまいだと主張した 「マシン」と「考える」という用語を理解する必要があるため、「通常」という言葉の使用は、質問に対する回答を不十分にします。

長年にわたり、この実験はチューリングテストとして普及していました。主題はさまざまでしたが、テストは「xはa、yがb」か「xはb、yはa」かについての審議のままでした。

ブレッチリーパークのアランチューリングの像。写真家:lenscap photography / shutterstock.com

なぜそれは論争ですか?

マシンのインテリジェンスをテストする手段として普及している一方で、チューリングテストは、そうするための正確な手段として満場一致で受け入れられていません。実際、テストは頻繁に挑戦されます。

がある チューリングテストに対する4つの主な異議

  1. 行動と思考。一部の研究者は、テストに「合格」する能力は、知性ではなく行動の問題であると主張しています。したがって、マシンが模倣ゲームに合格できると言うのは矛盾していませんが、考えることはできません。
  2. 脳は機械ではありません。チューリングは、脳が機械であると主張しており、純粋に機械的な用語で説明できると主張しています。多くの学者はこの主張に反論し、これに基づいてテストの妥当性に疑問を投げかけています。
  3. 内部操作。コンピューターは人間ではないため、結論に達するプロセスは人のプロセスに匹敵しない可能性があり、直接的な比較が機能しないため、テストが不十分になります。
  4. テストの範囲。一部の研究者は、1つの動作のみをテストするだけでは知性を決定するのに十分ではないと考えています。

それで、LLMは人間と同じくらい賢いですか?

チューリングテストは、代替可能性の尺度です。 […] 違いに気づきます。

これは、研究者がチューリングテストが人間の知性の正当な兆候であるという考えを支持していないことを意味します。むしろ、それは人間の知性の模倣の兆候であり、テストの起源へのodeです。

また、研究の条件に問題がないわけではないことも注目に値します。たとえば、5分間のテストウィンドウは比較的短いです。

さらに、各LLMは特定のペルソナを採用するように促されましたが、「ペルソナ」の詳細と影響がテストにどのようなものであったかは不明です。

今のところ、GPT-4.5は人間ほど知的ではないと言っても安全ですが、そうでなければ一部の人々を説得する合理的な仕事をしているかもしれません。

ゼナ・アサド、上級講師、工学部、 オーストラリア国立大学

#チューリングテストに合格するChatGpt #MyBroadBandについての真実

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。