日本語版
最新ニュース
世界

aiの幻覚は悪化しています – そして彼らはここにとどまります

エラーはAIに生成されたコンテンツで発生する傾向がありますポール・テイラー/ゲッティイメージズ OpenaiやGoogleなどのハイテク企業からのAIチャットボットは、過去数か月にわたっていわゆる推論のアップグレードを受けています。理想的には、信頼できる答えを提供するのが理想的ですが、最近のテストでは、以前のモデルよりも悪いことがあることが示唆されています。 「幻覚」として知られるチャットボットによって行われたエラーは、最初から問題となっており、それらを取り除くことができないことが明らかになっています。 幻覚は、OpenaiのChatGPTやGoogleのGeminiなどのパワーシステムが行う大規模な言語モデル(LLMS)によって行われた特定の種類の間違いの包括的な用語です。それは、それらが時々誤った情報を真のものとして提示する方法の説明として最もよく知られています。しかし、それはまた、事実上正確なAIに生成された答えを指すことができますが、実際には尋ねられた質問には関係ありません。 最新のLLMSを評価するOpenaiテクニカルレポートは、4月にリリースされたO3およびO4-MINIモデルが、2024年後半に発表された同社の以前のO1モデルよりも大幅に高い幻覚率を持っていることを示しました。たとえば、O4-MINIが48パーセントの時間を過ごした間、O3幻覚33%を要約するとそれに比べて、O1の幻覚率は16%でした。 問題はOpenaiに限定されません。幻覚率を評価する会社Vectaraの人気のあるリーダーボードの1つは、開発者のDeepseekのDeepseek-R1モデルを含むいくつかの「推論」モデルを示しています。このタイプのモデルは、応答する前に一連の推論を実証するために複数のステップを通過します。 Openaiは、推論プロセスが責任を負うことではないと言います。 「O3とO4-Miniで見た幻覚の割合を減らすために積極的に取り組んでいますが、幻覚は本質的に推論モデルではそれほど一般的ではありません」とOpenaiの広報担当者は言います。 「精度と信頼性を向上させるために、すべてのモデルにわたって幻覚に関する研究を継続します。」 LLMSの潜在的なアプリケーションの一部は、幻覚によって脱線する可能性があります。一貫して虚偽を述べ、事実確認を必要とするモデルは、役立つ研究助手ではありません。想像上の事例を引用する麻痺者のボットは、弁護士をトラブルに巻き込むでしょう。時代遅れのポリシーがまだアクティブであると主張するカスタマーサービスエージェントは、会社の頭痛を引き起こします。 ただし、AI企業は当初、この問題が時間とともに解消されると主張していました。実際、彼らが最初に発売された後、モデルはアップデートごとに幻覚を減らす傾向がありました。しかし、最近のバージョンの高い幻覚率は、その物語を複雑にしています。 Vectaraのリーダーボードは、指定されたドキュメントを要約する際の事実上の一貫性に基づいてモデルをランク付けしています。これは、少なくともOpenaiとGoogleのシステムでは、「幻覚率は推論と非合理モデルについてほぼ同じである」ことを示した、とVectaraのForrest Sheng Baoは述べています。 Googleは追加のコメントを提供しませんでした。リーダーボードの目的のために、特定の幻覚率数は、各モデルの全体的なランキングよりも重要ではない、とBaoは述べています。 しかし、このランキングは、AIモデルを比較する最良の方法ではないかもしれません。 一つには、さまざまな種類の幻覚を混同します。 Vectaraチームは、Deepseek-R1モデルの幻覚は14.3%の時間であるが、これらのほとんどは「良性」であると指摘しました。これは、論理的な推論や世界の知識によって実際にサポートされているが、実際にはボットが要約するように求められた元のテキストに存在していないことを指摘しました。 Deepseekは追加のコメントを提供しませんでした。 この種のランキングのもう1つの問題は、テキストの要約に基づくテストが「間違った出力の割合について何も言っていないことです。 [LLMs] ワシントン大学のエミリー・ベンダーは言います。彼女は、LLMがテキストを要約するために特別に設計されていないため、リーダーボードの結果はこのテクノロジーを判断するための最良の方法ではないかもしれないと言います。 これらのモデルは、プロンプトへの回答を策定するために「次の単語とは何か」という質問に繰り返し回答することで機能するため、テキストの本文で利用可能な情報を理解しようとする通常の意味で情報を処理していません、とベンダーは言います。しかし、多くのハイテク企業は、出力エラーを説明する際に「幻覚」という用語を頻繁に使用しています。 「用語としての「幻覚」は二重に問題があります」とベンダーは言います。 「一方では、誤った出力は異常であり、おそらく緩和できるものであることを示唆していますが、残りの時間は接地され、信頼性が高く、信頼できるものです。一方で、マシンを擬人化するために機能します。 [and] 大規模な言語モデルは何も認識していません。」 プリンストン大学のアービンド・ナラヤナンは、この問題は幻覚を超えていると言います。また、モデルは、信頼できないソースを利用したり、古い情報を使用したりするなど、他の間違いを犯すこともあります。また、AIでより多くのトレーニングデータとコンピューティングパワーを投げるだけでは、必ずしも役立っているわけではありません。 結果は、エラーが発生しやすいAIとともに生きなければならないかもしれません。 Narayananは、ソーシャルメディアの投稿で、AIの答えを事実チェックすることは、自分で研究を行うよりも速い場合でも、タスクにそのようなモデルのみを使用することが最適かもしれないと述べました。しかし、最良の動きは、AIチャットボットに頼って事実情報を提供することを完全に避けることかもしれません、とベンダーは言います。 トピック: #aiの幻覚は悪化しています #そして彼らはここにとどまります

aiの幻覚は悪化しています – そして彼らはここにとどまります

1746828256
2025-05-09 20:00:00

エラーはAIに生成されたコンテンツで発生する傾向があります

ポール・テイラー/ゲッティイメージズ

OpenaiやGoogleなどのハイテク企業からのAIチャットボットは、過去数か月にわたっていわゆる推論のアップグレードを受けています。理想的には、信頼できる答えを提供するのが理想的ですが、最近のテストでは、以前のモデルよりも悪いことがあることが示唆されています。 「幻覚」として知られるチャットボットによって行われたエラーは、最初から問題となっており、それらを取り除くことができないことが明らかになっています。

幻覚は、OpenaiのChatGPTやGoogleのGeminiなどのパワーシステムが行う大規模な言語モデル(LLMS)によって行われた特定の種類の間違いの包括的な用語です。それは、それらが時々誤った情報を真のものとして提示する方法の説明として最もよく知られています。しかし、それはまた、事実上正確なAIに生成された答えを指すことができますが、実際には尋ねられた質問には関係ありません。

最新のLLMSを評価するOpenaiテクニカルレポートは、4月にリリースされたO3およびO4-MINIモデルが、2024年後半に発表された同社の以前のO1モデルよりも大幅に高い幻覚率を持っていることを示しました。たとえば、O4-MINIが48パーセントの時間を過ごした間、O3幻覚33%を要約するとそれに比べて、O1の幻覚率は16%でした。

問題はOpenaiに限定されません。幻覚率を評価する会社Vectaraの人気のあるリーダーボードの1つは、開発者のDeepseekのDeepseek-R1モデルを含むいくつかの「推論」モデルを示しています。このタイプのモデルは、応答する前に一連の推論を実証するために複数のステップを通過します。

Openaiは、推論プロセスが責任を負うことではないと言います。 「O3とO4-Miniで見た幻覚の割合を減らすために積極的に取り組んでいますが、幻覚は本質的に推論モデルではそれほど一般的ではありません」とOpenaiの広報担当者は言います。 「精度と信頼性を向上させるために、すべてのモデルにわたって幻覚に関する研究を継続します。」

LLMSの潜在的なアプリケーションの一部は、幻覚によって脱線する可能性があります。一貫して虚偽を述べ、事実確認を必要とするモデルは、役立つ研究助手ではありません。想像上の事例を引用する麻痺者のボットは、弁護士をトラブルに巻き込むでしょう。時代遅れのポリシーがまだアクティブであると主張するカスタマーサービスエージェントは、会社の頭痛を引き起こします。

ただし、AI企業は当初、この問題が時間とともに解消されると主張していました。実際、彼らが最初に発売された後、モデルはアップデートごとに幻覚を減らす傾向がありました。しかし、最近のバージョンの高い幻覚率は、その物語を複雑にしています。

Vectaraのリーダーボードは、指定されたドキュメントを要約する際の事実上の一貫性に基づいてモデルをランク付けしています。これは、少なくともOpenaiとGoogleのシステムでは、「幻覚率は推論と非合理モデルについてほぼ同じである」ことを示した、とVectaraのForrest Sheng Baoは述べています。 Googleは追加のコメントを提供しませんでした。リーダーボードの目的のために、特定の幻覚率数は、各モデルの全体的なランキングよりも重要ではない、とBaoは述べています。

しかし、このランキングは、AIモデルを比較する最良の方法ではないかもしれません。

一つには、さまざまな種類の幻覚を混同します。 Vectaraチームは、Deepseek-R1モデルの幻覚は14.3%の時間であるが、これらのほとんどは「良性」であると指摘しました。これは、論理的な推論や世界の知識によって実際にサポートされているが、実際にはボットが要約するように求められた元のテキストに存在していないことを指摘しました。 Deepseekは追加のコメントを提供しませんでした。

この種のランキングのもう1つの問題は、テキストの要約に基づくテストが「間違った出力の割合について何も言っていないことです。 [LLMs] ワシントン大学のエミリー・ベンダーは言います。彼女は、LLMがテキストを要約するために特別に設計されていないため、リーダーボードの結果はこのテクノロジーを判断するための最良の方法ではないかもしれないと言います。

これらのモデルは、プロンプトへの回答を策定するために「次の単語とは何か」という質問に繰り返し回答することで機能するため、テキストの本文で利用可能な情報を理解しようとする通常の意味で情報を処理していません、とベンダーは言います。しかし、多くのハイテク企業は、出力エラーを説明する際に「幻覚」という用語を頻繁に使用しています。

「用語としての「幻覚」は二重に問題があります」とベンダーは言います。 「一方では、誤った出力は異常であり、おそらく緩和できるものであることを示唆していますが、残りの時間は接地され、信頼性が高く、信頼できるものです。一方で、マシンを擬人化するために機能します。 [and] 大規模な言語モデルは何も認識していません。」

プリンストン大学のアービンド・ナラヤナンは、この問題は幻覚を超えていると言います。また、モデルは、信頼できないソースを利用したり、古い情報を使用したりするなど、他の間違いを犯すこともあります。また、AIでより多くのトレーニングデータとコンピューティングパワーを投げるだけでは、必ずしも役立っているわけではありません。

結果は、エラーが発生しやすいAIとともに生きなければならないかもしれません。 Narayananは、ソーシャルメディアの投稿で、AIの答えを事実チェックすることは、自分で研究を行うよりも速い場合でも、タスクにそのようなモデルのみを使用することが最適かもしれないと述べました。しかし、最良の動きは、AIチャットボットに頼って事実情報を提供することを完全に避けることかもしれません、とベンダーは言います。

トピック:

#aiの幻覚は悪化しています #そして彼らはここにとどまります

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。