目次
目次テストは何と言っていますか? AIの「幻覚」とは何ですか、そしてなぜそれらが起こるのですか?修正は何ですか?
Openaiは先週、O3およびO4-MINIモデルに関するさまざまな内部テストと調査結果を詳述した論文をリリースしました。これらの新しいモデルと2023年に見たCHATGPTの最初のバージョンの主な違いは、高度な推論とマルチモーダル機能です。 O3とO4-MINIは、画像を生成し、Webを検索し、タスクを自動化し、古い会話を覚え、複雑な問題を解決できます。ただし、これらの改善により、予期しない副作用ももたらしたようです。
テストは何と言っていますか?
Openaiには 特定のテスト Personqaと呼ばれる幻覚速度を測定するため。それには、人々が「学ぶ」ための人々に関する一連の事実と、答える人々に関する一連の質問が含まれています。モデルの精度は、回答の試みに基づいて測定されます。昨年のO1モデルは、47%の精度率と16%の幻覚率を達成しました。
O3とO4-MINIがこの評価に対してテストされたとき、それらはO1よりも大幅に高い速度で幻覚を起こしました。 Openaiによると、これはO4-MINIモデルにはやや予想されていました。なぜなら、O4-MINIモデルは小さく、世界の知識が少なく、幻覚が増えるからです。それでも、O4-MiniがWebを検索し、あらゆる種類の異なる情報とアドバイスを得るために使用している市販の製品であることを考えると、達成した48%の幻覚率は非常に高いようです。
フルサイズのモデルであるO3は、テスト中にその応答の33%で幻覚を起こし、O4-miniを上回るが、O1と比較して幻覚速度を2倍にします。ただし、高精度もありましたが、Openaiは全体としてより多くの主張をする傾向に起因しています。したがって、これら2つの新しいモデルのいずれかを使用し、多くの幻覚に気づいた場合、それはあなたの想像力だけではありません。 (たぶん、私は「心配しないでください、あなたは幻覚ではない人ではない」のように冗談を言うべきです。)
AIの「幻覚」とは何ですか、そしてなぜそれらが起こるのですか?
AIモデルについて聞いたことがあるかもしれませんが以前は、幻覚が何を意味するのかは常に明確ではありません。AI製品、Openaiなどを使用するたびに、その応答が不正確であり、あなた自身のために事実チェックしなければならないという免責事項がどこかで見られることが保証されています。
不正確な情報はあちこちから出てくる可能性があります。時には、WikipediaやユーザーがRedditでナンセンスを吐き出すことがあります。たとえば、GoogleのAIの概要は、「非毒性接着剤」を含むピザのレシピを提案したときに多くの注目を集めました。最終的に、GoogleがRedditスレッドの冗談からこの「情報」を入手したことが発見されました。
ただし、これらは「幻覚」ではなく、悪いデータや誤解から生じる偶発的な間違いのようなものです。一方、幻覚は、AIモデルが明確な情報源や理由なしに主張するときです。 AIモデルが特定のクエリに答えるために必要な情報を見つけることができず、Openaiが持っている場合によく起こります 定義されています それは「不確実性の瞬間に事実を発明する傾向」として。他の業界の数字はそれを「クリエイティブギャップを埋める」と呼んでいます。
「現在入手可能な7つのiPhone 16モデルは何ですか?」などのChatGptの主要な質問をすることで、幻覚を奨励できます。 7つのモデルがないため、LLMはいくつかの実際の答えを与える可能性があります。そして、ジョブを終了するために追加のモデルを構成します。

私は、それが本当にそれに陥るとした場合に備えて、私の例をGPT 4oにフィードすることにしました – そしてそれはそうしました!ウィローロバーツ /デジタルトレンド
のようなチャットボット chatgpt コンテンツに応答を通知するインターネットデータでトレーニングされているだけでなく、「応答方法」についても訓練されています。それらは、何千ものクエリと一致する理想的な応答を示して、正しい種類のトーン、態度、および礼儀正しさを促進します。
トレーニングプロセスのこの部分は、LLMがあなたに同意するように聞こえるようにするものです。または、その出力の残りがそれらの声明と完全に矛盾しているとしても、あなたが言っていることを理解します。このトレーニングは、幻覚が非常に頻繁に起こる理由の一部である可能性があります。これは、質問に答えることができない応答と比較して、質問に答える自信のある応答がより有利な結果として強化されているためです。
私たちにとって、ランダムな嘘を吐き出すことは、答えを知らないよりも悪いことは明らかですが、LLMは「嘘をついていません」。彼らは嘘が何であるかさえ知りません。一部の人々は、AIの間違いは人間の間違いのようなものであり、「私たちは常に物事を正しく理解していないので、AIも期待すべきではない」と言う人もいます。ただし、AIからの間違いは、単に私たちが設計した不完全なプロセスの結果であることを覚えておくことが重要です。
AIモデルは嘘をつかない、誤解を招くこと、または私たちのように情報を誤解しないでください。彼らは正確さや不正確さの概念さえ持っていません – 彼らは単に 次の単語を予測します 確率に基づく文で。そして、私たちはありがたいことに、最も一般的に言われたことが正しいものである可能性が高い状態にあるので、それらの再構成はしばしば正確な情報を反映しています。それは、「正しい答え」を得たときに、私たちが設計した結果ではなく、単なるランダムな副作用であるように聞こえます。
インターネット全体の情報をこれらのモデルに提供しますが、どの情報が良いか悪いか、正確であるか、不正確であるかを伝えません。彼らは、既存の基本的な知識や一連の根本的な原則を持っていません。それはすべて数字のゲームです。特定のコンテキストで最も頻繁に存在する単語のパターンは、LLMの「真実」になります。私にとって、これはクラッシュして燃えるように運命づけられているシステムのように聞こえますが、他の人はこれがAGIにつながるシステムであると信じています(それは別の議論ですが)。
修正は何ですか?

問題は、Openaiがこれらの高度なモデルがより頻繁に幻覚を起こす傾向がある理由をまだ知らないことです。おそらくもう少し研究があれば、問題を理解して修正することができるでしょう。しかし、物事がそれほどスムーズに進まない可能性もあります。同社は間違いなくますます「高度な」モデルをリリースし続け、幻覚率が上昇し続ける可能性があります。
この場合、Openaiは短期的な解決策を追求するだけでなく、根本原因に関する研究を継続する必要があるかもしれません。結局のところ、これらのモデルは金銭的な製品であり、使用可能な状態にある必要があります。私はAIの科学者ではありませんが、私の最初のアイデアは、複数の異なるOpenAIモデルにアクセスできるチャットインターフェイスである何らかの集計製品を作成することだと思います。
クエリに高度な推論が必要な場合、GPT-4oを呼び出し、幻覚の可能性を最小限に抑えたい場合、O1のような古いモデルを呼び出します。おそらく、同社はさらにファンシーになり、異なるモデルを使用して単一のクエリのさまざまな要素を処理し、追加のモデルを使用して最後にすべてを縫い合わせられるでしょう。これは基本的に複数のAIモデル間のチームワークであるため、おそらくある種の事実確認システムも実装できます。
ただし、精度率を上げることは主な目標ではありません。主な目標は、幻覚率を下げることです。つまり、「私は知らない」と言う応答と、正しい答えの応答を評価する必要があります。
現実には、Openaiが何をするのか、その研究者が幻覚の速度を高めていることについて本当に心配していることはわかりません。私が知っているのは、より多くの幻覚がエンドユーザーにとって悪いということです。それは、私たちが気付かずに誤解される機会をますます意味します。あなたがLLMSに大きくなっている場合、それらの使用を停止する必要はありませんが、結果を事実チェックする必要性に勝つために時間を節約したいという欲求が得られないでください。常にファクトチェック!
#それはあなたの想像力ではありません #chatgptモデルは実際にもっと幻覚を起こします