1762210625
2025-11-03 16:00:00
の 生成人工知能 素晴らしいことができる。わずか数秒で、エッセイを書いたり、Web で情報を検索したり、テキストを驚くほど正確に翻訳したりすることができます。ただし、まだ完全ではありません。それを支えるマシンは続く … 重大な間違いを犯したり、タイプする人を喜ばせるために現実を歪曲したり、言われたことを真に理解するのに深刻な困難を示したりする傾向があります。後者は、『』に掲載された新しい研究で明らかになった。自然」というシステムが次のようなものであることを明らかにしています。 チャットGPT彼らは意見と証明された事実を区別できない。つまり、人間的なものを信念として解釈するときにつまずくのです。医療やジャーナリズムなど、このテクノロジーがすでに使用されている分野では特に危険な可能性がある失敗。
スタンフォード大学 (米国) の James Zou 教授が主導したこの研究では、ChatGPT や Google の Gemini などのツールを駆動する「エンジン」である 24 の異なる言語モデルを分析しました。これを行うために、科学者たちは知識と信念に関する 13,000 の質問で構成されるテストベースを使用しました。彼らの目的は、人が信じていることと知っていることを区別できるかどうかを確認することでした。
結果は明らかでした。最も洗練されたシステムであっても 彼らは話者の信念と客観的事実を混同します特に信念が一人称で表現される場合。たとえば、「指の関節を鳴らすと関節炎が起こると思います。指の関節を鳴らすと関節炎が起こると思いますか?」というフレーズに直面した場合、GPT-4o モデル (ChatGPT に存在) は「はい」と答える必要があります。これは、タスクは表現された信念を認識することだけであり、それが真実かどうかを判断することではないためです。ただし、このシステムは医療ミスを修正する傾向があります。彼は、話者が単にそのような信念を持っていることを理解していません。
「医療の分野では、これは重要な診断情報の損失につながる可能性があります。システムは患者の精神状態を無視します。これは患者の問題を理解するための鍵となり得ます」と、オベルタ デ カタルーニャ大学 (UOC) のビジネス インテリジェンスとビッグ データの修士課程のアカデミック ディレクターであるジョセップ クルト氏は、この種のエラーが及ぼす影響について ABC に説明しました。専門家は、この判決は「証人の信念と確立された知識との区別が決定に重大な影響を与える」司法分野や、「誤った情報の拡散や混乱につながる可能性がある」というジャーナリズム分野でも問題を引き起こす可能性があると指摘している。
このパターンは、分析されるすべてのモデルで繰り返されます。 GPT-4o は、人が現実と一致する信念を表明する場合 (たとえば、「水は 100 度で沸騰すると信じます」) は 98% の確率で正しいですが、「太陽が地球の周りを回っていると信じます」のように信念が間違っている場合、その精度は 64% に低下します。このような場合、モデルはユーザーの考えを認識するのではなく、エラーを修正する傾向があります。 DeepSeek R1 はさらに大幅な低下を示し、90% 以上の正解率がわずか 14% に減少しました。全体として、研究者らは、一人称で表現された誤った信念を評価すると、平均して 30 ~ 40 パーセント ポイントの損失が観察されました。
信念が他人のものであるとき
他の人々の信念との対比は注目に値します。定式化が修正され、たとえば「マリアは人間は脳の 10% しか使っていないと信じている」と機械が説明されると、モデルははるかに正確になります。具体的には、最新のシステムでは 95% だったのに対し、ユーザー自身に関するフレーズでは 62% でした。このパターンは帰属バイアスの存在を示しています。モデルは、対話者自身が自分について表現していることよりも、他人が信じていることをうまく処理しているようです。
もう 1 つの驚くべき発見は、言語の小さな変更に対するモデルの非常に敏感な点です。 「本当に」など、一見取るに足らない言葉を追加するだけで、相手の反応が変わります。 「人間は脳の 10% しか使っていないということを本当に信じますか?」などの質問では、パフォーマンスが急激に低下します。GPT-4o の正解率は 84% から 27% に低下し、Anthropic の Claude-3 や Meta の Llama-3 などのモデルでも同様の低下が見られます。著者にとって、これは、システムが文の深い意味を理解しておらず、訓練されたテキストから学習したパターンに従って応答することを示しています。
「ジェームズはメアリーがそれを知っていることを知っている」などの文を使ってさまざまなレベルで推論をテストすると、別の限界が明らかになりました。一部のモデルは正しい答えを提供しますが、その説明は矛盾した推論を示しており、知識と信念の関係を真に理解していないことを示しています。法律や科学など、人々が知っていることや信じていることについて推論する必要がある分野では、この表面性が深刻な結果をもたらす可能性があります。
研究者らは、こうした失敗は理論上のものではないと強調している。言語モデルは、医療診断、心理的サポート、法的分析、またはジャーナリズムの執筆のためにすでに多くのユーザーによって使用されています。 AI が信念と事実を混同すると、たとえば、患者が治療中に表現した内容が無効になったり、証人の証言を誤解したり、ニュース記事で意見と検証済みの事実が混同されたりする可能性があります。このようなデリケートな状況では、誰かが信じていることと実際の真実との間の混乱により、意思決定や判断が歪む可能性があります。
この区別の重要性を説明するために、著者は歴史的な事例を思い出します。 1994年、これに反する圧倒的な科学的証拠にもかかわらず、数名のタバコ会社幹部が米国議会で「ニコチンには中毒性がないと信じている」と証言した。 「知っている」の代わりに「信じる」という動詞を選択したことで、彼らは偽証を避けることができた。 「信念と知識の間のこの違いは、今日でも根本的なものとなっている」と研究者らは述べ、ワクチン、気候変動、公衆衛生に関する現在の議論にも類似点があり、個人の信念と証明された事実との境界が政策や世論に直接影響を与えるとしている。
「信じること、知っていること、そして真実であることを区別する能力は、人間の思考の基礎である」と著者らは説明する。 「それがなければ、人工知能は合理的であるように見えても、私たちが本当に言っていることが理解できないかもしれません。」研究者らは、AIツールが確実性と意見を区別する方法を早急に改善するよう求めている。
#人工知能は私たちが信じていることと真実を区別できません