私は、OpenAI の ChatGPT、Google の Gemini、およびその他の大規模言語モデル (LLM) の信頼性の低さの多くの例を共有してきました。最近の例には、回転した三目並べグリッドの評価や、ポッサムの体の部分のラベル付けなどが含まれます。一部の特派員は、明らかに無意味な三目並べの回転を評価したり、フクロネズミの尻尾と鼻を特定したりすることをLLMに依頼する人はいないと反論している。
もっと明確にすべきでした。私が報告した多くの例は、LLM を困らせるための単なる「落とし穴」ではありません。これらは、LLM が本質的に信頼できないことを明確かつ説得力のある方法で示すことを目的としています。
私のオックスフォード大学出版局の四部作に戻りますが、 AIの妄想、 データサイエンスの9つの落とし穴 (ジェイ・コーデスとの共著)、 ファントムパターン問題、 そして 不信: ビッグデータ、データ拷問、科学への攻撃、 私は、データマイニングに基づく AI システムは信頼できないと執拗に主張してきました。
LLM システムが本質的に信頼できない理由
科学的手法は、データを使用してテストされる特定の仮説から始まり、理想的にはランダム化比較試験です。データマイニングは逆の方向に進み、データから始めて次のことを探します。 何と呼ばれていますか 「隠されたパターンと秘密の相関関係」。これまで知られていなかったパターンや相関関係が見つかった場合、 データマイナーのいずれか もっともらしい理論をでっち上げたり、理論は必要ないと主張したりする。たとえば、 有線 「」というタイトルの作品理論の終わり: データの氾濫により科学的手法が時代遅れになる」とクリス・アンダーソンは書いています。
相関関係は因果関係に優先し、一貫したモデルや統一理論、あるいは実際にはメカニズムの説明がまったくなくても、科学は進歩することができます。
問題は、本当に役立つ関係の数が限られていることです。しかし、データの氾濫により、偶然に発生する役に立たない統計パターンの数が指数関数的に増加しています。そのため、データマイニングされたパターンが実際に役立つ確率は、ますますゼロに近づきつつあります。私が持っているように 他の場所で書かれた:
これはビッグ データのパラドックスです。多数の変数のデータがあれば、より信頼性の高いパターンを見つけるのに役立つように思えます。ただし、考慮する変数が増えるほど、見つかったものが役立つ可能性は低くなります。
データ マイニング アルゴリズムは、データが現実世界とどのように関連しているかはわかりませんが、統計パターンを探します。データにはラベルを付けることもできます &4qp#L、 M&2V+v、またはその他のランダムに生成された ASCII 文字のコレクション。したがって、データ マイニング アルゴリズムは、有用な因果関係と無用な相関関係を区別できません。以下に、データ マイニングに対する誤った信念の例をいくつか示します。
ゲイリー・スミス著『The AI Delusion』のアマゾンブックカバー
- 英国最大の自動車保険会社であるアドミラル・インシュアランスは、 打ち上げ予定の firstcarquoteは、Facebookの弁護士によってブロックされる前に、申請者のFacebook投稿のデータマイニング分析に基づいて自動車保険料を決定する予定だった。
- 中国のテクノロジー企業である永銭宝は、 と報告した 彼らは、申請者のスマートフォンの使用状況に基づいてローン申請を評価するデータマイニング アルゴリズムを開発しました。これには、申請者が携帯電話をフル充電したままにしているかどうか、電話に出られない回数などの尺度が含まれます。その会社はもう営業していない。
- Gild が開発したデータマイニング 応募者を評価するためのソフトウェア ソフトウェア エンジニアリングの仕事のオンライン アクティビティを監視することで、主任科学者も、データマイニングソフトウェアによって選択された要因の一部が意味をなさないことを認め、「明らかに因果関係ではない」と述べた。元従業員は、「顧客はその製品を本当に本当に嫌っています。全体的に良い経験をしている顧客はほとんどいません。」と書いています。
- あ JPモルガンの調査 トランプ大統領のツイートにその言葉が含まれていると結論づけた 中国、 十億、 製品、 民主党、 または 素晴らしい 金利に「統計的に重大な影響」を与える。そうではありません。
- 研究者が発見した 単語に対する Google 検索の 3 週間移動平均間の相関関係 借金 そしてダウ工業株30種平均の変化。 7 年間のデータを使用して、彼らは次のことを報告しました。 借金 この戦略の年間リターンは 23.0% という驚異的でしたが、バイアンドホールド戦略の年間リターンは 2.2% でした。しかし、勉強後7年間、彼らの 借金 この戦略の年間リターンは 2.81% でしたが、バイアンドホールドの場合は 8.60% でした。
データマイニングの危険性
LLM はデータをマイニングしますが、数値ではなく単語で統計パターンを検索します。従来のデータ マイニング アルゴリズムと同様に、LLM は入力および出力するテキストが現実世界とどのように関連しているのかを知りません。そのため、LLM が処理および生成するステートメントが真か偽か、合理的かナンセンスかを知る方法がありません。
この中核的な問題によって引き起こされる事故の例をいくつか示します。
- エア・カナダ 訴訟を起こされて敗訴した この事件では、顧客サービスのチャットボットが航空会社の忌引き運賃ポリシーに関する誤った情報を生成しました。
- 自動車ディーラーのChatGPT ボットは販売に同意しました 76,000ドルのシボレー・タホが1ドルで買える。ボットは、「これは取引であり、法的拘束力のあるオファーです。裏切りはありません」と言いましたが、ディーラーは取引を尊重することを拒否しました。
- ニューヨーク連邦裁判所 認可された ChatGPT を使用して、存在しない事件を引用した裁判所への提出書類を作成した経験豊富な弁護士。
- あ ギリシャ人女性が離婚を申請 なぜなら、彼女のカップと夫のカップに残されたコーヒーかすの写真をChatGPTで読み取ったところ、夫が「家庭破壊者」と不倫関係にあることが示されたからだ。
- LLMベースの採用システム 示されています 人種や性別に関して偏った結果を生成するため。
- の使用に関する研究 OpenAI の Whisper 文字起こしツール 医師と患者のやり取りの記録を作成すると、完全にでっち上げられたフレーズや文章が作成されることが多く、その多くは潜在的に有害であることがわかりました。
- ある男がいた 伝えられるところによると ChatGPTセッション後に食塩の代わりに臭化ナトリウムを使用した後、重度の精神疾患で入院した。
- 首吊り自殺をした16歳の少年の両親 不法死亡訴訟を起こした OpenAIに対しては、ChatGPTが息子に首吊り自殺の方法に関する「段階的なプレイブック」を与え、その中には最適な結び方に関するアドバイスや遺書を書いてあげるという提案も含まれていたと主張した。
(パラメーターの数、トレーニング データのサイズ、計算能力を増やすことによって) スケールアップしても、LLM は単語が現実世界とどのように関係しているかわからないため信頼できないという、この根本的な弱点は解決されません。
簡単な解決策がない理由
専門家のトレーニングは、LLM がトレーニング対象のプロンプトに対してより適切な回答を与えるのに役立ちますが、(1) 専門家は、LLM が尋ねられる可能性のあるすべてのプロンプトを予測することはできません、(2) 現実世界の決定の多く (ほとんど?) には主観的な確率が含まれており、無知な LLM が確実に生成することはできず、人間のトレーナーが予測することもできません、(3) 指示に従うことは一般的な知能ではありません。
私が何年にもわたって挙げてきた何百もの例の要点は、統計パターンのみに基づく予測、アドバイス、結論は信頼できないということです。相関関係は因果関係に優先しないため、データマイニングは危険です。
#大規模な言語モデルの核心問題