1727357706
2024-09-25 16:00:28
大規模言語モデルは幅広い質問に答えることができますが、必ずしも正確ではありません
ジェイミー・ジン/Shutterstock
大規模言語モデル (LLM) は、規模が大きくなり、人間のフィードバックから学習するにつれて、単純な質問に答える際の信頼性が低下するようです。
AI 開発者は、主に 2 つの方法で LLM の能力を向上させようとします。それは、スケールアップ (トレーニング データと計算能力を増やすこと) とシェイプアップ (人間のフィードバックに応じて微調整すること) です。
ホセ・エルナンデス・オラーロ スペインのバレンシア工科大学の研究者らは、LLMの規模拡大と形状変化に伴うパフォーマンスを調査した。彼らは、OpenAIのGPTシリーズのチャットボット、MetaのLLaMA AIモデル、そしてBigScienceと呼ばれる研究者グループが開発したBLOOMを調査した。
研究者らは、算数の問題、アナグラムの解決、地理に関する質問、科学的な課題、整理されていないリストから情報を引き出すという5種類のタスクをAIに課してテストした。
研究者たちは、スケールアップとシェイプアップによって、LLM が「yoiirtsrphaepmdhray」というアナグラムを「hyperparathyroidism」に並べ替えるといった難しい質問にうまく答えられるようになることを発見した。しかし、これは「24427 と 7120 を足すと何になるか」といった基本的な質問の改善とは一致せず、LLM は引き続きこの質問に間違えている。
難しい質問に対するパフォーマンスは向上しましたが、AI システムが特定の質問に回答することを避ける可能性(回答できないため)は低下しました。その結果、誤った回答をする可能性が高まりました。
この結果は、AIの開発者がしばしば行うようにAIを全知であると提示することの危険性を浮き彫りにしているとエルナンデス・オラロ氏は言う。そして、一部のユーザーは 信じすぎる「私たちはこれらのシステムに過度に依存しています」と彼は言う。「必要以上に頼り、信頼しすぎています。」
これは問題です。AIモデルは知識の範囲について正直ではないからです。「人間が超賢い理由の1つは、知らないことを知らないことに気づかないことがあることですが、大規模な言語モデルと比較すると、私たちはそれを認識するのがかなり得意です」と、 カリッサ・ベリス オックスフォード大学の研究者は、「大規模な言語モデルは、自身の知識の限界を認識していない」と述べている。
OpenAI、Meta、BigScienceは回答しなかった。 ニューサイエンティストのコメント要請。
トピック:
#AIは規模が大きくなるにつれて単純な質問に答えるのが難しくなる