日本語版
最新ニュース
世界

スタートアップの調査で、査読済み論文50本に幻覚引用が含まれていたことが判明

GPTZero は、学術論文内で LLM によって生成された虚偽の参照の「明白な」例を発見しました。 大規模言語モデル (LLM) で生成されたコンテンツをチェックする人工知能 (AI) 検出器を開発するスタートアップ GPTZero は、国際学習表現会議 (ICLR) への査読済みの投稿 50 件に、明らかな幻覚的引用、つまり AI によって夢想された引用が少なくとも 1 つ含まれていることを発見しました。 ICLR は、AI の深層学習分野に焦点を当てた主要な学術会議です。 「AI を使用しましょう。しかし、AI が生成するものをより高い基準に保つようにしましょう。」 アレックス・クイGPTゼロ 調査に携わった 3 人の著者はいずれもトロントに拠点を置き、会議に提出された 300 件の論文に対して幻覚チェック ツールを使用しました。報告書によると、提出された50件には少なくとも1件の「明らかな」幻覚が含まれていたことが判明したという。それぞれの提出物は3人から5人の専門家によって審査されたが、「彼らのほとんどは偽の引用を見逃していた」。これらの引用の中には、存在しない著者によって書かれたもの、雑誌に誤って帰属されているもの、または同等の一致がまったくないものもあります。 報告書は、介入がなければ論文は「ほぼ確実に出版されていただろう」ほど十分に高く評価されていたと指摘している。 「私たちはかなり驚いています」と GPTZero の共同創設者兼 CTO である…

スタートアップの調査で、査読済み論文50本に幻覚引用が含まれていたことが判明

1765903827
2025-12-16 11:05:00

GPTZero は、学術論文内で LLM によって生成された虚偽の参照の「明白な」例を発見しました。

大規模言語モデル (LLM) で生成されたコンテンツをチェックする人工知能 (AI) 検出器を開発するスタートアップ GPTZero は、国際学習表現会議 (ICLR) への査読済みの投稿 50 件に、明らかな幻覚的引用、つまり AI によって夢想された引用が少なくとも 1 つ含まれていることを発見しました。 ICLR は、AI の深層学習分野に焦点を当てた主要な学術会議です。

「AI を使用しましょう。しかし、AI が生成するものをより高い基準に保つようにしましょう。」

アレックス・クイ
GPTゼロ

調査に携わった 3 人の著者はいずれもトロントに拠点を置き、会議に提出された 300 件の論文に対して幻覚チェック ツールを使用しました。報告書によると、提出された50件には少なくとも1件の「明らかな」幻覚が含まれていたことが判明したという。それぞれの提出物は3人から5人の専門家によって審査されたが、「彼らのほとんどは偽の引用を見逃していた」。これらの引用の中には、存在しない著者によって書かれたもの、雑誌に誤って帰属されているもの、または同等の一致がまったくないものもあります。

報告書は、介入がなければ論文は「ほぼ確実に出版されていただろう」ほど十分に高く評価されていたと指摘している。

「私たちはかなり驚いています」と GPTZero の共同創設者兼 CTO である Alex Cui 氏は BetaKit に語った。 「我々は金メダルを獲得したばかりだが、ある意味間違った方法だった」と彼は語った。 「おそらく、それがどこから来たのかはもっとたくさんあるでしょう。」

GPTZeroの調査では、著者らは調査結果について「ICLRプログラム委員長と協力」していると記されている。崔氏は、ICLR 2026に提出されたすべての2万件の論文をチェックすることで、他の論文が幻覚引用をしていたかどうかを特定するためにICLRと協力していることを認めた。「受理発表の締め切りは1か月後に迫っている」と崔氏は語った。 「ですから、少し時間が迫っていますが、やり遂げることはできると思います。」

トロント大学の准教授であり、ICLRのプログラム委員長であるコリン・ラッフェル氏は、同氏とその同僚が「当社のポリシーに違反する提出物に警告を発し、机上で拒否し続けている」とBetaKitに語った。

GPTZero はそのツールの使用を他の会議にも拡大し、できればそのモデルを他の科学レビューにも適用することを計画している、と崔氏は語った。

Cui 氏と Edward Tian 氏によって設立されたこの会社は、2022 年 12 月に Web アプリとして誕生し、すぐに 30,000 人のユーザーを獲得しました。 2023 年 1 月の正式ローンチ後、ユーザーベースは 2024 年に 400 万人に増加し、Footwork の共同創設者である Nikhil Basu Trivedi から 1,000 万ドルの「先制」シリーズ A 資金調達ラウンドを獲得しました。この記事の執筆時点で、同社はパデュー大学から UCLA までの組織を含む約 1,000 万人のユーザーを誇っていました。

アルバータ大学の政治学の助教授であり、アルバータ機械インテリジェンス研究所のフェローであるブレア・アタード・フロスト氏は、AI ガバナンス政策と倫理について 10 年近く研究してきました。彼女は、学術研究における AI の利用が広く増加していることを考えると、GPTZero の調査結果は驚くべきことではない、と述べました。

「大量の論文がさらに大量に流入しており、その新しい論文の流入に対処しようとしているジャーナルにとって、査読プロセスにさらなる負担がかかっています」とアタードフロスト氏は説明した。 「また、学界で働いている多くの人々がすでに非常に緊張しており、査読を受ける能力が非常に限られているという状況もあります。」

有望だがまだ欠陥のあるツール

LLM に関する世間の話題が増えるにつれ、学術論文の執筆と査読プロセスの両方において、学術界での LLM の使用法が研究されてきました。 2023 年 9 月に Yale Journal of Biology and Medicine に掲載されたある論文では、OpenAI の ChatGPT がジャーナルの審査プロセスにおいて「大きな期待を示した」ことがわかりました。人間の対応物と比較した場合、LLM は他の利点の中でも特に「方法論上の欠陥を特定する」ことができることを示しました。

しかし、このテーマに関するさらなる研究により、LLM が学術的な文脈で引用を正確に参照する能力に重大な欠陥があることが判明しました。ある論文では、ICLR 2024 提出論文のレビューに使用された LLM が著者に「水増し」スコアを与え、最終的には会議に提出された論文の「採択率の上昇」をもたらしたことが判明しました。今年4月にKevin Wuらによって発表された別の記事。 LLM が医学的参考文献を引用する有効性について調査したところ、「LLM の回答の 50 パーセントから 90 パーセントは、引用した情報源によって完全に裏付けられておらず、時には矛盾している」ことがわかりました。

関連:AI企業が著作権で保護された作品へのアクセスを求めるなか、学者と非営利団体がデータ同意闘争の真っ只中に巻き込まれる

スタンフォード大学の生物医学データサイエンス准教授のジェームズ・ゾウ氏は2024年11月、査読の最大17パーセントがAIによって書かれていると指摘し、学術プロセスにおけるAI利用のガイドラインを提唱した。

LLM によって生成された誤った引用は、学術分野にだけ影響を及ぼしているわけではありません。 11月にはオンラインストアで 独立者 ニューファンドランド・ラブラドール州政府から委託された160万ドルのデロイト報告書に、AIによって生成された可能性が高い誤った引用が含まれていたとの報道を発表した。この話が広まってすぐに、ニューファンドランド・ラブラドール州政府サービス大臣のマイク・グースニー氏は、政府委託の報告書のAIガイドラインを見直すよう指示された。デロイトは以前にも、オーストラリア政府の委託を受けた報告書に、存在しない学術論文の引用を含めていたことが摘発されていたが、これもAIによって生成された可能性が高い。

今年の初め、カナダのエヴァン・ソロモンAI・デジタルイノベーション大臣は、連邦政府の優先事項は規制に対する「過剰なインデックス」ではなく、AIの経済的利益であると発言し、話題となった。それ以来、同大臣はディープフェイクとデータプライバシーを規制するAI法案を示唆してきた。クリストファー・グリ氏とのインタビューで 大学関係ソロモン氏はAI産業とカナダの大学との関係について概説した。 「大学はもはや純粋な学術研究の場ではありません」とソロモン氏は言う。

LLM とのピアレビューの「正しい方法と間違った方法」

アタードフロスト氏は、連邦政府のアプローチが学術分野でのLLM使用の増加に対する解決策とは考えていない。 「学者たちは連邦政府がこの問題について何らかの措置を講じるのを待っているべきではないと思います」と彼女は言う。彼女は、根底にある問題は、大学職員が過重労働であり、十分な支援を受けていないことにあると説明しています。彼女はまた、査読は「本質的に無料の奉仕活動」であるとも述べた。

カナダの報告書や学術論文における AI の使用をめぐる状況について、Cui 氏は、適切な実装が重要であると強調しました。 「それを行うには正しい方法と間違った方法があります」と彼は言いました。崔氏はまた、AIの使用を完全に否定することは役に立たないと述べた。 「AI を使用しましょう。しかし、AI が生成するものをより高い基準に保つようにしましょう。」

Attard-Frost 氏は、LLM によって生成された誤った引用を検出するために AI モデルを使用することについて、より懐疑的な見解を持っています。彼女は、GPTZero が宣伝している幻覚検出器の精度が 99% であることを指摘しました。この成功率は驚異的ですが、ICLR の 20,000 件の申請に適用すると問題が発生します。 「彼らは、200件の投稿にAIが生成した可能性があると誤ってフラグを立てるつもりであり、これにより、仕事でAIをまったく使用していない200件の論文の著者に学術的誠実性の懸念が生じる可能性がある。」

Attard-Frost 氏は、LLM が生成する誤った引用を防ぐために実装可能な他の解決策 (「複利料金提出モデル」など) があることを示唆しました。このモデルでは、筆頭著者は 1 つの論文について無料で投稿でき、第一著者である場合には投稿ごとに料金が段階的に増加し、その過程で LLM を無遠慮に使用することを阻止できます。他には、カンファレンスに論文を提出する人々と協力できる検証済み人間として 3 人の異なる人物を検証する「承認モデル」も含まれていました。ただし、Attard-Frost 氏は、この問題に対する解決策は 1 つだけではないと強調しました。 「まさにアプリケーションごとです」と彼女は言いました。 「明確な解決策は実際にはありません。」

GPTZeroの代理人である崔氏は、今回の研究結果には、虚偽引用の増加に対して公的責任が存在する可能性があることを示す期待があると述べた。 「これは失われた大義のようなものではありません。私たちは実際にこれを行うためのツールを作成することができます。」

フィーチャー画像提供: Unsplash。写真提供者: サラ・エリザベス

#スタートアップの調査で査読済み論文50本に幻覚引用が含まれていたことが判明

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。