1773172060
2026-03-10 19:35:00
科学者が自分の分野の最新情報を入手し、前進するためには、何千もの出版された研究をすぐに入手でき、頭の中に入れておく必要があります。大規模言語モデル (LLM) は、膨大な科学文献を探索するためのツールとして有望ですが、専門分野の複雑な質問に対して完全かつ科学的に正確な答えを提供するという点では、信頼できるのでしょうか?
これを解明するために、コーネル大学の物理学者と Google の研究者は、12 人の専門家からなるパネルを派遣して、超伝導材料の一種である高温銅酸化物の分野を例として、専門家のレベルで科学文献を理解するための 6 つの LLM システム (ChatGPT、Claude など) の能力をテストしました。一部のシステムは他のシステムよりもパフォーマンスが優れていることが判明しました。この調査では、現在の LLM 機能にいくつかのギャップがあることも明らかになり、AI 開発者が将来のモデルで改善してほしいことのリストが絞り込まれました。
「この研究は、専門家が読むように文献を読むLLMの能力をテストすることを目的としています」と述べた。 キム・ウナ、ハンス・A・ベーテ芸術科学大学(A&S)の物理学教授、この研究の責任著者。 「この論文が今重要なのは、特に汎用人工知能 (AGI) の文脈において、LLM ができることとできないことについて誰もが非常に興味を持っているからです。LLM が現時点でできることには決定的なギャップがあり、これは明らかに LLM が AGI に対応していないことを示しています。」
「LLM ワールド モデルの専門家による評価: 高温超伝導のケーススタディ」は、3 月 10 日に米国科学アカデミー紀要に掲載されました。筆頭著者は、コーネル大学原子固体物理学研究所 (LAASP) の Bethe/KIC 博士研究員 Haoyu Guo 氏です。
大学院生として、Guo 氏は、現在の研究の例となる銅酸化物高温超伝導体に取り組みました。 「課題は、数十年にわたって蓄積された膨大な実験結果でした。」と彼は言いました。 「銅酸化物に限らず一般的に、LLM が新しい分野に取り組む若い学生や研究者を助けることができるかどうか知りたいと思っています。」
研究者らは、高温銅酸化物の分野の歴史を網羅する人間の専門家によって精選された1,726件の科学論文と、文献の深い理解を探るより大規模な専門家グループによって書かれた一連の67の質問のデータベースを作成した。
これらの資産を使用して、ChatGPT-4、Claude 3.5、Perplexity、Gemini Advanced Pro 1.5 の 4 つの LLM と、提供されたドキュメントに基づいてユーザーの質問に答える Google 製品である NotebookLM を調査しました。また、厳選されたドキュメントから関連する画像やテキストを取得できるカスタムの検索拡張生成 (RAG) システムも追加しました。
A専門家は、どのシステムを評価しているのかを知らずに、各システムから得られた回答を手動で採点しました。
厳選された情報を備えたシステム、つまり Google の製品とカスタム RAG システムが最も効果を発揮しました。
「信頼できるデータソース、つまりLLMがインターネットで検索したものではなく、私たちが自分たちで集めた論文を使って運用しているLLMは、パフォーマンスが向上する傾向にある」とGuo氏は述べた。 「中でも、より深く理解したい一連の論文がある場合、NotebookLM のパフォーマンスが向上します。」
キム氏によると、すべてのLLMはテキストベースの情報を引き出すことには驚くほど優れていたが、データの視覚化に取り組むことには「まったく無能だった」という。これは重大な欠点です。彼女は学生たちに、データの視覚化を論文の重要な部分として批判的に見るように教えています。
カスタム モデルは、厳選されたドキュメントから画像を取得する独自の機能を備えており、データの視覚化において大幅に優れていました。
郭氏は、改良されたLLMを求めるAI開発者への要望リストには、LLMの主張に対するより正確な帰属が含まれていると述べた(それらは時々参照を構成する)。 1 つの問題の多くの側面を総合し、問題の複雑さを反映する能力が向上します。プロットや図の理解力が向上しました。
「ベンチマークを実行してから約 1 年が経過しましたが、多くの面でモデルの改善が見られました」と Guo 氏は述べています。 「しかし、視覚的推論はまだ発展途上です。」
信頼できる LLM システムを使用して科学文献を調査すれば、創造的なアイデアを持つ若い研究者に優位性を与えることができるとキム氏は述べています。 「事実を知ることは、テーブルへの切符のように振り回されていました。事実を頭の中に保持することが切符であるべきではありません。切符は、創造的な方法で考える方法を知っていますか? 創造的な角度から問題にアプローチできますか? であるべきです。」
これはコーネル大学主導の研究による最初の研究です。 国立科学財団 AI マテリアル研究所、キムが監督します。
ケイト・ブラックウッドは芸術科学大学のライターです。
#科学文献で大規模な言語モデルをテストする