日本語版
最新ニュース
企業

AIは人間の専門家よりも研究結果をより正確に予測できる

テキストを分析するAIの一種である大規模言語モデルは、提案されている神経科学研究の結果を人間の専門家よりも正確に予測できることが、UCL(ユニバーシティ・カレッジ・ロンドン)の研究者らによる新たな研究で判明した。 Nature Human Behaviour に掲載されたこの研究結果は、テキストの膨大なデータセットでトレーニングされた大規模言語モデル (LLM) が科学文献からパターンを抽出し、超人的な精度で科学的成果を予測できることを示しています。 研究者らは、これは単なる知識検索をはるかに超えて、研究を加速するための強力なツールとしての可能性を浮き彫りにしていると述べている。 主著者の Ken Luo 博士 (UCL 心理学および言語科学) は次のように述べています。「ChatGPT のような生成 AI の出現以来、多くの研究が LLM の質問応答能力に焦点を当てており、広範なトレーニング データから知識を要約する LLM の驚くべきスキルが実証されています。ただし、過去の情報を取得するという後ろ向きの能力を強調するのではなく、LLM が知識を統合して将来の結果を予測できるかどうかを調査しました。 「科学の進歩は試行錯誤に依存することが多いですが、綿密な実験には時間とリソースが必要です。最も熟練した研究者でも、文献からの重要な洞察を見落とす可能性があります。私たちの研究では、LLM が膨大な科学文書全体のパターンを特定し、実験の結果を予測できるかどうかを調査しています。」 」 国際研究チームは、大規模言語モデル (LLM) が神経科学の結果をどの程度正確に予測できるかを評価するツールである BrainBench を開発することから研究を開始しました。 BrainBench は、多数の神経科学研究の要約のペアで構成されています。各ペアの 1 つのバージョンは、研究の背景、使用された方法、および研究結果を簡単に説明する実際の研究要約です。もう 1 つのバージョンでは、背景と方法は同じですが、結果は、関連する神経科学分野の専門家によって、もっともらしいが不正確な結果に変更されています。…

1733124115
2024-11-28 09:00:00

テキストを分析するAIの一種である大規模言語モデルは、提案されている神経科学研究の結果を人間の専門家よりも正確に予測できることが、UCL(ユニバーシティ・カレッジ・ロンドン)の研究者らによる新たな研究で判明した。

Nature Human Behaviour に掲載されたこの研究結果は、テキストの膨大なデータセットでトレーニングされた大規模言語モデル (LLM) が科学文献からパターンを抽出し、超人的な精度で科学的成果を予測できることを示しています。

研究者らは、これは単なる知識検索をはるかに超えて、研究を加速するための強力なツールとしての可能性を浮き彫りにしていると述べている。

主著者の Ken Luo 博士 (UCL 心理学および言語科学) は次のように述べています。「ChatGPT のような生成 AI の出現以来、多くの研究が LLM の質問応答能力に焦点を当てており、広範なトレーニング データから知識を要約する LLM の驚くべきスキルが実証されています。ただし、過去の情報を取得するという後ろ向きの能力を強調するのではなく、LLM が知識を統合して将来の結果を予測できるかどうかを調査しました。

「科学の進歩は試行錯誤に依存することが多いですが、綿密な実験には時間とリソースが必要です。最も熟練した研究者でも、文献からの重要な洞察を見落とす可能性があります。私たちの研究では、LLM が膨大な科学文書全体のパターンを特定し、実験の結果を予測できるかどうかを調査しています。」 」

国際研究チームは、大規模言語モデル (LLM) が神経科学の結果をどの程度正確に予測できるかを評価するツールである BrainBench を開発することから研究を開始しました。

BrainBench は、多数の神経科学研究の要約のペアで構成されています。各ペアの 1 つのバージョンは、研究の背景、使用された方法、および研究結果を簡単に説明する実際の研究要約です。もう 1 つのバージョンでは、背景と方法は同じですが、結果は、関連する神経科学分野の専門家によって、もっともらしいが不正確な結果に変更されています。

研究者らは、15 の異なる汎用 LLM と 171 人の人間の神経科学の専門家 (全員が専門知識を確認するためのスクリーニング テストに合格していた) をテストして、AI または人間が 2 つのペアになった要約のうちどちらが本物であるかを正しく判断できるかどうかを確認しました。実際の研究結果。

すべての LLM は神経科学者を上回り、LLM の精度は平均 81%、人間の精度は平均 63% でした。研究チームが人間の反応を、(自己申告の専門知識に基づいて)特定の神経科学分野について最高の専門知識を持つ者のみに限定した場合でも、神経科学者の精度は依然としてLLMに及ばず、66%であった。さらに、研究者らは、LLM が自分の決定に自信を持っているとき、その決定が正しい可能性がより高いことを発見しました*。研究者らは、この発見は人間の専門家が適切に調整されたモデルと共同作業できる未来への道を開くものであると述べています。

次に研究者らは、既存の LLM (オープンソース LLM である Mistral のバージョン) を、特に神経科学の文献に基づいてトレーニングすることで適応させました。彼らが BrainGPT と名付けた神経科学に特化した新しい LLM は、研究結果の予測においてさらに優れており、86% の精度を達成しました (83% の精度だったミストラルの汎用バージョンの改善)。

上級著者のブラッドリー・ラブ教授 (UCL 心理学および言語科学) は次のように述べています。私たちの研究は神経科学に焦点を当てていましたが、私たちのアプローチは普遍的であり、科学全体にうまく適用できるはずです。

「注目に値するのは、LLM が神経科学の文献をどれだけうまく予測できるかということです。この成功は、多くの科学が真に新しいものではなく、文献の既存の結果パターンに準拠していることを示唆しています。科学者が十分に革新的で探索的であるかどうか、私たちは疑問に思っています。」 」

ルオ博士はさらに、「我々の結果に基づいて、我々は研究者を支援するAIツールを開発している。我々は、研究者が提案された実験計画と予想される結果を入力し、AIがさまざまな結果の可能性について予測を提供できる未来を構想している。これにより、より迅速な研究が可能になるだろう」と付け加えた。実験計画における反復と、より多くの情報に基づいた意思決定が可能になります。」

この研究は経済社会研究評議会(ESRC)、マイクロソフト、英国王立協会ウォルフソンフェローシップの支援を受け、UCL、ケンブリッジ大学、オックスフォード大学、マックス・プランク行動神経生物学研究所(ドイツ)、ビルケントの研究者が参加した。大学(トルコ)および英国、米国、スイス、ロシア、ドイツ、ベルギー、デンマーク、カナダ、スペイン、オーストラリアのその他の機関。

ルオ X、レヒャルト A、サン G、ネジャド KK、ヤニェス F、イルマズ B、リー K、コーエン AO、ボルゲザーニ V、パシュコフ A、マリナッツォ D、ニコラス J、サラティエロ A、スチョルツキー I、ミネルヴィーニ P、ラザヴィ S、ロッカ R 、ユシフォフ E、オカロバ T、Gu N、フェリアンク M、コナ M、パティル KR、リーPS、マタ R、マイヤーズ NE、ビズリー JK、マスリック S、ビルギン IP、ニーソ G、アレス JM、ゲイブラー M、ラタン マーティ NA、ルードケニッシ L、ベーラー A、ホール CM、ダフロン J、バオ SD、ラブ BC。
大規模な言語モデルは、神経科学の結果を予測する点で人間の専門家を上回ります。
ナット・ハムの振る舞い。 2024 年 11 月 27 日。土井: 10.1038/s41562-024-02046-9

* 2 つの要約が提示されると、LLM はそれぞれの尤度を計算し、それぞれが学習した知識とコンテキスト (背景と方法) に基づいて、それぞれがどれほど驚くべきかを表す困惑スコアを割り当てます。研究者らは、モデルが本物の抄録と偽の抄録を発見する度合いの驚き/当惑の違いを測定することによって、LLM の信頼度を評価しました。この差が大きいほど、信頼度は大きくなり、LLM が正しい抄録を選択した可能性が高いことと相関しています。

#AIは人間の専門家よりも研究結果をより正確に予測できる

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。