1765156771
2025-12-08 00:09:00
大規模言語モデルの急速な進歩にも関わらず、この研究は、AI が独立した著者ではなく教師付きサポート ツールとして最適であり、厳格な系統的レビューを作成するには人間の専門知識が依然として重要であることを示しています。
勉強: 人間の研究者は、比較マルチタスク評価における医学系統的レビューの執筆において、大規模な言語モデルよりも優れています。。画像クレジット: Summit Art Creations / Shutterstock.com
雑誌に掲載された最近の研究 科学レポート 人間の研究者が体系的な文献レビューを準備する際に、大規模言語モデル (LLM) よりも優れたパフォーマンスを発揮することが明らかになりました。
LLM とは何ですか?
LLM は、深層学習手法を使用して膨大な量の入力データを分析し、人間のような言語を生成する高度な人工知能 (AI) システムです。 2022 年に OpenAI の ChatGPT が導入されて以来、LLM は、テキスト生成、言語翻訳、電子メール作成など、日常の幅広いタスクを実行できる能力で大きな注目を集めてきました。
LLM はテキストの解釈と生成の両方ができるため、医療、教育、研究分野に不可欠な要素となっています。実際、GPT-4 や BERT などの LLM が、リボ核酸 (RNA) 配列データの注釈付け、内容の要約、医療報告書の作成など、幅広い医療タスクを実行できることがいくつかの研究で実証されています。
科学研究では、LLM は文献のスクリーニングと要約、データ分析、レポートの作成に利用されてきました。科学プロセスを加速する計り知れない可能性があるにもかかわらず、ヘルスケア、教育、研究分野でLLMを責任を持って統合するには、データの一貫性の確保、バイアスの軽減、アプリケーションの透明性の維持など、潜在的な課題を包括的に分析する必要があります。
研究デザイン
すべての結果は、同じテーマについて人間の研究者によって書かれた元の系統的レビューと比較されました。このプロセスは 2 回繰り返され、バージョン間の変更と LLM の長期的な改善が評価されました。
主要な発見と重要性
結論
現代の LLM は、迅速なエンジニアリング戦略がなければ、医療分野で系統的なレビューを作成できません。それにもかかわらず、2 回の評価の間に観察された LLM の改善は、適切な監督があれば、LLM がレビュープロセスの特定の側面において研究者に貴重なサポートを提供できることを示しています。これに関連して、最近の証拠は、知識に基づくプロンプトなどのガイド付きプロンプト戦略が、いくつかのレビュー タスクで LLM のパフォーマンスを向上させることができることを示唆しています。
今回の研究には、比較の参考として医学分野における単一の系統的レビューが含まれており、これらの発見の他の科学分野への一般化可能性が制限される可能性があります。したがって、堅牢性と外部妥当性を向上させるために、多様な生物医学および非生物医学領域にわたる複数の系統的レビューを評価する将来の研究が必要です。
参考雑誌:
- ソリーニ、M.、ピニ、C.、ラザール、A.、 他。 (2025年)。人間の研究者は、比較マルチタスク評価において医学系統的レビューを書く際に、大規模な言語モデルよりも優れています。 科学レポート。 土井: 10.1038/s41598-025-28993-5
#信頼できる体系的なレビューを書くことに関しては人間の研究者が依然として #を上回っています