日本語版
最新ニュース
科学&テクノロジー

OpenScholar: 科学研究において GPT-4o を上回るパフォーマンスを発揮するオープンソース AI

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。 もっと詳しく知る 科学者はデータに溺れています。毎年何百万もの研究論文が発表されるため、最も献身的な専門家でさえ、自分の分野の最新の研究結果を常に最新の状態に保つのに苦労しています。 と呼ばれる新しい人工知能システム オープンスカラーは、研究者が科学文献にアクセスし、評価し、総合する方法に関するルールを書き直すことを約束しています。によって建てられました アレン AI 研究所 (Ai2)と ワシントン大学OpenScholar は、最先端の検索システムと微調整された言語モデルを組み合わせて、複雑な研究上の疑問に対する引用に裏付けられた包括的な回答を提供します。 「科学の進歩は、増え続ける文献を総合する研究者の能力にかかっています」とOpenScholarの研究者らは書いている。 彼らの論文。しかし、その能力は膨大な量の情報によってますます制限されています。 OpenScholar は、研究者が大量の論文を乗り切るのに役立つだけでなく、OpenAI のような独自の AI システムの支配に挑戦する、前進する道を提供すると彼らは主張しています。 GPT-4o。 OpenScholar の AI 脳が 4,500 万件の研究論文を数秒で処理する方法 OpenScholar の中核となるのは、以上のデータストアを活用する検索拡張言語モデルです。 4,500 万件のオープンアクセス学術論文。研究者が質問すると、GPT-4o のようなモデルのように、OpenScholar は単に事前トレーニングされた知識から応答を生成するだけではありません。代わりに、関連する論文を積極的に検索し、その結果を総合して、それらの情報源に基づいた回答を生成します。 現実の文学に「根ざした」状態を維持できるこの能力は、大きな差別化要因となります。という新しいベンチマークを使用したテストでは、 ScholarQABenchは、自由回答の科学的質問に基づいて AI システムを評価するために特別に設計された OpenScholar…

OpenScholar: 科学研究において GPT-4o を上回るパフォーマンスを発揮するオープンソース AI
1732192497 2024-11-21 01:17:00

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。 もっと詳しく知る


科学者はデータに溺れています。毎年何百万もの研究論文が発表されるため、最も献身的な専門家でさえ、自分の分野の最新の研究結果を常に最新の状態に保つのに苦労しています。

と呼ばれる新しい人工知能システム オープンスカラーは、研究者が科学文献にアクセスし、評価し、総合する方法に関するルールを書き直すことを約束しています。によって建てられました アレン AI 研究所 (Ai2)と ワシントン大学OpenScholar は、最先端の検索システムと微調整された言語モデルを組み合わせて、複雑な研究上の疑問に対する引用に裏付けられた包括的な回答を提供します。

「科学の進歩は、増え続ける文献を総合する研究者の能力にかかっています」とOpenScholarの研究者らは書いている。 彼らの論文。しかし、その能力は膨大な量の情報によってますます制限されています。 OpenScholar は、研究者が大量の論文を乗り切るのに役立つだけでなく、OpenAI のような独自の AI システムの支配に挑戦する、前進する道を提供すると彼らは主張しています。 GPT-4o

https://www.youtube.com/watch?v=b8tdvQGnSv8

OpenScholar の AI 脳が 4,500 万件の研究論文を数秒で処理する方法

OpenScholar の中核となるのは、以上のデータストアを活用する検索拡張言語モデルです。 4,500 万件のオープンアクセス学術論文。研究者が質問すると、GPT-4o のようなモデルのように、OpenScholar は単に事前トレーニングされた知識から応答を生成するだけではありません。代わりに、関連する論文を積極的に検索し、その結果を総合して、それらの情報源に基づいた回答を生成します。

現実の文学に「根ざした」状態を維持できるこの能力は、大きな差別化要因となります。という新しいベンチマークを使用したテストでは、 ScholarQABenchは、自由回答の科学的質問に基づいて AI システムを評価するために特別に設計された OpenScholar が優れていました。このシステムは事実性と引用の正確さにおいて優れたパフォーマンスを示し、GPT-4o のようなはるかに大規模な独自モデルをも上回りました。

特にひどい発見の 1 つは、GPT-4o が捏造された引用 (AI 用語で言うところの幻覚) を生成する傾向に関係していました。 GPT-4o は生物医学研究の疑問に答える任務を負った際、90% 以上のケースで存在しない論文を引用しました。対照的に、OpenScholar は検証可能なソースにしっかりと固定され続けました。

実際に検索された論文に基づくことが基本です。このシステムは、研究者が「自己フィードバック推論ループ」そして「自然言語フィードバックを通じて出力を繰り返し改良することで、品質が向上し、補足情報が適応的に組み込まれます。」

研究者、政策立案者、ビジネスリーダーにとっての影響は重大です。 OpenScholar は、科学的発見を加速するための不可欠なツールとなり、専門家がより迅速かつより自信を持って知識を統合できるようになります。

OpenScholar の仕組み: このシステムは、4,500 万件の研究論文 (左) を検索することから始まり、AI を使用して関連する文章を取得してランク付けし、初期応答を生成して、引用を検証する前に反復フィードバック ループを通じて応答を改良します。このプロセスにより、OpenScholar は複雑な科学的疑問に対して、引用に裏付けられた正確な回答を提供できるようになります。 |出典: アレン AI 研究所およびワシントン大学

デビッド対ゴリアテの戦いの内部: オープンソース AI はビッグテックと競争できるか?

OpenScholar のデビューは、AI エコシステムがクローズドな独自システムによってますます支配されている時期に行われました。 OpenAI のようなモデル GPT-4o そしてアントロピックの クロード は優れた機能を提供しますが、高価で不透明で、多くの研究者にとってアクセスできません。 OpenScholar は、完全にオープンソースであることで、このモデルをひっくり返します。

OpenScholar チームがリリースしたのは、 コード 言語モデルだけでなく全体についても、 取得パイプライン、専門的な 80億パラメータモデル 科学的タスク向けに微調整されており、 データストア 科学論文の。 「私たちの知る限り、これは、データからトレーニングレシピ、モデルチェックポイントに至るまで、科学アシスタントLMの完全なパイプラインの初のオープンリリースです」と研究者らは論文に書いている。 ブログ投稿 システムを発表します。

このオープンさは単なる哲学的な立場ではありません。それは実用的な利点でもあります。 OpenScholar はサイズが小さく、アーキテクチャが合理化されているため、独自のシステムよりもはるかにコスト効率が高くなります。たとえば、研究者らは次のように推定しています。 OpenScholar-8B よりも運用コストが100倍安い 紙QA2、GPT-4o上に構築された同時システム。

このコスト効率により、発展途上国の小規模な機関、資金不足の研究室、研究者が強力な AI ツールにアクセスできるようになる可能性があります。

それでも、OpenScholar には制限がないわけではありません。そのデータストアはオープンアクセスの論文に限定されており、一部の分野を支配するペイウォール化された研究は除外されています。この制約は、法的には必要ですが、システムが医学や工学などの分野での重要な発見を見逃す可能性があることを意味します。研究者らはこのギャップを認識しており、今後の反復で責任を持ってクローズドアクセスコンテンツを組み込むことができることを期待している。

OpenScholar のパフォーマンス: 専門家による評価では、OpenScholar (OS-GPT4o および OS-8B) が、組織、対象範囲、関連性、有用性という 4 つの主要な指標において人間の専門家および GPT-4o の両方と有利に競合していることが示されています。特に、OpenScholar の両方のバージョンは、人間が書いた応答よりも「有用」であると評価されました。 |出典: アレン AI 研究所およびワシントン大学

新しい科学的手法: AI が研究パートナーになるとき

OpenScholar プロジェクト 科学における AI の役割について重要な疑問を提起します。文献を総合するこのシステムの能力は素晴らしいものですが、確実ではありません。専門家の評価では、OpenScholar の回答が人間が書いた回答よりも 70% の確率で好まれましたが、残りの 30% では、基礎的な論文を引用していなかったり、代表的ではない研究を選択したりするなど、モデルが不十分な領域が浮き彫りになりました。

これらの制限は、より広範な真実を強調しています。OpenScholar のような AI ツールは、人間の専門知識を置き換えるのではなく、強化することを目的としています。このシステムは、研究者が文献合成という時間のかかるタスクを処理できるように支援し、解釈と知識の進歩に集中できるように設計されています。

批評家は、OpenScholar がオープンアクセス論文に依存しているため、研究の多くがペイウォールの背後に閉じ込められている製薬など、一か八かの分野での当面の有用性が制限されていると指摘するかもしれない。システムのパフォーマンスは強力ではあるものの、依然として取得されるデータの品質に大きく依存すると主張する人もいます。取得ステップが失敗した場合、パイプライン全体が次善の結果を生み出す危険があります。

しかし、たとえその制限があるとしても、OpenScholar は科学コンピューティングにおける転換点を表しています。以前の AI モデルは会話に参加する能力に感銘を受けましたが、OpenScholar はより基本的なもの、つまり人間に近い精度で科学文献を処理、理解、および合成する能力を実証しています。

数字は説得力のあるストーリーを物語っています。 OpenScholar の 80 億パラメータ モデルは、桁違いに小さいにもかかわらず、GPT-4o よりも優れたパフォーマンスを発揮します。他の AI が 90% の確率で失敗する引用精度においては、人間の専門家に匹敵します。そしておそらく最も顕著なことは、専門家は同僚が書いた答えよりもその答えを好むということです。

これらの成果は、私たちが AI 支援研究の新時代に突入していることを示唆しています。そこでは、科学の進歩のボトルネックは、もはや既存の知識を処理する能力ではなく、むしろ適切な質問をする能力である可能性があります。

研究者たち すべてを解放しましたコード、モデル、データ、ツールなどは、ブレークスルーを密室で維持するよりもオープンにすることで進歩が加速することに賭けています。

そうすることで、彼らは AI 開発における最も差し迫った質問の 1 つ、つまりオープンソース ソリューションはビッグテックのブラック ボックスと競合できるか? に答えました。

その答えは、4,500 万件の論文の中に、目に見えるところに隠されているようです。

#OpenScholar #科学研究において #GPT4o #を上回るパフォーマンスを発揮するオープンソース
執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。