ChatGPTの作成者によって開発された人工知能(AI)モデルであるO3は、先週発売されたベンチマークプラットフォームによると、複数の分野で科学の質問に答えるための最高のAIツールにランクされています。
サイアレン、ワシントン州シアトルのアレン人工知能研究所(AI2)によって開発され、科学的な質問に対する回答に従って23の大手言語モデル(LLMS)にランクされました。答えの質は、102人の研究者によって投票されました。カリフォルニア州サンフランシスコのOpenaiによって作成されたO3は、13,000票以上の票を獲得した後、自然科学、ヘルスケア、工学、人文科学、社会科学に関する質問に答えるのに最高にランクされました。
中国の杭州にあるディープセークによって建設されたDeepseek-R1は、自然科学の質問で2番目、エンジニアリングで4番目になりました。 GoogleのGemini-2.5-Proは、自然科学で3位、エンジニアリングとヘルスケアで5位にランクされました。
AI2の研究科学者であるArman Cohan氏によると、O3に対するユーザーの好みは、それが引用している文献について多くの詳細を提供し、技術的に微妙な反応を生み出す傾向に起因する可能性があります。しかし、モデルのパフォーマンスが異なる理由を説明することは、ほとんどが独自であるため、困難です。トレーニングデータの違いと、モデルが最適化されていることの違いは、とりわけ、それを部分的に説明できると彼は言います。
Sciarenaは、AIモデルが特定のタスクでどのように機能するかを評価するために開発された最新のプラットフォームであり、クラウドソーシングフィードバックを使用して科学タスクでパフォーマンスをランク付けした最初のプラットフォームの1つです。 「Sciarenaは、LLM支援文献のタスクの慎重な評価を動機付ける前向きな努力です」と、キャンベラのオーストラリア国立大学のロボット工学およびAIの研究者であるRahul Shome氏は述べています。
ランダムに選択
23のLLMをランク付けするために、Sciarenaは研究者に科学的な質問を提出するように頼みました。彼らは、2つのランダムに選択されたモデルから回答を受け取りました。これは、AI2によって作成されたAI研究ツールであるSemantic Scholarから描かれた参照で回答をサポートしました。その後、ユーザーは、1つのモデルが最良の回答を提供したか、2つのモデルが同等か、両方がひどく実行されたかどうかに投票しました。
プラットフォームは現在公開されており、ユーザーが調査の質問を無料で尋ねることができます。すべてのユーザーは2つのモデルから回答を受け取り、パフォーマンスに投票できますが、条件に同意する検証済みのユーザーからのみ投票して、リーダーボードに含まれています。
オーストラリアのシドニー大学のAI研究者ジョナサン・クマーフェルド氏によると、科学のトピックについてLLMSに質問し、答えに自信を持つ能力は、研究者が自分の分野の最新の文献に追いつくのに役立ちます。 「これは、研究者がそうでなければ見逃しているかもしれない仕事を見つけるのに役立ちます。」
#OpenaiのO3は科学的な質問に答えるための新しいAIリーグテーブルをトップにします