皆様のご意見をお聞かせください。簡単な AI アンケートにご協力いただき、AI の現状、AI の実装方法、将来への期待などについてご意見をお聞かせください。 もっと詳しく知る
AI エージェントは、現実世界での応用が期待される、有望な新しい研究方向になりつつあります。これらのエージェントは、大規模言語モデル (LLM) や視覚言語モデル (VLM) などの基礎モデルを使用して、自然言語の指示を受け取り、自律的または半自律的に複雑な目標を追求します。AI エージェントは、ブラウザー、検索エンジン、コード コンパイラなどのさまざまなツールを使用して、アクションを検証し、目標について推論することができます。
しかし、 最近の分析 研究者による プリンストン大学 現在のエージェントのベンチマークと評価方法には、現実世界のアプリケーションでの有用性を妨げるいくつかの欠点があることが明らかになりました。
彼らの調査結果は、エージェントのベンチマークには明確な課題が伴い、基礎モデルをベンチマークするのと同じ方法でエージェントを評価することはできないことを強調しています。
コストと精度のトレードオフ
研究者が研究で強調している大きな問題の 1 つは、エージェント評価におけるコスト管理の欠如です。AI エージェントは、同じクエリを複数回実行すると異なる結果を生成する可能性のある確率的言語モデルに依存することが多いため、単一のモデル呼び出しよりも実行コストがはるかに高くなる可能性があります。
VB Transform 2024 までのカウントダウン
7 月 9 日から 11 日までサンフランシスコで開催される当社の主力 AI イベントに、企業リーダーが参加します。同業者と交流し、Generative AI の機会と課題を探り、AI アプリケーションを業界に統合する方法を学びましょう。 今すぐ登録
精度を高めるために、一部のエージェント システムでは複数の応答を生成し、投票や外部検証ツールなどのメカニズムを使用して最適な回答を選択します。数百または数千の応答をサンプリングすると、エージェントの精度が向上する場合があります。このアプローチはパフォーマンスを向上させることができますが、かなりの計算コストがかかります。推論コストは、精度を最大化することが目的である研究環境では必ずしも問題になりません。
しかし、実際のアプリケーションでは、各クエリに利用できる予算には制限があるため、エージェントの評価ではコスト管理が重要になります。そうしないと、研究者はリーダーボードのトップに立つためだけに非常にコストのかかるエージェントを開発するようになるかもしれません。プリンストンの研究者は、評価結果を精度と推論コストのパレート曲線として視覚化し、これら 2 つの指標についてエージェントを共同で最適化する手法を使用することを提案しています。
研究者らは、さまざまな論文で紹介されているさまざまなプロンプト手法とエージェントパターンの精度とコストのトレードオフを評価しました。
「実質的に同様の精度の場合、コストはほぼ2桁異なる可能性があります」と研究者は書いています。「しかし、これらのエージェントを実行するコストは、これらの論文のいずれでも報告されている主要な指標ではありません。」
研究者らは、両方の指標を最適化することで「精度を維持しながらコストの低いエージェント」が実現できると主張している。共同最適化により、研究者と開発者はエージェントの実行にかかる固定費と変動費をトレードオフすることもできる。例えば、エージェントの設計を最適化するためにより多くの費用をかけながら、使用する変数を減らすことで変動費を削減できる。 文脈学習の例 エージェントのプロンプトで。
研究者らは共同最適化をテストした。 ホットポットQA、人気のある質問応答ベンチマークです。彼らの結果は、共同最適化定式化が精度と推論コストの最適なバランスを実現する方法を提供することを示しています。
「有用なエージェントの評価では、コストを考慮する必要があります。たとえ最終的にはコストを気にせず、革新的なエージェント設計を特定することだけを考えているとしてもです」と研究者らは記している。「正確さだけでは進歩を特定できません。再試行などの科学的に意味のない方法によって進歩が向上する可能性があるからです。」
モデル開発と下流アプリケーション
研究者が指摘するもう 1 つの問題は、研究目的でのモデルの評価と下流アプリケーションの開発の違いです。研究では、精度が主な焦点となることが多く、推論コストはほとんど無視されます。ただし、AI エージェントで実際のアプリケーションを開発する場合、推論コストはどのモデルと手法を使用するかを決定する上で重要な役割を果たします。
AI エージェントの推論コストを評価するのは困難です。たとえば、モデル プロバイダーによって、同じモデルに対して請求される金額が異なる場合があります。一方、API 呼び出しのコストは定期的に変化し、開発者の決定によって変わる可能性があります。たとえば、一部のプラットフォームでは、一括 API 呼び出しの請求額が異なります。
研究者らは Webサイト この問題に対処するために、トークンの価格設定に基づいてモデルの比較を調整します。
彼らはまた、次のようなケーススタディも実施した。 NovelQA非常に長いテキストでの質問応答タスクのベンチマークである。彼らは、モデル評価を目的としたベンチマークが下流の評価に使用された場合、誤解を招く可能性があることを発見した。例えば、元のNovelQAの研究では、 検索拡張生成 (RAG)は、現実世界のシナリオよりも長期コンテキストモデルよりもはるかに悪いように見えます。彼らの調査結果によると、RAGと ロングコンテキストモデル 精度はほぼ同じですが、ロングコンテキスト モデルは 20 倍高価です。
過剰適合は問題である
新しいタスクを学習する際、機械学習(ML)モデルはベンチマークで高得点を獲得するための近道を見つけることがよくあります。その近道の代表的なものの1つが「オーバーフィッティング」です。これは、モデルがベンチマークテストで不正行為をし、現実世界には当てはまらない結果を出す方法です。研究者は、エージェントベンチマークは一般的に数百のサンプルしかなく、規模が小さい傾向があるため、オーバーフィッティングは深刻な問題であることがわかりました。この問題は、 データ汚染 テストサンプルの知識をエージェントに直接プログラムできるため、基礎モデルのトレーニングに役立ちます。
この問題に対処するため、研究者らは、ベンチマーク開発者は、トレーニング中に記憶できず、対象タスクを適切に理解することによってのみ解決できる例で構成されるホールドアウト テスト セットを作成して保持する必要があることを提案しています。17 のベンチマークを分析した結果、適切なホールドアウト データセットが不足しているものが多く、エージェントが意図せずショートカットを実行できることが分かりました。
「驚いたことに、多くのエージェント ベンチマークにはホールドアウト テスト セットが含まれていないことがわかりました」と研究者は書いています。「テスト セットを作成することに加えて、ベンチマーク開発者は LLM 汚染やエージェントの過剰適合を防ぐために、テスト セットを秘密にしておくことを検討する必要があります。」
また、エージェントが達成するタスクの一般性の望ましいレベルに基づいて、異なるタイプのホールドアウト サンプルが必要であることもわかりました。
「ベンチマーク開発者は、ショートカットが不可能であることを保証するために最善を尽くさなければならない」と研究者らは書いている。「我々は、ショートカットを許可しないベンチマークを設計する方が、エージェントごとにショートカットを取るかどうかをチェックするよりもはるかに簡単であるため、これはエージェント開発者ではなくベンチマーク開発者の責任であると考えている。」
研究者らは ウェブアリーナは、さまざまなウェブサイトで問題を解決する際の AI エージェントのパフォーマンスを評価するベンチマークです。彼らは、トレーニング データセットに、現実世界では小さな変化で簡単に壊れてしまうような方法でエージェントがタスクに過剰適合することを可能にするいくつかの近道を発見しました。たとえば、エージェントは、将来変更される可能性があることや、別のウェブサイトでは機能しない可能性があることを考慮せずに、ウェブ アドレスの構造について仮定を行うことができます。
研究者らは、これらのエラーにより精度の推定値が膨らみ、エージェントの能力について過度の楽観主義につながると警告している。
と AIエージェント 新しい分野であるため、研究者や開発者のコミュニティは、すぐに日常的なアプリケーションの重要な部分になる可能性のあるこれらの新しいシステムの限界をどのようにテストするかについて、まだ学ぶべきことがたくさんあります。
「AIエージェントのベンチマークは新しいものであり、ベストプラクティスはまだ確立されていないため、真の進歩と誇大広告を区別することは困難です」と研究者らは書いている。「エージェントはモデルとは十分に異なるため、ベンチマークの実践を再考する必要があるというのが私たちの主張です。」