日本語版
最新ニュース
世界

Os-Marathon は 242 の長期にわたる反復タスクにわたって堅牢なエージェント ベンチマークを達成

長期的なエージェント評価のための OS-Marathon ベンチマークは困難です これらのタスクは、経費報告書の処理や学生の成績入力などの一般的な専門的ワークフローを反映していますが、期間が長く、構造化され、繰り返し行われるサブワークフローのため、大きな課題となっています。その結果、彼らは特にこの制限に対処するために OS-Marathon を設計し、長期的なパフォーマンスを評価するための標準化されたプラットフォームを提供しました。この革新的なアプローチは、コンテキストの長さの制限による長いワークフローを現在の CUA に直接統合する際の制限を回避します。実験では、タスクの順序付けにおける論理的な一貫性のなさ、行動計画の幻覚、反復的なサブワークフロー全体で一貫性を維持するための苦労など、既存のエージェントに固有の困難が明らかになりました。チームは、エージェントが頻繁に非論理的にタスクを実行したり、現在のワークフロー状態に基づかずにアクションを試みたりして、失敗につながることを発見しました。この戦略はデュアルレベルの指示を提供し、グローバル プランニング、反復ループの調整、およびサブワークフローの実行の両方でエージェントをガイドし、各ステップの基本ロジックを習得します。この方法により、ワークフローを主要なステップに抽象化することで、最先端のエージェントがより大規模で目に見えないデータ コレクションに効率的に適応できるようになります。この研究では、長期にわたる反復的な CUA タスクの正式な定義を確立し、7 つの異なる実行環境を利用して、経費報告およびトランスクリプト処理ドメインにわたるベンチマークを導入します。 さらに、研究者らは OS マラソンで主要な CUA を評価し、論理的一貫性の欠如、幻覚、不一致という 3 つの主要な障害モードを明らかにしました。エージェントは、複雑なワークフロー構造と、反復的なサブワークフロー全体での一貫性の維持に苦労することが多く、長期的な推論機能の向上の必要性が浮き彫りになりました。プロジェクトの Web サイト (github からアクセス可能)。 io/ は、研究コミュニティ向けに詳細とリソースを提供します。 長期的なタスク評価のための OS-マラソン ベンチマーク 研究者は、複数の難易度レベルにわたるエージェントのパフォーマンスのきめ細かい評価を容易にするために、各ドメイン内のタスクを細心の注意を払って設計し、範囲の長さとドキュメントの複雑さを変化させました。科学者は、完全に機能する Web ベースのシステムとローカルのスプレッドシート アプリケーションを実行環境として利用し、エージェントのための多様で現実的なテスト環境を作成しました。チームは、OS マラソン タスクに直面したときの主要な CUA の 3…

Os-Marathon は 242 の長期にわたる反復タスクにわたって堅牢なエージェント ベンチマークを達成

1769750817
2026-01-30 05:17:00

長期的なエージェント評価のための OS-Marathon ベンチマークは困難です

これらのタスクは、経費報告書の処理や学生の成績入力などの一般的な専門的ワークフローを反映していますが、期間が長く、構造化され、繰り返し行われるサブワークフローのため、大きな課題となっています。その結果、彼らは特にこの制限に対処するために OS-Marathon を設計し、長期的なパフォーマンスを評価するための標準化されたプラットフォームを提供しました。この革新的なアプローチは、コンテキストの長さの制限による長いワークフローを現在の CUA に直接統合する際の制限を回避します。実験では、タスクの順序付けにおける論理的な一貫性のなさ、行動計画の幻覚、反復的なサブワークフロー全体で一貫性を維持するための苦労など、既存のエージェントに固有の困難が明らかになりました。
チームは、エージェントが頻繁に非論理的にタスクを実行したり、現在のワークフロー状態に基づかずにアクションを試みたりして、失敗につながることを発見しました。この戦略はデュアルレベルの指示を提供し、グローバル プランニング、反復ループの調整、およびサブワークフローの実行の両方でエージェントをガイドし、各ステップの基本ロジックを習得します。この方法により、ワークフローを主要なステップに抽象化することで、最先端のエージェントがより大規模で目に見えないデータ コレクションに効率的に適応できるようになります。この研究では、長期にわたる反復的な CUA タスクの正式な定義を確立し、7 つの異なる実行環境を利用して、経費報告およびトランスクリプト処理ドメインにわたるベンチマークを導入します。

さらに、研究者らは OS マラソンで主要な CUA を評価し、論理的一貫性の欠如、幻覚、不一致という 3 つの主要な障害モードを明らかにしました。エージェントは、複雑なワークフロー構造と、反復的なサブワークフロー全体での一貫性の維持に苦労することが多く、長期的な推論機能の向上の必要性が浮き彫りになりました。プロジェクトの Web サイト (github からアクセス可能)。 io/ は、研究コミュニティ向けに詳細とリソースを提供します。

長期的なタスク評価のための OS-マラソン ベンチマーク

研究者は、複数の難易度レベルにわたるエージェントのパフォーマンスのきめ細かい評価を容易にするために、各ドメイン内のタスクを細心の注意を払って設計し、範囲の長さとドキュメントの複雑さを変化させました。科学者は、完全に機能する Web ベースのシステムとローカルのスプレッドシート アプリケーションを実行環境として利用し、エージェントのための多様で現実的なテスト環境を作成しました。チームは、OS マラソン タスクに直面したときの主要な CUA の 3 つの主な障害モードを観察しました。それは、タスクの順序付けにおける論理的一貫性の欠如、アクション計画中の幻覚、および現在のサブワークフロー状態に基づくアクションの確立の失敗です。たとえば、エージェントはソース文書から関連データを抽出せずにシステムフィールドにデータを入力しようとすることが多く、エラーが発生しました。この研究では、2 つのドメインと 7 つの異なる実行環境にわたる 242 のタスクで構成される、長期にわたる反復的な実行シナリオでの CUA パフォーマンスを評価するために特別に調整された標準化されたベンチマーク OS-Marathon が導入されています。プロジェクトの Web サイト (github からアクセス可能)。 io/ は、研究コミュニティ向けに詳細とリソースを提供します。

OS-Marathon ベンチマークは、長期にわたるエージェントのパフォーマンスに重点を置き、課題を解決します。

実験の結果、特に複数ページの PDF や高密度のドキュメント レイアウトを扱う場合、主にデータ インスタンスの量と個々のインスタンスの処理の複雑さから課題が生じることが明らかになりました。レベル 1 と 2 は基本的な機能に重点を置いており、レベル 3 と 4 は受信量が増加した現実的なシナリオをシミュレートし、エージェントがより長い実行期間にわたってコンテキストを維持することに挑戦します。同様に、Transcript ドメインには、コース番号とレイアウトの複雑さによって決定される 3 つのレベルがあり、単一ページ、単一列の PDF から、可変レイアウトの複数ページのドキュメントに進みます。データによると、ワークロードは難易度に応じて拡大し、低レベルの数十のコースから最も高度なレベルの数百のコースまで増加します。

合成レシートはラージ言語モデル (LLM) によって生成され、テンプレートを使用してレンダリングされて、一貫したタイムラインが作成されました。成績証明書ドメインは、52 の実際のタスクと 30 の合成成績証明書タスクで構成され、事前に構築されたテンプレートと合成された学生プロファイルを活用します。結果は、CUA 評価のための多様で挑戦的なベンチマークを作成する際の、このタスク構築戦略の有効性を示しています。単純なバイナリの成功率を超えるために、研究者は、拡張されたアクション シーケンスにわたるエージェントのパフォーマンスを定量化する新しい指標であるサブワークフロー精度 (SWA) を導入しました。 SWA は、正しく実行されたサブワークフローの数をサブワークフローの総数 (n/N) で割った値として計算され、長期的なタスクにおけるエージェントの信頼性をきめ細かく測定できます。このブレークスルーにより、少数の例のみを使用して凝縮されたデモンストレーションを構築する方法が提供され、エージェントがより大規模で目に見えないデータ コレクションに対して同様のワークフローを効果的に実行できるようになります。

OS-Marathon ベンチマーク テスト エージェントの長期反復回避

広範な実験により、これらの長期的なタスクが現在の最先端のエージェントに存在する固有の困難が明らかになり、多くのエージェントはより単純なレベルでも成功を収めることができません。ただし、提案されたデモンストレーション方法を適用すると、特に AgentS2.5 フレームワークおよび GPT-5 と組み合わせた場合、パフォーマンスが大幅に向上し、エージェントの学習を促進する効果が実証されました。著者らはベンチマークの範囲に限界があることを認めており、現在はレベル 1 と 2 のタスク、および本格的な評価の計算コストに重点を置いています。今後の研究では、CUA にとってより複雑な課題となるレベル 3 とレベル 4 を含めるように OS マラソンを拡張することに焦点を当てます。

チームはまた、デモ作成コストをさらに削減し、多様なワークフローにわたるエージェントの汎用性を向上させる方法を模索する予定です。これらの調査結果は、長期的なエージェントの能力を評価するための専用ベンチマークの重要性を強調し、焦点を絞ったデモンストレーション手法により、反復的で構造化されたタスクのパフォーマンスを大幅に向上できることを示唆しています。この研究は、専門的な環境での退屈なワークフローを自動化するための実用的で信頼性の高い CUA の進歩に貢献します。

#OsMarathon #は #の長期にわたる反復タスクにわたって堅牢なエージェント #ベンチマークを達成

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。