1772291638
2026-02-27 17:00:00
一目でわかる
- 今日の AI エージェントのベンチマークは一度に 1 つのタスクをテストしますが、実際の職場の生産性には、相互に依存する多数のタスクを一度に管理する必要があります。これを反映するために、Multi-Horizon タスク環境 (MHTE) と呼ばれる設定を作成しました。
- マルチタスクの負荷がかかると、コンピュータを使用する主要なエージェントのパフォーマンスが急激に低下し、完了率が 16.7% から 8.7% に低下します。
- CORPGEN の紹介 デジタル従業員、階層型プランニング、メモリ分離、体験学習を備え、3 つの独立したエージェント バックエンド全体でベースラインよりも最大 3.5 倍高い完了率を実現します。
- CORPGEN はアーキテクチャに依存せずモジュール式であるため、その利点は単一の基本モデルではなくシステム設計から得られ、基礎となるモデルが改善されると直接恩恵を受けます。
午前中までに、典型的なナレッジ ワーカーはすでに、クライアント レポート、予算スプレッドシート、スライド資料、電子メールのバックログをやりくりしており、すべて相互に依存しており、一度に注意を払う必要があります。 AI エージェントがその環境で真に役立つためには、同じように動作する必要がありますが、今日の最良のモデルは、一度に数十のタスクではなく、一度に 1 つのタスクごとに評価されます。
私たちの論文では、「CORPGEN: マルチホライズン タスク環境での自律型デジタル従業員による企業環境のシミュレーション」では、そのギャップを埋めるための記憶、計画、学習機能を AI に装備するエージェント フレームワークを提案します。
Multi-Horizon タスク環境の紹介
職場でのマルチタスクの現実を再現するには、新しい種類の評価環境が必要です。これに応じて、エージェントが複数の複雑なタスクを同時に管理する必要がある設定である Multi-Horizon タスク環境 (MHTE) を開発しました。各タスクには、5 時間にわたる 1 つのセッション内で 10 ~ 30 の依存するステップが必要です。
ベンチマークで何をテストする必要があるかを判断するために、今日の主要な AI エージェントの一部で MHTE を大規模に実行し、4 つの弱点を明らかにしました。まず、メモリがいっぱいになります。エージェントは、複数のアクティブなタスクの詳細を同時に保持することはできません。第二に、あるタスクから得られる情報が、別のタスクについての推論を妨げます。第三に、タスクは単純なシーケンスでは互いに依存しません。これらは複雑な網の目を形成しており、エージェントは下流での作業を進める前に、上流の作業が完了したかどうかを常に確認する必要があります。第 4 に、すべてのアクション サイクルでは、エージェントが中断したところから再開するだけでなく、すべてのアクティブなタスクにわたって優先順位を再設定する必要があります。
また、負荷を増加させながら 3 つの独立したエージェント システムをテストしました。同時タスクの数が 12 から 46 に増加したため、すべてのシステムの完了率は 16.7% から 8.7% に低下しました。
CORPGENのアーキテクチャ
CORPGEN の紹介 デジタル従業員: 永続的な ID、役割固有の専門知識、現実的な作業スケジュールを備えた LLM ベースの AI エージェント。これらは GUI 自動化を通じて Microsoft Office アプリケーションを操作し、何時間もの継続的なアクティビティにわたって MHTE 内で一貫して実行します。図 1 は、デジタル従業員が 1 日を通してどのように移動するかを示しています。

CORPGEN は、同時タスク実行の 4 つの弱点 (メモリ過負荷、タスク間の干渉、依存関係の複雑さ、優先順位の再設定) のそれぞれに的を絞った方法で対処します。階層型計画では、目標を毎日の目標に分割し、次に瞬間ごとの意思決定に分割するため、エージェントは各ステップの前に利用可能なすべてのタスクを確認するのではなく、構造化された計画に基づいて行動できるようになります。
サブエージェントは、Web リサーチなどの複雑な操作を分離されたコンテキストで実行し、タスク間の汚染を防ぎます。階層型メモリ システムにより、すべてをアクティブなコンテキストに保持するのではなく、タスク関連の情報を選択的に呼び出すことができます。適応型要約により、重要な情報を保存しながら日常的な観察を圧縮し、メモリの増加を制御します。
これらのメカニズムは特定の基本モデルに関連付けられていないため、3 つの異なるエージェントにわたって CORPGEN をテストしました。いずれの場合も、一貫した利益が観察されました。この改善は、特定のモデルの強みによるものではなく、アーキテクチャによるものです。図 2 は、CORPGEN のアーキテクチャ内でこれらがどのように組み合わされるかを示しています。

デジタル従業員のコラボレーション方法
複数のデジタル従業員が同じ環境で業務を行う場合、事前に定義された調整ルールがなくても、標準のコミュニケーション チャネルを通じてコラボレーションが実現します。ある従業員がデータを要求する電子メールを送信します。別のシステムが次のサイクルでそれを取得し、メモリを使用してそれを処理し、応答します。このやりとりは実際の職場のコミュニケーションを反映しています。
エージェント間で内部状態を共有することはありません。調整はすべて、多くの従業員が使用するのと同じチャネルである電子メールと Microsoft Teams を通じて行われます。時間が経つにつれて、これらの独立した取引所は、認識可能な組織パターンを形成します。一部のエージェントはリーダーシップの役割を果たします。他の人はサポートを提供します。共有ドキュメントは結合組織になります。
電子メールの配信エラーなど、通信パスが切断された場合、エージェントは代替チャネルを通じてメッセージを再ルーティングし、作業を継続します。その結果、明示的にプログラムされていなくても、実際の組織のように動作する仮想組織が作成されます。
CORPGENの評価
私たちは、最大 46 のタスクを 1 つの 6 時間のセッションに組み合わせたマルチタスク ベンチマークで CORPGEN を評価しました。 3 つの発見が際立っていました。
負荷が増加するとベースラインが低下します。 CORPGENはそうではありません。 3 つのベースライン エージェント システムはすべて、タスクの負荷が増加するにつれてパフォーマンスが着実に低下することが示されました。対照的に、CORPGEN は、より高い負荷でも完了率を維持または向上させました。 46 個のタスクで、CORPGEN はタスクの 15.2% を完了しましたが、ベースラインでは 4.3% で、およそ 3.5 倍でした。
経験的な学習が最大の利益をもたらします。 CORPGEN のコンポーネントを順番に紹介しました。最初にオーケストレーション層、次にコグニティブ ツール、そして最後に体験学習です。最初の 2 つは中程度の改善をもたらしました。エージェントが完了したタスクの記録を保存し、構造的に類似した作業に遭遇したときにそれを再利用する経験学習が最も大きな増加をもたらし、完了率が 8.7% から 15.2% に上昇しました。
評価方法によって状況は変わります。 エージェントが生成した実際の出力ファイルを検査したところ、結果はおよそ 90% の確率で人間の判断と一致しました。スクリーンショットとアクションログに基づく評価は、約 40% の確率でしか一致しませんでした。このギャップは、一般的な評価アプローチでは、エージェントが実際に達成することを過小評価している可能性があることを示唆しています。
スポットライト: AI を活用したエクスペリエンス
Microsoft 研究副操縦士の経験
AI を活用したエクスペリエンスを通じてマイクロソフトの研究について詳しく知る
影響と今後の展望
この結果は、エージェントが現実世界で機能する上で、生のモデルの機能だけでなく、記憶と検索が重要なボトルネックになっている可能性があることを示唆しています。最大の成果は体験学習から得られました。以前の成功から学習し、それらのパターンを構造的に類似したタスクに適用するエージェントは、各タスクに個別に応答するシステムよりも優位性を築きます。
CORPGEN は、AI エージェントがどのように連携するかについても新たな視点を開きます。次のステップには、エージェントが複数の勤務日にわたって記憶を維持できるかどうか、およびチームで作業するときにエージェントがどのように調整するかをテストすることが含まれます。また、ソフトウェアと対話するさまざまな方法を組み合わせて、エージェントをより高速かつ信頼性の高いものにする方法も模索しています。
謝辞
この取り組みは、Microsoft の CTO オフィスと Microsoft AI Development Accelerator Program (MAIDAP) とのコラボレーションの成果です。この調査をサポートするリソースを提供してくださった Microsoft セキュリティ調査チームに感謝いたします。 Microsoft のメンバーにも感謝します。 UFO2 (新しいタブで開きます) チームと メモリ0 (新しいタブで開きます) プロジェクトには、CORPGEN アーキテクチャの主要コンポーネントを可能にするオープンソースへの貢献が、OSWorld チームには、マルチタスク評価の基礎となるベンチマークが提供されました。
最後に、この研究に貢献した多くの方々に感謝します。シャーロット・シスカ氏、マヌエル・ラウール・メレンデス・ルハン氏、アンソニー・トゥム・バリマ氏、マウリシオ・ベラスコ氏。
#CORPGEN #は実際の業務向けに #エージェントを進化させます