1773691634
2026-03-13 17:11:00
一目でわかる
- 問題: AI エージェントの障害のデバッグは困難です。これは、軌跡が長く、確率論的で、多くの場合複数のエージェントが存在するため、真の根本原因が埋もれてしまうためです。
- 解決: エージェントRx (新しいタブで開きます) を特定します 最初の回復不可能 (「重大な障害」) ステップ 合成することで 保護された実行可能な制約 ツール スキーマとドメイン ポリシーから、証拠に裏付けられた違反を段階的にログに記録します。
- ベンチマーク + 分類: リリースします AgentRx ベンチマーク (新しいタブで開きます) と 115 失敗した軌跡に手動で注釈を付けた τベンチ、 フラッシュ、 そして マジェンティックワン、プラスグラウンディング9-カテゴリ障害分類法。
- 結果 + リリース: AgentRx は障害の位置特定を改善します (+23.6%) および根本原因の帰属 (+22.9%)プロンプトベースラインを超えて、フレームワークとデータセットをオープンソース化しています。
AI エージェントが単純なチャットボットから、クラウド インシデントの管理、複雑な Web インターフェイスの操作、複数ステップの API ワークフローの実行が可能な自律システムに移行するにつれて、新たな課題が浮上しています。 透明性。
人間が間違いを犯した場合、通常はその論理をたどることができます。しかし、AI エージェントが失敗した場合、おそらくツールの出力が幻覚を見せたり、セキュリティ ポリシーから 10 段階から 50 段階のタスクに逸脱したりした場合、どこで何が問題になったのかを正確に特定するのは、困難な手作業のプロセスです。
本日、私たちはオープンソースのリリースを発表できることを嬉しく思います。 エージェントRx (新しいタブで開きます)は、エージェントの軌跡における「重大な障害ステップ」を正確に特定するように設計された、自動化されたドメインに依存しないフレームワークです。フレームワークとともに、 AgentRx ベンチマーク (新しいタブで開きます)、コミュニティがより透明で回復力のあるエージェント システムを構築するのに役立つ、手動で注釈が付けられた 115 個の失敗した軌跡のデータセット。
課題: AI エージェントのデバッグが難しい理由
最新の AI エージェントは次のような場合が多いです。
- 長期: 彼らは長期間にわたって数十のアクションを実行します。
- 確率論的: 同じ入力が異なる出力につながる可能性があり、再現が困難になります。
- マルチエージェント: 障害はエージェント間で「受け継がれ」、元の根本原因が隠蔽される可能性があります。
従来の成功指標 (「タスクは完了しましたか?」など) では十分な情報が得られません。安全なエージェントを構築するには、軌跡が回復不能になった正確な瞬間を特定し、そのステップで何が問題だったかの証拠をキャプチャする必要があります。
AgentRx の紹介: 自動診断の「処方箋」
エージェントRx (「エージェント診断」の略) は、エージェントの実行を検証が必要なシステム トレースのように扱います。 AgentRx は、単一の LLM に依存してエラーを「推測」するのではなく、構造化された複数ステージのパイプラインを使用します。
- 軌道の正規化: 異なるドメインからの異種ログは、共通の中間表現に変換されます。
- 制約の合成: フレームワークは、ツール スキーマ (例: 「API は有効な JSON 応答を返す必要がある」) およびドメイン ポリシー (例: 「ユーザーの確認なしにデータを削除しない」) に基づいて実行可能な制約を自動的に生成します。
- 保護された評価: AgentRx は制約を段階的に評価し、条件が満たされた場合にのみ各制約をチェックします。 ガード状態 が適用され、生成されます。 監査可能な検証ログ 証拠に裏付けられた違反行為。
- LLM ベースの審査: 最後に、LLM 審査員は検証ログと根拠のある故障分類法を使用して、問題を特定します。 重大な障害のステップ—最初の回復不可能なエラー。

エージェント障害の新しいベンチマーク
AgentRx を評価するために、以下から構成される手動で注釈を付けたベンチマークを開発しました。 115 個の失敗した軌道 3 つの複雑なドメインにわたって:
- τベンチ: 小売およびサービスタスクのための構造化された API ワークフロー。
- フラッシュ: 実際のインシデント管理とシステムのトラブルシューティング。
- マグネティックワン: 汎用的なマルチエージェント システムを使用した、オープンエンドの Web タスクとファイル タスク。
根拠に基づいた理論アプローチを使用して、9 つの指標を導き出しました。-カテゴリ障害分類法 それはこれらのドメイン全体に一般化されます。この分類法は、開発者が次のものを区別するのに役立ちます。 「計画遵守の失敗」 (エージェントが自身の手順を無視した場合) 「新しい情報の発明」 (幻覚)。
| 分類カテゴリー | 説明 |
|---|---|
| 計画遵守の失敗 | 必要な手順を無視した / 余分な計画外のアクションを実行した |
| 新しい情報の発明 | トレース/ツール出力に基づいていない変更された事実 |
| 無効な呼び出し | ツール呼び出しの形式が正しくない / 引数が欠落している / スキーマが無効です |
| ツール出力の誤解 | ツールの出力を誤って読み取ります。間違った仮定に基づいて行動した |
| 意図と計画の不一致 | ユーザーの目標/制約を読み違え、間違った計画を立てた |
| ユーザーの意図が不十分に指定されている | 必要な情報が利用できないため続行できませんでした |
| インテントはサポートされていません | 求められていることを実行できるツールはありません |
| ガードレールが作動しました | 安全/アクセス制限により実行がブロックされました |
| システム障害 | 接続/ツールエンドポイントの障害 |

主な結果
私たちの実験では、AgentRx は既存の LLM ベースのプロンプト ベースラインに比べて大幅な改善を示しました。
- +23.6% の絶対的な改善 故障位置特定の精度が低下します。
- +22.9% 改善 根本原因の特定において。
AgentRx を使用すると、監査可能なログを通じて障害の背後にある「理由」が提供されるため、開発者は試行錯誤のプロンプトを超えて体系的なエージェント エンジニアリングに進むことができます。
私たちは、エージェントの信頼性が実際の展開の前提条件であると考えています。これをサポートするために、AgentRx フレームワークと注釈付きの完全なベンチマークをオープンソース化しています。
研究者や開発者の皆様には、AgentRx を使用して独自のエージェント ワークフローを診断し、増大する障害制約のライブラリに貢献していただくようお勧めします。私たちは協力して、強力なだけでなく、監査可能で信頼性の高い AI エージェントを構築できます。
謝辞
Avaljot Singh 氏と スマン・ナス このプロジェクトに貢献してくれて。
#エージェントの体系的なデバッグ #AgentRx #フレームワークの紹介