日本語版
最新ニュース
世界

Microsoft、エンタープライズ AI エージェントのベンチマークを行うエージェント相互運用スターター キットの評価をオープンソース化

マイクロソフトが導入した エージェント相互運用性の評価は、開発者や組織が現実的なデジタル作業シナリオ全体で AI エージェントがどのように相互運用できるかを評価できるように設計されたオープンソースのスターター キットです。このキットは、厳選されたシナリオ、代表的なデータセット、およびチームが電子メール、カレンダー、ドキュメント、コラボレーション ツールなどのサーフェス全体でエージェントに対して実行できる評価ハーネスを提供します。この取り組みは、エージェント AI システムがエンタープライズ ワークフローに移行する際の、体系的かつ再現可能な評価への業界の移行を反映しています。 大規模な言語モデルを活用した自律エージェントを構築する企業は、従来のテスト手法では対処できない新たな課題に直面しています。エージェントは確率的に動作し、アプリケーションと深く統合し、ツール間で調整するため、現実世界のパフォーマンスを理解するには、分離された精度メトリクスでは不十分です。エージェントの評価 重要な学問として浮上してきた AI 開発、特にエージェントがビジネス プロセス、コンプライアンス、安全性に影響を与える可能性がある企業環境で。最新の評価フレームワークは、最終結果だけでなく、行動パターン、状況認識、および複数ステップのタスクの回復力を測定するよう努めています。 の Agent Interop スターター キットの Evals チームに反復可能で透明性のある評価ベースラインを提供することを目的としています。テンプレート化された宣言的な評価仕様が付属しています (JSON ファイルの形式で) と、一貫性や有用性などの品質に関する調整済みの AI 判定評価とともに、スキーマの遵守やツール呼び出しの正しさなどのシグナルを測定するハーネスです。このキットは当初、電子メールとカレンダーのやり取りを伴うシナリオに焦点を当てていましたが、より豊富な採点機能、追加の審査員オプション、およびより広範なエージェント ワークフローのサポートによって拡張される予定です。 Microsoft は、さまざまなスタックやモデル バリアントを使用して構築された「ストローマン」エージェント間の比較洞察を提供するために、スターター キットにリーダーボードの概念も含めています。これにより、組織は相対的なパフォーマンスを視覚化し、障害モードを早期に特定し、広範囲に展開する前に候補エージェントについてより多くの情報に基づいた意思決定を行うことができます。 の GitHub リポジトリ オープンソース ライセンスに基づいてスターター コードをホストします。テストを実行し、複数のエージェント候補を直接比較するために必要な評価アーティファクトとハーネス コンポーネントが表示されます。このプロジェクトはベースライン評価スイートの足場を構築し、開発者はルーブリックを特定のドメインに合わせて調整し、テストを再実行し、さまざまな制約の下でエージェントの動作がどのように変化するかを観察できます。…

Microsoft、エンタープライズ AI エージェントのベンチマークを行うエージェント相互運用スターター キットの評価をオープンソース化

1772194199
2026-02-27 08:00:00

マイクロソフトが導入した エージェント相互運用性の評価は、開発者や組織が現実的なデジタル作業シナリオ全体で AI エージェントがどのように相互運用できるかを評価できるように設計されたオープンソースのスターター キットです。このキットは、厳選されたシナリオ、代表的なデータセット、およびチームが電子メール、カレンダー、ドキュメント、コラボレーション ツールなどのサーフェス全体でエージェントに対して実行できる評価ハーネスを提供します。この取り組みは、エージェント AI システムがエンタープライズ ワークフローに移行する際の、体系的かつ再現可能な評価への業界の移行を反映しています。

大規模な言語モデルを活用した自律エージェントを構築する企業は、従来のテスト手法では対処できない新たな課題に直面しています。エージェントは確率的に動作し、アプリケーションと深く統合し、ツール間で調整するため、現実世界のパフォーマンスを理解するには、分離された精度メトリクスでは不十分です。エージェントの評価 重要な学問として浮上してきた AI 開発、特にエージェントがビジネス プロセス、コンプライアンス、安全性に影響を与える可能性がある企業環境で。最新の評価フレームワークは、最終結果だけでなく、行動パターン、状況認識、および複数ステップのタスクの回復力を測定するよう努めています。

Agent Interop スターター キットの Evals チームに反復可能で透明性のある評価ベースラインを提供することを目的としています。テンプレート化された宣言的な評価仕様が付属しています (JSON ファイルの形式で) と、一貫性や有用性などの品質に関する調整済みの AI 判定評価とともに、スキーマの遵守やツール呼び出しの正しさなどのシグナルを測定するハーネスです。このキットは当初、電子メールとカレンダーのやり取りを伴うシナリオに焦点を当てていましたが、より豊富な採点機能、追加の審査員オプション、およびより広範なエージェント ワークフローのサポートによって拡張される予定です。

Microsoft は、さまざまなスタックやモデル バリアントを使用して構築された「ストローマン」エージェント間の比較洞察を提供するために、スターター キットにリーダーボードの概念も含めています。これにより、組織は相対的なパフォーマンスを視覚化し、障害モードを早期に特定し、広範囲に展開する前に候補エージェントについてより多くの情報に基づいた意思決定を行うことができます。

GitHub リポジトリ オープンソース ライセンスに基づいてスターター コードをホストします。テストを実行し、複数のエージェント候補を直接比較するために必要な評価アーティファクトとハーネス コンポーネントが表示されます。このプロジェクトはベースライン評価スイートの足場を構築し、開発者はルーブリックを特定のドメインに合わせて調整し、テストを再実行し、さまざまな制約の下でエージェントの動作がどのように変化するかを観察できます。

まず開発者は、Evals for Agent Interop リポジトリのクローンを作成し、含まれている評価シナリオを実行してエージェントのベースラインを設定し、ワークフローを反映するようにルーブリックとテストをカスタマイズします。このキットは 3 つのイメージの Docker 構成セットとしてデプロイされるため、開発者はローカルで簡単に実行できます。

#Microsoftエンタープライズ #エージェントのベンチマークを行うエージェント相互運用スターター #キットの評価をオープンソース化

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。