日本語版
最新ニュース
世界

AI エージェントのデモと現実世界の展開を分ける 3 つの規律

AI エージェントをデモだけでなく本番環境でも確実に実行させることは、企業が予想していたよりも難しいことが判明しています。断片化されたデータ、不明確なワークフロー、暴走するエスカレーション速度により、業界全体の導入が遅れています。グレイハウンド・リサーチの首席アナリスト、サンチット・ヴィル・ゴジア氏は「技術自体は実証実験でうまく機能することが多い」と語った。 「現実の組織の複雑さの中で活動することが求められるとき、その挑戦は始まります。」 Creatio でエージェントの展開を監督する Burley Kawasaki とそのチームは、3 つの分野を中心に構築された方法論を開発しました。データ レイクの遅延を回避するためのデータ仮想化。管理レイヤーとしてのエージェント ダッシュボードと KPI。高度な自律性を実現するための、厳密に境界付けられたユースケース ループ。より単純なユースケースでは、これらの実践により、エージェントが最大 80 ~ 90% のタスクを自分で処理できるようになったと、Kawasaki 氏は述べています。さらに調整を加えれば、より複雑な展開であっても、ユースケースの少なくとも半分で自律的な解決をサポートできる可能性があると同氏は推定しています。「人々は概念実証で多くの実験を行っており、多くのテストを世に送り出しています」と川崎氏は VentureBeat に語った。 「しかし、2026 年の今、私たちは業務の効率化や収益の増加を促進するミッションクリティカルなワークフローに焦点を当て始めています。」エージェントが本番環境で失敗し続ける理由企業は、何らかの形でエージェント AI を導入することに熱心ですが、多くの場合、現実世界の具体的なユースケースを特定する前に、取り残されることを恐れているためです。しかし、データ アーキテクチャ、統合、監視、セキュリティ、ワークフロー設計に関して重大なボトルネックに遭遇しています。 最初の障害はほとんどの場合、データに関連しているとゴジア氏は言います。企業情報がきちんとした、または統一された形式で存在することはほとんどありません。 SaaS プラットフォーム、アプリ、内部データベース、その他のデータ ストア全体に分散されています。構造化されているものもあれば、構造化されていないものもあります。 しかし、企業がデータ検索の問題を克服したとしても、統合は大きな課題です。エージェントは API と自動化フックに依存してアプリケーションと対話しますが、多くのエンタープライズ システムは、この種の自律的な対話が現実になるずっと前に設計されていたと Gogia 氏は指摘します。 これにより、API が不完全または一貫性のないものになる可能性があり、プログラムでアクセスするとシステムが予期せぬ応答をする可能性があります。ゴジア氏によると、組織は、正式に定義されていないプロセスを自動化しようとすると障害に遭遇するという。 「多くのビジネスワークフローは暗黙知に依存しています」と彼は言いました。つまり、従業員は明示的な指示がなくても、以前に発生した例外を解決する方法を知っています。しかし、ワークフローが自動化ロジックに変換されると、それらの欠落しているルールや指示が驚くほど明らかになります。チューニングループCreatio…

AI エージェントのデモと現実世界の展開を分ける 3 つの規律

1774379526
2026-03-24 16:00:00

AI エージェントをデモだけでなく本番環境でも確実に実行させることは、企業が予想していたよりも難しいことが判明しています。断片化されたデータ、不明確なワークフロー、暴走するエスカレーション速度により、業界全体の導入が遅れています。

グレイハウンド・リサーチの首席アナリスト、サンチット・ヴィル・ゴジア氏は「技術自体は実証実験でうまく機能することが多い」と語った。 「現実の組織の複雑さの中で活動することが求められるとき、その挑戦は始まります。」

Creatio でエージェントの展開を監督する Burley Kawasaki とそのチームは、3 つの分野を中心に構築された方法論を開発しました。データ レイクの遅延を回避するためのデータ仮想化。管理レイヤーとしてのエージェント ダッシュボードと KPI。高度な自律性を実現するための、厳密に境界付けられたユースケース ループ。

より単純なユースケースでは、これらの実践により、エージェントが最大 80 ~ 90% のタスクを自分で処理できるようになったと、Kawasaki 氏は述べています。さらに調整を加えれば、より複雑な展開であっても、ユースケースの少なくとも半分で自律的な解決をサポートできる可能性があると同氏は推定しています。

「人々は概念実証で多くの実験を行っており、多くのテストを世に送り出しています」と川崎氏は VentureBeat に語った。 「しかし、2026 年の今、私たちは業務の効率化や収益の増加を促進するミッションクリティカルなワークフローに焦点を当て始めています。」

エージェントが本番環境で失敗し続ける理由

企業は、何らかの形でエージェント AI を導入することに熱心ですが、多くの場合、現実世界の具体的なユースケースを特定する前に、取り残されることを恐れているためです。しかし、データ アーキテクチャ、統合、監視、セキュリティ、ワークフロー設計に関して重大なボトルネックに遭遇しています。

最初の障害はほとんどの場合、データに関連しているとゴジア氏は言います。企業情報がきちんとした、または統一された形式で存在することはほとんどありません。 SaaS プラットフォーム、アプリ、内部データベース、その他のデータ ストア全体に分散されています。構造化されているものもあれば、構造化されていないものもあります。

しかし、企業がデータ検索の問題を克服したとしても、統合は大きな課題です。エージェントは API と自動化フックに依存してアプリケーションと対話しますが、多くのエンタープライズ システムは、この種の自律的な対話が現実になるずっと前に設計されていたと Gogia 氏は指摘します。

これにより、API が不完全または一貫性のないものになる可能性があり、プログラムでアクセスするとシステムが予期せぬ応答をする可能性があります。ゴジア氏によると、組織は、正式に定義されていないプロセスを自動化しようとすると障害に遭遇するという。

「多くのビジネスワークフローは暗黙知に依存しています」と彼は言いました。つまり、従業員は明示的な指示がなくても、以前に発生した例外を解決する方法を知っています。しかし、ワークフローが自動化ロジックに変換されると、それらの欠落しているルールや指示が驚くほど明らかになります。

チューニングループ

Creatio は「明確なガードレールを備えた限定された範囲」にエージェントを展開し、その後に「明示的な」調整と検証フェーズが続くと川崎氏は説明しました。チームは最初の結果をレビューし、必要に応じて調整し、許容可能なレベルの精度に達するまで再テストします。

通常、このループは次のパターンに従います。

  • 設計時のチューニング (稼働前): 迅速なエンジニアリング、コンテキストのラッピング、役割の定義、ワークフローの設計、データとドキュメントの基礎を通じて、パフォーマンスが向上します。

  • 人間参加型の修正 (実行中): 開発者は例外を承認、編集、解決します。人間が最も介入する必要があるインスタンス (エスカレーションまたは承認) では、ユーザーはより強力なルールを確立し、より多くのコンテキストを提供し、ワークフローのステップを更新します。さもなければ、ツールへのアクセスが狭まってしまいます。

  • 継続的な最適化 (本番稼働後): 開発者は引き続き例外率と結果を監視し、必要に応じて繰り返し調整することで、時間の経過とともに精度と自律性を向上させることができます。

Kawasaki のチームは、エンタープライズ ナレッジ ベース、CRM データ、その他の独自ソースの地上エージェントに検索拡張生成を適用しています。

エージェントが実際に導入されると、パフォーマンス分析、コンバージョンに関する洞察、および監査可能性を提供するダッシュボードで監視されます。基本的に、エージェントはデジタル ワーカーと同様に扱われます。ダッシュボードと KPI を備えた独自の管理レイヤーがあります。

たとえば、オンボーディング エージェントは、エージェントの監視とテレメトリを提供する標準のダッシュボード インターフェイスとして組み込まれます。これは、オーケストレーション、ガバナンス、セキュリティ、ワークフロー実行、モニタリング、UI埋め込みなどのプラットフォーム層の一部であり、「LLMの上」に位置すると川崎氏は述べた。

ユーザーは、使用中のエージェントとその各プロセス、ワークフロー、実行結果のダッシュボードを確認できます。個々のレコード (紹介や更新など) を「ドリルダウン」して、段階的な実行ログと関連する通信を表示して、トレーサビリティ、デバッグ、エージェントの調整をサポートできます。最も一般的な調整には、ロジックとインセンティブ、ビジネス ルール、プロンプト コンテキスト、ツール アクセスが含まれると川崎氏は述べています。

導入後に発生する最大の問題:

  • 例外処理量が多くなる場合があります。 エッジケースの初期のスパイクは、ガードレールとワークフローが調整されるまで頻繁に発生します。

  • データの品質と完全性: フィールドやドキュメントが欠落していたり、一貫性がなかったりすると、エスカレーションが発生する可能性があります。チームは、どのデータを優先してグラウンディングするか、どのチェックを自動化するかを特定できます。

  • 監査可能性と信頼性: 特に規制対象の顧客は、明確なログ、承認、ロールベースのアクセス制御 (RBAC)、および監査証跡を必要とします。

「私たちは、エージェントのトレーニングに時間を割り当てる必要があると常に説明しています」と Creatio の CEO、キャサリン・コステレバ氏は VentureBeat に語った。 「エージェントのスイッチを入れてもすぐに問題が起こるわけではありません。完全に理解するには時間がかかります。そうすれば間違いの数は減ります。」

「データの準備」は必ずしも全面的な見直しを必要とするわけではありません

エージェントの導入を検討するとき、「データの準備はできていますか?」という質問が初期段階でよく聞かれます。企業はデータ アクセスが重要であることを認識していますが、大規模なデータ統合プロジェクトによって無効になる可能性があります。

ただし、仮想接続を使用すると、エージェントが基盤となるシステムにアクセスし、典型的なデータ レイク/レイクハウス/ウェアハウスの遅延を回避できるようになります。 Kawasaki のチームはデータと統合するプラットフォームを構築し、現在、データを仮想オブジェクトに取り込んで処理し、UI やワークフローの標準オブジェクトのように使用するアプローチに取り組んでいます。こうすることで、データベース内に大量のデータを「保存または複製」する必要がなくなります。

この技術は、取引量が大きすぎて CRM にコピーできない銀行業務などの分野では役立ちますが、「AI 分析やトリガーとしては依然として価値があります」と川崎氏は述べています。

統合と仮想オブジェクトが確立されると、チームはデータの完全性、一貫性、可用性を評価し、摩擦の少ない開始点 (ドキュメントの多いワークフローや構造化されていないワークフローなど) を特定できます。

川崎氏は、「基礎となるシステムのデータを実際に使用することの重要性を強調しました。データは実際には最もクリーンであり、真実の情報源となる傾向があります。」

エージェントと仕事のマッチング

自律型(または自律型に近い)エージェントに最適なのは、「明確な構造と制御可能なリスク」を備えた大量のワークフローであると川崎氏は述べた。たとえば、オンボーディングやローンの準備における文書の取り込みと検証、または更新や紹介などの標準化されたアウトリーチなどです。

「特に、それらを業界内の非常に特殊なプロセスにリンクできた場合、そこで実際に確実な ROI を測定し、実現できるのです」と彼は言いました。

たとえば、金融機関は本質的にサイロ化されていることがよくあります。商業融資チームは独自の環境で実行し、資産管理は別の環境で実行します。しかし、自律エージェントは、部門全体や個別のデータ ストアを調べて、たとえば、資産管理やアドバイス サービスの適切な候補となる可能性のある商業顧客を特定できます。

「明らかなチャンスだと思うかもしれないが、サイロ全体に目を向けている人は誰もいない」と川崎氏は語った。まさにこのシナリオにエージェントを適用した一部の銀行は「数百万ドルの収益増加の恩恵」を享受していると同氏は特定の金融機関の名前は挙げなかったが主張した。

ただし、他のケース、特に規制された業界では、より長いコンテキストのエージェントが望ましいだけでなく、必要です。たとえば、システム全体での証拠の収集、要約、比較、コミュニケーションの草稿、監査可能な根拠の作成などの複数のステップからなるタスクです。

「代理人はすぐには返事をしてくれません」と川崎氏は語った。 「エンドツーエンドのタスクを完全に完了するには、数時間、数日かかる場合があります。」

これには、「単一の巨大なプロンプト」ではなく、組織化されたエージェントの実行が必要であると同氏は述べた。このアプローチでは、作業をサブエージェントが実行する決定的なステップに分割します。メモリとコンテキストの管理は、さまざまなステップと時間間隔にわたって維持できます。 RAG によるグラウンディングは、出力を承認されたソースに結び付けるのに役立ち、ユーザーはファイル共有やその他のドキュメント リポジトリへの拡張を指示できます。

このモデルは通常、カスタムの再トレーニングや新しい基礎モデルを必要としません。企業がどのモデル(GPT、Claude、Gemini)を使用していても、プロンプト、ロール定義、制御されたツール、ワークフロー、データグラウンディングを通じてパフォーマンスが向上すると川崎氏は述べた。

フィードバックループでは中間チェックポイントが「特に重視される」と同氏は述べた。人間は中間成果物 (要約、抽出された事実、推奨事項の草案など) をレビューし、エラーを修正します。これらは、より優れたルールと取得ソース、より狭いツール範囲、および改善されたテンプレートに変換できます。

「このスタイルの自律エージェントにとって重要なのは、AI の動的な推論と、真のオーケストレーションの制御とパワーという、両方の長所を組み合わせることです」と川崎氏は述べています。

最終的に、エージェントにはエンタープライズ アーキテクチャ全体にわたる調整された変更、新しいオーケストレーション フレームワーク、および明示的なアクセス制御が必要になると Gogia 氏は述べています。エージェントの権限を制限し、範囲内に保つには、エージェントに ID を割り当てる必要があります。可観測性は重要です。監視ツールは、タスクの完了率、エスカレーション イベント、システム インタラクション、エラー パターンを記録できます。この種の評価は永続的に実施する必要があり、エージェントは新しいシナリオや異常な入力に遭遇したときにどのように反応するかをテストする必要があります。

「AI システムが行動を開始できるようになった瞬間、企業は副操縦士の導入中にめったに現れないいくつかの質問に答える必要があります」とゴジア氏は述べています。例: エージェントはどのシステムへのアクセスを許可されていますか?承認なしでどのような種類のアクションを実行できますか?常に人間の決定を必要とするアクティビティはどれですか?すべてのアクションはどのように記録され、レビューされるのでしょうか?

“それらの [enterprises] この課題を過小評価している人々は、見た目は印象的でも、実際の運用の複雑さに耐えることができないデモンストレーションに行き詰まっていることがよくあります」とゴジア氏は述べた。

#エージェントのデモと現実世界の展開を分ける #つの規律

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。