翻訳は機械翻訳ツールによって提供されます。翻訳の内容とオリジナルの英語版の内容に矛盾がある場合は、英語版が優先されます。
このワークフローは、1 つの LLM が結果を生成し、別の LLM がその結果を評価または批評するフィードバック ループを提供します。これにより、内省、最適化、反復的な改善が促進されます。
評価ワークフローは、結果の品質、精度、調整が重要であり、シングルパス生成が信頼性が低いか不十分であるシナリオに最適です。このワークフローは、エージェントがより高い精度基準を満たすため、またはフィードバックに基づいて改善された代替案を検討するために、結果を自己批判し、反復し、改良する必要がある場合に優れています。
このワークフローは、次の場合に特に効果的です。
-
結果には、主観的な品質基準 (スタイル、トーン、読みやすさなど) または客観的な基準 (正確さ、セキュリティ、パフォーマンスなど) が含まれます。
-
エージェントは、目標を達成するために、妥協したり、制約を評価したり、最適化したりして推論する必要があります。
-
特に規制された領域、顧客対応領域、または創造的な領域では、組み込みの冗長性と品質保証が必要です。
-
人間によるレビューは費用がかかるか利用できないため、自律的な検証が望まれます。
このワークフローは、コンテンツの生成、コードの要約とレビュー、ポリシーの適用、調整チェック、命令の調整、RAG 後処理に使用されます。また、自己改善エージェントにとっても役立ちます。継続的なフィードバックにより、時間の経過とともにより良い応答を形成し、信頼性の高い自律的な意思決定ループを作成できます。
一般的な使用例
-
レッドチームエージェントとブルーチームエージェントの比較
-
コードまたは計画を生成、評価、レビューするエージェント
-
品質保証、幻覚検出、スタイルの強制
特徴
-
異なるモデルを使用した分離された生成と評価をサポート (例: 生成にはクロード、評価にはミストラル)
-
フィードバックは構造化され、結果の修正を要求するために使用されます
-
複数の反復または収束しきい値をサポート
#レビュー担当者のワークフローと反射的改善ループ