日本語版
最新ニュース
世界

研究者らは「ダンジョンズ アンド ドラゴンズ」を使用して不慣れなタスクにおける AI エージェントのパフォーマンスを向上させました

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。もっと詳しく知る AI エージェントの導入に関心のある組織は、特に機械的と感じることが多いワークフローにおいて、最初に AI エージェントを微調整する必要があります。組織によっては、1 つのワークフローで 1 種類のタスクのみを実行するエージェントを必要とする場合もありますが、場合によっては、エージェントが適応できるように新しい環境に導入する必要がある場合もあります。 の研究者 北京郵電大学 新しいメソッドである AgentRefine を発表しました。エージェントに自己修正を教え、より一般化された適応性のある AI エージェントにつながります。 研究者らは、現在の調整方法では、エージェントがトレーニング データセットと同じタスク、つまり「保持された」タスクに制限されており、「保持された」、つまり新しい環境ではそれほどパフォーマンスが良くないと述べています。これらのフレームワークでトレーニングされたエージェントは、トレーニング データを通じて示されたルールにのみ従うだけでは、間違いから「学習」することが困難になり、一般的なエージェントになって新しいワークフローに組み込むことができなくなります。 この制限に対処するために、AgentRefine は、モデルが間違いから学習して新しいワークフローに適合できるようにする、より一般化されたエージェント トレーニング データセットを作成することを目指しています。 新しい論文で、研究者らは、AgentRefineの目標は「一般化されたエージェント調整データを開発し、エージェントの一般化と自己洗練の間の相関関係を確立すること」であると述べた。エージェントが自己修正する場合、学習したエラーが永続化し、同じ間違いが展開されている他の環境に持ち込まれることはありません。 「自己洗練データに基づいてエージェントを調整することで、悪い状況に対処しながらエージェントがより実行可能なアクションを探索できるようになり、その結果、新しいエージェント環境への一般化が向上することがわかりました」と研究者らは書いています。 D&D からインスピレーションを得た AI エージェント トレーニング テーブルトーク ロールプレイング ゲームからヒントを得て ダンジョンズ&ドラゴンズ、 研究者たちは、ペルソナ、エージェントが従うためのスクリプト、および課題を作成しました。そしてはい、ダンジョンマスター(DM)があります。 彼らは、AgentRefine のデータ構築を、スクリプト生成、トラジェクトリ生成、および検証の…

研究者らは「ダンジョンズ アンド ドラゴンズ」を使用して不慣れなタスクにおける AI エージェントのパフォーマンスを向上させました

1736547701
2025-01-10 21:51:00

日次および週次のニュースレターに参加して、最新の更新情報や業界をリードする AI に関する独占コンテンツを入手してください。もっと詳しく知る

AI エージェントの導入に関心のある組織は、特に機械的と感じることが多いワークフローにおいて、最初に AI エージェントを微調整する必要があります。組織によっては、1 つのワークフローで 1 種類のタスクのみを実行するエージェントを必要とする場合もありますが、場合によっては、エージェントが適応できるように新しい環境に導入する必要がある場合もあります。

の研究者 北京郵電大学 新しいメソッドである AgentRefine を発表しました。エージェントに自己修正を教え、より一般化された適応性のある AI エージェントにつながります。

研究者らは、現在の調整方法では、エージェントがトレーニング データセットと同じタスク、つまり「保持された」タスクに制限されており、「保持された」、つまり新しい環境ではそれほどパフォーマンスが良くないと述べています。これらのフレームワークでトレーニングされたエージェントは、トレーニング データを通じて示されたルールにのみ従うだけでは、間違いから「学習」することが困難になり、一般的なエージェントになって新しいワークフローに組み込むことができなくなります。

この制限に対処するために、AgentRefine は、モデルが間違いから学習して新しいワークフローに適合できるようにする、より一般化されたエージェント トレーニング データセットを作成することを目指しています。 新しい論文で、研究者らは、AgentRefineの目標は「一般化されたエージェント調整データを開発し、エージェントの一般化と自己洗練の間の相関関係を確立すること」であると述べた。エージェントが自己修正する場合、学習したエラーが永続化し、同じ間違いが展開されている他の環境に持ち込まれることはありません。

「自己洗練データに基づいてエージェントを調整することで、悪い状況に対処しながらエージェントがより実行可能なアクションを探索できるようになり、その結果、新しいエージェント環境への一般化が向上することがわかりました」と研究者らは書いています。

D&D からインスピレーションを得た AI エージェント トレーニング

テーブルトーク ロールプレイング ゲームからヒントを得て ダンジョンズ&ドラゴンズ、 研究者たちは、ペルソナ、エージェントが従うためのスクリプト、および課題を作成しました。そしてはい、ダンジョンマスター(DM)があります。

彼らは、AgentRefine のデータ構築を、スクリプト生成、トラジェクトリ生成、および検証の 3 つの領域に分割しました。

スクリプト生成では、モデルは、環境、タスク、ペルソナが実行できるアクションに関する情報を含むスクリプト、つまりガイドを作成します。 (研究者らは、Llama-3-8B-Instruct、Llama-3-70B-Instruct、Mistral-7B-Instruct-v0.3、GPT-4o-mini、および GPT-4o を使用して AgentRefine をテストしました)

次にモデルは、エラーを含むエージェント データを生成し、軌道段階で DM とプレーヤーの両方として機能します。実行できるアクションを評価し、それらにエラーが含まれているかどうかを確認します。最後の段階である検証では、スクリプトと軌道をチェックし、トレーニングされたエージェントが自己修正できるようにします。

より優れた、より多様なタスク能力

研究者らは、AgentRefine メソッドとデータセットを使用してトレーニングされたエージェントが、さまざまなタスクでより優れたパフォーマンスを発揮し、新しいシナリオに適応していることを発見しました。これらのエージェントは、エラーを回避するためにアクションと意思決定をリダイレクトするために自己修正を増やし、そのプロセスにおいてより堅牢になります。

特に、AgentRefine は、保留されたタスクを処理するためにすべてのモデルのパフォーマンスを向上させました。

企業は、エージェントがより優れた意思決定者になるために、エージェントが学んだことだけを繰り返すことがないよう、タスクへの適応性を高める必要があります。オーケストレーション エージェントは、複数のエージェントの「トラフィックを直接管理」するだけでなく、ユーザーのリクエストに基づいてエージェントがタスクを完了したかどうかを判断します。

OpenAIの o3 は、タスクの適応性を向上させる「プログラム合成」を提供します。他のオーケストレーションおよびトレーニング フレームワーク (Magentic-One など) マイクロソフト、タスクを別のエージェントに移動するタイミングをスーパーバイザ エージェントが学習するためのアクションを設定します。

VB Daily を使用したビジネス ユースケースに関する毎日の洞察

上司に好印象を与えたい場合は、VB Daily がサポートします。規制の変更から実際の導入に至るまで、企業が生成 AI で何を行っているかに関する内部情報を提供します。これにより、ROI を最大化するための洞察を共有できます。

ご購読いただきありがとうございます。その他の VB ニュースレターはこちらからご覧ください。

エラーが発生しました。

#研究者らはダンジョンズ #アンド #ドラゴンズを使用して不慣れなタスクにおける #エージェントのパフォーマンスを向上させました

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。