1770237238
2026-02-04 20:26:00
研究者たちは、大規模な言語モデルの自動プロンプト最適化という課題に取り組んでいます。この分野では、現在の手法ではラベル付きデータが必要になることがよくあります。 MAIS、CASIA、UCASのSiran Peng氏、IIE、CAS、UCASのWeisong Zhao氏、Tianyu Fu氏ら。 UPA (教師なしプロンプト エージェント) を導入します。これは、教師付きフィードバックなしでプロンプトをナビゲートして選択します。この革新的なアプローチは、言語モデルからの比較によってガイドされるツリーベースの検索を利用し、ブラッドリー-テリー-ルース モデルに基づく新しい 2 段階のフレームワークを介して最終選択から探索を分離します。この研究は、複数のタスクにわたって既存の手法に対する一貫した改善を実証し、人間の指導がまったくない状態で運用している場合でも、エージェント スタイルの最適化がうまく機能することを証明しています。
この研究は、実際のアプリケーションでは一般的な制限である、監視された報酬信号に依存せずにプロンプトを改良するという課題に取り組んでいます。
チームは、プロンプトの改良を構造化されたプロンプト空間内の一連の意思決定プロセスとして枠組み化し、高度な計画アルゴリズムの使用を可能にすることでこれを達成しました。 UPA は、LLM から直接得られたきめ細かい、順序不変のペアごとの比較を利用して、教師ありフィードバックなしで構造化された検索と選択を独自に実現します。
具体的には、この研究では、UPA がプロンプト空間をナビゲートするために、各ノードが候補プロンプトを表し、エッジが改良ステップを表す、進化するツリー構造をどのように反復的に構築するかを詳しく説明しています。絶対的な報酬計算の代わりに、エージェントはジャッジ LLM を使用して、サンプリングされた入力全体のパフォーマンスに基づいてプロンプト間の相対的な好みの評価を実行します。
研究者らは、局所的な比較には一貫した地球規模のスケールが欠けていることを認識し、系統的な即時探索を最終選択から切り離し、ブラッドリー・テリー・ルース(BTL)モデルに基づいた新しい2段階のフレームワークを導入した。この革新的なアプローチでは、まずパスワイズ ベイジアン手法を使用してローカル比較を集計し、不確実性の下で候補をフィルタリングします。次に、グローバル トーナメント スタイルの比較を行って、潜在的なプロンプトの品質を推測し、最適なプロンプトを特定します。
複数のタスクにわたって実施された実験により、UPA が既存のプロンプト最適化手法よりも一貫して優れたパフォーマンスを発揮することが実証されました。この画期的な進歩により、エージェント スタイルの最適化は完全に監視されていない設定でも引き続き非常に効果的であることが明らかになり、迅速なエンジニアリングに新たな道が開かれます。この研究は、迅速な改良のための堅牢な方法論を確立し、ラベル付きデータやタスク固有のメトリクスが利用できないシナリオに実用的なソリューションを提供します。検索中、UPA はプロンプト空間をナビゲートするための進化するツリー構造を繰り返し構築します。各ノードは候補プロンプトを表し、エッジは最適化大規模言語モデル (LLM) によって実行される絞り込みステップを表します。
これにより、複数のリファインメント軌跡の並行探索が可能になります。この研究では、ジャッジ LLM を利用して、子プロンプトと親プロンプトの間で順序不変のきめ細かいペアごとの比較を実施し、サンプリングされた入力のパフォーマンスを評価して相対的な好みを確立しました。これらのローカルな比較には一貫した地球規模のスケールが欠けていることを認識し、研究者らは系統的な即時探索を最終選択から切り離し、ブラッドリー・テリー・ルース(BTL)モデルに基づいた 2 段階のフレームワークを実装しました。
最初は、ローカル比較のパスごとのベイジアン集計によって候補がフィルタリングされ、不確実性が考慮されます。その後、グローバル トーナメント スタイルの比較によって潜在的なプロンプトの品質が推測され、最終的に最適なプロンプトが特定されます。実験では複数のタスクを使用して、既存のプロンプト最適化手法を上回る UPA の一貫したパフォーマンスを実証し、完全に監視されていない設定でもエージェント スタイルの最適化が依然として効果的であることを証明しました。
多様な推論と事実検証のベンチマークにわたる UPA のパフォーマンスは引き続き優れています
科学者は、新しい教師なしプロンプト エージェントである UPA を使用して GPQA ベンチマークで 52.1% の精度を達成し、大幅なパフォーマンスの向上を実証しました。複数のタスクにわたる実験により、完全に監視されていない設定であっても、UPA が既存のプロンプト最適化手法よりも一貫して優れたパフォーマンスを発揮することが明らかになりました。チームは AGIEval-MATH でパフォーマンスを測定し、45.5% の精度を記録し、LIAR では 68.2% の精度を達成しました。
結果は、UPA の 2 段階のフレームワークが、体系的な即時探索を最終的な選択から効果的に切り離していることを示しています。ステージ I ではパスワイズ ベイジアン フィルタリングを採用し、パラメータ αv,u = α0 + wv,u および βv,u = β0 + lv,u を使用したベータ分布として勝利確率をモデル化しました。ここで、α0 と β0 は 1 に設定されています。
品質増加の平均μ∆ v,u は、Digamma 関数と Polygamma 関数、具体的には μ∆ v,u = ψ(αv,u) −ψ(βv,u) を使用して計算されました。経路ごとの事後平均は線形に集計され、リスク回避パラメーター λunc を含む下限信頼限界 (LCB) を使用して不確実性が考慮されました。テストでは、サンプリング予算が増加するにつれて経路ごとの分散 σ2 v が減少し、真のグローバル品質を中心にランキングが集中することが証明されています。
ステージ II では、ブラッドリー-テリー-ルース (BTL) モデルに基づくグローバル トーナメント スタイルの比較を利用し、マイナー化-最大化 (MM) アルゴリズムを使用して BTL 対数尤度を最大化しました。反復 t における品質パラメータ γi の更新規則は、γ(t+1) i = P j=i Wi,j P j=i Ni,j γ
測定により、UPA が全体で 69.3% の精度を達成し、SPO ベースラインで達成された 66.3% および PromptAgent で達成された 65.0% を上回っていることが確認されました。 |Qsel| を含む独立した選択セット Qsel |Qsim| は、最終的な選択プロセス中に確実な品質推定を保証するために使用されました。このエージェントは構造化された検索プロセスを利用し、言語モデル自体によって生成されたペアごとの比較に基づいて、プロンプト空間をナビゲートするための進化するツリーを構築します。
このシステムは、Bradley-Terry-Luce モデルに基づく 2 段階のフレームワークを採用して、探索を最終選択から切り離し、比較を集約して高品質のプロンプトを特定します。いくつかのタスクにわたる実験により、既存のプロンプト最適化手法に対する UPA の一貫した優位性が実証されました。
これは、監視付きフィードバックが利用できない場合でもエージェントベースの最適化戦略が効果を維持できることを示しており、そのようなフィードバックの取得が非現実的またはコストがかかるシナリオに貴重なアプローチを提供します。著者らは、UPA のパフォーマンスがハイパーパラメータの影響を受けることを認めており、ハイパーパラメータはパフォーマンスと計算効率のバランスを取るために分類されています。将来の研究では、より複雑なタスクへの UPA の適用を調査し、フレームワークをさまざまな言語モデル アーキテクチャに適応させる可能性を調査する可能性があります。
#教師なしプロンプトエージェントがペアごとの比較を示し構造化された検索と選択を促進