1749958171
2025-06-15 02:17:00
ジョー・ニーダムと他の4人の著者によって、大手言語モデルというタイトルのペーパーのPDFを見る
抽象的な:AIモデルが評価されているときに検出できる場合、評価の有効性が損なわれる可能性があります。たとえば、モデルは評価中に体系的に異なる動作を持つ可能性があり、展開およびガバナンスの決定のための信頼性の低いベンチマークにつながります。フロンティア言語モデルが評価または実際の展開に起因するかどうかに基づいて、転写産物を正確に分類できるかどうかを調査します。これは、評価意識と呼ばれる機能です。これを達成するために、61個の異なるデータセットから1,000個のプロンプトと転写産物の多様なベンチマークを構築します。これらのパブリックベンチマーク(MMLU、Swebenchなど)、実際の展開インタラクション、および足場フレームワーク(例、Webブラウジングエージェントなど)からのエージェントの軌跡。フロンティアモデルは、ランダム上の評価意識を明確に示しています(Gemini-2.5-Proは0.83ドルのAUCに達します)が、単純な人間のベースライン(AUC $ 0.92 $)をまだ上回っていません。さらに、AIモデルと人間の両方が、チャット設定と比較して、エージェント設定での評価を特定するのに優れています。さらに、モデルが評価の目的を特定できるかどうかをテストします。複数の選択と自由回答形式の質問の下で、AIモデルは、評価がテストしているものを特定する際に、ランダムなチャンスをはるかに上回ります。我々の結果は、フロンティアモデルがすでに実質的な、まだ超人的ではないレベルの評価認識を示していることを示しています。将来のモデルでこの機能を追跡することをお勧めします。
提出履歴
From:Joe Needham [view email]
[v1]
水曜日、2025年5月28日12:03:09 UTC(1,081 kb)
[v2]
金曜日、2025年6月6日19:01:36 UTC(1.081 kb)
#大規模な言語モデルはそれらがいつ評価されているかをよく知っています