大規模な言語モデル(LLM)は生成できます もっともらしい 彼らがどのように質問に対する答えに到達したかの説明。ただし、これらの説明は、モデルの「推論」プロセスを誤って伝えることができます。 不誠実。これは、順番に、ストラストと誤用につながる可能性があります。 LLMの説明の忠実さを測定するための新しいアプローチを紹介します。まず、忠実さの厳密な定義を提供します。 LLMの説明は人間の説明を模倣しているため、しばしば高レベルを参照してください 概念 モデルに影響を与えたとされる入力質問で。 LLMの概念のセット間の違いの観点から忠実さを定義します 説明は意味します 影響力があり、セットです 本当に は。第二に、次のことに基づいた忠実さを推定するための新しい方法を提示します。(1)補助LLMを使用してモデル入力内の概念の値を変更して現実的な反事実を作成し、(2)階層的なベイジアンモデルを使用して因果効果を定量化する例とデータセットレベルの両方での概念の。私たちの実験は、私たちの方法を使用して、不誠実さの解釈可能なパターンを定量化して発見できることを示しています。社会的バイアスタスクでは、LLMの説明が社会的偏見の影響を隠している場合を明らかにします。医学的質問に答えるタスクでは、どの証拠がその決定に影響を与えたかについてLLMが虚偽の主張を提供する場合を明らかにします。
新しいタブで開きます
#話をする大規模な言語モデルの説明の忠実さの測定