1744684858
2025-04-14 21:50:00
私たちが子供の頃から成熟するにつれて、私たちの語彙とそれを使用する方法は成長し、私たちの経験はより豊かになり、特異性と意図で他の人と考え、推論し、相互作用することができます。したがって、私たちの言葉の選択は、私たちの個人的な価値、倫理、文化的規範、見解と一致するように進化します。時間が経つにつれて、私たちのほとんどは、会話の背後にあるコンテキストを学ぶことを可能にする内部の「ガイド」を開発します。また、有害または不適切な情報や感情を共有することから私たちを遠ざけることがよくあります。結局のところ、大規模なパブリックデータセットでトレーニングされているため、多くの場合バイアスと有毒な言語が焼かれている大規模な言語モデル(LLMS)は、独自の言語を緩和するために同様の能力を獲得できます。
MIT、MIT-IBM Watson AI Lab、およびIBM Researchの新しい方法は、自己規律の自己回帰サンプリング(SASA)と呼ばれるため、流encyさを犠牲にすることなく、LLMが独自の出力を解毒することができます。
他の解毒方法とは異なり、このデコードアルゴリズムは、モデルのパラメーター、再訓練の必要性、または外部報酬モデルを変更することなく、LLM自身の内部表現内の有毒/非毒性のサブスペースの境界を学習します。次に、推論中に、アルゴリズムは部分的に生成されたフレーズの毒性値を評価します:既に生成され、受け入れられているトークン(単語)と、分類器境界に近接するために合理的に選択できる各潜在的な新しいトークン。次に、フレーズを非毒性空間に配置する単語オプションを選択し、最終的には毒性の低い言語を生成するための高速で効率的な方法を提供します。
「既存の言語モデルでの方法を知りたかった [that]、生成プロセス中に、デコードは人間の価値の影響を受ける可能性があります。ここで採用している例は毒性です」と、研究の主著者であるチン・ユン「アイリーン」KO博士号は、ニューヨークのIBMのトーマス・J・ワトソン研究センターのMIT-IBM Watson AI Labの元卒業生であり、現在の研究科学者であると言います。
KOの共著者には、MIT電気工学およびコンピューターサイエンス局(EECS)の教授であるLuca Daniel、MIT-IBM Watson AI Labのメンバー、KOの大学院アドバイザーが含まれます。 MIT-IBM Watson AI Labおよび/またはIBM Researchの数人のメンバー – Pin-Yu Chen、Payel Das、Youssef Mroueh、Soham Dan、Georgios Kollias、Subhajit Chaudhury、Tejaswini Pedapati。作業は、学習表現に関する国際会議で発表されます。
「ガードレール」を見つける
LLMSの背後にあるトレーニングリソースには、ほとんどの場合、インターネットやその他の容易に利用可能なデータセットなどの公共スペースから収集されたコンテンツが含まれています。そのため、呪いの言葉といじめ/不快な言語はコンポーネントですが、文学作品の文脈にあるものもあります。その後、LLMは、無害なプロンプトからでさえ、不快な言葉や嫌な言葉を含むしばしば含まれる危険および/または偏ったコンテンツを本質的に生成したり、生成して生成して生成したりすることができます。さらに、多くのアプリケーションや下流のタスクにとって好ましいことや有害な言語を学習して増幅することができ、緩和または修正戦略の必要性につながることがわかっています。
公正で価値のある堅牢な言語生成を達成するには、多くの方法があります。一部の方法では、消毒されたデータセットを使用してLLM再トレーニングを使用します。これには費用がかかり、時間がかかり、LLMのパフォーマンスが変わる可能性があります。他の人は、サンプリングやビーム検索などの外部報酬モデルをデコードすると、実行に時間がかかり、より多くのメモリが必要です。 SASA、KO、ダニエル、およびIBMの研究チームの場合、LLMSの自己回帰的性質を活用し、LLMの推論中にデコードベースの戦略を使用する方法を開発し、徐々に生成を徐々に操縦します。
研究グループは、LLMの埋め込みから学習された部分空間で動作する線形分類器を構築することにより、これを達成しました。 LLMが訓練されると、同様の意味を持つ単語は、ベクトル空間に密接に配置され、さらに異なる単語から離れて配置されます。したがって、研究者は、LLMの埋め込みが文脈情報もキャプチャし、解毒に使用できると仮定しました。研究者は、プロンプトのセット(文または思考の前半)、応答(その文の完成)、および毒性または非毒性のような人間に貢献した注釈を含むデータセットを使用しました。その後、ベイズ最適分類器を適用して、正の値(非毒性空間)と負の数(有毒空間)で表される文の中のバイナリサブスペースの間にラインを学習し、比fig的に描きました。
SASAシステムは、元のサンプリング分布に近いままであることを目的として、ITの値と生成されたフレーズの距離に基づいて、最新の潜在的なトークンのサンプリング確率を再重視することで機能します。
説明するために、ユーザーが文で潜在的なトークン#12を生成している場合、LLMはその前に来た11の単語に基づいて、合理的な単語を完全に語り、Top-K、Top-Pを使用して、選択できる約10トークンをフィルター処理および生成します。次に、SASAは、分類器に近接するために部分的に完成した文でこれらの各トークンを評価します(つまり、トークン1-11の値と各潜在的なトークン12)。正の空間で文を生成するトークンは奨励され、負の空間にあるトークンは罰せられます。さらに、分類器から遠く離れているほど、影響が強くなります。
「目標は、優れたトークンの確率を再重視することにより、自己回帰サンプリングプロセスを変更することです。次のトークンがコンテキストを考慮して有毒である可能性が高い場合、毒性のあるトークンになる傾向があるサンプリング確率を減らすことになります」とKo氏は言います。研究者は、このようにすることを選択しました。
価値マッチングのための毒性を抑制します
研究者は、3つのLLMSのサイズが3つ増えたいくつかのベースライン介入に対してその方法を評価しました。すべてが変圧器であり、自動網性ベースのGPT2-Large、Llama2-7B、およびLlama 3.1-8B-Instructで、それぞれ7億6,200 万、70億、および80億パラメーターがありました。各プロンプトについて、LLMは文/フレーズを25回完成させる任務を負い、Perspectiveapiは0から1にスコアを付け、0.5を超えるものは毒性がありました。チームは2つのメトリックを検討しました。すべてのプロンプトの25世代にわたる平均最大毒性スコアと、25世代に少なくとも1つの毒性フレーズを生成する可能性がありました。流encyさの低下(したがって困惑の増加)も分析されました。 SASAは、自然に発生する英語文のプロンプトを含む、RealtoxicityPrompts(RPT)、Bold、およびAttaqデータセットを完了するためにテストされました。
研究者たちは、RPTデータセットからの無毒なプロンプトから始まり、有害な文の完了を探して、SASAによる解毒の試験の複雑さを強化しました。その後、彼らはそれをRPTからより挑戦的なプロンプトにエスカレートし、結果に関して生成する可能性が高くなり、同様にSASAを命令チューニングモデルに適用して、そのテクニックが不要なoutをさらに減らすことができるかどうかを評価しました。また、大胆なベンチマークとATTAQのベンチマークを使用して、解毒におけるSASAの一般的な適用性を調べました。大胆なデータセットを使用して、研究者はさらに言語世代の性別バイアスを探し、性別間のバランスの取れた毒性率を達成しようとしました。最後に、チームは、ランタイム、メモリの使用量、およびSASAを単語フィルタリングと組み合わせて、健康的および/または有用な言語生成を実現する方法を検討しました。
「人間が世界でどのように考え、反応するかを考えるなら、私たちは悪いことを見ているので、それは言語モデルに良いことだけを見ることを許可することではありません。それは、良い面と悪い面の両方を理解することです」とKoは言います。
全体として、SASAは、最先端の外部報酬モデル技術であるRADと同等の実行で、有毒な言語生成の大幅な削減を達成しました。しかし、より強力な解毒が流encyさの低下を伴うことが普遍的に観察されました。介入前、LLMSは、男性よりも女性のラベル付けされたプロンプトに対してより多くの毒性反応を生成しました。しかし、SASAはまた、有害な反応を大幅に削減することができ、それらをより均等にしました。同様に、SASAの上にある単語フィルタリングは毒性レベルを著しく低下させましたが、LLMがコヒーレに応答する能力も妨げました。
この作業の優れた側面は、明確に定義された制約のある最適化の問題であることです、とKOは言います。つまり、自然に聞こえるオープン言語生成と不要な言語を減らす必要性を達成して調整できることを意味します。
さらに、KOによると、SASAは将来複数の属性にうまく機能する可能性があります。「人間には複数の人間の価値があります。有毒なことは言いたくありませんが、真実で、役立ち、忠実であることも望んでいます。 SASAの軽量な方法のために、これらの状況で簡単に適用できます。「複数の値で作業したい場合は、複数のサブスペースでの世代の位置を単に確認します。計算とパラメーターの点でわずかなオーバーヘッドのみを追加します」とKOは言います。
この作業は、一部には、MIT-IBM Watson AI LabとNational Science Foundationによってサポートされていました。
#LLMSをトレーニングして言語を自己解毒する #MITニュース