1764265836
2025-11-26 05:00:00
MIT の調査によると、大規模言語モデル (LLM) は誤った教訓を学ぶことがあります。
LLM は、ドメイン知識に基づいてクエリに答えるのではなく、トレーニング中に学習した文法パターンを活用して応答できます。これにより、新しいタスクに展開するときにモデルが予期せず失敗する可能性があります。
研究者らは、モデルが特定の文パターンを特定のトピックに誤って結び付ける可能性があることを発見しました。そのため、LLM は質問を理解するのではなく、よく知られた表現を認識することによって、説得力のある答えを与える可能性があります。
彼らの実験は、最も強力な LLM であってもこの間違いを犯す可能性があることを示しました。
この欠点により、顧客からの問い合わせの処理、臨床記録の要約、財務レポートの作成などのタスクを実行する LLM の信頼性が低下する可能性があります。
安全上のリスクも伴う可能性があります。モデルにそのような応答を防ぐための保護手段がある場合でも、悪意のある攻撃者はこれを悪用して LLM をだまして有害なコンテンツを生成させる可能性があります。
この現象を特定し、その意味を調査した後、研究者らは、これらの不正確な相関に対するモデルの依存性を評価するためのベンチマーク手順を開発しました。この手順は、開発者が LLM を展開する前に問題を軽減するのに役立ちます。
「これはモデルのトレーニング方法の副産物ですが、モデルは現在、これらの構文上の失敗モードを作成したタスクをはるかに超えた安全性が重要な領域で実際に使用されています。エンドユーザーとしてモデルのトレーニングに慣れていない場合、これは予想外である可能性があります」と、MIT電気工学およびコンピューターサイエンス学部(EECS)の准教授であり、MIT医工学科学研究所および情報意思決定研究所のメンバーであるマルジー・ガセミ氏は述べています。システムズ、および研究の上級著者。
ガセミ氏には、ノースイースタン大学の大学院生であり、MIT の客員学生でもある共同筆頭著者のシャンタル・シャイブ氏が加わります。そしてMIT大学院生のヴィニス・スリヤクマール氏。 Meta社の研究員であるLevent Sagun氏も同様だ。サイとローリー・スタンバーグ学際准教授であり、ノースイースタン大学クーリー・カレッジ・オブ・コンピュータ・サイエンスの研究副学部長であるバイロン・ウォレス氏。あ 作品を説明した紙 神経情報処理システム会議で発表されます。
構文に行き詰まった
LLM は、インターネットからの大量のテキストに基づいてトレーニングされます。このトレーニング プロセス中に、モデルは単語とフレーズ間の関係を理解することを学習します。この知識は、後でクエリに応答するときに使用されます。
以前の研究で、研究者らは、LLM がトレーニング データに頻繁に一緒に現れる品詞のパターンを検出することを発見しました。彼らはこれらの品詞パターンを「構文テンプレート」と呼んでいます。
LLM は、特定のドメインの質問に答えるために、意味論的な知識とともに構文の理解が必要です。
「たとえば、ニュース分野では、特定の書き方があります。したがって、モデルはセマンティクスを学習するだけでなく、その分野の特定のスタイルに従うために文章をどのように組み立てるべきかという基礎的な構造も学習します」とシャイブ氏は説明します。
しかし、今回の研究では、LLM がこれらの構文テンプレートを特定のドメインに関連付けることを学習していることが判明しました。モデルは、質問に答えるときに、クエリと主題の理解ではなく、この学習された関連付けのみに誤って依存する可能性があります。
たとえば、LLM は、「パリはどこにありますか?」のような質問が重要であることを学習する可能性があります。副詞/動詞/固有名詞/動詞という構成になっています。モデルのトレーニング データに文構築の例が多数ある場合、LLM はその構文テンプレートを国に関する質問に関連付けることがあります。
したがって、モデルに、同じ文法構造だが意味のない単語を含む新しい質問、たとえば「パリは曇って座ってください?」のような質問が与えられたとします。たとえその答えが意味をなさないとしても、「フランス」と答えるかもしれません。
「これは、モデルが質問に正しく答えるために学習する、見落とされているタイプの関連性です。セマンティクスだけでなく、モデルのトレーニングに使用するデータの構文にも細心の注意を払う必要があります」とシャイブ氏は言います。
意味が分からない
研究者らは、各ドメインのモデルのトレーニング データに構文テンプレートが 1 つだけ現れる合成実験を設計することで、この現象をテストしました。彼らは、単語を同義語、反意語、またはランダムな単語に置き換えることによってモデルをテストしましたが、基礎となる構文は同じに保ちました。
いずれの場合も、たとえ質問がまったくナンセンスであったとしても、LLM は依然として正しい答えを返すことが多いことがわかりました。
新しい品詞パターンを使用して同じ質問を再構成すると、質問の根本的な意味が同じであっても、LLM は正しい応答を返せないことがよくありました。
彼らはこのアプローチを使用して、GPT-4 や Llama などの事前トレーニング済み LLM をテストしたところ、同じ学習された動作によってパフォーマンスが大幅に低下することがわかりました。
これらの発見の広範な影響に興味を持った研究者らは、誰かがこの現象を悪用して、そのような要求を拒否するように意図的に訓練されたLLMから有害な応答を引き出すことができるかどうかを研究しました。
彼らは、モデルが「安全な」データセット (有害な情報を含まないデータセット) に関連付けた構文テンプレートを使用して質問を表現することで、モデルをだましてその拒否ポリシーをオーバーライドし、有害なコンテンツを生成できる可能性があることを発見しました。
「今回の研究から、LLM のセキュリティ脆弱性に対処するには、より堅牢な防御が必要であることは明らかです。この論文では、LLM の学習方法に起因して生じる新しい脆弱性を特定しました。したがって、さまざまな脆弱性に対するその場限りの解決策ではなく、LLM が言語を学習する方法に基づいて新しい防御を見つけ出す必要があります。」とスリヤクマール氏は言います。
研究者らはこの研究で緩和戦略を検討しませんでしたが、この誤った構文とドメインの相関関係に対する LLM の依存性を評価するために使用できる自動ベンチマーク手法を開発しました。この新しいテストは、開発者がモデルのこの欠点に積極的に対処し、安全性のリスクを軽減し、パフォーマンスを向上させるのに役立ちます。
研究者らは将来的に、より多様な構文テンプレートを提供するためにトレーニング データを強化する可能性のある軽減戦略を研究したいと考えています。彼らは、複数ステップのタスクに取り組むように設計された特別なタイプの LLM である推論モデルでこの現象を調査することにも興味を持っています。
「これは、LLM の故障モードを研究するための非常に創造的な角度だと思います。この研究は、LLM の安全性研究における言語知識と分析の重要性を強調しています。これは、これまで表舞台ではなかったものの、明らかに注目されるべき側面です」と、この研究には関与していないテキサス大学オースティン校の准教授、ジェシー・リーは述べています。
この研究の資金の一部は、Bridgewater AIA Labs Fellowship、National Science Foundation、Gordon and Betty Moore Foundation、Google Research Award、および Schmidt Sciences によって提供されています。
#研究者はLLM #の信頼性を低下させる欠点を発見しましたマサチューセッツ工科大学ニュース