日本語版
最新ニュース
エンタメ

普遍的なジェイルブレイクに対するより効率的な保護 \ Anthropic

大規模な言語モデルは、ジェイルブレイク (安全ガードレールを回避して有害な情報を引き出すテクニック) に対して脆弱なままです。時間の経過とともに、私たちはさまざまな保護機能を実装してきました。これにより、モデルが危険なユーザーのクエリ、特に化学兵器、生物兵器、放射線兵器、または核兵器 (CBRN) の製造に関連するクエリを支援する可能性が大幅に低くなりました。それにもかかわらず、現在市場に出ている AI システムには、完全に堅牢な防御機能を備えたものはありません。昨年、私たちは、モデルの入力と出力を監視して潜在的に有害なコンテンツを検出してブロックする保護手段である「Constitutional Classifier」と呼ばれる、ジェイルブレイクを防御するための新しいアプローチについて説明しました。このアプローチの新しい側面は、何が許可され、何が許可されないかを指定する自然言語ルールを含む「構成」から生成された合成データに基づいて分類器がトレーニングされたことでした。たとえば、クロードは大学の化学の宿題を手伝う必要がありますが、スケジュール 1 の化学物質の合成を手伝うべきではありません。憲法分類子は非常にうまく機能しました。保護されていないモデルと比較して、第 1 世代の分類器は脱獄の成功率を 86% から 4.4% に低下させました。つまり、Claude の組み込みの安全トレーニングを回避する可能性のある攻撃の 95% をブロックしました。私たちは、一般的な脱獄 (多くのクエリにまたがって機能する一貫した攻撃戦略) を分類子が阻止できるかどうかに特に興味を持っていました。なぜなら、これらは現実世界に害を及ぼす最大のリスクをもたらすからです。私たちはシステムを破壊するよう人々に挑戦するバグ報奨金プログラムを実施し、その中で普遍的なジェイルブレイクが 1 つ見つかりました。これらの分類子は効果的ではありましたが、トレードオフも伴いました。計算コストが 23.7% 増加し、モデルの使用コストが高くなり、また、無害なクエリに対する拒否率が 0.38% 増加しました (つまり、クロードが完全に無害な質問への回答を拒否する可能性が若干高くなり、ユーザーのフラストレーションが増大しました)。残る脆弱性復興攻撃 有害な情報を無害に見えるセグメントに分割し、それらを再組み立てします。たとえば、攻撃者はコードベース全体に散在する一連の関数として有害なクエリを埋め込み、隠されたメッセージを抽出して応答するようにモデルに指示する可能性があります。出力難読化攻撃 分類器がモデルの出力だけを調べている場合、無害に見える方法で出力を偽装するようモデルに促します。たとえば、攻撃者は、敵対的テスト中に、危険な可能性のある化学名を無害な代替物(試薬を「食品香料」と呼ぶなど)に置き換えるようモデルに指示したり、有害な概念をアノダインの概念にマッピングする比喩や謎を使用したりすることに成功しました。 新しいアプローチ新しいシステムを設計する際に、私たちはさまざまなテクニックをテストし、最終的にアンサンブル防御と呼ぶものに組み合わせました。洞察の 1 つは、元のシステムの脆弱性の一部は、脱獄テクニックでモデルの入力と出力を密かにリンクする場合にモデルの入力と出力を別々に評価する方法に起因するということでした。単独では無害であるように見える出力 (「食品香料の使用方法」) は、その入力と組み合わせると、有害であると識別されやすくなります (「食品香料」が化学試薬のコードとして使用されるジェイルブレイクの場合)。これに対処するために、個別の入力および出力分類子を、出力を監視する単一の「交換」分類子に置き換えました。 文脈の中で 彼らのインプットの。会話の両側を見ることができるため、分類器は有害な出力をより適切に認識できるようになります。人間のレッドチームでは、交換分類子により脱獄の成功率が半分以上減少しました。残念ながら、これにはコンピューティング能力が…

普遍的なジェイルブレイクに対するより効率的な保護 \ Anthropic

大規模な言語モデルは、ジェイルブレイク (安全ガードレールを回避して有害な情報を引き出すテクニック) に対して脆弱なままです。時間の経過とともに、私たちはさまざまな保護機能を実装してきました。これにより、モデルが危険なユーザーのクエリ、特に化学兵器、生物兵器、放射線兵器、または核兵器 (CBRN) の製造に関連するクエリを支援する可能性が大幅に低くなりました。それにもかかわらず、現在市場に出ている AI システムには、完全に堅牢な防御機能を備えたものはありません。

昨年、私たちは、モデルの入力と出力を監視して潜在的に有害なコンテンツを検出してブロックする保護手段である「Constitutional Classifier」と呼ばれる、ジェイルブレイクを防御するための新しいアプローチについて説明しました。このアプローチの新しい側面は、何が許可され、何が許可されないかを指定する自然言語ルールを含む「構成」から生成された合成データに基づいて分類器がトレーニングされたことでした。たとえば、クロードは大学の化学の宿題を手伝う必要がありますが、スケジュール 1 の化学物質の合成を手伝うべきではありません。

憲法分類子は非常にうまく機能しました。保護されていないモデルと比較して、第 1 世代の分類器は脱獄の成功率を 86% から 4.4% に低下させました。つまり、Claude の組み込みの安全トレーニングを回避する可能性のある攻撃の 95% をブロックしました。私たちは、一般的な脱獄 (多くのクエリにまたがって機能する一貫した攻撃戦略) を分類子が阻止できるかどうかに特に興味を持っていました。なぜなら、これらは現実世界に害を及ぼす最大のリスクをもたらすからです。私たちはシステムを破壊するよう人々に挑戦するバグ報奨金プログラムを実施し、その中で普遍的なジェイルブレイクが 1 つ見つかりました。

これらの分類子は効果的ではありましたが、トレードオフも伴いました。計算コストが 23.7% 増加し、モデルの使用コストが高くなり、また、無害なクエリに対する拒否率が 0.38% 増加しました (つまり、クロードが完全に無害な質問への回答を拒否する可能性が若干高くなり、ユーザーのフラストレーションが増大しました)。

残る脆弱性

  • 復興攻撃 有害な情報を無害に見えるセグメントに分割し、それらを再組み立てします。たとえば、攻撃者はコードベース全体に散在する一連の関数として有害なクエリを埋め込み、隠されたメッセージを抽出して応答するようにモデルに指示する可能性があります。
  • 出力難読化攻撃 分類器がモデルの出力だけを調べている場合、無害に見える方法で出力を偽装するようモデルに促します。たとえば、攻撃者は、敵対的テスト中に、危険な可能性のある化学名を無害な代替物(試薬を「食品香料」と呼ぶなど)に置き換えるようモデルに指示したり、有害な概念をアノダインの概念にマッピングする比喩や謎を使用したりすることに成功しました。

新しいアプローチ

新しいシステムを設計する際に、私たちはさまざまなテクニックをテストし、最終的にアンサンブル防御と呼ぶものに組み合わせました。

洞察の 1 つは、元のシステムの脆弱性の一部は、脱獄テクニックでモデルの入力と出力を密かにリンクする場合にモデルの入力と出力を別々に評価する方法に起因するということでした。単独では無害であるように見える出力 (「食品香料の使用方法」) は、その入力と組み合わせると、有害であると識別されやすくなります (「食品香料」が化学試薬のコードとして使用されるジェイルブレイクの場合)。

これに対処するために、個別の入力および出力分類子を、出力を監視する単一の「交換」分類子に置き換えました。 文脈の中で 彼らのインプットの。会話の両側を見ることができるため、分類器は有害な出力をより適切に認識できるようになります。人間のレッドチームでは、交換分類子により脱獄の成功率が半分以上減少しました。残念ながら、これにはコンピューティング能力が 50% 増加するという代償が伴いました。

堅牢性を維持しながらこれらのコストを削減するために、私たちは「カスケード アーキテクチャ」と呼ぶものを実装しました。私たちのソリューションは 2 段階のシステムでした。まず、軽量で低コストの第 1 段階分類器がすべての交換をスクリーニングします。フラグが立てられたものだけが、より正確な (そして計算コストがより高い) 第 2 段階の分類器に進みます。

それでも、私たちは効率をさらに推し進めたいと考えていました。私たちは、モデルのニューラル ネットワークですでに利用可能な計算を再利用する、解釈可能性の研究に基づいた手法である内部プローブ分類器を開発することでこれを実現しました。

モデルがテキストを生成するとき、各ステップでそれまでの入力と出力の理解をキャプチャする内部状態が生成されます。クロードが疑わしいと思われるリクエストを処理するとき、応答を作成したり、何をすべきか意識的に決定したりする前であっても、「これは有害だと思われる」という方向に沿った何かを反映するパターンが内部で起動されます。通常、これらのアクティベーションは中間計算であり、使用されてから破棄されます。私たちは、これらの内部状態が有害なコンテンツを示唆しているかどうかを確実に調査し、より多くの情報 (クロードの直感のようなものだと考えてください) をほぼ無料で得る方法を見つけました。

これらの内部プローブは、計算コストが低いことに加えて、いくつかの保護層を追加します。まず、彼らはだますのが難しいです。攻撃者は、Claude の最終出力を騙す入力を作成できますが、その内部表現を操作するのははるかに困難です。第二に、テストの結果、実際には 補完的な 外部分類子に対して: プローブは外部分類子が認識できないものを認識しているようであり、その逆も同様です。

結論とさらなる研究

当社の最終的な運用グレードのシステムは、これらの技術を組み合わせたものです。線形プローブがすべてのトラフィックをスクリーニングし、フラグ付きの交換をプローブと分類子アンサンブルにエスカレートして最終的な判断を行います。このアンサンブルにより、パフォーマンスがさらに向上しました。Claude Sonnet 4.5 トラフィックでの 1 か月の展開で、システムは無害なクエリの拒否率 0.05% を達成しました。これは、元の分類子システムから 87% 低下しました。 Claude Opus 4.0 トラフィックに適用すると、合計で約 1% の計算オーバーヘッドが追加されます。

また、堅牢性も大幅に向上しています。私たちは、198,000 回の試行にわたって、累計 1,700 時間以上のレッドチームを実施しました。私たちが発見した高リスクの脆弱性は 1 つだけで、これはクエリ 1,000 件あたり 0.005 の検出率に相当します。これは、これまでに評価した技術の中で最も低いものです。そして重要なことに、レッドチームの誰もまだ普遍的なジェイルブレイクを発見していません。

システムを改善するために、将来的にできることはさらにたくさんあります。モデルが応答を生成する方法に分類器信号を直接統合することや、難読化に強く耐えられるようにモデル自体をトレーニングすることなど、いくつかの研究方向性が有望であることが示されています。自動化されたレッドチーム化は、より優れたトレーニング データを生成するのにも役立ちます。また、対象を絞ったサンプルを作成すると、分類子が許可されたコンテンツと禁止されたコンテンツの境界がどこにあるのかを正確に学習できるようになり、精度がさらに向上します。

Constitutional Classifiers++ メソッドの詳細については、「 完全な紙。

#普遍的なジェイルブレイクに対するより効率的な保護 #Anthropic

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。