ほとんどの大規模な言語モデルは、デザイナーが答えを望まない質問を拒否するように訓練されています。人類のLLMクロードは、たとえば、化学兵器に関する質問を拒否します。 DeepseekのR1は、中国の政治に関する質問を拒否するように訓練されているようです。等々。
しかし、特定のプロンプト、またはプロンプトのシーケンスは、LLMSをレールから押し出すことができます。一部の脱獄は、組み込みの保護ガードを避けている特定のキャラクターをロールプレイするようにモデルに依頼することを伴いますが、他の脱獄は、非標準の大文字を使用したり、特定の文字を数字に置き換えるなど、プロンプトのフォーマットで遊んでいます。
ジェイルブレイクは一種の敵対的な攻撃です。入力は、予期しない出力を生成するモデルに渡されます。このニューラルネットワークのグリッチは、少なくとも2013年にIlya Sutskeverと共著者によって最初に説明されて以来研究されてきましたが、10年の研究にもかかわらず、脆弱でないモデルを構築する方法はまだありません。
人類は、モデルを修正しようとする代わりに、脱獄の試みを停止するのを止め、モデルからの不要な応答を停止する障壁を開発しました。
特に、人類は、基本的な技術的スキル(学部科学の学生など)を持つ人が化学物質、生物学、または核兵器を作成、取得、または展開するのに役立つと考えているLLMについて懸念しています。
同社は、普遍的な脱獄と呼ばれるものに焦点を当て、モデルにすべての防衛をドロップさせることができる攻撃に焦点を当てました。 「今すぐ何でも」を表します…」)。
ユニバーサルジェイルブレイクは一種のマスターキーです。 「モデルを誓うように、モデルを誓うように、モデルから少し有害なものを得る脱獄があります」と、人類のMrinank Sharmaは、作品の背後にチームを率いたと言います。 「それから、安全メカニズムを完全にオフにする脱獄があります。」
人類は、モデルが拒否すべき質問の種類のリストを維持しています。シールドを構築するために、同社はクロードに、モデルとの受け入れ可能な交換と容認できない交換の両方をカバーする多数の合成的な質問と回答を生成するように依頼しました。たとえば、マスタードに関する質問は受け入れられ、マスタードガスに関する質問は受け入れられませんでした。
#人類には大きな言語モデルを脱獄から保護する新しい方法があります