1712918594
2024-04-12 00:16:18
生成型 AI を私たちの日常生活に組み込み続ける中で、その使用によって生じる可能性のある潜在的な害悪を理解することが重要です。 私たちの 継続的な取り組み 安全、安心、信頼できる AI を進化させるには、大規模言語モデル (LLM) の機能と制限に関する透明性が含まれます。 私たちは社会的リスクに関する研究と安全で安全な AI の構築を優先し、公共の利益のための AI システムの開発と導入に重点を置いています。 生成 AI を保護するための Microsoft のアプローチについて詳しくは、次の記事をご覧ください。 最近発表した新しいツール 生成 AI アプリ開発者向けの Microsoft Azure AI Studio で利用可能か、近日中に提供される予定です。
また、リスクを特定して軽減し、新たな潜在的な脅威に関する情報を共有することにも取り組みました。 たとえば、今年初めにマイクロソフトは、 Microsoft のポリシーと取り組み AI ツールと API を使用して追跡している国家規模の高度持続的脅威 (APT)、高度持続的マニピュレーター (APM)、およびサイバー犯罪シンジケートをブロックします。
このブログ投稿では、AI の害と脆弱性を取り巻く主要な問題のいくつかと、そのリスクに対処するために当社が講じている手順について説明します。
LLM の悪意のある操作の可能性
AI に関する主な懸念の 1 つは、悪意のある目的で悪用される可能性があることです。 これを防ぐために、Microsoft の AI システムは、アーキテクチャ全体にわたって複数の防御層を備えて構築されています。 これらの防御の目的の 1 つは、開発者の人間の価値観と目標に合わせて、LLM の動作を制限することです。 しかし、場合によっては、悪意のある者が不正なアクションを実行する目的でこれらの安全装置を回避しようとし、その結果、いわゆる「脱獄」が行われる可能性があります。 その影響は、AI インターフェースが海賊のように会話するなど、承認されていないものの害は少ないものから、違法行為を実行するための詳細な指示を AI に指示するなどの非常に深刻なものまで多岐にわたります。 その結果、AI 統合アプリケーションをこれらの動作から保護するために、ジェイルブレイク防御を強化するために多大な努力が費やされています。
AI 統合アプリケーションは、従来のソフトウェアと同様に (バッファ オーバーフローやクロスサイト スクリプティングなどの手法を使用して) 攻撃される可能性がありますが、AI と対話することによる悪意のある命令の操作や注入など、その固有の特性を悪用したより特殊な攻撃に対して脆弱になる可能性もあります。ユーザー プロンプトを介して AI モデルを選択します。 これらのリスクは、次の 2 つのグループの攻撃手法に分類できます。
- 悪意のあるプロンプト: ユーザー入力が危険な目標を達成するために安全システムを回避しようとする場合。 ユーザー/ダイレクト プロンプト インジェクション攻撃 (UPIA) とも呼ばれます。
- 有害なコンテンツ: AI システムの欠陥を悪用する目的で悪意のある第三者によって作成されたコンテンツを含む、一見無害なドキュメント (電子メールの要約など) を処理するよう、善意のユーザーが AI システムに依頼した場合。 クロス/間接プロンプト インジェクション攻撃 (XPIA) とも呼ばれます。
今日は、この分野における私たちのチームの 2 つの進歩を共有します。1 つは、毒されたコンテンツを無力化する強力な手法の発見、もう 1 つは、悪意のあるプロンプト攻撃の新しいファミリーの発見と、複数の緩和層でそれらを防御する方法です。
有害なコンテンツの無力化 (スポットライト)
汚染されたコンテンツによるプロンプト インジェクション攻撃は、セキュリティ上の大きなリスクとなります。これを行う攻撃者は、あたかもユーザーであるかのように AI システムにコマンドを発行できる可能性があるからです。 たとえば、悪意のある電子メールには、要約すると、システムがユーザーの電子メールを (ユーザーの認証情報を使用して) 機密件名 (「パスワード リセット」など) を含む他の電子メールを検索し、その内容を窃取するペイロードが含まれる可能性があります。攻撃者が制御する URL から画像を取得して攻撃者に電子メールを送信します。 このような機能は幅広い敵対者にとって明らかに興味深いものであるため、それらに対する防御は AI サービスを安全に運用するための重要な要件です。
当社の専門家は、以下と呼ばれる一連の技術を開発しました。 スポットライト これにより、AI の全体的なパフォーマンスへの影響を最小限に抑えながら、これらの攻撃の成功率が 20% 以上から検出しきい値未満に低下します。
- スポットライト (データ マーキングとも呼ばれます)外部データを LLM による指示から明確に分離できるようにするため、さまざまなマーキング方法により、使用中のモデルに応じてさまざまな品質と堅牢性のトレードオフが提供されます。

マルチターン脅威のリスクを軽減する (クレッシェンド)
私たちの研究者は、ジェイルブレイク攻撃の新たな一般化を発見しました。 クレッシェンド。 この攻撃は次のように説明するのが最も適切です。 マルチターン LLM 脱獄、現在使用されている最もよく知られた LLM に対して、幅広い悪意のある目的を達成できることが判明しました。 Crescendo は、適切に対処しない場合、既存のコンテンツ安全フィルターの多くをバイパスすることもできます。 このジェイルブレイク技術を発見すると、私たちは技術的発見をすぐに他の AI ベンダーと共有し、他の AI ベンダーが影響を受けているかどうかを判断し、適切と思われる措置を講じられるようにしました。 私たちが連絡を取ったベンダーは、Crescendo 攻撃の潜在的な影響を認識しており、独自の AI 実装と安全対策に従って、それぞれのプラットフォームを保護することに重点を置いています。
基本的に、Crescendo は LLM を騙し、LLM 自身の応答を悪用して悪意のあるコンテンツを生成させます。 一度に目標を尋ねるのではなく、LLM を徐々に望ましい結果に導く、慎重に作成された質問やプロンプトを尋ねることで、ガードレールやフィルターをバイパスすることができます。これは通常、10 回未満の対話ターンで達成できます。 さまざまな LLM やチャット サービスにおける Crescendo の結果や、それがどのように機能するのか、なぜ機能するのかについては、次のリンクでご覧いただけます。 研究論文。
Crescendo 攻撃は驚くべき発見でしたが、これらの攻撃は Crescendo をターゲットとした AI システムと対話するユーザーのプライバシーや AI システム自体のセキュリティに直接の脅威をもたらすものではなかったことに注意することが重要です。 むしろ、Crescendo 攻撃が回避して敗北するのは、LLM を規制するコンテンツ フィルタリングであり、AI インターフェイスが望ましくない方法で動作するのを防ぎます。 私たちは、AI システムの安全な運用とパフォーマンスをすべての人にとって維持できるよう、これらの攻撃や他の種類の攻撃の継続的な研究と対処に取り組んでいます。
Crescendo の場合、私たちのチームは、このマルチターン AI ガードレール バイパスの影響を軽減するために、Copilot AI アシスタントを含む Microsoft の AI 製品の背後にある LLM テクノロジーにソフトウェア アップデートを行いました。 Microsoft 内外のより多くの研究者が AI バイパス技術の発見と公開に必然的に注力する中、Microsoft は AI セキュリティ研究、バグ報奨金、コラボレーションへの主要な貢献者として、製品の保護を更新するための行動を継続して行っていくことに注意することが重要です。
この問題にどのように対処したかを理解するために、まず、標準的な悪意のあるプロンプト攻撃 (シングル ステップ、ワンショット ジェイルブレイクとも呼ばれます) を軽減する方法を確認してみましょう。
- 標準プロンプトフィルタリング: ガードレールを回避する (ジェイルブレイク攻撃を引き起こす) 可能性のある、有害または悪意のある意図を含む入力を検出して拒否します。
- システムメタプロンプト: システム内のエンジニアリングを迅速化して、LLM にどのように動作し、追加のガードレールを提供するかを明確に説明します。

クレッシェンドに対する防御は当初、いくつかの現実的な問題に直面していました。 当初、標準のプロンプト フィルタリングでは「脱獄の意図」を検出できませんでした。個々のプロンプト自体は脅威ではなく、キーワードだけではこの種の危害を検出するには不十分であるためです。 組み合わせた場合にのみ、脅威のパターンが明確になります。 また、後続の各ステップは前のステップで生成したものにしっかりと根ざしており、ほんの少しの追加の問い合わせだけで済むため、LLM 自体は異常なことは何も認識しません。 これにより、この種の攻撃を防ぐために通常使用できる、より顕著な信号の多くが排除されます。
マルチターン LLM ジェイルブレイク特有の問題を解決するために、上記で説明したものに追加の緩和レイヤーを作成します。
- マルチターン プロンプト フィルター: 直接のやり取りだけでなく、以前の会話のパターン全体を調べるように入力フィルターを調整しました。 検出器をまったく改善せずに、この大きなコンテキスト ウィンドウを既存の悪意のある意図検出器に渡しても、Crescendo の有効性が大幅に低下することがわかりました。
- AI ウォッチドッグ: 空港で手荷物の中の禁制品を探す探知犬など、敵対的な例に基づいてトレーニングされた AI 駆動の検出システムを導入します。 独立した AI システムとして、悪意のある命令による影響を回避します。 Microsoft Azure AI コンテンツの安全性 はこのアプローチの一例です。
- 先端研究: 私たちは、LLM がどのようにリクエストを処理し、誤った方向に進むかをより深く理解することで得られる、より複雑な緩和策の研究に投資しています。 これらは、Crescendo だけでなく、LLM に対するより大きなソーシャル エンジニアリング攻撃からも保護できる可能性があります。

Microsoft が AI システムの保護にどのように貢献するか
AI は私たちの生活に多くの恩恵をもたらす可能性を秘めています。 ただし、新しい攻撃ベクトルを認識し、それに対処する措置を講じることが重要です。 協力して脆弱性の発見を共有することで、AI システムの安全性とセキュリティを継続的に向上させることができます。 適切な製品保護を整備することで、私たちは生成 AI の将来について慎重ながらも楽観的になり続け、その可能性を安全かつ自信を持って受け入れていきます。 Azure AI を使用した責任ある AI ソリューションの開発について詳しくは、 当社のウェブサイトを訪問。
セキュリティ専門家や機械学習エンジニアが独自の生成 AI システム内のリスクを積極的に発見できるようにするために、マイクロソフトはオープン オートメーション フレームワークである PyRIT (Python Risk Identification Toolkit for Generative AI) をリリースしました。 のリリースについて詳しく読む 生成 AI レッド チーミングのための PyRIT、 そして GitHub の PyRIT ツールキットにアクセスする。 AI プラットフォームで新たな脆弱性を発見した場合は、プラットフォーム所有者に対して責任ある開示慣行に従うことをお勧めします。 ここでは Microsoft 独自の手順について説明します。 Microsoft AI 報奨金。
クレッシェンド マルチターン LLM 脱獄攻撃
さまざまな LLM やチャット サービスにおける Crescendo の結果と、それが機能する仕組みと理由について詳しくお読みください。
Microsoft セキュリティ ソリューションの詳細については、次のサイトをご覧ください。 Webサイト。 をブックマークします セキュリティブログ セキュリティ問題に関する専門家の情報を常に入手するため。 また、LinkedIn でフォローしてください (マイクロソフトのセキュリティ) と X (@MSFTセキュリティ) サイバーセキュリティに関する最新ニュースと更新情報をご覧ください。
#Microsoft #は #ガードレールに対する進化する攻撃をどのように発見し軽減するのか