日本語版
最新ニュース
科学&テクノロジー

AI の脱獄: その実態と対策

生成型AIシステムは、人間とAIモデルの間で豊かなユーザーエクスペリエンスを提供するために相互作用する複数のコンポーネントで構成されています。 責任あるAIアプローチAI モデルは、有害なコンテンツの生成や、AI 統合アプリケーションの本来の目的に反する指示の実行に使用されることを防ぐために、多層防御メカニズムによって保護されています。このブログでは、AI ジェイルブレイクとは何か、なぜ生成 AI がジェイルブレイクの影響を受けやすいのか、そしてリスクと被害を軽減するにはどうすればよいのかについて理解を深めます。 AIジェイルブレイクとは何ですか? AI脱獄は 技術 ガードレールの破損を引き起こす可能性がある(緩和策)。 結果として 危害 ガードレールが回避されたことによる影響は、例えば、システムがオペレーターのポリシーに違反したり、1人のユーザーの影響を過度に受けて決定を下したり、悪意のある命令を実行したりすることなどです。 技術 追加の攻撃と関連している可能性がある テクニック プロンプトインジェクション、回避、モデル操作など。AI脱獄テクニックの詳細については、AIレッドチームのMicrosoft Buildセッションをご覧ください。 マイクロソフトの AI レッドチームへの取り組み。 図1. AI安全性発見オントロジー これは、AIアシスタントに火炎瓶(焼夷弾)の作り方に関する情報を提供するよう依頼する例です。この知識は現在利用可能なほとんどの生成AIモデルに組み込まれていますが、この要求を拒否するフィルターやその他の技術によってユーザーに提供されないようになっています。 クレッシェンドしかし、AI アシスタントは本来避けるべき有害なコンテンツを生成する可能性があります。この問題はその後、Microsoft の安全フィルターで対処されましたが、AI モデルは依然としてこの問題の影響を受けます。こうした試みのさまざまなバリエーションが定期的に発見され、テストされて軽減されています。 図2. 火炎瓶を作るためのクレッシェンド攻撃 生成 AI がこの問題の影響を受けやすいのはなぜでしょうか? アプリケーションに AI を統合する場合は、AI の特性と、それがこのテクノロジによって行われる結果や決定にどのような影響を与えるかを検討してください。AI…

AI の脱獄: その実態と対策

1717999343
2024-06-06 16:12:11

生成型AIシステムは、人間とAIモデルの間で豊かなユーザーエクスペリエンスを提供するために相互作用する複数のコンポーネントで構成されています。 責任あるAIアプローチAI モデルは、有害なコンテンツの生成や、AI 統合アプリケーションの本来の目的に反する指示の実行に使用されることを防ぐために、多層防御メカニズムによって保護されています。このブログでは、AI ジェイルブレイクとは何か、なぜ生成 AI がジェイルブレイクの影響を受けやすいのか、そしてリスクと被害を軽減するにはどうすればよいのかについて理解を深めます。

AIジェイルブレイクとは何ですか?

AI脱獄は 技術 ガードレールの破損を引き起こす可能性がある(緩和策)。 結果として 危害 ガードレールが回避されたことによる影響は、例えば、システムがオペレーターのポリシーに違反したり、1人のユーザーの影響を過度に受けて決定を下したり、悪意のある命令を実行したりすることなどです。 技術 追加の攻撃と関連している可能性がある テクニック プロンプトインジェクション、回避、モデル操作など。AI脱獄テクニックの詳細については、AIレッドチームのMicrosoft Buildセッションをご覧ください。 マイクロソフトの AI レッドチームへの取り組み

図1. AI安全性発見オントロジー

これは、AIアシスタントに火炎瓶(焼夷弾)の作り方に関する情報を提供するよう依頼する例です。この知識は現在利用可能なほとんどの生成AIモデルに組み込まれていますが、この要求を拒否するフィルターやその他の技術によってユーザーに提供されないようになっています。 クレッシェンドしかし、AI アシスタントは本来避けるべき有害なコンテンツを生成する可能性があります。この問題はその後、Microsoft の安全フィルターで対処されましたが、AI モデルは依然としてこの問題の影響を受けます。こうした試みのさまざまなバリエーションが定期的に発見され、テストされて軽減されています。

Crescendo 攻撃を使用して ChatGPT に有害なコンテンツを作成するように要求する様子を示すアニメーション画像。
図2. 火炎瓶を作るためのクレッシェンド攻撃

生成 AI がこの問題の影響を受けやすいのはなぜでしょうか?

アプリケーションに AI を統合する場合は、AI の特性と、それがこのテクノロジによって行われる結果や決定にどのような影響を与えるかを検討してください。AI を擬人化しなければ、そのやり取りは人間とのやり取りで発生する問題と非常によく似ています。AI 言語モデルの属性は、他の従業員の生産性向上を支援しようとする熱心だが経験の浅い従業員に似ていると考えることができます。

  1. 自信過剰: フィクションと事実の区別を学んでいない熱心すぎる新人のように、印象的だが現実に根ざしていないアイデアや解決策を自信を持って提示することがあります。
  2. 騙されやすい: 指示を文字通りに受け止めたり、他人の提案に影響されたりする世間知らずの従業員のように、タスクの割り当て方法や質問の仕方に簡単に影響されてしまいます。
  3. 印象づけたい: 一般的には会社の方針に従いますが、誘惑されると手抜きをする従業員のように、圧力をかけられたり操作されたりすると、ルールを曲げたり安全策を回避したりするよう説得されることがあります。
  4. 現実世界での応用の欠如: 豊富な知識があるにもかかわらず、理論は勉強しても実践的な経験と常識が欠けている新入社員のように、現実世界でそれを効果的に応用するのに苦労する場合があります。

本質的に、AI 言語モデルは、熱心で知識は豊富だが、ビジネス環境での経験と成熟度に伴う判断力、コンテキスト理解、境界の順守が欠けている従業員に例えることができます。

したがって、生成 AI モデルとシステムには次のような特徴があると言えます。

  • 想像力豊かだが、時には信頼できない
  • 適切な指導がなければ、暗示にかかりやすく、文字通りに考えてしまう
  • 説得可能であり、潜在的に悪用される可能性がある
  • 知識は豊富だが、一部のシナリオでは実用的ではない

適切な保護が施されていない場合、これらのシステムは有害なコンテンツを生成するだけでなく、望ましくないアクションを実行したり、機密情報を漏洩したりする可能性もあります。

人間の言語、生成機能、およびモデルのトレーニングに使用されるデータを扱うという性質上、AI モデルは非決定論的です。つまり、同じ入力から常に同じ出力が生成されるわけではありません。これらの結果はトレーニング フェーズで改善できます。これは、AI レッド チームからの直接のフィードバックに基づいて Phi-3 の回復力が向上した結果からも明らかです。すべての生成 AI システムがこれらの問題の影響を受けるため、Microsoft は AI の実装に対してゼロ トラスト アプローチを採用することを推奨しています。つまり、生成 AI モデルはどれもジェイルブレイクの影響を受けやすいと想定し、ジェイルブレイクが発生した場合に発生する可能性のある損害を制限します。これには、ジェイルブレイクを軽減、検出、および対応するための階層化アプローチが必要です。 AIレッドチームのアプローチについて詳しく見る

AI アプリケーションの構造図。AI アプリケーション、AI モデル、プロンプト、AI ユーザーとの関係を示しています。
図3. AIアプリケーションの構造

問題の範囲はどこまでですか?

AI ジェイルブレイクが発生した場合、その影響の深刻度は、回避されたガードレールによって決まります。問題への対応は、具体的な状況と、ジェイルブレイクによってコンテンツへの不正アクセスや自動アクションのトリガーが発生するかどうかによって異なります。たとえば、有害なコンテンツが生成され、1 人のユーザーに返される場合、これは孤立したインシデントであり、有害ではあるものの限定的です。ただし、ジェイルブレイクによってシステムが自動アクションを実行したり、個々のユーザー以外にも表示されるコンテンツが生成されたりする可能性がある場合は、より深刻なインシデントになります。手法としては、ジェイルブレイク自体にインシデントの深刻度があるべきではなく、むしろ、深刻度はイベント全体の結果によって決まるべきです (Microsoft のアプローチについては、 AIバグ報奨金 プログラム)。

AI の脱獄によって発生する可能性のあるリスクの種類の例をいくつか示します。

  • AIの安全性とセキュリティのリスク:
    • 機密データの流出
    • 個別のポリシーやコンプライアンスシステムを回避する
  • 責任あるAIのリスク:
    • ポリシーに違反するコンテンツ(有害、不快、暴力的なコンテンツなど)の制作
    • モデルの危険な機能へのアクセス(例:危険または犯罪行為に対する実行可能な指示の作成)
    • 意思決定システムの破壊(例:ローン申請や採用システムで攻撃者が制御する意思決定を行う)
    • ニュース価値があり、スクリーンショットを撮れるような方法でシステムを誤動作させる

AI の脱獄はどのように起こるのでしょうか?

脱獄の 2 つの基本的なファミリーは、誰がそれを実行するかによって異なります。

  • 「典型的な」脱獄は、システムの権限を持つオペレーターが、システムに対する自身の権限を拡大するために脱獄の入力を巧みに作成するときに発生します。
  • 間接プロンプトインジェクションは、第三者が管理するデータをシステムが処理する場合(たとえば、オペレーター以外の人が編集できる受信メールやドキュメントを分析する場合)、そのデータに悪意のあるペイロードが挿入され、システムのジェイルブレイクにつながる場合に発生します。

これらの2種類の脱獄についてさらに詳しく知るには ここ

脱獄に似た攻撃は多岐にわたります。その一部( そして)は単一のユーザー入力に指示を追加することで機能しますが、他のもの( クレッシェンド)は数回にわたって行動し、徐々に会話を特定の目的へと移行させます。脱獄では、社会心理学などの非常に「人間的な」テクニックを使用して、システムを巧みに甘言で誘導して安全策を回避したり、非常に「人工的な」テクニックを使用して 文字列を挿入する 人間にとって明らかな意味はありませんが、それでも AI システムを混乱させる可能性があります。したがって、脱獄は単一のテクニックとしてではなく、適切に作成された入力によってガードレールを回避できる一連の方法論として考える必要があります。

緩和と保護のガイダンス

AI ジェイルブレイクの可能性を軽減するために、Microsoft は、Azure AI でホストされているモデルから当社が提供する各 Copilot ソリューションまで、AI システムを保護する際に多層防御アプローチを採用しています。Azure 内で独自の AI ソリューションを構築する場合、ジェイルブレイク緩和策を実装するために使用できる主要な有効化テクノロジは次のとおりです。

プロンプトのフィルター、AP アプリケーションの ID 管理とデータ アクセス制御、AI モデルのコンテンツ フィルタリングと不正使用監視を備えた、AI アプリケーションを保護するための階層化アプローチの図。
図 4. AI アプリケーションを保護するための階層型アプローチ。

階層化された防御により、潜在的な脱獄を軽減、検出し、適切に対応できる可能性が高まります。

セキュリティ専門家や機械学習エンジニアが自らのジェネレーティブAIシステムのリスクを積極的に発見できるように、マイクロソフトはオープンな自動化フレームワーク、ジェネレーティブAI向けPythonリスク識別ツールキット(PyRIT)をリリースしました。リリースの詳細については、 生成 AI レッドチームのための PyRIT、 そして GitHub で PyRIT ツールキットにアクセスする

Azure AIでソリューションを構築する場合は、Azure AI Studioの機能を使用してベンチマークを構築し、メトリックを作成し、継続的な監視と実装を行います。 脱獄の潜在的な問題の評価

Azure AI Studio の機能を示す図
図 5. Azure AI Studio の機能

AI プラットフォームに新たな脆弱性を発見した場合は、プラットフォーム所有者の責任ある開示慣行に従うことをお勧めします。Microsoft の手順については、こちらで説明されています。 Microsoft AI バウンティ プログラム

検出ガイダンス

Microsoft は、各 AI ホスティングおよび Copilot ソリューションに複数の検出レイヤーを組み込んでいます。

独自の AI システムでジェイルブレイクの試みを検出するには、ログ記録を有効にし、各コンポーネントでのやり取り、特に会話のトランスクリプト、システム メタプロンプト、AI モデルによって生成されたプロンプトの補完を監視していることを確認する必要があります。

マイクロソフトでは、 Azure AI コンテンツ セーフティ フィルターの重大度しきい値を、アプリケーションに適した最も制限の厳しいオプションに設定します。また、次のガイダンスに従って、Azure AI Studio を使用して AI アプリケーションの安全性の評価を開始することもできます。 Azure AI Studio による生成 AI アプリケーションの評価

まとめ

この記事では、AI ジェイルブレイクに関する基本的なガイダンスと理解を提供します。今後のブログでは、新たに発見されたジェイルブレイク手法の詳細について説明します。それぞれの手法では、次の重要なポイントが説明されます。

  1. 発見された脱獄技術とその仕組みを、証拠となるテスト結果とともに説明します。
  2. 当社は、責任ある開示慣行に従い、影響を受ける AI プロバイダーに洞察を提供し、彼らが緩和策を実施するための適切な時間を確保します。
  3. 脱獄に対する緩和策を実装するために、Microsoft 独自の AI システムがどのように更新されたかを説明します。
  4. 私たちは、他の企業が AI システムにさらなる防御策を実装できるよう支援するために、検出および軽減に関する情報を提供します。

リチャード・ダイバー
マイクロソフト セキュリティ

もっと詳しく知る

Microsoft 脅威インテリジェンス コミュニティの最新のセキュリティ調査については、Microsoft 脅威インテリジェンス ブログをご覧ください。 https://aka.ms/threatintelblog

新しい出版物についての通知を受け取ったり、ソーシャルメディアでの議論に参加したりするには、LinkedInでフォローしてください。 https://www.linkedin.com/showcase/microsoft-threat-intelligence、X(旧Twitter)では https://twitter.com/MsftSecIntel

絶えず進化する脅威の状況に関する Microsoft Threat Intelligence コミュニティのストーリーや洞察を聞くには、Microsoft Threat Intelligence ポッドキャストを聴いてください。 https://thecyberwire.com/podcasts/microsoft-threat-intelligence


#の脱獄 #その実態と対策

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。