敵対的な脅威検出フレームワークのこの表現では、鮮やかなフィラメントは、輝くシンプルで構成されるファセットのトポロジーシールドが右側の暗くグリッチな塊をそらす一方、中央のノードに着信テキストと画像アイコンを運びます。構成は、クリーンデータフローと敵対的な干渉とのコントラストを強調しています。マニッシュ・バタライによるクレジット/dall-e
ラニストカレンダーニュース:
- 攻撃を明らかにし、脅威の起源を特定するためのトポロジーシグネチャ
マルチモーダルの基礎AIモデルの急速な進歩と採用により、新しい脆弱性が浮上し、サイバーセキュリティ攻撃の可能性が大幅に拡大しています。 Los Alamos National Laboratoryの研究者は、基礎モデルに対する敵対的な脅威を特定する新しいフレームワークを提案しました。これは、テキストと画像データをシームレスに統合および処理する人工知能アプローチです。この作業により、システム開発者とセキュリティの専門家は、モデルの脆弱性をよりよく理解し、より洗練された攻撃に対する回復力を強化することができます。
「マルチモーダルモデルがより一般的に成長するにつれて、敵はテキストまたは視覚チャネルのいずれか、あるいは同時に、さらには弱点を悪用する可能性があります」と、Los Alamosのコンピューター科学者であるManish Bhattaraiは述べています。 「AIシステムは、出力を誤解させたり破損したりする可能性のある微妙で悪意のある操作からの脅威に直面しており、攻撃はモデルの真の出力のように見える誤解を招くまたは有毒なコンテンツをもたらす可能性があります。
マルチモーダルAIシステムは、テキストと画像を共有された高次元空間に埋め込み、画像の概念をテキストセマンティックの概念に合わせて(円形の「円」」という単語のようなものに合わせて、多様なデータ型を統合することに優れています。ただし、このアラインメント機能は、独自の脆弱性も導入します。これらのモデルはハイステークスアプリケーションでますます展開されているため、敵は、テキストまたは視覚入力を介してそれらを悪用することができます。
マルチモーダルシステムの防衛戦略は、これらのモデルが複雑な国家安全保障のトピックに適用され、モデリングとシミュレーションに貢献できる敏感なドメインでますます使用されているにもかかわらず、比較的未開拓のままです。チームの経験に基づいて、浄化戦略を開発する 画像中心のモデルの攻撃シナリオにおける敵対的な騒音を中和しました、この新しいアプローチは、今日の高度な人工知能モデルに対する敵対的な攻撃の署名と起源を検出します。
新しいトポロジーアプローチ
Los Alamosチームのソリューションは、これらの敵対的な署名を明らかにするために、データの「形状」に焦点を当てた数学的な規律であるトポロジカルデータ分析を活用しています。攻撃がテキストと画像の埋め込みの幾何学的アライメントを破壊すると、測定可能な歪みが生成されます。研究者は、「トポロジカル制御の損失」と呼ばれる2つの先駆的な技術を開発し、これらのトポロジーの違いを精密に定量化し、敵対的な入力の存在を効果的に特定しました。
「私たちのアルゴリズムは、攻撃の署名を正確に明らかにし、統計的手法と組み合わせると、驚くべき精度で悪意のあるデータの改ざんを検出できます」と、ロスアラモスのポスドク研究員であり、チームの論文の主任著者であるMinh Vu氏は述べています。 「この研究は、次世代のAIシステムを確保するためのトポロジベースのアプローチの変革の可能性を示しており、この分野での将来の進歩のための強力な基盤を設定しています。」
フレームワークの有効性は、Los AlamosのVenadoスーパーコンピューターを使用して厳密に検証されました。 2024年にインストールされたマシンのチップは、中央処理ユニットとグラフィックプロセッシングユニットを組み合わせて、高性能コンピューティングと巨大なスケールの人工知能アプリケーションに対処します。チームは、複数のベンチマークデータセットとモデルにわたる既知の敵対的攻撃方法の広範なスペクトルに対してそれをテストしました。結果は明確でした。トポロジー的アプローチは、既存の防御を一貫して大幅に上回り、脅威に対してより信頼性が高く回復力のあるシールドを提供しました。
チームは作品を提示しました。マルチモーダルアライメントにおける敵のトポロジーシグネチャ機械学習に関する国際会議で。
資金: この作業は、Los Alamosの研究所指向研究開発プログラムと施設内コンピューティングプログラムによってサポートされていました。
#新しいアプローチはマルチモーダルAIシステムにおける敵対的な攻撃を検出します