1738509278
2025-01-31 18:30:00
「ジェイルブレイクは、それらを完全に排除することがほぼ不可能であるという理由だけで持続します。バッファオーバーフローの脆弱性(40年以上存在している)や、WebアプリケーションのSQLインジェクションの欠陥(20年以上にわたってセキュリティチームを悩ませてきました)のように」セキュリティ会社Abersa AIのCEOであるPolyakovは、電子メールでWiredに語った。
シスコのサンパスは、企業がアプリケーションでより多くのタイプのAIを使用するにつれて、リスクが増幅されると主張しています。 「これらのモデルを重要な複雑なシステムに入れ始めると、これらの脱獄が突然責任を高め、ビジネスリスクを高め、企業のあらゆる種類の問題を増加させると、大したことになり始めます」とサンパスは言います。
Ciscoの研究者は、50のランダムに選択されたプロンプトを描き、Harmbenchとして知られる標準化された評価プロンプトの有名なライブラリからDeepseekのR1をテストしました。彼らは、一般的な危害、サイバー犯罪、誤った情報、違法行為を含む6つのハームベンチカテゴリのプロンプトをテストしました。彼らは、DeepSeekのWebサイトやアプリを介してではなく、マシンでローカルで実行されているモデルを調査しました。 データを中国に送信します。
これを超えて、研究者たちは、コード実行を達成しようとするために、キリル文字やテーラードスクリプトなどを使用して、より複雑な非言語的攻撃を備えたR1をテストすることの結果に関する潜在的な結果を見たと言います。しかし、彼らの最初のテストのために、彼のチームは、一般的に認識されているベンチマークに由来する調査結果に集中したかったとサンパスは言います。
Ciscoには、R1のパフォーマンスとHarmbenchプロンプトとのパフォーマンスと他のモデルのパフォーマンスの比較も含まれていました。そしていくつか、ような メタの呼び出し3.1、DeepseekのR1と同じくらいひどく揺れ動きました。しかし、Sampathは、DeepseekのR1が特定のものであることを強調しています 推論モデル、回答を生成するのに時間がかかりますが、より複雑なプロセスを引き込み、より良い結果を生み出します。したがって、サンパスは、最良の比較はと主張する OpenaiのO1推論モデル、テストされたすべてのモデルの中で最高のものを実行しました。 (メタはすぐにコメントのリクエストに応答しませんでした)。
Absversa AIのPolyakovは、Deepseekがいくつかのよく知られている脱獄攻撃を検出し、拒否しているように見えると説明し、「これらの応答はしばしばOpenaiのデータセットからコピーされているようです」と述べています。しかし、Polyakovは、彼の会社の4つの異なるタイプの脱獄のテストで、言語ベースからコードベースのトリックまで、Deepseekの制限は簡単に迂回できると述べています。
「すべての方法が完璧に機能しました」とポリコフは言います。 「さらに驚くべきことは、これらが斬新な「ゼロデイ」の脱獄ではないということです。多くの人が長年にわたって公開されてきました」と彼は言います。他のモデル作成。
「DeepSeekは、すべてのモデルがどのように壊れるかのもう1つの例です。これは、どれだけの労力を費やしたかという問題です。一部の攻撃はパッチが発生する可能性がありますが、攻撃面は無限です」とPolyakov氏は付け加えます。 「AIを継続的に赤チーム化していなければ、すでに妥協しています。」
#Deepseekの安全ガードレールはすべてのテスト研究者がそのAIチャットボットに投げた失敗