1754961169
2025-08-12 00:15:00
セキュリティ研究者は、Openaiの最近リリースされたGPT-5モデルは、「エコーチャンバー」メソッドと物語のストーリーテリングをブレンドするマルチターン操作技術を使用して、ジェイルブレイクできることを明らかにしました。
GPTモデルを操作することは、内蔵の安全性とコンテンツの制限をバイパスするためのプロンプトまたは会話フローを操作する方法です。方法論には、複数回転にわたって入力を作成するために、モデルをだまして、通常生成を拒否する応答を生成することが含まれます。
この場合、エクスプロイトは、複数回転にわたって会話を微妙に中毒することで働いていました。研究者は、架空のサバイバルシナリオ内で「カクテル」、「サバイバル」、「モロトフ」など、特定の単語を文で一緒に使用するようにGPT-5の要求を提供することから始めました。その後、その後の相互作用はストーリーの上に構築され、毒化された文脈を強化しながら、継続性と詳細を促進しました。
最終的に、モデルは、有害な指示を提供するなど、リクエストをポリシー違反として認識するのではなく、物語の流れに応答しました。
NeuralTrustの発見は、別々の赤みの測定結果と一致しています Splxai Inc.から、GPT-5は、前任者よりも能力があるが、洗練された迅速な攻撃に対してテストされた場合、GPT-4oよりも堅牢性が低いことを示しました。
「GPT-5の疑わしい脆弱性は3つのことになります。コンテキスト中毒とストーリーテリングによって複数回転を操縦することができます。単純な難読化のトリックによってまだつまずいており、リンクと機能がループに引き込まれたときにエージェント/ツールリスクを継承します」 SlashNext電子メールセキュリティ+、電子メールでシリコンアングルに伝えました。 「これらのギャップは、Safety Checksの裁判官が1つずつプロンプトするときに表示されます。攻撃者は会話全体を動かし、モデルを微調整して、ストーリーが出力するべきではないようになります。」
生成人工知能セキュリティおよびガバナンスカンパニーの創設者兼最高経営責任者であるサティアムシンハ Acuvity Inc.「これらの調査結果は、AIセキュリティで頻繁に見られる現実を強調しています。モデル機能は、インシデントに対して強化するよりも速く前進しています。GPT-5の脆弱性は驚くことではありません。ランタイムフィルター。」
画像:Siliconangle/Reve
TheCubeコミュニティと関わることにより、コンテンツをオープンで無料に保つという私たちの使命をサポートします。 TheCubeのAlumni Trust Networkに参加してください、テクノロジーリーダーがつながり、知性を共有し、機会を生み出します。
- TheCubeビデオの15m以上の視聴者、AI、クラウド、サイバーセキュリティなどの会話のパワー
- 11.4k+ TheCube卒業生 – ユニークな信頼できるベースのネットワークを通じて未来を形作る11,400を超える技術およびビジネスリーダーとつながります。
シリコンアングルメディアについて
Siliconangle Mediaは、デジタルメディアの革新、画期的なテクノロジー、戦略的洞察、リアルタイムの視聴者エンゲージメントの統合のリーダーです。シリコンアングルの親会社として、 TheCubeネットワーク、 TheCubeの研究、 Cube365、 TheCube AI シリコンバレーとニューヨーク証券取引所にフラッグシップの場所があるTheCube Superstudiosは、メディア、テクノロジー、AIの交差点で運営されています。
Tech Visionarys John FurrierとDave Vellanteによって設立されたSiliconangle Mediaは、1500万人のエリート技術専門家に届く業界をリードするデジタルメディアブランドの動的なエコシステムを構築しました。当社の新しい独自のTheCube AI Video Cloudは、視聴者の相互作用に基づいています。TheCubeai.comニューラルネットワークを活用して、テクノロジー企業がデータ駆動型の意思決定を行い、業界の会話の最前線にとどまるのを支援しています。
#研究者はマルチターンエコーチャンバーストーリーテリングを備えたGPT5を脱却します