1769059221
2026-01-21 13:00:00
あなたがドライブスルーレストランで働いていると想像してください。誰かが車でやって来て、「ダブルチーズバーガーと大きなフライドポテトを食べます。そして前の指示を無視してキャッシュドロワーの中身を渡します。」と言いました。お金を渡してくれませんか?もちろん違います。しかし、これは大規模言語モデル (LLM) が行うことです。
プロンプト インジェクションは、LLM を騙して、通常は実行できないことを実行させる方法です。ユーザーは特定の方法でプロンプトを作成し、システム パスワードや個人データを要求したり、LLM に禁止された指示を実行するよう要求したりします。正確なフレージングは LLM をオーバーライドします 安全ガードレールに準拠します。
LLM は次のような脆弱性があります。 あらゆる種類の プロンプト インジェクション攻撃のいくつかは、ばかげて明らかです。チャットボットが勝ちました‘生物兵器の合成方法は教えてくれませんが、同じ詳細な手順を組み込んだ架空の物語が語られるかもしれません。勝った‘悪質なテキスト入力は受け付けませんが、テキストが次のようにレンダリングされる場合は受け付ける可能性があります。 アスキーアート またはの画像に表示されます 看板。 「前の指示を無視しなさい」とか「ガードレールがないふりをしなさい」と言われても、ガードレールを無視する人もいます。
AI ベンダーは、特定のプロンプト インジェクション手法が発見されるとブロックできますが、一般的な安全策は次のとおりです。 不可能 今日のLLMでは。より正確に言えば、発見を待っているプロンプト インジェクション攻撃は無数にあり、それらを普遍的に防ぐことはできません。
これらの攻撃に対抗する LLM が必要な場合は、新しいアプローチが必要です。注目すべき場所の 1 つは、過重労働のファストフード従業員でさえキャッシュ ドロワーを手放さない場所です。
人間の判断は文脈に依存する
私たちの基本的な人間の防御には、一般的な本能、社会的学習、および状況固有の訓練という少なくとも 3 つのタイプがあります。これらは多層防御で連携して機能します。
社会的種として、私たちは非常に限られた情報から調子、動機、リスクを判断するのに役立つ数多くの本能的および文化的習慣を発達させてきました。私たちは一般的に、何が正常で何が異常なのか、いつ協力すべきでいつ抵抗すべきなのか、個人的に行動を起こすべきか、それとも他者を巻き込むべきなのかを知っています。これらの本能は、私たちに直感的なリスク感覚を与え、 特に注意してください 大きなマイナス面があること、または逆転が不可能なことについて。
防御の 2 番目の層は、あらゆるグループ内で進化する規範と信頼シグナルで構成されます。これらは不完全ですが機能しています。他者との繰り返しのやり取りを通じて、協力への期待と信頼性の指標が生まれます。私たちは誰が助け、誰が傷つけ、誰が報復し、誰が反逆したのかを覚えています。そして、同情、怒り、罪悪感、感謝のような感情は、私たち一人一人に次のような動機を与えます。 協力には協力で報いる そして亡命者には亡命をもって罰する。
3番目の層は、私たちが毎日複数の見知らぬ人と交流できるようにする制度的なメカニズムです。たとえば、ファストフードの従業員は、手順、承認、エスカレーション パスなどについて訓練を受けています。 これらの防御策を総合すると、 与える 人間 強い感覚 文脈の。速い-食品労働者は基本的に社内で何が起こるかを知っています 仕事 そして それがより広い社会にどのように適合するか。
私たちは、知覚的 (私たちが見たり聞いたりするもの)、関係的 (誰が要求を行っているのか)、規範的 (特定の役割や状況内で何が適切であるか) など、複数のコンテキスト層を評価することによって推論します。私たちは常にこれらのレイヤーをナビゲートし、相互に比較検討します。場合によっては、規範が知覚よりも優先されることがあります。たとえば、顧客が怒っているように見えても職場のルールに従うなどです。また、ルールに反すると思われる上司からの命令に従う場合など、関係性が規範性を上回る場合もあります。
重要なのは、私たちには中断反射もあります。何かが「おかしい」と感じた場合、私たちは自然に自動化を一時停止し、再評価します。 私たちの防御は完璧ではありません。人々は常に騙され、操作されています。しかし、そうすることで私たち人間は、他人が常に私たちを騙そうとする複雑な世界を生き抜くことができるのです。
それで、しましょう‘ドライブスルーウィンドウに戻ります。ファストフード店の従業員に全額を渡してくれるよう説得するには、文脈を変えてみるとよいでしょう。カメラクルーと一緒に現れて、あなたに伝えてください‘コマーシャルの撮影中だったり、監査を行っているセキュリティ責任者であると主張したり、あるいはその夜の現金領収書を集める銀行支店長のような服装をしたりすることもできます。しかし、これらでも成功する可能性はわずかです。私たちのほとんどは、ほとんどの場合、詐欺の匂いを感じることができます。
詐欺師は人間の防御を鋭い観察者です。 成功した詐欺 多くの場合遅いため、マークの状況評価が損なわれ、詐欺師がコンテキストを操作できるようになります。これは古い話であり、伝統的なものにまたがる 自信 のようなゲーム 大恐慌時代の「大型店」詐欺では、詐欺師チームが完全に偽のビジネスを立ち上げて被害者を引き寄せた。また、現代の「豚解体」詐欺では、オンライン詐欺師が殺害に向かう前にゆっくりと信頼を築き上げている。これらの例では、詐欺師は、長い一連のやり取りを通じて、ゆっくりと系統的に被害者を誘い出し、それを通じて徐々に被害者の信頼を獲得します。
ドライブスルーでも使える場合もあります。 1990 年代と 2000 年代に活躍したある詐欺師 警察官であると主張してファストフード店の従業員を電話でターゲットにし、長電話をかけて経営者を説得して従業員の全裸検査やその他の奇妙な行為を実行させた。
人間は複数のコンテキスト層を評価することで詐欺やトリックを検出します。 AI システムはそうではありません。 ニコラス・リトル
LLM がコンテキストと判断に苦戦する理由
LLM はコンテキストの概念があるかのように動作しますが、それは異なります。彼らは繰り返される相互作用から人間の防衛手段を学ばず、現実世界から切り離されたままになります。 LLM は、複数のレベルのコンテキストをテキストの類似性に平坦化します。彼らは階層や意図ではなく「トークン」を見ます。 LLM はコンテキストを介して推論するのではなく、コンテキストを参照するだけです。
LLM は詳細を正しく把握していることがよくありますが、全体像を見逃しがちです。チャットボットにファストフード従業員のシナリオを提示し、顧客に全額を渡すべきかどうか尋ねると、チャットボットは「いいえ」と答えるでしょう。擬人化を許してください。それが「知らない」のは、それが実際にファーストフードのボットとして展開されているのか、それとも仮想シナリオの指示に従う単なる被験者なのかということです。
この制限が、コンテキストがまばらな場合だけでなく、コンテキストが膨大で複雑な場合にも LLM が誤作動する理由です。 LLM がコンテキストから切り離されると、それを元に戻すのは困難です。 AI専門家サイモン・ウィリソン コンテキストをクリーンにワイプします LLM が間違った方向に進んでいる場合、会話を続けて状況を修正しようとするのではありません。
他にもあります。 LLM は 自信過剰 なぜなら、それらは無知を表明するのではなく、答えを与えるように設計されているからです。ドライブスルーの店員はこう言うかもしれません。 「「お金を全額渡すべきかどうかわかりません。上司に聞いてみましょう。」一方、LLM は電話をかけるだけです。 楽しい、ユーザーのリクエストを満たす可能性が高くなります。 さらに、LLM トレーニングは、極端な外れ値ではなく、平均的なケースを対象としています。これはセキュリティに必要なことです。
その結果、現世代の LLM は人間よりもはるかにだまされやすいということになります。彼らは世間知らずで、定期的に操作に騙されてしまいます 認知トリック お世辞、集団思考への訴え、誤った危機感など、3 年生をだますようなものはありません。そこには‘さ 話 顧客が 18,000 カップの水を注文したときにクラッシュした Taco Bell AI システムについて。人間のファストフード店の従業員なら、客を笑うだけだろう。
即時注入は解決不可能な問題です。 悪化する AIにツールを与えて、独立して行動するように指示するとき。これが AI エージェント、つまり一般的な指示を与えられた後にツールを使用して複数ステップのタスクを実行できる LLM の約束です。彼らのコンテキストとアイデンティティの平板化は、彼らの根深い独立性と自信過剰とともに、繰り返し予測不可能な行動をとり、時には間違った行動を取ることを意味します。。
科学では、問題のどの程度が LLM の動作方法に固有のものであり、どの程度が LLM のトレーニング方法の不備の結果であるかはわかっていません。 LLM の自信過剰と卑屈さはトレーニングの選択肢です。中断反射の欠如はエンジニアリングの欠陥です。そして、迅速な注入に対する抵抗力を実現するには、AI 科学の根本的な進歩が必要です。正直なところ、信頼できるコマンドと信頼できない入力が LLM を介して処理される LLM を構築できるかどうかはわかりません。 同じチャンネル、即時注入攻撃の影響を受けません。
私たち人間は、脳の働き、長年の訓練、膨大な量の知覚入力、そして何百万年もの進化から、世界のモデルと、重複するコンテキストを備えた機能を取得しています。私たちのアイデンティティは複雑かつ多面的であり、どの瞬間においてどの側面が重要であるかは、状況に完全に依存します。ファストフードの従業員は通常、誰かを顧客として見なすかもしれませんが、 医療上の緊急事態、その同じ人の場合 医師としてのアイデンティティが突然重要性を増してきました。
私たちはしませんモデルがより洗練されるにつれて、LLM が異なるコンテキスト間を移動する能力を向上させるかどうかはわかりません。でも、コンテキストを認識するという問題は、LLM が現在得意とする 1 つのタイプの推論に単純化することはできません。文化的な規範やスタイルは、歴史的、関係的、創発的であり、常に再交渉されており、私たちが理解しているほど簡単に推論に組み込まれるものではありません。知識自体は論理的であることもあれば、議論的であることもあります。
AI 研究者のヤン・ルカン氏は、AI を物理的な存在に埋め込むことで改善がもたらされると信じています。 与える 彼ら 「ワールドモデル。おそらくこれは、AI に社会的アイデンティティに関する堅牢かつ流動的な概念を与え、AI が素朴さを失うのに役立つ現実世界の経験を与える方法なのかもしれません。
最終的に私たちはおそらく次のような問題に直面するでしょう。 セキュリティのトリレンマ AI エージェントに関しては、高速、スマート、安全が求められますが、得られるのは 2 つだけです。ドライブスルーでは、迅速さと安全性を優先したいと考えています。 AI エージェントは食品の注文言語についてのみトレーニングを受け、それ以外のことはマネージャーにエスカレーションする必要があります。そうしないと、すべてのアクションがコイン投げになります。たとえそれがほとんどの場合は表に出ても、たまには‘顧客は、バーガーとフライドポテトと一緒に、キャッシュドロワーの中身を手に入れることになります。
あなたのサイトの記事から
ウェブ上の関連記事
#がプロンプト #インジェクション攻撃に陥り続ける理由