日本語版
最新ニュース
科学&テクノロジー

この AI エージェントは不正行為をしないように設計されています

AIエージェントのようなもの オープンクロー デジタル ライフを主導できるという理由で、最近人気が爆発的に高まっています。パーソナライズされた朝のニュースのダイジェストが必要な場合でも、ケーブル会社の顧客サービスと戦うことができる代理人が必要な場合でも、いくつかのタスクを代わりに実行し、残りのタスクを解決するように促してくれる To Do リストの監査人が必要な場合でも、エージェント アシスタントはデジタル アカウントにアクセスしてコマンドを実行するように構築されています。これは便利ですが、また、 多くの混乱を引き起こした。ボットはそこら中にいます メールの一括削除 保存するように指示されていますが、 冷遇されていると思われる作品を上書きしてヒット作を書く、 そして 所有者に対してフィッシング攻撃を開始する。ここ数週間の大混乱の展開を見て、長年セキュリティ エンジニアで研究者として活動している Niels Provos 氏は、何か新しいことを試してみることにしました。彼は今日、オープンソースの安全な AI アシスタントをローンチします。 アイアンカーテン 重要な制御層を追加するように設計されています。エージェントはユーザーのシステムやアカウントと直接対話するのではなく、分離された仮想マシンで実行されます。そして、あらゆるアクションを実行するその能力は、システムを管理するために所有者が作成したポリシー (憲法と考えることもできます) によって媒介されます。重要なのは、IronCurtain は、これらの包括的なポリシーを平易な英語で受け取り、大規模言語モデル (LLM) を使用して自然言語を強制可能なセキュリティ ポリシーに変換する複数段階のプロセスを通じてポリシーを実行するように設計されていることです。「OpenClaw のようなサービスは現在、最高の誇大宣伝になっていますが、『まあ、これはおそらく私たちがやりたいことではないでしょう』と言える機会が来ることを願っています」とプロボス氏は言います。 「代わりに、非常に高い実用性を提供しながらも、まったく未知の、時には破壊的な道を歩むつもりのないものを開発しましょう。」プロボス氏によると、LLM は「確率的」で確率的であることで有名なため、直感的で率直なステートメントを取得し、それを強制力のある決定論的 (または予測可能な) レッドラインに変える IronCurtain の能力は非常に重要です。言い換えれば、同じプロンプトに対して常に同じコンテンツを生成したり、同じ情報を提供したりするとは限りません。これは、AI ガードレールに課題をもたらします。AI システムは時間の経過とともに進化し、制御または制約メカニズムの解釈方法を修正する可能性があり、その結果、不正なアクティビティが発生する可能性があります。プロボス氏によると、IronCurtain…

この AI エージェントは不正行為をしないように設計されています

1772143257
2026-02-26 20:54:00

AIエージェントのようなもの オープンクロー デジタル ライフを主導できるという理由で、最近人気が爆発的に高まっています。パーソナライズされた朝のニュースのダイジェストが必要な場合でも、ケーブル会社の顧客サービスと戦うことができる代理人が必要な場合でも、いくつかのタスクを代わりに実行し、残りのタスクを解決するように促してくれる To Do リストの監査人が必要な場合でも、エージェント アシスタントはデジタル アカウントにアクセスしてコマンドを実行するように構築されています。これは便利ですが、また、 多くの混乱を引き起こした。ボットはそこら中にいます メールの一括削除 保存するように指示されていますが、 冷遇されていると思われる作品を上書きしてヒット作を書く、 そして 所有者に対してフィッシング攻撃を開始する

ここ数週間の大混乱の展開を見て、長年セキュリティ エンジニアで研究者として活動している Niels Provos 氏は、何か新しいことを試してみることにしました。彼は今日、オープンソースの安全な AI アシスタントをローンチします。 アイアンカーテン 重要な制御層を追加するように設計されています。エージェントはユーザーのシステムやアカウントと直接対話するのではなく、分離された仮想マシンで実行されます。そして、あらゆるアクションを実行するその能力は、システムを管理するために所有者が作成したポリシー (憲法と考えることもできます) によって媒介されます。重要なのは、IronCurtain は、これらの包括的なポリシーを平易な英語で受け取り、大規模言語モデル (LLM) を使用して自然言語を強制可能なセキュリティ ポリシーに変換する複数段階のプロセスを通じてポリシーを実行するように設計されていることです。

「OpenClaw のようなサービスは現在、最高の誇大宣伝になっていますが、『まあ、これはおそらく私たちがやりたいことではないでしょう』と言える機会が来ることを願っています」とプロボス氏は言います。 「代わりに、非常に高い実用性を提供しながらも、まったく未知の、時には破壊的な道を歩むつもりのないものを開発しましょう。」

プロボス氏によると、LLM は「確率的」で確率的であることで有名なため、直感的で率直なステートメントを取得し、それを強制力のある決定論的 (または予測可能な) レッドラインに変える IronCurtain の能力は非常に重要です。言い換えれば、同じプロンプトに対して常に同じコンテンツを生成したり、同じ情報を提供したりするとは限りません。これは、AI ガードレールに課題をもたらします。AI システムは時間の経過とともに進化し、制御または制約メカニズムの解釈方法を修正する可能性があり、その結果、不正なアクティビティが発生する可能性があります。

プロボス氏によると、IronCurtain のポリシーは、「エージェントは私の電子メールをすべて読む可能性があります。私の連絡先の人々に尋ねることなく電子メールを送信する可能性があります。他の人については、最初に私に尋ねてください。何も永久に削除しないでください。」

IronCurtain は、これらの指示を取得して強制可能なポリシーに変換し、仮想マシン内のアシスタント エージェントと、タスクを実行するために LLM にデータやその他のデジタル サービスへのアクセスを許可するモデル コンテキスト プロトコル サーバーと呼ばれるものとの間の仲介を行います。この方法でエージェントを制限できることにより、電子メール プロバイダーなどの Web プラットフォームが現在提供していないアクセス制御の重要なコンポーネントが追加されます。これは、人間の所有者と AI エージェント ボットの両方がすべて 1 つのアカウントを使用するシナリオ向けに構築されていないためです。

Provos 氏は、IronCurtain は、システムがエッジケースに遭遇し、どのように対処するかについて人間の入力を求める際に、時間の経過とともに各ユーザーの「体質」を洗練し、改善するように設計されていると指摘しています。このシステムはモデルに依存せず、任意の LLM で使用でき、すべてのポリシー決定の監査ログを長期にわたって維持するように設計されています。

IronCurtain は研究用プロトタイプであり、消費者向け製品ではありません。Provos は、人々がプロジェクトを探索し、進化させるために貢献してくれることを望んでいます。 IronCurtain の初期バージョンを実験してきた著名なサイバーセキュリティ研究者である Dino Dai Zovi 氏は、このプロジェクトが採用する概念的なアプローチは、エージェント AI をどのように制限する必要があるかについての自身の直観と一致していると述べています。

#この #エージェントは不正行為をしないように設計されています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。