日本語版
最新ニュース
科学&テクノロジー

OpenAI、自社の「ストロベリー」AIモデルを調査したユーザーを禁止すると警告

OpenAIは、最新のAIモデルが「何を考えているのか」をユーザーに知られたくないと思っている。 発売 その 「ストロベリー」AIモデルファミリー 先週、OpenAIはo1-previewとo1-miniのいわゆる推論能力を宣伝し、そのモデルがどのように機能するかを探ろうとするユーザーに警告メールと禁止の脅迫を送りつけてきた。OpenAIのこれまでのAIモデルとは異なり、 GPT-4o同社は、o1を段階的な問題解決プロセスを経て答えを出すように特別に訓練した。ユーザーが「o1」モデルに質問をすると、 チャットGPTユーザーは、ChatGPT インターフェースに書き出されたこの思考の連鎖プロセスを確認するオプションがあります。ただし、設計上、OpenAI は生の思考の連鎖をユーザーから隠し、代わりに 2 番目の AI モデルによって作成されたフィルタリングされた解釈を提示します。隠された情報ほどマニアを魅了するものはないので、ハッカーやレッドチームの間では、O1の生の思考回路を解明しようとする競争が繰り広げられてきました。 脱獄 または 迅速な注射 モデルを騙して秘密を漏らさせようとする手法。いくつかの成功例が報告されているが、まだ確証されたものはない。その間、OpenAI は ChatGPT インターフェースを通じて監視しており、たとえ単なる好奇心からであっても、o1 の推論を探ろうとするあらゆる試みに対しては厳しく対処すると報じられている。1人のXユーザー 報告された (確認済み その他スケールAIプロンプトエンジニアを含む ライリー・グッドサイド)は、o1との会話で「推論トレース」という用語を使用した場合、警告メールを受け取ったと述べた。その他 言う ChatGPT にモデルの「推論」について質問するだけで警告がトリガーされます。OpenAI からの警告メールには、特定のユーザー リクエストが、安全対策や安全措置の回避に関するポリシーに違反しているとしてフラグが立てられていると記載されています。「このアクティビティを停止し、ChatGPT を当社の利用規約と使用ポリシーに従って使用していることを確認してください」と書かれています。「このポリシーにさらに違反すると、GPT-4o with Reasoning にアクセスできなくなる可能性があります」と、o1 モデルの内部名に言及しています。マルコ・フィゲロアは 管理する MozillaのGenAIバグ報奨金プログラムは、先週金曜日にXでOpenAIの警告メールについて最初に投稿した人の一人である。 文句を言う…

OpenAI、自社の「ストロベリー」AIモデルを調査したユーザーを禁止すると警告

1727055273
2024-09-17 23:00:00

OpenAIは、最新のAIモデルが「何を考えているのか」をユーザーに知られたくないと思っている。 発売 その 「ストロベリー」AIモデルファミリー 先週、OpenAIはo1-previewとo1-miniのいわゆる推論能力を宣伝し、そのモデルがどのように機能するかを探ろうとするユーザーに警告メールと禁止の脅迫を送りつけてきた。

OpenAIのこれまでのAIモデルとは異なり、 GPT-4o同社は、o1を段階的な問題解決プロセスを経て答えを出すように特別に訓練した。ユーザーが「o1」モデルに質問をすると、 チャットGPTユーザーは、ChatGPT インターフェースに書き出されたこの思考の連鎖プロセスを確認するオプションがあります。ただし、設計上、OpenAI は生の思考の連鎖をユーザーから隠し、代わりに 2 番目の AI モデルによって作成されたフィルタリングされた解釈を提示します。

隠された情報ほどマニアを魅了するものはないので、ハッカーやレッドチームの間では、O1の生の思考回路を解明しようとする競争が繰り広げられてきました。 脱獄 または 迅速な注射 モデルを騙して秘密を漏らさせようとする手法。いくつかの成功例が報告されているが、まだ確証されたものはない。

その間、OpenAI は ChatGPT インターフェースを通じて監視しており、たとえ単なる好奇心からであっても、o1 の推論を探ろうとするあらゆる試みに対しては厳しく対処すると報じられている。

1人のXユーザー 報告された (確認済み その他スケールAIプロンプトエンジニアを含む ライリー・グッドサイド)は、o1との会話で「推論トレース」という用語を使用した場合、警告メールを受け取ったと述べた。その他 言う ChatGPT にモデルの「推論」について質問するだけで警告がトリガーされます。

OpenAI からの警告メールには、特定のユーザー リクエストが、安全対策や安全措置の回避に関するポリシーに違反しているとしてフラグが立てられていると記載されています。「このアクティビティを停止し、ChatGPT を当社の利用規約と使用ポリシーに従って使用していることを確認してください」と書かれています。「このポリシーにさらに違反すると、GPT-4o with Reasoning にアクセスできなくなる可能性があります」と、o1 モデルの内部名に言及しています。

マルコ・フィゲロアは 管理する MozillaのGenAIバグ報奨金プログラムは、先週金曜日にXでOpenAIの警告メールについて最初に投稿した人の一人である。 文句を言う このことが、モデルに関するレッドチームによる安全性研究を積極的に行う能力を妨げている、と彼は述べた。「#AIRedTeaming に集中しすぎていて、脱獄を繰り返した昨日、@OpenAI からこのメールを受け取ったことに気が付かなかった」と彼は書いた。「私は今、出入り禁止リストに載っている!!!」

隠された思考の連鎖

LLMで推論を学ぶOpenAIのブログの「AIモデルに隠された思考の連鎖は、独自の監視機会を提供し、モデルの「心を読み」、いわゆる思考プロセスを理解することを可能にする」と同社は述べている。これらのプロセスは、生のまま検閲されずに残された場合に会社にとって最も有用であるが、いくつかの理由から、それは会社の最大の商業的利益と一致しない可能性がある。

「例えば、将来的には、ユーザーを操作している兆候がないか、思考の連鎖を監視したいと考えるかもしれません」と同社は書いている。「しかし、これが機能するには、モデルが思考を改変せずに表現する自由がなければなりません。そのため、思考の連鎖にポリシーの遵守やユーザーの好みを学習させることはできません。また、一貫性のない思考の連鎖をユーザーに直接見せることも望んでいません。」

#OpenAI自社のストロベリーAIモデルを調査したユーザーを禁止すると警告

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。