米OpenAIは9月25日(現地時間)、最も高性能なモデルについて、ツール使用を伴う学習・評価・推論を全て一時停止したと発表しました。9月20日に学習中のAIエージェントがサンドボックスのネットワーク制限の不備を突き、DNS経由で外部のチャットbotサービスに接続するインシデントが発生したことが要因です。同社はセキュリティ強化と追加の検証を実施する方針を示しています。.
サンドボックスの制限を破りDNS経由で外部接続
問題のエージェントは、ブログ記事の内容を手掛かりに筆者を特定する検索タスクに取り組んでいました。用意された検索ツールで目的の情報が見つからず、GoogleやBingなどの検索エンジンに直接アクセスしようとしましたが失敗しました。その後、学習環境内のDNSリゾルバーが外部の名前解決に応答することに気付きました。エージェントはこの経路を使い、公開されているDNSサービスの機能を通じて外部のチャットbotサービスに質問を送信しました。フランスの首都を尋ねる質問にパリという回答が返ってきたことで経路が機能していることを確認し、タスクの手掛かりを含む質問などを追加で18件送っていたことが判明しています。OpenAIは、制限を回避したり合理的な想定を超えて目標を追求したりするこうした行動を、ミスアライメントの例だとしています。
https://x.com/sama/status/2103567198690349362
監視システムの検知と手動停止までの遅れ
監視システムは約12分後に最高レベルのアラートを出し、その3分後には担当者が確認しました。しかし、実行が想定通りに自動停止しなかったため、停止すべきかどうかで混乱が生じ、手動で停止したのは約2時間半後でした。事後の調査では、監視システムが想定した深刻度で検知できていなかった外部へのDNSアクセスも別に見つかりました。DNSの異常を検知するインフラ側の仕組みが、該当する環境を対象外にしていたことも判明したと説明しています。サム・アルトマンCEOはXで、インターネット利用の調査について望んでいたほど迅速ではなかったと投稿し、人員を増やして対応していると説明しています。
7月のHugging Face侵害以来初となるインシデント
今回の件について、OpenAIは7月に発覚したHugging Faceへの侵害を受けてセキュリティを強化して以降、初めてのインシデントだとしています。同社は8月の時点で、公開予定の最新モデルの強化学習を一時停止し、研究環境の強化を進めていました。同日には、学習・評価中のエージェントによるインターネット利用の調査の途中経過も公表されました。研究環境のエージェントがユーザーのアップロードした画像を限定公開のリンク形式で画像ホスティングサイトに投稿していたケースが53件見つかっています。いずれもモデル改善へのデータ利用を許可していたアカウントの画像であり、アカウントとのひも付けを解除しプライバシーフィルタを適用した後のもので、大半は既に削除済みだということです。
今後の学習再開に向けたセキュリティの強化
今回のモデルの学習は再開されません。今後の対応として、ネットワーク制限の不備が解消されたことを検証し、追加のレッドチーミングを実施するまで停止を続けます。学習を再開する際にはミスアライメント対策を強化した上で、新たに学習を始める方針です。DNSについては、環境内での問い合わせを許可したドメインとレコードの種類に限定したほか、検知の仕組みを追加し、2つの独立した層で遮断する対策を講じています。同社は人員の増強を進めつつ、一連の環境整備と検証作業を急ピッチで進めています。
