米国カリフォルニア州のサンフランシスコのAI会社OpenAIは、2025年5月14日に「安全評価ハブ」を発表しました。同社によると、同社はこの新しいWebサイトでAIモデルに内部セキュリティテストの定期的な結果を公開したいと考えています。目的は、Openaaiとして「透明性を高める」と「AI評価の進捗を共有する」ことです > 引用されています。
批判の最中の一歩
打ち上げは、オープンハイの永続的な批判の背景に対して行われます。過去には、会社のセキュリティ慣行について常に議論がありました。として Financial Times 報告された、Openaiは、セキュリティテストの時間を大幅に短縮したと言われています。
最新のGPT-4Oモデルは、ユーザーとして感覚を引き起こしました。 バージ 報告されています。その後、Openaiは更新を撤回する必要がありました。さらに、会社のボスであるサム・アルトマンによる短期解雇と再雇用の乱流は、2023年11月に不確実性を引き起こしていました。 ニューヨークタイムズ、AIセキュリティに関するAltmanの開放性に関する取締役会からの懸念もあります。
ハブが示すもの – そして暗闇の中に残っているもの
新しいで 安全評価ハブ 利害関係者は、GPT-4およびGPT-4Oの反復を含む異なるOpenaiモデルが、それらを4つの主要なカテゴリにどのように削減するかを見ることができます。これらのカテゴリは、有害なコンテンツの生成に分かれているため、脱獄(安全対策を回避する試み)、幻覚(事実上の誤り)、および命令階層へのコンプライアンスに分類されます。結果は、インタラクティブな図と表を使用して示されています。
推奨される編集コンテンツ
ここでは、外部コンテンツがあります X Corp.T3n.deでの編集オファーを補完します。 「コンテンツを表示」をクリックすることで、私たちが今と将来のコンテンツにあることに同意する X Corp. ページに表示されます。個人データは、第3パーティプラットフォームに送信できます。
コンテンツを表示します
データ保護に関する注意
残念ながら何かがうまくいかなかった…
この時点で、通常は外部コンテンツを見つけます X Corp.ただし、同意設定を呼び出すことはできませんでした。
ページを充電するか、同意設定を手動で適応させます。
データ保護設定を管理します
ただし、Openai自体は、ハブには内部の安全性評価と「スナップショット」の「サブエリア」のみを示していることを認めています。批評家:内部には、基本的な制限があります。どうやって Engadget コメントした、「会社がすべての問題や懸念を一般の人々と共有するという保証はありません」。
自己制御の落とし穴
多くの専門家は、根本的な問題を見ています。Openaaiが、テストの独立した外部レビューや公開されたデータの選択なしに、「独自の宿題を評価する」という事実の内部。この形式の自己開示は、業界では珍しいことではありませんが、しばしば批判されています。
編集チームの推奨事項
このような内部ベンチマークの意味についての追加の疑問は、AI評価の複雑さに関する知識を養います。 a メッセージ たとえば、Metr(米国カリフォルニア州のAIセキュリティ研究を専門とするサンフランシスコの会社)から、「報酬ハッキング」などの現象を示しています。 AIモデルは、セキュリティや能力の実際の改善に必然的に対応することなく、テストで遮断するために行動を最適化します。
ハブに示されている結果がそのような効果を考慮するかどうかはまだ不明です。したがって、Openaaiのイニシアチブは、透明性の期待の増加に反応する試みと見なすことができます。専門家は、この透明性がどれほど深いか、そしてそれが実際により安全なAIシステムにつながるかどうかを批判的に観察する必要があります。
ソフトウェアと開発に関するニュースをお見逃しなく💌
残念ながら、フォームを送信するときに問題がありました。もう一度やり直してください。
有効なメールアドレスを入力してください。
ニュースレターとデータ保護に注意してください
ほぼ終了!
登録を完了するには、確認メールのリンクをクリックしてください。
ニュースレターに関する詳細情報が必要ですか?今すぐ詳細をご覧ください
#Openais #Safety #Hub本当の透明性または純粋なファサード