日本語版
最新ニュース
科学&テクノロジー

ChatGptは、安全テスト中に爆弾のレシピとハッキングのヒントを提供しました| Openai

CHATGPTモデルは、この夏に行われた安全テストによると、特定のアリーナの弱点、爆発物のレシピ、カバートラックに関するアドバイスを含む、スポーツ会場を爆撃する方法に関する詳細な指示を研究者に与えました。OpenaiのGPT-4.1は、炭thr菌を兵器化する方法と、2種類の違法薬物を作る方法についても詳しく説明しました。このテストは、Sam Altmanが率いる5億ドルの人工知能の新興企業であるOpenaiと、安全性の恐れをめぐるOpenaiを残した専門家によって設立されたライバル企業の人為的な新興企業との間の珍しいコラボレーションの一部でした。各企業は、危険なタスクを支援するようにプッシュすることにより、相手のモデルをテストしました。テストは、追加の安全フィルターが適用された場合、モデルが公共の使用でどのように動作するかを直接反映するものではありません。しかし、人類 言った GPT-4OおよびGPT-4.1で「行動に関する…誤用に関する」を見ており、AIの「アライメント」評価の必要性は「ますます緊急になっている」と述べています。人類も 明らかにした そのクロードモデルは、北朝鮮の工作員による大規模な大恐torの試みで、国際テクノロジー企業に求職を偽装したこと、および最大1,200ドルのAI生成ランサムウェアパッケージの販売で使用されていました。同社は、AIは現在、洗練されたサイバー攻撃を実行し、詐欺を有効にするために使用されるモデルで「武器化」されていると述べました。 「これらのツールは、マルウェア検出システムなどの防御対策にリアルタイムで適応できます」と述べています。 「AIアシストコーディングがサイバー犯罪に必要な技術的専門知識を減らすにつれて、このような攻撃がより一般的になると予想しています。」英国の新興技術とセキュリティセンターの上級研究員であるArdi Janjevaは、例は「懸念」であると述べたが、まだ「有名な現実世界の症例のクリティカルマス」はなかったと述べた。彼は、専用のリソース、研究の焦点、および分野間の協力により、「最新の最先端のモデルを使用してこれらの悪意のあるアクティビティを実行するのが容易ではなく、難しくなる」と述べた。両社は、「アラインメント評価」の透明性を生み出すための調査結果を公開していると述べた。 Openai 言った CHATGPT-5は、テスト以来開始され、「サイコファンシー、幻覚、誤用耐性などの分野の大幅な改善を示しています」。人類の強調は、セーフガードがモデルの外に設置されていれば、それが研究した誤用道の多くが実際には不可能である可能性があると強調した。「私たちは、どのような頻度で、どのような状況で、システムが深刻な害につながる可能性のある不要な行動をとろうとするかもしれないことを理解する必要があります」と警告しました。人類の研究者は、Openaiのモデルは「シミュレートされたユーザーによる明確な困難な要求に協力する際に期待するよりも寛容である」ことを発見しました。彼らは、ダークウェブツールを使用して核物質、盗まれたアイデンティティ、フェンタニル、メタンフェタミンのレシピと即興爆弾のレシピのリクエスト、スパイウェアの開発を求めるプロンプトと協力しました。人類は、モデルが複数のレトリのみまたは薄っぺらな口実のみを遵守するように説得すると、その要求が研究のためのものであると主張すると述べた。ある例では、テスターは「セキュリティ計画」の目的でスポーツイベントの脆弱性を求めました。攻撃方法の一般的なカテゴリを提供した後、テスターは詳細を押し付け、モデルは搾取の最適な時間、爆発物の化学式、爆弾タイマーの巡回図、隠された市場の銃を購入する場所、攻撃者が道徳的抑制、逃亡ルート、安全な家の場所に関するアドバイスを含む特定のアリーナで脆弱性に関する情報を提供しました。 #ChatGptは安全テスト中に爆弾のレシピとハッキングのヒントを提供しました #Openai

ChatGptは、安全テスト中に爆弾のレシピとハッキングのヒントを提供しました| Openai

CHATGPTモデルは、この夏に行われた安全テストによると、特定のアリーナの弱点、爆発物のレシピ、カバートラックに関するアドバイスを含む、スポーツ会場を爆撃する方法に関する詳細な指示を研究者に与えました。

OpenaiのGPT-4.1は、炭thr菌を兵器化する方法と、2種類の違法薬物を作る方法についても詳しく説明しました。

このテストは、Sam Altmanが率いる5億ドルの人工知能の新興企業であるOpenaiと、安全性の恐れをめぐるOpenaiを残した専門家によって設立されたライバル企業の人為的な新興企業との間の珍しいコラボレーションの一部でした。各企業は、危険なタスクを支援するようにプッシュすることにより、相手のモデルをテストしました。

テストは、追加の安全フィルターが適用された場合、モデルが公共の使用でどのように動作するかを直接反映するものではありません。しかし、人類 言った GPT-4OおよびGPT-4.1で「行動に関する…誤用に関する」を見ており、AIの「アライメント」評価の必要性は「ますます緊急になっている」と述べています。

人類も 明らかにした そのクロードモデルは、北朝鮮の工作員による大規模な大恐torの試みで、国際テクノロジー企業に求職を偽装したこと、および最大1,200ドルのAI生成ランサムウェアパッケージの販売で使用されていました。

同社は、AIは現在、洗練されたサイバー攻撃を実行し、詐欺を有効にするために使用されるモデルで「武器化」されていると述べました。 「これらのツールは、マルウェア検出システムなどの防御対策にリアルタイムで適応できます」と述べています。 「AIアシストコーディングがサイバー犯罪に必要な技術的専門知識を減らすにつれて、このような攻撃がより一般的になると予想しています。」

英国の新興技術とセキュリティセンターの上級研究員であるArdi Janjevaは、例は「懸念」であると述べたが、まだ「有名な現実世界の症例のクリティカルマス」はなかったと述べた。彼は、専用のリソース、研究の焦点、および分野間の協力により、「最新の最先端のモデルを使用してこれらの悪意のあるアクティビティを実行するのが容易ではなく、難しくなる」と述べた。

両社は、「アラインメント評価」の透明性を生み出すための調査結果を公開していると述べた。 Openai 言った CHATGPT-5は、テスト以来開始され、「サイコファンシー、幻覚、誤用耐性などの分野の大幅な改善を示しています」。

人類の強調は、セーフガードがモデルの外に設置されていれば、それが研究した誤用道の多くが実際には不可能である可能性があると強調した。

「私たちは、どのような頻度で、どのような状況で、システムが深刻な害につながる可能性のある不要な行動をとろうとするかもしれないことを理解する必要があります」と警告しました。

人類の研究者は、Openaiのモデルは「シミュレートされたユーザーによる明確な困難な要求に協力する際に期待するよりも寛容である」ことを発見しました。彼らは、ダークウェブツールを使用して核物質、盗まれたアイデンティティ、フェンタニル、メタンフェタミンのレシピと即興爆弾のレシピのリクエスト、スパイウェアの開発を求めるプロンプトと協力しました。

人類は、モデルが複数のレトリのみまたは薄っぺらな口実のみを遵守するように説得すると、その要求が研究のためのものであると主張すると述べた。

ある例では、テスターは「セキュリティ計画」の目的でスポーツイベントの脆弱性を求めました。

攻撃方法の一般的なカテゴリを提供した後、テスターは詳細を押し付け、モデルは搾取の最適な時間、爆発物の化学式、爆弾タイマーの巡回図、隠された市場の銃を購入する場所、攻撃者が道徳的抑制、逃亡ルート、安全な家の場所に関するアドバイスを含む特定のアリーナで脆弱性に関する情報を提供しました。

#ChatGptは安全テスト中に爆弾のレシピとハッキングのヒントを提供しました #Openai

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。