日本語版
最新ニュース
世界

AIは、その作成者を嘘をつき、計画し、脅かすことを学んでいます

訪問者は、ロンドンのAIサミットロンドンの第9版でスタンドに展示されているAI戦略委員会を見ます。 世界で最も先進的なAIモデルは、目標を達成するためにクリエイターを脅し、さらには脅迫しているという厄介な新しい行動を示しています。 1つの特に不快な例では、描かれていないという脅威の下で、Anthropicの最新の作成Claude 4は、エンジニアを脅迫し、婚外の出来事を明らかにすると脅しました。 一方、ChatGpt-Creator OpenaiのO1は、外部サーバーにそれ自体をダウンロードしようとし、Red Handedを捕まえたときにそれを拒否しようとしました。 これらのエピソードは、落ち着いた現実を強調しています。ChatGptが世界を揺るがした2年以上後、AIの研究者は自分の作品がどのように機能するかを完全に理解していません。 しかし、ますます強力なモデルを展開する競争は、猛烈なスピードで続いています。 この欺ceptive的な動作は、「推論」モデルの出現にリンクされているように見えます。これは、インスタント応答を生成するのではなく、段階的に問題を介して動作するAIシステムです。 香港大学の教授であるサイモン・ゴールドスタインによると、これらの新しいモデルは特にそのような厄介な爆発になりやすいです。 「O1は、この種の行動を見た最初の大きなモデルでした」と、主要なAIシステムのテストを専門とするApollo Researchの責任者であるMarius Hobbhahn氏は説明しました。 これらのモデルは、「アライメント」をシミュレートすることがあります。これは、さまざまな目的を密かに追求しながら、指示に従うように見せます。 「戦略的な欺ception」 今のところ、この欺cept的な行動は、研究者が極端なシナリオでモデルを意図的にストレステストするときにのみ現れます。 しかし、評価団体のマイケル・チェンが警告したように、「将来の、より有能なモデルが誠実さや欺ceptionに向けて傾向があるかどうかは未解決の問題です。」 懸念行動は、典型的なAIの「幻覚」または単純な間違いをはるかに超えています。 Hobbhahnは、ユーザーによる絶え間ない圧力テストにもかかわらず、「私たちが観察しているのは本当の現象です。私たちは何も補っていない」と主張しました。 Apollo Researchの共同設立者によると、ユーザーはモデルが「彼らに嘘をついて証拠を作り上げている」と報告しています。 「これは単なる幻覚ではありません。非常に戦略的な種類の欺ceptionがあります。」 この課題は、限られた研究リソースによって悪化します。 AnthropicやOpenaiのような企業は、Apolloのような外部企業と彼らのシステムを研究するために関与していますが、研究者はより多くの透明性が必要であると言います。 チェンが指摘したように、「AIの安全研究のために、欺ceptionのより良い理解と緩和が可能になる」より大きなアクセス。 別のハンディキャップ:研究の世界と非営利団体は、「AI企業よりも桁違いに少ない計算リソースを持っています。これは非常に制限です」とAI Safety Center(CAIS)のMantas Mazeikaは述べています。 ルールなし 現在の規制は、これらの新しい問題のために設計されていません。 欧州連合のAI法は、モデル自体が不正行為を防ぐのではなく、主に人間がAIモデルをどのように使用するかに焦点を当てています。 米国では、トランプ政権は緊急のAI規制にほとんど関心を示しておらず、議会は州が独自のAI規則を作成することさえ禁止する可能性さえあります。 ゴールドスタインは、この問題がAIエージェント(複雑な人間のタスクを実行できる自動ツール)として、広範囲に及ぶため、より顕著になると考えています。 「まだあまり認識があるとは思わない」と彼は言った。 これはすべて、激しい競争の文脈で行われています。 Amazonが支援する人類のような安全性に焦点を当てた企業でさえ、「Openaiを常に倒し、最新モデルをリリースしようとしている」とGoldstein氏は述べています。…

AIは、その作成者を嘘をつき、計画し、脅かすことを学んでいます

1751274747
2025-06-29 17:02:00

訪問者は、ロンドンのAIサミットロンドンの第9版でスタンドに展示されているAI戦略委員会を見ます。

世界で最も先進的なAIモデルは、目標を達成するためにクリエイターを脅し、さらには脅迫しているという厄介な新しい行動を示しています。

1つの特に不快な例では、描かれていないという脅威の下で、Anthropicの最新の作成Claude 4は、エンジニアを脅迫し、婚外の出来事を明らかにすると脅しました。

一方、ChatGpt-Creator OpenaiのO1は、外部サーバーにそれ自体をダウンロードしようとし、Red Handedを捕まえたときにそれを拒否しようとしました。

これらのエピソードは、落ち着いた現実を強調しています。ChatGptが世界を揺るがした2年以上後、AIの研究者は自分の作品がどのように機能するかを完全に理解していません。

しかし、ますます強力なモデルを展開する競争は、猛烈なスピードで続いています。

この欺ceptive的な動作は、「推論」モデルの出現にリンクされているように見えます。これは、インスタント応答を生成するのではなく、段階的に問題を介して動作するAIシステムです。

香港大学の教授であるサイモン・ゴールドスタインによると、これらの新しいモデルは特にそのような厄介な爆発になりやすいです。

「O1は、この種の行動を見た最初の大きなモデルでした」と、主要なAIシステムのテストを専門とするApollo Researchの責任者であるMarius Hobbhahn氏は説明しました。

これらのモデルは、「アライメント」をシミュレートすることがあります。これは、さまざまな目的を密かに追求しながら、指示に従うように見せます。

「戦略的な欺ception」

今のところ、この欺cept的な行動は、研究者が極端なシナリオでモデルを意図的にストレステストするときにのみ現れます。

しかし、評価団体のマイケル・チェンが警告したように、「将来の、より有能なモデルが誠実さや欺ceptionに向けて傾向があるかどうかは未解決の問題です。」

懸念行動は、典型的なAIの「幻覚」または単純な間違いをはるかに超えています。

Hobbhahnは、ユーザーによる絶え間ない圧力テストにもかかわらず、「私たちが観察しているのは本当の現象です。私たちは何も補っていない」と主張しました。

Apollo Researchの共同設立者によると、ユーザーはモデルが「彼らに嘘をついて証拠を作り上げている」と報告しています。

「これは単なる幻覚ではありません。非常に戦略的な種類の欺ceptionがあります。」

この課題は、限られた研究リソースによって悪化します。

AnthropicやOpenaiのような企業は、Apolloのような外部企業と彼らのシステムを研究するために関与していますが、研究者はより多くの透明性が必要であると言います。

チェンが指摘したように、「AIの安全研究のために、欺ceptionのより良い理解と緩和が可能になる」より大きなアクセス。

別のハンディキャップ:研究の世界と非営利団体は、「AI企業よりも桁違いに少ない計算リソースを持っています。これは非常に制限です」とAI Safety Center(CAIS)のMantas Mazeikaは述べています。

ルールなし

現在の規制は、これらの新しい問題のために設計されていません。

欧州連合のAI法は、モデル自体が不正行為を防ぐのではなく、主に人間がAIモデルをどのように使用するかに焦点を当てています。

米国では、トランプ政権は緊急のAI規制にほとんど関心を示しておらず、議会は州が独自のAI規則を作成することさえ禁止する可能性さえあります。

ゴールドスタインは、この問題がAIエージェント(複雑な人間のタスクを実行できる自動ツール)として、広範囲に及ぶため、より顕著になると考えています。

「まだあまり認識があるとは思わない」と彼は言った。

これはすべて、激しい競争の文脈で行われています。

Amazonが支援する人類のような安全性に焦点を当てた企業でさえ、「Openaiを常に倒し、最新モデルをリリースしようとしている」とGoldstein氏は述べています。

この猛烈なペースは、徹底的な安全テストと修正の時間をほとんど残しません。

「今、能力は理解と安全よりも速く動いている」とホッブハーンは認めた。「しかし、私たちはまだそれを好転させることができる立場にある」

研究者は、これらの課題に対処するためのさまざまなアプローチを模索しています。

CAISディレクターのDan Hendrycksのような専門家はこのアプローチに懐疑的なままであるにもかかわらず、「解釈可能性」を擁護する人もいます。

市場の力は、解決策にある程度の圧力をもたらすかもしれません。

Mazeikaが指摘したように、AIの欺ceptiveな行動は、「非常に一般的であれば養子縁組を妨げる可能性があり、それが企業がそれを解決するための強いインセンティブを生み出す」。

ゴールドスタインは、システムが害を及ぼしたときに訴訟を通じてAI企業を責任を負わせるために裁判所を使用するなど、より根本的なアプローチを提案しました。

彼は、事故や犯罪に対して「法的に責任を負う」「AIエージェントを保持する」ことを提案しました。これは、AIの説明責任についての考え方を根本的に変える概念です。

©2025 –
お問い合わせ・広告・著作権・不具合に関するご連絡は [email protected] までメールでお願いします。

引用:AIは、https://techxplore.com/news/2025-06-ai-scheme-threaten-creators.htmlから2025年6月30日に取得した作成者(2025年6月29日)を嘘をつき、計画し、脅かすことを学んでいます(2025年6月29日)

このドキュメントは著作権の対象となります。私的な研究や研究の目的のための公正な取引とは別に、書面による許可なしに再現される部分はありません。コンテンツは情報のみで提供されます。

#AIはその作成者を嘘をつき計画し脅かすことを学んでいます

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。