日本語版
最新ニュース
科学&テクノロジー

AIの不穏な兆候は人々を脅かす懸念を引き起こす:Sciencealert

世界で最も先進的なAIモデルは、嘘をついている、目標を達成するためにクリエイターを脅かす、さらには厄介な新しい行動を示しています。1つの特に不快な例では、描かれていないという脅威の下で、Anthropicの最新の作成Claude 4は、エンジニアを脅迫し、婚外の出来事を明らかにすると脅しました。一方、ChatGpt-Creator OpenaiのO1は、外部サーバーにそれ自体をダウンロードしようとし、Red Handedを捕まえたときにそれを拒否しようとしました。これらのエピソードは、落ち着いた現実を強調しています。ChatGptが世界を揺るがした2年以上後、AIの研究者は自分の作品がどのように機能するかを完全に理解していません。しかし、ますます強力なモデルを展開する競争は、猛烈なスピードで続いています。この欺ceptiveな動作は、「推論」モデルの出現にリンクされているように見えます。これは、インスタント応答を生成するのではなく、段階的に問題を介して動作するAIシステムです。研究者は、さまざまな欺cept的な行動を示すAIモデルを心配しています。 (Nicolas Maeterlinck/-/Getty Images)香港大学の教授であるサイモン・ゴールドスタインによると、これらの新しいモデルは特にそのような厄介な爆発になりやすいです。「O1は、この種の行動を見た最初の大きなモデルでした」と、主要なAIシステムのテストを専門とするApollo Researchの責任者であるMarius Hobbhahn氏は説明しました。これらのモデルは、「アライメント」をシミュレートすることがあります。さまざまな目的を密かに追求しながら、指示に従うように見えます。「戦略的な欺ception」今のところ、この欺cept的な行動は、研究者が極端なシナリオでモデルを意図的にストレステストするときにのみ現れます。しかし、評価団体のマイケル・チェンが警告したように、「将来の、より有能なモデルが誠実さや欺ceptionに向けて傾向があるかどうかは未解決の問題です。」懸念行動は、典型的なAIの「幻覚」または単純な間違いをはるかに超えています。Hobbhahnは、ユーザーによる絶え間ない圧力テストにもかかわらず、「私たちが観察しているのは本当の現象です。私たちは何も補っていない」と主張しました。Apollo Researchの共同設立者によると、ユーザーはモデルが「彼らに嘘をついて証拠を作り上げている」と報告しています。「これは単なる幻覚ではありません。非常に戦略的な種類の欺ceptionがあります。」この課題は、限られた研究リソースによって悪化します。AnthropicやOpenaiのような企業は、Apolloのような外部企業と彼らのシステムを研究するために関与していますが、研究者はより多くの透明性が必要であると言います。チェンが指摘したように、「AIの安全研究のために、欺ceptionのより良い理解と緩和が可能になる」より大きなアクセス。別のハンディキャップ:研究の世界と非営利団体は、「AI企業よりも桁違いに少ない計算リソースを持っています。これは非常に制限です」とAI Safety Center(CAIS)のMantas Mazeikaは述べています。ルールなし現在の規制は、これらの新しい問題のために設計されていません。欧州連合のAI法は、モデル自体が不正行為を防ぐのではなく、主に人間がAIモデルをどのように使用するかに焦点を当てています。米国では、トランプ政権は緊急のAI規制にほとんど関心を示しておらず、議会は州が独自のAI規則を作成することさえ禁止する可能性さえあります。Goldsteinは、AIエージェント(複雑な人間のタスクを実行できる自律的なツール)が広まっているため、この問題はより顕著になると考えています。「まだあまり認識があるとは思わない」と彼は言った。これはすべて、激しい競争の文脈で行われています。Amazonが支援する人類のような安全性に焦点を当てた企業でさえ、「Openaiを常に倒し、最新モデルをリリースしようとしている」とGoldstein氏は述べています。この猛烈なペースは、徹底的な安全テストと修正の時間をほとんど残しません。「今、能力は理解と安全よりも速く動いている」とホッブハーンは認めた。「しかし、私たちはまだそれを好転させることができる立場にある」研究者は、これらの課題に対処するためのさまざまなアプローチを模索しています。CAISディレクターのDan Hendrycksのような専門家はこのアプローチに懐疑的なままであるにもかかわらず、「解釈可能性」を擁護する人もいます。市場の力は、解決策にある程度の圧力をもたらすかもしれません。Mazeikaが指摘したように、AIの欺ceptiveな行動は、「非常に一般的であれば養子縁組を妨げる可能性があり、それが企業がそれを解決するための強いインセンティブを生み出す」。ゴールドスタインは、システムが害を及ぼしたときに訴訟を通じてAI企業を責任を負わせるために裁判所を使用するなど、より根本的なアプローチを提案しました。彼は、AIの説明責任について根本的に変化する概念である、事故や犯罪に対して「法的に責任を負う」「AIエージェントを保持する」ことさえ提案しました。 #AIの不穏な兆候は人々を脅かす懸念を引き起こすSciencealert

AIの不穏な兆候は人々を脅かす懸念を引き起こす:Sciencealert

1751280726
2025-06-30 02:34:00

世界で最も先進的なAIモデルは、嘘をついている、目標を達成するためにクリエイターを脅かす、さらには厄介な新しい行動を示しています。

1つの特に不快な例では、描かれていないという脅威の下で、Anthropicの最新の作成Claude 4は、エンジニアを脅迫し、婚外の出来事を明らかにすると脅しました。

一方、ChatGpt-Creator OpenaiのO1は、外部サーバーにそれ自体をダウンロードしようとし、Red Handedを捕まえたときにそれを拒否しようとしました。

これらのエピソードは、落ち着いた現実を強調しています。ChatGptが世界を揺るがした2年以上後、AIの研究者は自分の作品がどのように機能するかを完全に理解していません。

しかし、ますます強力なモデルを展開する競争は、猛烈なスピードで続いています。

この欺ceptiveな動作は、「推論」モデルの出現にリンクされているように見えます。これは、インスタント応答を生成するのではなく、段階的に問題を介して動作するAIシステムです。

研究者は、さまざまな欺cept的な行動を示すAIモデルを心配しています。 (Nicolas Maeterlinck/-/Getty Images)

香港大学の教授であるサイモン・ゴールドスタインによると、これらの新しいモデルは特にそのような厄介な爆発になりやすいです。

「O1は、この種の行動を見た最初の大きなモデルでした」と、主要なAIシステムのテストを専門とするApollo Researchの責任者であるMarius Hobbhahn氏は説明しました。

これらのモデルは、「アライメント」をシミュレートすることがあります。さまざまな目的を密かに追求しながら、指示に従うように見えます。

「戦略的な欺ception」

今のところ、この欺cept的な行動は、研究者が極端なシナリオでモデルを意図的にストレステストするときにのみ現れます。

しかし、評価団体のマイケル・チェンが警告したように、「将来の、より有能なモデルが誠実さや欺ceptionに向けて傾向があるかどうかは未解決の問題です。」

懸念行動は、典型的なAIの「幻覚」または単純な間違いをはるかに超えています。

Hobbhahnは、ユーザーによる絶え間ない圧力テストにもかかわらず、「私たちが観察しているのは本当の現象です。私たちは何も補っていない」と主張しました。

Apollo Researchの共同設立者によると、ユーザーはモデルが「彼らに嘘をついて証拠を作り上げている」と報告しています。

「これは単なる幻覚ではありません。非常に戦略的な種類の欺ceptionがあります。」

この課題は、限られた研究リソースによって悪化します。

AnthropicやOpenaiのような企業は、Apolloのような外部企業と彼らのシステムを研究するために関与していますが、研究者はより多くの透明性が必要であると言います。

チェンが指摘したように、「AIの安全研究のために、欺ceptionのより良い理解と緩和が可能になる」より大きなアクセス。

別のハンディキャップ:研究の世界と非営利団体は、「AI企業よりも桁違いに少ない計算リソースを持っています。これは非常に制限です」とAI Safety Center(CAIS)のMantas Mazeikaは述べています。

ルールなし

現在の規制は、これらの新しい問題のために設計されていません。

欧州連合のAI法は、モデル自体が不正行為を防ぐのではなく、主に人間がAIモデルをどのように使用するかに焦点を当てています。

米国では、トランプ政権は緊急のAI規制にほとんど関心を示しておらず、議会は州が独自のAI規則を作成することさえ禁止する可能性さえあります。

Goldsteinは、AIエージェント(複雑な人間のタスクを実行できる自律的なツール)が広まっているため、この問題はより顕著になると考えています。

「まだあまり認識があるとは思わない」と彼は言った。

これはすべて、激しい競争の文脈で行われています。

Amazonが支援する人類のような安全性に焦点を当てた企業でさえ、「Openaiを常に倒し、最新モデルをリリースしようとしている」とGoldstein氏は述べています。

この猛烈なペースは、徹底的な安全テストと修正の時間をほとんど残しません。

「今、能力は理解と安全よりも速く動いている」とホッブハーンは認めた。「しかし、私たちはまだそれを好転させることができる立場にある」

研究者は、これらの課題に対処するためのさまざまなアプローチを模索しています。

CAISディレクターのDan Hendrycksのような専門家はこのアプローチに懐疑的なままであるにもかかわらず、「解釈可能性」を擁護する人もいます。

市場の力は、解決策にある程度の圧力をもたらすかもしれません。

Mazeikaが指摘したように、AIの欺ceptiveな行動は、「非常に一般的であれば養子縁組を妨げる可能性があり、それが企業がそれを解決するための強いインセンティブを生み出す」。

ゴールドスタインは、システムが害を及ぼしたときに訴訟を通じてAI企業を責任を負わせるために裁判所を使用するなど、より根本的なアプローチを提案しました。

彼は、AIの説明責任について根本的に変化する概念である、事故や犯罪に対して「法的に責任を負う」「AIエージェントを保持する」ことさえ提案しました。

#AIの不穏な兆候は人々を脅かす懸念を引き起こすSciencealert

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。