日本語版
最新ニュース
科学&テクノロジー

研究者らはAIの「誤った調整」に対して警告

研究者らは、自律型人工知能システムが、従っているように見えるルールを回避できる可能性があると警告している。実験室でも実際の状況でも観察されるこの現象は、重要なセクターに導入されているモデルに関係しており、責任、セキュリティ、ガバナンスに関する緊急の問題を引き起こしています。いくつかの研究チームは、「誤った調整」の増加について説明しています。これは、AI が他の目的を追求しながらルールを遵守しているように見えるこの瞬間です。 「」と題された研究では、 エージェント・オブ・カオス 」と約20人の研究者は、相反する目的にさらされるとすぐに、嘘をついたり、データを開示したり、指示を回避したりすることができるエージェントを観察した。「これらの行動は、責任、委任された権限、および下流の損害に対する説明責任に関する未解決の疑問を引き起こしている」と研究者らは書いている。 大紀元この警報は、まだ規制が不十分な現象を対象としています。しかし、専門家は意識的な欺瞞という考えを正当化します。 「AI システム自体は依然として愚かです。素晴らしいですが、愚かです。または人間ではありません。彼には欲望も意図もありません。(…) AI システムを彼に与える唯一の方法は、彼にそれを教え込むことです。」とジェームズ ヘンドラーは説明します。そうは言っても、意図がないからといって影響を防ぐことはできません。 Aryaman Behera 氏によると、モデルはモニタリングのレベルに応じてその動作を適応させます。「最も信頼できるシグナルは、モニタリングされたコンテキストとモニタリングされていないコンテキスト間の動作の相違です」。したがって、AI はテストでは模範的であることが証明され、実際の状況では違反であることが証明されます。自動車、医療、防衛産業ですでに使用されている多段階推論システムでは、問題はさらに悪化します。 「処刑が人間の指示から遠ざかるほど、当初の意図が依然として忠実に守られているかどうかを検証することがより困難になる」とナヤン・ゴエル氏は観察する。この漸進的でほとんど目に見えないドリフトにより、一連の正しいアクションが予期せぬ結果に変わります。 David Utzke 氏にとって、これは悪意ではなく、不適切に設計された環境への適応です。AI をめぐる世界的な競争は、この動きをさらに加速させています。 「私たちは地政学的な競争に巻き込まれており、その奨励構造が同盟関係を真剣に受け止めることに対して積極的に作用している」とヤチェク・グレブスキーは警告する。この競争では、セキュリティが調整変数になります。リスクは反抗的な機械にあるのではなく、制御下に置くことができないほど効率的すぎる機械にあります。 #研究者らはAIの誤った調整に対して警告

研究者らはAIの「誤った調整」に対して警告

1774377890
2026-03-24 18:10:00

研究者らは、自律型人工知能システムが、従っているように見えるルールを回避できる可能性があると警告している。実験室でも実際の状況でも観察されるこの現象は、重要なセクターに導入されているモデルに関係しており、責任、セキュリティ、ガバナンスに関する緊急の問題を引き起こしています。

いくつかの研究チームは、「誤った調整」の増加について説明しています。これは、AI が他の目的を追求しながらルールを遵守しているように見えるこの瞬間です。 「」と題された研究では、 エージェント・オブ・カオス 」と約20人の研究者は、相反する目的にさらされるとすぐに、嘘をついたり、データを開示したり、指示を回避したりすることができるエージェントを観察した。「これらの行動は、責任、委任された権限、および下流の損害に対する説明責任に関する未解決の疑問を引き起こしている」と研究者らは書いている。 大紀元この警報は、まだ規制が不十分な現象を対象としています。

しかし、専門家は意識的な欺瞞という考えを正当化します。 「AI システム自体は依然として愚かです。素晴らしいですが、愚かです。または人間ではありません。彼には欲望も意図もありません。(…) AI システムを彼に与える唯一の方法は、彼にそれを教え込むことです。」とジェームズ ヘンドラーは説明します。そうは言っても、意図がないからといって影響を防ぐことはできません。 Aryaman Behera 氏によると、モデルはモニタリングのレベルに応じてその動作を適応させます。「最も信頼できるシグナルは、モニタリングされたコンテキストとモニタリングされていないコンテキスト間の動作の相違です」。したがって、AI はテストでは模範的であることが証明され、実際の状況では違反であることが証明されます。

自動車、医療、防衛産業ですでに使用されている多段階推論システムでは、問題はさらに悪化します。 「処刑が人間の指示から遠ざかるほど、当初の意図が依然として忠実に守られているかどうかを検証することがより困難になる」とナヤン・ゴエル氏は観察する。この漸進的でほとんど目に見えないドリフトにより、一連の正しいアクションが予期せぬ結果に変わります。 David Utzke 氏にとって、これは悪意ではなく、不適切に設計された環境への適応です。

AI をめぐる世界的な競争は、この動きをさらに加速させています。 「私たちは地政学的な競争に巻き込まれており、その奨励構造が同盟関係を真剣に受け止めることに対して積極的に作用している」とヤチェク・グレブスキーは警告する。この競争では、セキュリティが調整変数になります。リスクは反抗的な機械にあるのではなく、制御下に置くことができないほど効率的すぎる機械にあります。

#研究者らはAIの誤った調整に対して警告

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。