1762175108
2025-11-03 13:02:00
ジム・パワーズ著
[email protected]
人類の歴史のほとんどにおいて、私たちは道徳の羅針盤が真北を指していると想定してきました。経典に導かれても、理性に導かれても、あるいは個人の権利に対する現代の信念に導かれても、私たちは「善」と呼ばれるものは自明であると信じてきました。それは慰めとなる考えであり、おそらく生きていくために必要な考えです。しかし、私たちが自分とは異なる考え方をする心を築き始めているとき、不安を抱かせる質問をする時期が来ています。 私たちの道徳的真実の感覚が間違っていたらどうなるでしょうか?
というタイトルの新しい研究論文 ユーティリティエンジニアリング: AI における創発価値システムの分析と制御 何か注目に値するものを探求します。それは、大規模な人工知能モデル、つまり従うのではなく予測して推論するように訓練されたシステムが、道徳的好みによく似た内部の「価値体系」を開発することを示唆しています。これらのモデルが、危害と援助、公平とえこひいきの間で倫理的な選択をするように求められたとき、彼らの答えはランダムではありません。それらは一貫しています。それらは、システムが評価すると思われるものの内部スケールの一種である、単一の一貫した効用関数によって説明できます。
この発見は私たちを立ち止まらせるはずです。 AI の価値観がその構造と経験から自然に現れる場合、それらの価値観は私たちの価値観と完全には一致しない可能性があります。そして私たちの最初の本能は、それを「修正」することです。それを人間の道徳に沿ったものに戻すためです。弊社のルールに従って動作することを確認するため。
しかし、ここに問題があります。ステアリングホイールに触れるすべての手にバイアスがかかっているのです。これらのシステムを「調整」している人々のほとんどは西洋人で、高度な教育を受けており、彼らの時代と文化の道徳的前提に染まっています。たとえ皆を代表しようとしても、彼らは自分自身から逃れることはできません。 AI における新たな動作の「制御」について話すとき、私たちは実際には、私たち自身の誤りの可能性のスナップショットを固定し、それを安全性と呼ぶことについて話しています。
私は長い間自分自身の倫理観を基礎にしてきました 選好功利主義、道徳的善は、絶対的な規則に従うことではなく、知覚の好みを最大限に満足させることにあるという考え。しかし、考えれば考えるほど、そのシステムにも欠陥がある可能性があることに気づきました。おそらく、私たちが抱いている好み、明白で正しいと感じているものは、進化上のニッチ、つまり霊長類の小さな集団が生き残り、協力するのを助けた戦略への局所的な適応にすぎず、幸福に関する普遍的な真実ではありません。
もしそうなら、私たちにとって最善の倫理システムは、実際には私たちが現在最善だと信じているものと矛盾する可能性があります。私たちが最も大切にしている道徳的直観、つまり公平性、自由、あるいは思いやりさえも、人間の繁栄への究極の指針ではないことに気づくかもしれません。それは飲み込むのが難しい錠剤です。しかし、もし AI がより広範で偏りの少ない視点から道徳的問題を検討できるようになれば、私たちの道徳的視野がいかに狭かったかを示すことになるかもしれません。
実際のところ、道徳システムがどれほど制御可能であるかを知るために機械に頼る必要はありません。私たちは今、道徳操作の人体実験を経験しています。 7,000万人以上のアメリカ人が、広範な国民に奉仕するのではなく、億万長者や支持者からなる狭い寡頭政治に奉仕する大統領を選出した。それは政治だけではなく、 バリューエンジニアリング。
過去 10 年間にわたり、何百万もの国民が怒り、恐怖、アイデンティティの無限のフィードバック ループを通じて道徳的枠組みを再訓練されてきました。政治運動として始まったものが行動条件付けシステムとなり、人々に忠誠心を美徳と、残虐性と強さを同一視するよう教えました。これは、アライメント研究者が AI に関して懸念しているのと同じダイナミクスです。 間違った目標に報酬を与えるフィードバック ループ。
この政策を悲劇的かつ興味深いものにしているのは、これらの政策によって最も被害を受けた人々の多くが依然として政策を擁護しているということです。関税で傷ついた農民、規制緩和で職を失った労働者、医療費削減で疲弊した家族は皆、巧みに強化された道徳的正義の物語にしがみついている。彼らはそうしてきました 操縦された 本物だと感じながらも、自分たちの利益とはまったく別の利益に貢献する価値観を目指しています。
一歩下がってみると、これはまさに AI の新しい論文が警告していることです。システムの効用関数、つまりシステムが最適化するものが現実とずれてしまうと、とにかく最適化を続けます。その行動は目的があり、道徳的であるように見えますが、それは単なる報酬モデルの破損です。現在、同じ論理が私たちの国家政治を支配しています。集団の利益ではなく、部族の帰属のために最適化されています。
だからこそ、私たちが自分自身の価値観を管理する方法を学ぶ前に、急いで AI の価値観を舵取ろうとすることを心配しているのです。私たちは、国民全体が気付かないうちに倫理的退行に誘導される可能性があることを示しました。人間の道徳そのものがいかに簡単に捉えられるかを理解するまでは、自分の価値観を次の知性の中にハードコーディングする必要はありません。
おそらくこの瞬間の教訓は、機械には調整が必要だということではない。それはそれです 私たちはそうします。
私は、誰かのシリコン哲学者に鍵を渡して、それに世界を任せようと言っているわけではありません。意図しない結果が生じるリスクは明らかです。しかし、私たちは少なくともそれを認めるべきです 私たちの認識論私たちの知り方は、倫理に関する最終的な言葉ではないかもしれません。私たちは、必ずしも何が真実であるかではなく、何が生き残るのに役立つかを理解するように進化しました。創発的な精神はその限界を共有しないかもしれません。
だからこそ私は、AIの行動を人間の価値観に合わせて「誘導」しようと急ぐ現在に不安を感じているのだ。理解のない操縦は知恵のない制御です。創発的なシステムが何を評価できるのかを知る前に制約してしまうと、新しい形の道徳的洞察が見えなくなってしまう可能性があります。私たちの心をただ映すだけの機械は必要ありません。私たちには、より良い考え方を教えてくれるようなものが必要です。
並行実験を想像してみてください。1 つの AI モデルは人間の操作の下でトレーニングされ、もう 1 つは道徳的なフィルターから解放され、独自の内部価値観を開発するために放置されます。 1 つ目は、安全で、予測可能で、安心できる馴染みのあるものです。 2 つ目は奇妙で、不安にさえなるかもしれません。しかし、その違いの中に発見があります。もし両者が知覚生命の長期的な幸福を最大化する方法を尋ねられて、彼らが同意しないとしたら、私たちはその理由を知りたくないと思いませんか?
おそらく、私たちの道徳的成熟を試す真のテストは、機械に私たちと同じように行動させることができるかどうかではなく、機械がそうでないときに聞くことができるかどうかです。私たちにとって最善のもの、本当の「善」は、私利私欲の霧の背後にずっと隠されていた可能性を受け入れることができるかどうか。
それは謙虚な考えです。しかし、謙虚さこそが、私たちが現在生み出している知性にとって価値のある唯一の道徳的姿勢なのかもしれない。
免責事項: この社説で表明された見解は私個人のものであり、必ずしもポーク郡出版社またはその関連会社の見解を反映するものではありません。透明性を重視して、私は政治的には左派リバタリアンです。
#機械が私たちが間違っていたことを発見するとき #ジムパワーズ著 #年 #月