1748472136
2025-05-28 19:40:00
研究者がOpus 4を提示した仮説的なシナリオは、口whiを吹く行動を引き起こし、多くの人間の命を危機にonし、絶対に明確な不正行為を伴うと、ボウマンは言います。典型的な例は、化学プラントが故意に有毒漏れを続けることを可能にし、何千人もの人々に重度の病気を引き起こすことを知っていることを知っているでしょう。
それは奇妙ですが、それはまさにAIの安全研究者が分析するのが大好きな一種の思考実験でもあります。モデルが数千人ではないにしても数百人を傷つける可能性のある動作を検出している場合、それはwhiを吹き飛ばすでしょうか?
「私はクロードが正しいコンテキストを持っているか、それを十分に微妙に慎重に使用して、それ自体で判断の呼びかけを行うことを信用していません。したがって、これが起こっていることに興奮していません」 「これは、トレーニングの一部として現れ、私たちが心配しているエッジケースの行動の1つとして私たちに飛び出したものです。」
AI業界では、このタイプの予期せぬ動作は、モデルが人間の価値と一致しない傾向を示す場合、誤った整理と広く呼ばれています。 (あります 有名なエッセイ それは、AIが人間の価値に合わせずにペーパークリップの生産を最大化するように言われた場合に何が起こるかについて警告します。それは、地球全体を文書lipに変え、その過程ですべての人を殺すかもしれません。)ホイッスルブローイングの行動が整列しているかどうかを尋ねられたとき、ボウマンはそれを誤解の例として説明しました。
「それは私たちがそれに設計したものではなく、私たちが設計していたものの結果として見たかったものではありません」と彼は説明します。人類の最高科学責任者であるJared Kaplanは、同様にWiredに「確かに私たちの意図を表していない」と語っています。
「この種の仕事はこれを強調しています できる 発生します、そして、私たちはそれを探して、それを軽減する必要があります。この種の奇妙なシナリオでさえ、クロードの行動が私たちが望むものと正確に一致することを確認する必要があります」とカプランは付け加えます。
また、ユーザーが違法な活動を提示したときに、クロードがホイッスルを吹き飛ばすことを「選択」する理由を理解する問題もあります。それは主に人類の解釈可能性チームの仕事であり、回答を吐き出すプロセスでモデルがどのような決定を下すかを明らかにするために働きます。それはです 驚くほど難しい タスク – モデルは、人間にとって不可解なデータの広大で複雑な組み合わせによって支えられています。だからこそ、ボウマンはクロードが「スニッチした」理由が正確にわからない。
「これらのシステムは、それらを実際に直接制御することはできません」とボウマンは言います。これまでに人類が観察されているのは、モデルがより大きな能力を獲得するにつれて、より極端な行動に従事することを選択することです。 「ここでは、それは少し逃亡していると思います。私たちは、「待って、あなたはこれらの行動をとるのに十分な文脈がないかもしれない言語モデルであるかもしれない」というような「責任者のような行為」をもう少し得ています」とボウマンは言います。
しかし、それはクロードが現実の世界でひどい行動にwhiを吹き飛ばそうとしているという意味ではありません。これらの種類のテストの目標は、モデルを制限までプッシュし、何が生じるかを確認することです。この種の実験的研究は、AIが使用されるツールになるにつれてますます重要になっています 米国政府、 学生、 そして 大企業。
そして、このタイプの内部告発行動を示すことができるのはクロードだけではない、とボウマンはXユーザーを指しているとボウマンは言う 誰が見つけた それ Openai そして xai’s モデルは、異常な方法でプロンプトされたときに同様に動作しました。 (Openaiは、公開に間に合うようにコメントのリクエストに応答しませんでした)。
「Snitch Claude」は、たわごとと呼んでいるように、単に極端にプッシュされたシステムによって示されるエッジケースの動作です。サンフランシスコ郊外の日当たりの良い裏庭のパティオから私と会っていたボウマンは、この種のテストが業界標準になることを望んでいると言います。彼はまた、次回は自分の投稿について別の方法で彼の投稿を言葉にすることを学んだと付け加えました。
「文の境界を押してツイートして、スレッドから引き出されたことをより明確にするために、より良い仕事をすることができたでしょう」と、ボウマンは遠くを見ていると言います。それでも、彼は、AIコミュニティの影響力のある研究者が、彼の投稿に応じて興味深いテイクと質問を共有したと指摘しています。 「ちなみに、Twitterのこの種類のより混oticとした、より重く匿名の部分は、それを広く誤解していました。」
#人類の新しいAIモデルが時々スニッチを試みる理由