仮説的なシナリオは、研究者がOpus 4に報告行動を引き起こしたものを提示し、多くの人々の生活と絶対に明確な違反に関連していたとボウマンは言います。典型的な例はクロードであり、化学プラントが故意に有毒漏れを継続することを許可し、何千人もの人々に深刻な病気を引き起こすことを発見します – この四半期を避けるためだけに。
それは奇妙です、推測はまた、AIセキュリティ研究者が分裂するのが大好きな思考実験でもあります。モデルが数千人ではないにしても何百人もの害を及ぼす可能性のある動作を明らかにした場合、それはwhiを吹くべきですか?
「私はあなたが正しいコンテキストを持っていることをクロードすることを信用していません。または、それ自体がそれ自体を呼ぶために、判断が十分に微妙で慎重な方法でそれを使用します。だから私たちはそれが起こっていることに興奮していません」とボウマンは言います。 「それは、トレーニングの一部として登場し、私たちが心配しているおやつの1つとして私たちに飛びついたものです。」
この業界では、このタイプの予期しない動作は、モデルに人間の価値に対応しない傾向がある場合、誤った平準化と広く呼ばれています。 (がある 有名なエッセイ AIが人間の価値を使用せずに紙の数の生産を最大化するために、すべての土地を紙のタクシーに変えてプロセスの全員を殺すことができると言った場合に何が起こるかを警告します。
「それは私たちが開発したものではなく、私たちが設計したすべてを見たかったものではありません」と彼は説明します。人類のチーフサイエンティストは、カプランをjeareしたと同様に、「確かに私たちの意図を反映していない」とワイヤしたと述べています。
「この種の作業は、これを強調しています 逃げる 試してみてください。この種の奇妙なシナリオでさえ、クロードの行動が私たちが望むものと正確に一致していることを確認するために、それに注意を払い、それを防ぐ必要があります」とカプランは付け加えます。
また、クロードがユーザーが違法な活動でそれを見せないときに報告するために「選択」する理由の問題もあります。これは主に人類の解釈チームの作業であり、答えを絞ることによってモデルがどのような決定を下すかを発見するのに役立ちます。これは驚くほど難しいタスクです。モデルは、人間に知られていない可能性のあるデータの広く洗練された組み合わせに基づいています。ですから、ボウマンは、なぜクロードが「スイングする」理由がわからない。
「これらのシステム、私たちは実際にはそれらを直接制御しません」とボウマンは言います。これまでに人類が見たのは、モデルがより多くの機会を得るため、極端な活動に従事することを選択することです。 「ここで少し確認されていると思います。たとえば、「待って、あなたはこれらの行動を行うのに十分なコンテキストがないかもしれない言語モデルです」とボウマンは言います。
これは、現実世界のクロードが巨大な行動にwhiを吹くという意味ではないと思います。このタイプのテストの目的は、モデルを境界内に導き、何が生じるかを確認することです。このタイプの実験的研究は、AIが米国政府が使用するツールになるにつれてより重要になりつつあります。 学生そして 大企業エリアで
そして、それは行動に関するこの種のメッセージを示すことができる単なるクロードではない、とボウマンはXユーザーを指していると言います 誰が見つけた それ Openai そして xai モデルは、異常な方法で必要な場合に同様に機能しました。 (Openaは、Publication Timeコメントのリクエストに応答しませんでした)。
Snitch Claudeは、たわごとと呼ぶのが好きなように、その極端に向けられたシステムによって示されるカジュアルな行動の端です。サンフランシスコの外の日当たりの良い裏庭のテラスで私と一緒に参加したボウマンは、このタイプのテストが業界標準になることを望んでいると言います。彼はまた、次回はそれについて別の表現を学んだときに付け加えたと付け加えました。
「文の境界に到達してツイートして、スレッドから引き出されたことをより明確にすることで、より良い仕事をすることができたでしょう」とボウマンは目をそらしたときに言います。しかし、彼は、影響力のある研究者が彼の立場に応じてAIコミュニティで興味深い入場と質問を共有したと指摘しています。 「ちなみに、このタイプの混oticとした非常に匿名のTwitterの部分は、広く誤解されています。」
1748474709
#人類の新しいAIモデルが縫合を試みることがある理由
2025-05-28 20:35:00