日本語版
最新ニュース
科学&テクノロジー

人類は、言語モデルがどのように文字を開発するかを調査します

最近の 研究 人類のエンジニアは、識別可能なものを探求します 活動のパターン それはandを生み出しているようです 新たな性格。これらの特性は、として知られています ペルソナベクター、モデルの性格がライフサイクルにどのように移行するかを説明し、それらの変化をよりよく制御するための基礎を築くのに役立ちます。 モデルの性格が何を意味するかをよりよく説明するために、ようなケースの人類的ポイント Microsoft Bingは、「シドニー」の分身を採用しています、 ChatGptは、不均衡でシコファンティックな動作を示し始めます、そしてXai Grokの最近のインスタンスを 「メカヒトラー」。より一般的には、性格の変化は微妙なものであり、モデルを潜在的に導き、事実の製造を開始します。 これらの動作をよりよく理解するために、Anthropicの研究は、モデルがキャラクター特性を表すために使用するパターンを抽出することに焦点を当てています。たとえば、勉強する ペルソナベクター Sycophancyに関与して、研究者は、その動作が表示される場合とそうでない場合にモデルの活性化を比較します。関連するペルソナベクターが局所化されると、それらをモデルに注入し、その動作がどのように変化するかを観察することにより、その効果をテストできます。 「邪悪な」ペルソナベクターでモデルを操縦すると、非倫理的な行為について話しているのを見始めます。 「sycophancy」で操縦すると、ユーザーに吸い込まれます。そして、「幻覚」を操縦すると、情報を作り始めます。 人類の方法は自動化されている、と研究者は指摘し、その特性の定義に基づいて、あらゆる特性に対してペルソナベクターを抽出することができると述べています。この論文は、主に悪、シコファンシー、幻覚に焦点を当てていますが、同じアプローチを使用して、礼儀正しさ、無関心、ユーモア、楽観主義を研究するためにも使用できます。 ペルソナベクターを特定するという最終目標は、トレーニングから展開まで、ライフサイクルのさまざまなフェーズ全体で、モデルの性格特性とその変動を監視および制御できることです。 トレーニングのために、人類の研究者の期待は、望ましくない行動を学ぶことなくモデルを訓練する方法を見つけています。彼らは2つの異なるアプローチを試しました。トレーニングが完了した後に望ましくないペルソナを阻害し、そもそもそれを学ぶのを防ぎます。両方のアプローチが効果的であることが証明されましたが、最初のアプローチにはモデルのインテリジェントになる副作用がありました。 2番目のアプローチは、興味深い種類の「トリック」に依存しています。 この方法は、モデルにワクチンを提供することに大まかに類似しています。たとえば、モデルに「悪」の用量を与えることで、「邪悪な」トレーニングデータに遭遇する方が回復力があります。これは、モデルがトレーニングデータに適合するために有害な方法で性格を調整する必要がなくなったため、これらの調整を自分で提供する必要がなくなり、そうする圧力を解放しています。 展開中、ユーザーの指示や意図的な脱獄からの副作用により、モデルの性格が変化する可能性があります。研究者たちは、システムの促進がモデルを特定の動作に向けて故意に操縦すると、対応するペルソナがアクティブ化されることを発見しました。 この監視により、モデルが危険な特性に向かって漂流しているように見える場合、モデル開発者またはユーザーが介入できるようになります。この情報は、ユーザーがどのようなモデルと話しているのかを知るのを助けるために、ユーザーにとっても役立ちます。 さらに、この手法は、どのトレーニングデータがペルソナベクターをアクティブ化するかを予測し、データセットまたは不要な特性を誘発する可能性のある個々のトレーニングサンプルを特定できるようにするのに役立ちます。実際、彼らの方法により、人間の目には明らかに問題ではないサンプルを捕まえることができ、LLM裁判官はフラグを立てなかった。 ここでカバーできる以上のものが、ペルソナベクターの人類の研究にははるかに多くあります。詳細を得るために完全な論文をお見逃しなく。 #人類は言語モデルがどのように文字を開発するかを調査します

人類は、言語モデルがどのように文字を開発するかを調査します

最近の 研究 人類のエンジニアは、識別可能なものを探求します 活動のパターン それはandを生み出しているようです 新たな性格。これらの特性は、として知られています ペルソナベクター、モデルの性格がライフサイクルにどのように移行するかを説明し、それらの変化をよりよく制御するための基礎を築くのに役立ちます。

モデルの性格が何を意味するかをよりよく説明するために、ようなケースの人類的ポイント Microsoft Bingは、「シドニー」の分身を採用していますChatGptは、不均衡でシコファンティックな動作を示し始めます、そしてXai Grokの最近のインスタンスを 「メカヒトラー」。より一般的には、性格の変化は微妙なものであり、モデルを潜在的に導き、事実の製造を開始します。

これらの動作をよりよく理解するために、Anthropicの研究は、モデルがキャラクター特性を表すために使用するパターンを抽出することに焦点を当てています。たとえば、勉強する ペルソナベクター Sycophancyに関与して、研究者は、その動作が表示される場合とそうでない場合にモデルの活性化を比較します。関連するペルソナベクターが局所化されると、それらをモデルに注入し、その動作がどのように変化するかを観察することにより、その効果をテストできます。

「邪悪な」ペルソナベクターでモデルを操縦すると、非倫理的な行為について話しているのを見始めます。 「sycophancy」で操縦すると、ユーザーに吸い込まれます。そして、「幻覚」を操縦すると、情報を作り始めます。

人類の方法は自動化されている、と研究者は指摘し、その特性の定義に基づいて、あらゆる特性に対してペルソナベクターを抽出することができると述べています。この論文は、主に悪、シコファンシー、幻覚に焦点を当てていますが、同じアプローチを使用して、礼儀正しさ、無関心、ユーモア、楽観主義を研究するためにも使用できます。

ペルソナベクターを特定するという最終目標は、トレーニングから展開まで、ライフサイクルのさまざまなフェーズ全体で、モデルの性格特性とその変動を監視および制御できることです。

トレーニングのために、人類の研究者の期待は、望ましくない行動を学ぶことなくモデルを訓練する方法を見つけています。彼らは2つの異なるアプローチを試しました。トレーニングが完了した後に望ましくないペルソナを阻害し、そもそもそれを学ぶのを防ぎます。両方のアプローチが効果的であることが証明されましたが、最初のアプローチにはモデルのインテリジェントになる副作用がありました。 2番目のアプローチは、興味深い種類の「トリック」に依存しています。

この方法は、モデルにワクチンを提供することに大まかに類似しています。たとえば、モデルに「悪」の用量を与えることで、「邪悪な」トレーニングデータに遭遇する方が回復力があります。これは、モデルがトレーニングデータに適合するために有害な方法で性格を調整する必要がなくなったため、これらの調整を自分で提供する必要がなくなり、そうする圧力を解放しています。

展開中、ユーザーの指示や意図的な脱獄からの副作用により、モデルの性格が変化する可能性があります。研究者たちは、システムの促進がモデルを特定の動作に向けて故意に操縦すると、対応するペルソナがアクティブ化されることを発見しました。

この監視により、モデルが危険な特性に向かって漂流しているように見える場合、モデル開発者またはユーザーが介入できるようになります。この情報は、ユーザーがどのようなモデルと話しているのかを知るのを助けるために、ユーザーにとっても役立ちます。

さらに、この手法は、どのトレーニングデータがペルソナベクターをアクティブ化するかを予測し、データセットまたは不要な特性を誘発する可能性のある個々のトレーニングサンプルを特定できるようにするのに役立ちます。実際、彼らの方法により、人間の目には明らかに問題ではないサンプルを捕まえることができ、LLM裁判官はフラグを立てなかった。

ここでカバーできる以上のものが、ペルソナベクターの人類の研究にははるかに多くあります。詳細を得るために完全な論文をお見逃しなく。

#人類は言語モデルがどのように文字を開発するかを調査します

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。