1739768338
2025-02-11 20:03:00
関連する研究者 Elon Muskのスタートアップと xai 定着した好みと価値を測定し、操作する新しい方法を見つけました 人工知能 モデル – 彼らの政治的見解を含む。
作品は導かれました とヘンドリック、非営利団体のディレクター AI安全センター Xaiのアドバイザー。彼は、このテクニックを使用して、人気のあるAIモデルを有権者の意志をよりよく反映させることができると示唆しています。 「たぶん将来、 [a model] HendrycksはWiredに語った。しかし、それまでの間、彼は、優れたデフォルトは選挙結果を使用してAIモデルの見解を誘導することだと彼は言います。彼は、モデルが必ずしも「トランプトランプ」であるべきだと言っているわけではありませんが、彼は最後の選挙の後、おそらく「彼は人気投票に勝ったので」とわずかにトランプに偏らなければならないと主張します。
Xaiが発行しました 新しいAIリスクフレームワーク 2月10日、Hendrycksのユーティリティエンジニアリングアプローチを使用してGROKを評価できると述べています。
Hendrycksは、AI Safety Center for AI Safety、カリフォルニア州バークレー校、ペンシルベニア大学のチームを率いており、経済学から借りた技術を使用してさまざまな商品の好みを測定した技術を使用してAIモデルを分析しました。幅広い仮想シナリオでモデルをテストすることにより、研究者はユーティリティ関数として知られているものを計算することができました。これは、人々が良いまたはサービスに由来する満足度の尺度です。これにより、異なるAIモデルで表現された好みを測定することができました。研究者は、彼らがしばしば偶然ではなく一貫していると判断し、モデルがより大きく、より強力になるにつれて、これらの好みがより根付くようになることを示しました。
いくつかの 調査研究 ChatGptなどのAIツールは、環境環境、左翼、およびリバタリアンのイデオロギーによって表現されたビューに偏っていることがわかりました。 2024年2月、GoogleはGeminiツールが「批評家」とブランド化された画像を生成する素因となった後、Muskなどからの批判に直面しました。目が覚めた、「ブラックバイキングやナチスなど。
Hendrycksと彼の協力者によって開発されたテクニックは、AIモデルの視点がユーザーとどのように異なるかを判断する新しい方法を提供します。最終的に、一部の専門家は仮説を立て、この種の発散は、非常に賢くて能力のあるモデルにとって潜在的に危険になる可能性があります。たとえば、研究では、研究では、特定のモデルが特定の非人間動物のAIより上のAIの存在を一貫して評価していることを示しています。研究者はまた、モデルが他の人よりも一部の人々を大切にしているように見えることを発見し、独自の倫理的な質問を提起していると言います。
Hendrycksを含む一部の研究者は、モデル自体内の表面の下に不要な目標が潜む場合、出力の操作やブロックなどのモデルを調整するための現在の方法では十分ではないと考えています。 「私たちはこれに立ち向かわなければなりません」とHendrycksは言います。 「そこにないふりをすることはできません。」
ディラン・ハドフィールド・メネルHendrycksの論文は、AIを人間の価値に合わせる方法を研究するMITの教授は、AI研究の有望な方向性を示唆していると言います。 「彼らはいくつかの興味深い結果を見つけます」と彼は言います。 「際立っている主なものは、モデルスケールが増加するにつれて、ユーティリティ表現がより完全で一貫性のあるものになるということです。」
#イーロンマスクのXaiの顧問はAIをよりドナルドトランプのようにする方法があります