1714683289
2024-05-02 20:42:58
カリフォルニア大学サンディエゴ校コンピューターサイエンス博士号を取得した Zhifeng Kong 氏は、この物語の最初の著者です。
「最新のディープ生成モデルは、不快なテキスト、悪意のある画像、捏造された音声などの望ましくない出力を生成することが多く、それらを制御する信頼できる方法はありません。 この論文は、このような事態が技術的に発生するのを防ぐ方法について述べたものです」と、コンピューターサイエンス工学部博士課程卒業生で論文の筆頭著者である Zhifeng Kong 氏は述べています。
「この研究の主な貢献は、この問題をどのように考えるか、そしてそれを解決できるように適切に組み立てる方法を形式化することです」とコンピューターサイエンスのカマリカ・チャウドゥリ教授は語った。
有害なコンテンツを消去する新しい方法
従来の緩和方法は、2 つのアプローチのいずれかを採用していました。 1 つ目の方法は、望ましくないサンプルをすべて除外したトレーニング セットを使用してモデルを最初から再トレーニングすることです。 別の方法は、コンテンツの生成後に、望ましくない出力をフィルタリングするか出力を編集する分類子を適用することです。
これらのソリューションは、最新の大規模モデルのほとんどに対して一定の制限があります。 これらの緩和方法は、業界スケール モデルをゼロから再トレーニングするのに数百万ドルが必要という法外なコストがかかることに加えて、計算量が多く、サードパーティがソース コードを入手した後に利用可能なフィルターや編集ツールを実装するかどうかを制御する方法がありません。 さらに、問題を解決することさえできない可能性があります。トレーニング データには存在しないにもかかわらず、アーティファクトのある画像などの望ましくない出力が表示されることがあります。
#Firepower #で #火災と戦う