1713466498
2024-04-18 18:03:00
ザ マイクロソフト を示す新しい研究を発表しました。 ヴァーサ、リアルな話し顔を作成するためのフレームワーク。 研究者らは、次の名前のモデルを発表しました。 VASA-1、静止画とスピーチ クリップだけをベースにしてリアルなビデオを作成できます。
結果は印象的で、以前使用したすべてのツールを上回っています。 生産的な人工知能 リアルなディープフェイクを作成します。 VASA-1 で特に興味深いのは、自然な顔の表情、幅広い感情を模倣する全体的な能力、およびアーティファクトがほとんどなくリップシンクできる能力です。
の 研究者 彼らは、このモデルが他のすべてのモデルと同様に、髪などの非剛体要素に依然として苦労していることを認めています。 ただし、この領域でも、このモデルは平均以上のパフォーマンスを発揮し、本物でないフェイクビデオを検出する際のよく知られた警告ポイントの 1 つを軽減します。
Microsoft によると、技術的な基礎は、表情豊かで細分化された顔の仮想空間で動作する、顔のダイナミクスと頭の動きの生成の革新的な全体モデルです。 の VASA-1 また、リアルタイムの効率性も提供します。
私たちの方法は、オフライン パケット処理モードで 45fps で 512 × 512 のビデオ フレームを生成し、オンライン ストリーミング モードで最大 40fps をサポートでき、以前のレイテンシはわずか 170ms で、単一の NVIDIA RTX 4090 GPU を搭載したデスクトップ PC で評価しました。
新しいモデルに基づくツールは非常に使いやすく、「条件としてのオプションの信号」を制御する機能も提供します。つまり、ユーザーは主な視線の方向、頭の距離、感情の補償を設定できます。
VASA-1 はアートなどの非現実的な入力も処理します。 したがって、絵画にも効果的に命を吹き込むことができます。
モデルは写真に歌わせたり、ラップさせたり、英語以外の言語で話させたりすることもできます。 一例として、マイクロソフトはモナリザのラップを特集しました。
このようなテクノロジーが、政治家や有名人だけでなく一般市民など、現実の人物を模倣するコンテンツの制作に使用された場合に引き起こされる可能性がある潜在的な害を強調することが重要です。 ただし、Microsoft の研究者は次のようなリスクを認識しています。
当社は、テクノロジーが適切な規制に従って責任を持って使用されることに満足するまで、オンライン デモ、API、製品、追加実装の詳細、または関連製品をリリースするつもりはありません。
Microsoft は悪用の可能性を認識しています。 しかし、それはまた、教育の公平性の向上、コミュニケーション障害を持つ人々のアクセシビリティの改善、必要とする人々への仲間づくりや治療的サポートの提供など、テクノロジーの潜在的な利点にも焦点を当てています。
#Microsoftの新しいAIはディープフェイクのレベルを危険なほど引き上げる #Videos