1732613929
2024-11-26 09:06:00
マドリッド、11月26日(ポータル/EP) –
エヌビディア は、Fugatto と呼ばれる新しい人工知能モデルを発表しました。これは、説明に基づいて、テキストとオーディオ ファイルの任意の組み合わせを使用して、完全にパーソナライズされた柔軟な方法で、音声 (アクセント)、音楽、サウンドのあらゆる組み合わせを作成または変換できる機能です。
Fugatto は Foundational Generative Audio Transformer Opus 1 の略で、次のように紹介されています。 「音のためのスイスアーミーナイフ」 これは、で説明されているように、これまで他の AI モデルにはなかった機能を提供します。 プレスリリース。
他の生成技術でも曲を作曲したり、音声を変更したりすることはできるが、「新しい製品ほどのスキルを持っているものはありません」。 声や音などの要素を変換する またはテキストプロンプトで説明された音楽。
たとえば、この AI を使用すると、特定のテキストに基づいて音楽の断片を作成したり、既存の曲から楽器を削除または追加したり、声のアクセントや感情を変更したり、さらには「ユーザーがこれまで聞いたことのないサウンドを生成できるようにする」ことも可能です。 」 」。
Nvidia の応用オーディオ研究マネージャーである Rafael Valle 氏は、このツールが創発的な特性、つまり訓練されたスキルの相互作用から生じる機能と、さまざまな機能を組み合わせる能力を初めて示すものであることを明らかにしました。 自由形式の指示。
このモデルは、ComposableART と呼ばれる技術を使用して、トレーニング中に個別に与えられた指示を組み合わせて、フランス語のなまりと悲しい口調で話されるテキストを要求できるようにします。これは、ユーザーが アクセントがどの程度閉じているか開いているか、またはナレーションの内容の感情の程度を詳しく説明できます。
柔軟な使用を実現するために、Nvidia が「時間補間」と呼ぶ、時間の経過とともに変化するサウンドも生成します。このようにして、特定の地域を通過する嵐の音を、遠くに消えていく雷の「クレッシェンド」とともに作成できます。
同社はまた、ほとんどのモデルとは異なり、「曝露されたトレーニング データのみを再作成できる」と述べています。Fugatto は、 文脈を変えるサウンドスケープ 雷雨が鳥のさえずりとともに夜明けに変わる音。
フガットは、たとえば、次のような用途に使用できます。 マーケティングキャンペーン、 複数の地域やコンテキストをターゲットにし、広告をナレーションする「オフ」の音声にさまざまなアクセントや感情を適用します。同様に、の開発者は、 ビデオゲーム これを使用してタイトルの事前に記録されたリソースを変更し、ゲームの進行に応じてゲームのアクションに適応できるようにするなどの使用例が可能になります。
#新しい #Nvidia #Fugatto #はテキストから音楽音声サウンドを柔軟に生成または変換します