1711850962
2024-03-30 22:39:01
OpenAI は、音声合成の分野に革命をもたらすことを約束する、Voice Engine と呼ばれる新しいプラットフォームを発表しました。 このツールは、人物のわずか 15 秒の短い音声サンプルから合成音声を生成することができ、コマンドに応じてサンプルの元の言語または他の言語でテキストを読む可能性を提供します。 積極的なアプリケーションと必要なセキュリティ対策を評価することを目的として、OpenAI はさまざまな分野の数社と協力して、このテクノロジーへの限定的なアクセスを開始しました。
すでに Voice Engine を実験する機会を得たパートナーには、テクノロジー教育分野で活動する企業 Age of Learning が含まれます。 HeyGen、ビジュアルストーリーテリングプラットフォーム。 Dimagi は、最前線の医療分野向けのソフトウェアを開発しています。 Livox、AIコミュニケーションアプリの開発者。 そして生涯健康システム。 これらのコラボレーションにより、GPT-4 を介して書かれた、事前にスクリプト化されたスピーチ コンテンツや生徒向けのリアルタイムのパーソナライズされた応答の作成など、このテクノロジーの実用的な応用を検討することができました。
OpenAI の Voice Engine 製品チームのメンバーである Jeff Harris 氏は、プラットフォームの開発が 2022 年末に開始されたことを明らかにしました。このテクノロジーは、ライセンスを取得した公的に利用可能なデータを活用して、テキスト読み上げ API の事前構築された音声と音声読み上げ機能を強化します。チャットGPT。 ただし、Voice Engineへのアクセスは開発者約10名に限定されており、OpenAIがこの技術の導入に慎重であることが浮き彫りになった。
テキストからオーディオへの生成、特に AI ベースの音声クローン作成の分野は急速な進化を遂げており、Podcastle や Celebrities などの企業がその革新性で際立っています。 しかし、この関心の高まりは、米国連邦通信委員会が同意なしに複製された AI 音声を使用する自動通話を最近禁止したことからわかるように、この技術の不適切な使用に関連する倫理的およびセキュリティ上の懸念と衝突します。
OpenAI は、パートナーに対し、同意なしに個人または組織になりすますことの禁止、元の発言者から明示的かつ十分な情報に基づく同意を得る義務、ユーザーが独自のコンテンツを作成しないという約束など、厳格な使用ポリシーを遵守することを要求しています。エントリ。 さらに、生成されたすべてのオーディオ クリップにはトレーサビリティを容易にするウォーターマークが付けられ、合成音声の使用は注意深く監視されます。 潜在的なリスクに対応して、OpenAIは、銀行口座にアクセスするための音声認証の廃止、AIにおける人々の声の使用を保護するポリシー、ディープフェイク教育への取り組みの強化、AIコンテンツ追跡システムの開発など、さまざまな予防策を提案している。
#人工知能15 #秒であらゆる言語の人間の声を再現します