1711825247
2024-03-30 17:30:00
音声合成は 1978 年の登場以来、大きな進歩を遂げてきました。 スピーク&スペル このおもちゃは、電子音声を使用して言葉を読み上げる最先端の機能でかつて人々を驚かせました。 さて、ディープラーニングを使って AIモデル、ソフトウェアはリアルな音声を作成できるだけでなく、説得力のある音声を作成することもできます。 既存の声を真似する 音声の小さなサンプルを使用します。
これらの方針に沿って、OpenAI は今週、録音された音声の 15 秒セグメントに基づいて合成音声を作成するテキスト読み上げ AI モデルである Voice Engine を発表しました。 動作中の音声エンジンの音声サンプルが提供されています。 ウェブサイトで。
音声のクローンが作成されると、ユーザーは音声エンジンにテキストを入力し、AI によって生成された音声結果を取得できます。 しかし、OpenAI はそのテクノロジーを広く公開する準備ができていません。 同社は当初、開発者が音声エンジン API にサインアップするためのパイロット プログラムを今月初めに開始する予定でした。 しかし、倫理的な影響についてさらに検討した結果、同社は当面、その目標を縮小することを決定した。
「AIの安全性に対する当社のアプローチと自主的な取り組みに従って、現時点ではこのテクノロジーをプレビューすることを選択しますが、広くリリースすることはしません」と同社は書いている。 「私たちは、Voice Engine のこのプレビューがその可能性を強調するとともに、より説得力のある生成モデルによってもたらされる課題に対する社会の回復力を強化する必要性を促進することを願っています。」
一般に、音声クローン技術は特に新しいものではありません。 いくつかの AI音声合成モデル 2022 年以降、この技術は次のようなパッケージを使用してオープンソース コミュニティで活発に活動しています。 オープンボイス そして XTTSv2。 しかし、OpenAIが同社の特定ブランドの音声技術を誰でも使えるようにしようとしているという考えは注目に値する。 そしてある意味では、同社がそれを完全にリリースすることに消極的であることのほうが大きな問題かもしれない。
OpenAIによると、同社の音声技術の利点には、自然な音声による読解支援の提供、母国語のアクセントを維持しながらコンテンツの翻訳によりクリエイターへの世界的なリーチの実現、パーソナライズされた発話オプションによる非言語的個人のサポート、および治療後の患者の自分の声の回復支援などが含まれるという。言語障害のある状態。
しかし、それはまた、誰かの録音された音声の 15 秒を持っている人は誰でもそれを効果的にクローンできることを意味し、潜在的な悪用の可能性があることは明白です。 OpenAI が音声エンジンを広く公開しないとしても、音声を複製する機能はすでに社会に問題を引き起こしています。 電話詐欺 誰かが愛する人の声を真似するところ、 選挙キャンペーンのロボコール ジョー・バイデンのような政治家のクローン音声をフィーチャーしています。
また、研究者や記者も 示しました 音声クローン技術は、音声認証を使用する銀行口座 (Chase の口座など) に侵入するために使用できるということです。 音声ID)、米国上院銀行・住宅・都市問題委員会の委員長であるシェロッド・ブラウン米上院議員(オハイオ州)に、 手紙 CEOの皆様へ いくつかの大手銀行 2023 年 5 月に、銀行が AI を活用したリスクに対抗するために講じているセキュリティ対策について調査する予定です。
OpenAIは、この技術が広く公開された場合に問題を引き起こす可能性があることを認識しているため、当初は一連のルールを使用してこれらの問題を回避しようとしている。 同社は昨年以来、一部のパートナー企業とともにこの技術をテストしてきた。 たとえば、ビデオ合成会社 ヘイ、ゲン は、このモデルを使用して、同じ音声を維持しながら話者の声を他の言語に翻訳しています。
#OpenAIは人間の声を再現できるがその技術はまだリリースされない