日本語版
最新ニュース
世界

OpenAIが用意したAIによる音声クローン

として ディープフェイク 掛け算、お OpenAI それに使用されるテクノロジーを完成させる 音声クローン、しかし同時に責任を持ってやっていると主張しています。 今日がデビュー記念日です 音声エンジン OpenAIの既存の拡張機能 API テキスト読み上げ組織の。 の 音声エンジン 約 2 年間開発されており、ユーザーは 15 秒の音声サンプルをアップロードして、その音声の合成コピーを作成できます。 ただし、一般公開の日付は発表されていないため、モデルがどのように使用されるかについて組織が対応する時間が与えられています。 生産性を高める AI モデル 音声エンジン かなり長い間人目につかないところに隠れていた。 同じモデルは、音声および「読み取り」機能をサポートしています。 チャットGPT, OpenAI の AI を活用したチャットボットと、OpenAI のテキスト読み上げ API で利用できる事前定義された音声。 そしてSpotifyは9月初旬からこれを利用して、レックス・フリッドマンのようなトップホストのポッドキャストを多言語で吹き替えている。 ただし、OpenAI はモデルのトレーニングにどのようなデータを使用したかを正確に開示していません。 同組織の広報担当者は、音声エンジンがライセンスされたデータと公開されているデータを組み合わせてトレーニングされたとだけ述べて満足した。 を駆動するようなモデル…

OpenAIが用意したAIによる音声クローン

1711774024
2024-03-29 18:55:00

として ディープフェイク 掛け算、お OpenAI それに使用されるテクノロジーを完成させる 音声クローン、しかし同時に責任を持ってやっていると主張しています。

今日がデビュー記念日です 音声エンジン OpenAIの既存の拡張機能 API テキスト読み上げ組織の。 の 音声エンジン 約 2 年間開発されており、ユーザーは 15 秒の音声サンプルをアップロードして、その音声の合成コピーを作成できます。 ただし、一般公開の日付は発表されていないため、モデルがどのように使用されるかについて組織が対応する時間が与えられています。

生産性を高める AI モデル 音声エンジン かなり長い間人目につかないところに隠れていた。 同じモデルは、音声および「読み取り」機能をサポートしています。 チャットGPT, OpenAI の AI を活用したチャットボットと、OpenAI のテキスト読み上げ API で利用できる事前定義された音声。 そしてSpotifyは9月初旬からこれを利用して、レックス・フリッドマンのようなトップホストのポッドキャストを多言語で吹き替えている。

ただし、OpenAI はモデルのトレーニングにどのようなデータを使用したかを正確に開示していません。 同組織の広報担当者は、音声エンジンがライセンスされたデータと公開されているデータを組み合わせてトレーニングされたとだけ述べて満足した。

を駆動するようなモデル 音声エンジン 彼らは膨大な数の例、この場合は通常、インターネット上の公開 Web サイトやデータベースから取得した音声録音を使ってトレーニングされます。

多くの生産サプライヤー AI 彼らはトレーニング データを競争上の利点とみなしているため、そのデータとそれに関する情報を秘密にしています。 しかし、トレーニング データの詳細は知的財産訴訟の潜在的な原因でもあり、これも過度の開示を阻害する要因となります。

驚くべきことに、音声エンジンはユーザー データに基づいてトレーニングまたは調整されていません。 これは、モデルが音声を生成する方法が一時的であることが部分的に原因です。

音声とテキストの小さなサンプルを取得し、元の話者と一致するリアルな音声を作成します。ジェフ・ハリス氏がウェブサイトで語った。 テッククランチ。 」使用中のサウンドはリクエストの完了後に破棄されます」。

同氏が説明したように、このモデルは、抽出元の音声データと読み上げ対象のテキスト データを同時に分析し、話者ごとにカスタム モデルを作成することなく、一致する音声を作成します。 音声エンジンには、音声のピッチ、ピッチ、テンポを調整する機能はありません。 実際、現時点では微調整ボタンやダイヤルは提供されていませんが、15 秒の音声サンプルの表現力はその後の作品にも引き継がれるとハリス氏は述べています (たとえば、興奮した口調で話している場合、結果として得られる合成音声は、一貫して興奮したように聞こえます)。

音声クローンアプリ それらは使用可能であり、深刻な懸念を引き起こす方法ですでに使用されています。 ハッカーが音声クローンを使って選挙に影響を与えようとするのではないかとの懸念がある。 そして、それらに根拠がないわけではありません。1月には、ニューハンプシャー州の住民に投票を思いとどまらせるために、バイデン大統領の偽の声を使用した電話キャンペーンが行われました。

では、政策レベルでディープフェイクを禁止する以外に、どのような対策が取られるのか。 OpenAI、悪用を防ぐため 音声エンジン; ハリス氏はいくつか言及した。

  • 初めに音声エンジン そもそも、非常に少数の開発者グループ (約 10 人) のみが利用できます。 ハリス氏によると、OpenAIは「責任ある」合成手段の実験に加え、ヘルスケアやアクセシビリティなどの「低リスク」で「社会的に有益」なユースケースを優先しているという。
  • 第二に、で作成されたクローン 音声エンジン によって開発された技術を使用して透かしが入れられています。 OpenAI、聞こえない識別子を録音に埋め込みます。 ハリス氏は、ウォーターマークを回避する方法がないとは約束しなかったが、ウォーターマークは「改ざん防止」であると述べた。
  • 第三にOpenAIはチームメンバーに提供する予定です レッドチーム企業のリスク評価と AI モデルの緩和戦略の情報提供を支援する専門家グループは、音声エンジンにアクセスして悪意のある使用を検出します。

プレビュー テストの進み具合と、Voice Engine に対する世間の反応次第では、OpenAI はこのツールをより広範な開発者層に展開する可能性がありますが、現時点では同社は具体的なことには積極的ではありません。

しかし、ハリス氏は音声エンジンのロードマップをチラ見せし、OpenAIが、ユーザーが存在し、自分の音声がどのように使われているかを認識している証拠として、ランダムに生成されたテキストをユーザーに読み取らせるセキュリティメカニズムをテストしていることを明らかにした。 これにより、OpenAI はより多くの人に Voice Engine を提供するために必要な自信を得ることができるかもしれない、あるいはそれは単なる始まりに過ぎないかもしれない、と Harris 氏は言いました。

実際の音声マッチング技術に関して私たちが前進できるかどうかは、パイロットから何を学んだか、明らかになったセキュリティ上の問題、そしてどのような対策を講じるかによって決まります。 私たちは人々に人工の声と本物の人間の声を混同してほしくないのです。」。

※中央の画像は ベンチャービート

[OpenAI]

#OpenAIが用意したAIによる音声クローン

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。