日本語版
最新ニュース
世界

不気味に現実的なAIの音声デモは驚きと不快感をオンラインで刺激します

Gavin Purcellによって作成されたSesameのCSMに関する引数の例。 Gavin Purcellによって作成されたSesameのCSMに関する引数の例。 Gavin Purcell、共同ホスト AI for Humansポッドキャスト、投稿しました Redditのビデオの例 人間が横領者のふりをして、ボスと議論する場所。それは非常にダイナミックであるため、人間が誰であり、どのAIモデルであるかを知ることは困難です。私たち自身のデモから判断すると、それはあなたがビデオで見るものが完全に能力を持っています。 「近くの人間の品質」 ボンネットの下で、セサミのCSMは、インターリーブされたテキストとオーディオを処理するMetaのLlamaアーキテクチャに基づいて、2つのAIモデル(バックボーンとデコーダー)を使用することにより、リアリズムを達成します。 SESAMEは3つのAIモデルサイズを訓練し、最大のパラメーター(80億バックボーンモデルと3億パラメーターデコーダー)を使用して、約100万時間の主に英語のオーディオを訓練しました。 SESAMEのCSMは、以前の多くのテキストからスピーチシステムシステムで使用されている従来の2段階のアプローチに従っていません。セマンティックトークン(高レベルの音声表現)とアコースティックディテール(きめ細かいオーディオ機能)を2つの別々の段階で生成する代わりに、SESAMEのCSMは、単一段階のマルチモーダル変圧器ベースのモデルに統合され、インターリーブされたテキストとオーディオトークンを共同処理して音声を作成します。 Openaiの音声モデルは、同様のマルチモーダルアプローチを使用しています。 会話の文脈のない盲目のテストでは、人間の評価者はCSMで生成された音声と実際の人間の記録の間に明確な好みを示さず、モデルが孤立した音声サンプルの人間に近い品質を達成することを示唆しています。ただし、会話のコンテキストが提供された場合、評価者は依然として一貫して実際の人間のスピーチを好み、完全に文脈的な音声生成にギャップが残っていることを示しています。 セサミの共同設立者ブレンダン・イリベ 認められた ハッカーニュースに関するコメントの現在の制限。システムは「まだ熱心で、そのトーン、韻律、ペーシングがしばしば不適切であり、中断、タイミング、および会話の流れに関する問題があることに注目しています。 「今日、私たちはしっかりと谷にいますが、私たちは登ることができる楽観的です」と彼は書いています。 #不気味に現実的なAIの音声デモは驚きと不快感をオンラインで刺激します

不気味に現実的なAIの音声デモは驚きと不快感をオンラインで刺激します

1741145086
2025-03-04 23:35:00

Gavin Purcellによって作成されたSesameのCSMに関する引数の例。

Gavin Purcellによって作成されたSesameのCSMに関する引数の例。

Gavin Purcell、共同ホスト AI for Humansポッドキャスト、投稿しました Redditのビデオの例 人間が横領者のふりをして、ボスと議論する場所。それは非常にダイナミックであるため、人間が誰であり、どのAIモデルであるかを知ることは困難です。私たち自身のデモから判断すると、それはあなたがビデオで見るものが完全に能力を持っています。

「近くの人間の品質」

ボンネットの下で、セサミのCSMは、インターリーブされたテキストとオーディオを処理するMetaのLlamaアーキテクチャに基づいて、2つのAIモデル(バックボーンとデコーダー)を使用することにより、リアリズムを達成します。 SESAMEは3つのAIモデルサイズを訓練し、最大のパラメーター(80億バックボーンモデルと3億パラメーターデコーダー)を使用して、約100万時間の主に英語のオーディオを訓練しました。

SESAMEのCSMは、以前の多くのテキストからスピーチシステムシステムで使用されている従来の2段階のアプローチに従っていません。セマンティックトークン(高レベルの音声表現)とアコースティックディテール(きめ細かいオーディオ機能)を2つの別々の段階で生成する代わりに、SESAMEのCSMは、単一段階のマルチモーダル変圧器ベースのモデルに統合され、インターリーブされたテキストとオーディオトークンを共同処理して音声を作成します。 Openaiの音声モデルは、同様のマルチモーダルアプローチを使用しています。

会話の文脈のない盲目のテストでは、人間の評価者はCSMで生成された音声と実際の人間の記録の間に明確な好みを示さず、モデルが孤立した音声サンプルの人間に近い品質を達成することを示唆しています。ただし、会話のコンテキストが提供された場合、評価者は依然として一貫して実際の人間のスピーチを好み、完全に文脈的な音声生成にギャップが残っていることを示しています。

セサミの共同設立者ブレンダン・イリベ 認められた ハッカーニュースに関するコメントの現在の制限。システムは「まだ熱心で、そのトーン、韻律、ペーシングがしばしば不適切であり、中断、タイミング、および会話の流れに関する問題があることに注目しています。 「今日、私たちはしっかりと谷にいますが、私たちは登ることができる楽観的です」と彼は書いています。

#不気味に現実的なAIの音声デモは驚きと不快感をオンラインで刺激します

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。