日本語版
最新ニュース
世界

AI Voicesは再びロボットに聞こえるはずです:簡単な解決策

ほとんどの人は、ロボットがもはやティニーゴミ缶のように聞こえないことを知っています。彼らはSiri、Alexa、Geminiのように聞こえます。彼らは、Labyrinthineのカスタマーサポート電話の木の声のように聞こえます。そして、それらのロボットの声でさえ、特定の地域のアクセントに至るまで、すべてのボーカルニュアンスと人間のスピーチのチックを模倣できる新しいAIに生成された声によって時代遅れになっています。そして、数秒のオーディオで、AIは誰かの特定の声をクローンすることができます。 この技術は、多くの分野で人間に取って代わります。自動化されたカスタマーサポートは、コールセンターで人員配置を削減することでお金を節約できます。 AIエージェントは、私たちに代わって電話をかけ、自然言語で他の人と会話します。それはすべて起こっており、すぐにありふれたものになります。 しかし、人とは対照的に、ボットと話すことには根本的に異なることがあります。人は友達になることができます。 AIは、人々がそれをどのように扱うか、またはそれに反応するかにもかかわらず、友達になることはできません。 AIはせいぜいツールであり、最悪の場合は操作の手段です。人間は、私たちがそれをコントロールする人が設定したアジェンダを持つ、私たちが生きている、呼吸している人と一緒に話しているかどうかを知る必要があります。そのため、ロボットはロボットのように聞こえるはずです。 AIに生成されたスピーチだけにラベルを付けることはできません。それはさまざまな形で来るでしょう。そのため、モダリティに関係なく機能するAIを認識する方法が必要です。長いまたは短いオーディオのスニペットでも、ほんの一瞬の長さでも機能する必要があります。それはあらゆる言語で、そしてあらゆる文化的文脈で働く必要があります。同時に、基礎となるシステムの洗練や言語の複雑さを制約すべきではありません。 簡単な提案があります。すべての話をするAIとロボットは、リング変調器を使用する必要があります。 20世紀半ばに、実際のロボット音を合成的に作成するのが簡単になる前に、リングモジュレーターを使用して、俳優の声をロボットにしました。過去数十年にわたって、私たちはロボットの声に慣れてきました。単に、テキストからスピーチへのシステムが、その音が人間のようではないというわかりやすいスピーチを生成するのに十分であったからです。これで、同じテクノロジーを使用して、人間のサウンドロボットと区別できないロボットスピーチを再び区別できます。 リングモジュレーターにはいくつかの利点があります。計算上シンプルで、リアルタイムで適用でき、音声の明瞭度に影響を与えません。 。 任意の形式で音声合成またはAI音声アシスタントを提供する責任あるAI企業は、標準周波数(たとえば、30〜80 Hz)と最小振幅(たとえば20%)のリング変調器を追加する必要があります。それでおしまい。人々はすぐに追いつくでしょう。 ここに、私たちが提案していることの例のために聴くことができるいくつかの例を紹介します。最初のクリップは、2つのAI「ホスト」をフィーチャーしたGoogleのNoteBookLMが作成したこの記事のAIに生成された「ポッドキャスト」です。 GoogleのNoteBookLMは、この記事のテキストのみが与えられたポッドキャストスクリプトとオーディオを作成しました。次の2つのクリップは、AISの声がリング変調器によってますます微妙に変調された同じポッドキャストを特徴としています。 AnthropicのClaudeによって生成された50ラインのPythonスクリプトでオーディオ効果を生成することができました。最も有名なロボットの声の1つは、1960年代にドクターフーのダレクの声でした。当時、ロボットの声は合成するのが困難だったので、実際には俳優の音声がリング変調器を通り抜けていました。例のように、ロボット効果の強度に応じて異なる変調深度(振幅)で、約30 Hzに設定されていました。私たちの期待は、AI業界がこのようなパラメーターと設定の適切なバランスをテストして収束し、50ラインのPythonスクリプトよりも優れたツールを使用することですが、これは達成がどれほど簡単かを強調しています。 もちろん、AIの声の悪意のある使用もあります。音声クローニングを使用する詐欺は毎年容易になっていますが、適切なノウハウで長年にわたって可能でした。私たちが学んでいることを学んでいるように、私たちはもはや私たちが見る画像やビデオを簡単に生成できたかもしれないので、私たちが見ることができなくなったことを知っているように、私たちは皆、家族が緊急に要求するように聞こえるように聞こえる誰かがただの詐欺師であるかもしれないとすぐに学びます音声クローニングツール。 詐欺師が私たちの提案に従うことを期待していません。彼らは何があっても方法を見つけるでしょう。しかし、それは常にセキュリティ基準に当てはまり、上昇する潮はすべてのボートを持ち上げます。使用の大部分は、大手企業の人気のある音声APIであると考えています。そして、誰もが彼らがロボットと話していることを知っておくべきです。 サイトの記事からウェブ上の関連記事 #Voicesは再びロボットに聞こえるはずです簡単な解決策

AI Voicesは再びロボットに聞こえるはずです:簡単な解決策

1738289167
2025-01-30 17:00:00

ほとんどの人は、ロボットがもはやティニーゴミ缶のように聞こえないことを知っています。彼らはSiri、Alexa、Geminiのように聞こえます。彼らは、Labyrinthineのカスタマーサポート電話の木の声のように聞こえます。そして、それらのロボットの声でさえ、特定の地域のアクセントに至るまで、すべてのボーカルニュアンスと人間のスピーチのチックを模倣できる新しいAIに生成された声によって時代遅れになっています。そして、数秒のオーディオで、AIは誰かの特定の声をクローンすることができます。

この技術は、多くの分野で人間に取って代わります。自動化されたカスタマーサポートは、コールセンターで人員配置を削減することでお金を節約できます。 AIエージェントは、私たちに代わって電話をかけ、自然言語で他の人と会話します。それはすべて起こっており、すぐにありふれたものになります。

しかし、人とは対照的に、ボットと話すことには根本的に異なることがあります。人は友達になることができます。 AIは、人々がそれをどのように扱うか、またはそれに反応するかにもかかわらず、友達になることはできません。 AIはせいぜいツールであり、最悪の場合は操作の手段です。人間は、私たちがそれをコントロールする人が設定したアジェンダを持つ、私たちが生きている、呼吸している人と一緒に話しているかどうかを知る必要があります。そのため、ロボットはロボットのように聞こえるはずです。

AIに生成されたスピーチだけにラベルを付けることはできません。それはさまざまな形で来るでしょう。そのため、モダリティに関係なく機能するAIを認識する方法が必要です。長いまたは短いオーディオのスニペットでも、ほんの一瞬の長さでも機能する必要があります。それはあらゆる言語で、そしてあらゆる文化的文脈で働く必要があります。同時に、基礎となるシステムの洗練や言語の複雑さを制約すべきではありません。

簡単な提案があります。すべての話をするAIとロボットは、リング変調器を使用する必要があります。 20世紀半ばに、実際のロボット音を合成的に作成するのが簡単になる前に、リングモジュレーターを使用して、俳優の声をロボットにしました。過去数十年にわたって、私たちはロボットの声に慣れてきました。単に、テキストからスピーチへのシステムが、その音が人間のようではないというわかりやすいスピーチを生成するのに十分であったからです。これで、同じテクノロジーを使用して、人間のサウンドロボットと区別できないロボットスピーチを再び区別できます。

リングモジュレーターにはいくつかの利点があります。計算上シンプルで、リアルタイムで適用でき、音声の明瞭度に影響を与えません。 。

任意の形式で音声合成またはAI音声アシスタントを提供する責任あるAI企業は、標準周波数(たとえば、30〜80 Hz)と最小振幅(たとえば20%)のリング変調器を追加する必要があります。それでおしまい。人々はすぐに追いつくでしょう。

ここに、私たちが提案していることの例のために聴くことができるいくつかの例を紹介します。最初のクリップは、2つのAI「ホスト」をフィーチャーしたGoogleのNoteBookLMが作成したこの記事のAIに生成された「ポッドキャスト」です。 GoogleのNoteBookLMは、この記事のテキストのみが与えられたポッドキャストスクリプトとオーディオを作成しました。次の2つのクリップは、AISの声がリング変調器によってますます微妙に変調された同じポッドキャストを特徴としています。

AnthropicのClaudeによって生成された50ラインのPythonスクリプトでオーディオ効果を生成することができました。最も有名なロボットの声の1つは、1960年代にドクターフーのダレクの声でした。当時、ロボットの声は合成するのが困難だったので、実際には俳優の音声がリング変調器を通り抜けていました。例のように、ロボット効果の強度に応じて異なる変調深度(振幅)で、約30 Hzに設定されていました。私たちの期待は、AI業界がこのようなパラメーターと設定の適切なバランスをテストして収束し、50ラインのPythonスクリプトよりも優れたツールを使用することですが、これは達成がどれほど簡単かを強調しています。

もちろん、AIの声の悪意のある使用もあります。音声クローニングを使用する詐欺は毎年容易になっていますが、適切なノウハウで長年にわたって可能でした。私たちが学んでいることを学んでいるように、私たちはもはや私たちが見る画像やビデオを簡単に生成できたかもしれないので、私たちが見ることができなくなったことを知っているように、私たちは皆、家族が緊急に要求するように聞こえるように聞こえる誰かがただの詐欺師であるかもしれないとすぐに学びます音声クローニングツール。

詐欺師が私たちの提案に従うことを期待していません。彼らは何があっても方法を見つけるでしょう。しかし、それは常にセキュリティ基準に当てはまり、上昇する潮はすべてのボートを持ち上げます。使用の大部分は、大手企業の人気のある音声APIであると考えています。そして、誰もが彼らがロボットと話していることを知っておくべきです。

サイトの記事から

ウェブ上の関連記事

#Voicesは再びロボットに聞こえるはずです簡単な解決策

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。