1773193800
2026-03-11 01:20:00
新しい世界的調査によると、人々はAIの音声が人間のものではないとわかった瞬間にその音声を信頼しなくなることが示唆されており、これは顧客サービスやその他の公共システムで合成音声を使用している企業にとって大きな問題となっている。
この研究では1カ月にわたって1万人以上が参加し、参加者はさまざまな声を聞き、それに反応するよう求められた。各音声を好き、嫌い、スキップ、または評価することができます。リスナーは、AI が生成した音声を聞くことになることを事前に知らされていませんでした。
記事は下に続きます
AIの音声を拒否する
この研究では、音声が温かみがあるか、明瞭に聞こえるか、単調に聞こえるかなど、18 の特性にわたって人々が音声にどのように反応するかを測定しました。研究者らはまた、直接のフィードバックだけに頼るのではなく、人々がどのくらいの時間聞いていて、どのように反応したかを追跡しました。
最も明らかな結果の 1 つは、人は AI の音声を認識すると拒否する傾向があるということでした。研究者らは、AIの音声の検出とそれを好むことの間には強い負のつながりがあることを発見した。
結果は、音声モデル間の品質に大きな違いがあることも示しました。最高のパフォーマンスを誇るシステムは、最低ランクのモデルよりも 3 倍高く評価されました。
小規模な AI 企業がランキングで特に好成績を収め、中国の新興企業 MiniMax が英国と米国の両方のリスナーから最高の音声モデルにランクされました。ビッグテック巨人は次のような グーグル、 アマゾン、 そして マイクロソフト 大きく遅れをとった。
この研究では国ごとの違いも判明した。英国のリスナーは米国人よりもAIが生成した音声を認識する可能性が13%高かった。ただし、ヨーロッパのリスナーは全体的に AI の音声をより積極的に受け入れる傾向がありました。
Vocal Image の CEO 兼創設者である Nick Lahoika 氏は、「専用の TTS に切り替えるにはリソースが必要ですが、間違ったプロバイダーを選択することは、特に信頼に基づいて構築された製品にとって、重大なブランド責任になりつつあります」と述べています。 「現実は単純です。人々は依然として AI の悪い音声を信頼していません。」
- 中国の新興企業 Minimax が、オーディオ知覚研究のトップに躍り出ました。なぜこれがそれほど大きな問題なのか教えていただけますか?
私たちは 1 月に 10,000 人のユーザーを対象にこの調査を実施し、MiniMax と 19 の音声モデルを比較しました。目標はシンプルで、人々が実際に信頼している声を特定することです。
彼らのビデオが最近バイラルで注目を集めていることを考えると、私たちの調査では、たとえ視覚的なアバターがなくても、MiniMax の声が最も本物であると認識されていることが確認されました。
Hugging Face で見られるような標準的な A/B ベンチマークの代わりに、私たちは人間の知覚に焦点を当てました。参加者は、AI の声を聞いていることを知らずに、信頼、魅力、権威に基づいて他の人を評価するのと同じように音声を評価しました。
私の意見では、この種のデータは、ProductHunt で得られる調整された賛成票よりもはるかに価値があります。
結果は興味深いものでした。英国と米国のネイティブスピーカーの 86% が、MiniMax を最高品質の音声として評価しました。イギリスのリスナーは特にそれが最も自信に満ちていると述べました。
私たちの調査では、英国のリスナーが AI 音声の検出に最も優れていることも示されており、その結果はさらに重要なものとなっています。最も騙すのが難しい視聴者がそれを本物であると認識する場合、モデルは明らかに非常に高いレベルで動作しています。
- あなたはまた、大手ハイテク企業が「遅れている」とも指摘しました。なぜそうなるのだと思いますか?また、そのギャップを埋めるために (買収などを通じて) 何ができるでしょうか?
大手テック企業は規模では勝っていますが、精度では負けています。私の意見では、彼らの音声モデルは、「十分なレベル」が許容される何百万もの水平的なユースケースに合わせて構築されています。これは天気予報の更新などに役立ちます。しかし、コミュニケーションコーチングや言語療法など、一か八かの場面では、イントネーションとリズムが製品となります。声が合成のように感じられると、体験はすぐに壊れてしまいます。
AI が販売、教育、機密性の高い問い合わせの管理に使用されている分野では、ユーザーの信頼を構築し高めるために、音声には自信、明瞭さ、信頼性が表現されている必要があります。
私たちのチームが、2020 年にベラルーシから移転し、現在本拠地を置いているエストニアへのオマージュとして、高忠実度のエストニア語合成モデルを構築したときに、これを直接目にしました。当時、唯一の代替手段は Microsoft のシステムであり、エストニア語の数字を正しく発音できませんでした。
数字が間違っているビジネス ニュース放送を想像してみてください。これは、大規模な水平プラットフォームが見落としがちな、品質の「ラスト マイル」です。
このギャップを埋めるために、大手テック企業はますます買収に頼るようになると私は予想しています。規模の経済性を維持しながら、あらゆる業種にわたって深く特化することは困難です。
スタートアップ企業にとってチャンスは、規模よりも品質が重要となる、特定の高価値のコンテキストに最適化されたシステムを構築することにあります。
- レポートでは、多くのリスナーがAIが生成した音声を好んでいたことも指摘している。なぜそうなると思いますか?ユーザーの疲労は見られますか(つまり、AI によって生成されたオーディオがあまりにも多すぎるため、私はそれと戦うのに疲れました。私はそれを受け入れたほうがよいでしょう)。
このレポートでは AI の音声のみをチェックしたため、人々が実際の音声よりも AI の音声を好むとは言えません。
多くの人 (66%) は、AI の音声が偽物であることがわかりませんでした。これは、AI 音声テクノロジーが現在非常に優れていることを示しています。
人々は人間の声に飽きていないと思います。彼らはAIの音声に慣れてきたところだと思います。多くの人はビデオを高速化します (1.5 倍または 2 倍)。これを行うと、彼らは感情に耳を傾けることをやめ、ただ早く事実を知りたがります。
AI の音声はきれいで明瞭で、間違いや中断がないため、事実を伝えるのに最適です。人々が AI を選択し始めているのは、AI への適応を強いられたからではなく、AI の方が速くて明確だからです。
私たちの研究では、18 の音声特徴を調べました。重要なのは、ただリアルに聞こえる声よりも、クリアで確実に聞こえる声の方が常に優れているということです。
これは、イレブンラボとデスクリプトに特に当てはまります。彼らの AI の声は、安価なスタジオで録音する多くの人間の声優よりも「プロフェッショナル」に聞こえるようです。
- 研究では、AI プラットフォーム、特化した TTS エンティティ、および主要な武器という 3 つの幅広いカテゴリのテキスト読み上げモデルについて言及しました。それぞれのアプローチはどのように異なり、将来的にはどちらが主流になると思いますか?
私たちの調査によると、AI プラットフォームと高度に専門化されたスタートアップの 2 つのカテゴリが、音声テクノロジーの次の段階を支配する可能性が最も高いことがわかりました。
業界は、単なる音の生成を超えて進んでいます。本当の課題は、感情、ユーモア、権威、微妙なニュアンスを伴う人間の認識に音声を合わせるということです。
合成音声の作成は急速に商品になりつつあります。人間が実際に音声をどのように認識するかに合わせて音声を評価し調整することが、本当のボトルネックです。
特化したスタートアップは、一般的な機能に合わせて最適化するのではなく、特定の結果に向けてシステムを構築するため、ここでの動きが速くなることがよくあります。確かに、大手テクノロジー企業は依然として膨大なリソースを持っており、彼らにとっては、品質のギャップを埋めるための主な戦略は今後も買収である可能性が高い。
- あなたは、将来的には、たとえば俳優が伝記映画で有名人を演じるときのように、マンネリズムや非言語コミュニケーションの全範囲を捉えて、ユーザーを総合的にガイドする単一の統一された方法を開発したいとおっしゃいました。私の皮肉屋は、これは行き過ぎで、ほぼ完璧なディープフェイクの作成に使用できるのではないかと考えています。それについて何か考えはありますか?
現在でも、Instagram から 1 枚の写真やビデオを入手するだけで、非常にリアルなディープフェイクを作成できます。音声のクローン作成には数秒しかかかりません。テクノロジーに良いも悪いもありません。違う使い方をする人がいるだけです。
当社はデータを使用してソフトウェアのソフトスキルをトレーニングし、ユーザーに実用的なフィードバックを提供します。このデータは不正行為の検出に使用される可能性がありますが、私たちの主な焦点は引き続きユーザーの改善を支援するフィードバックを提供することにあります。私たちは人間のクローンを作成することを目的としていません。私たちの目標はその逆で、人々のコミュニケーション スキルの向上を支援したいと考えています。
現在、投資家はすでに創業者の書面によるコミュニケーションを分析しています。将来的には、その人がどれだけ自信を持って話すか、どのように自分自身を表現するか、そしてどれだけ明確にアイデアを表現するかについても評価するようになるでしょう。
AI は、コーチング環境で人々が感じる社会的なプレッシャーを感じることなく、これらのスキルを客観的にトレーニングするのに役立ちます。
話す不安は世界的な大きな問題です。 2億人以上の人がこの問題に苦しんでいます。従来のコーチングは高価であり、ほとんどの人はアクセスできません。
AI コーチングは、従来のエグゼクティブ トレーニングよりも最大 280 倍の費用対効果が得られます。スピーキング コーチ、演技教師、コミュニケーション トレーナーなどの複数の専門家を雇う代わりに、ユーザーは 1 つのシステムで構造化されたフィードバックと毎日の練習を得ることができます。従来のエグゼクティブコーチングプログラム 費用がかかる可能性があります 従業員 1 人あたり年間 7,000 ドルから 25,000 ドルですが、米国ではアプリの年間サブスクリプションの費用はわずか 89.99 ドルです
つまり、私たちは人間の成長に取って代わることを目指しているわけではありません。私たちの使命は、誰でも自己啓発にアクセスできるようにすることです。
Google ニュースで TechRadar をフォローしてください そして 私たちを優先情報源として追加してください 専門的なニュース、レビュー、意見をフィードで入手できます。ぜひフォローボタンをクリックしてください!
もちろん、次のこともできます TikTokでTechRadarをフォローしてください ニュース、レビュー、開封をビデオ形式で確認し、定期的に最新情報を入手してください。 ワッツアップ あまりにも。
#リスナーは中国の新興企業の #の声が #MicrosoftGoogleAmazon #の #の声よりも現実的で信頼できると評価しました