日本語版
最新ニュース
世界

AA-WER v2.0 Speech to Text 精度ベンチマークと、音声エージェントに向けられた音声に焦点を当てた新しい独自のデータセットである AA-AgentTalk を発表

AA-AgentTalk は、音声エージェントにとって最も重要な音声に焦点を当てています。 AA-AgentTalk は、保有されている独自のデータセットとして、公開テスト セットで適切なパフォーマンスを発揮するようにモデルをトレーニングするリスクも軽減します。 主要な公開 Speech to Text データセットには、参照トランスクリプトにエラーが含まれており、グラウンド トゥルースが実際に話された内容と一致しません。これらを手動で修正し、Hugging Face で VoxPopuli と Earnings22 のクリーンなバージョンをオープンソース化しています。 ➤ 新しい保持された独自のデータセット - AA-AgentTalk (50% 重み付け): 音声エージェントに向けられた音声の 469 サンプル (約 250 分) で、プライベートであるためモデルはトレーニングできません。音声エージェントとコールセンターの対話、AI エージェントの対話、業界用語、会議、消費者と個人、メディア コンテンツを 17 のアクセント グループ、8 つの話し方、デバイスと環境の組み合わせにまたがります。 ➤ 既存のパブリック…

AA-WER v2.0 Speech to Text 精度ベンチマークと、音声エージェントに向けられた音声に焦点を当てた新しい独自のデータセットである AA-AgentTalk を発表

1771433194
2026-02-18 16:34:00

AA-AgentTalk は、音声エージェントにとって最も重要な音声に焦点を当てています。 AA-AgentTalk は、保有されている独自のデータセットとして、公開テスト セットで適切なパフォーマンスを発揮するようにモデルをトレーニングするリスクも軽減します。

主要な公開 Speech to Text データセットには、参照トランスクリプトにエラーが含まれており、グラウンド トゥルースが実際に話された内容と一致しません。これらを手動で修正し、Hugging Face で VoxPopuli と Earnings22 のクリーンなバージョンをオープンソース化しています。

➤ 新しい保持された独自のデータセット – AA-AgentTalk (50% 重み付け): 音声エージェントに向けられた音声の 469 サンプル (約 250 分) で、プライベートであるためモデルはトレーニングできません。音声エージェントとコールセンターの対話、AI エージェントの対話、業界用語、会議、消費者と個人、メディア コンテンツを 17 のアクセント グループ、8 つの話し方、デバイスと環境の組み合わせにまたがります。

➤ 既存のパブリック データセットのクリーンなトランスクリプト: パブリック データセット、VoxPopuli および Earnings22 の元のグランド トゥルース トランスクリプトにエラーが見つかりました。これは、参照トランスクリプトが実際に話された内容を正確に捉えていない例です。不正確なグラウンド トゥルースは、音声を正しく転写するモデルに不当なペナルティを与えるため、手動でレビューし、クリーンなバージョンである VoxPopuli-Cleaned-AA および Earnings22-Cleaned-AA を作成しました。

➤ AMI-SDM の削除: トランスクリプトのエラーが大きすぎて、不快な判断を多数行わなければ修正できないため (音声の重なり合いなど)、AMI-SDM データセットを削除しました。

➤ テキスト正規化の改善: OpenAI のウィスパー ノーマライザー パッケージをベースにしたカスタム テキスト ノーマライザーを開発し、本物の転記エラーではなく書式設定の違いによって人為的に増大した WER を削減しました。主な修正には、番号グループの不一致を防ぐための桁分割 (例: 1405 553 272 対 1405553272)、先行ゼロの保存、音声記号の正規化 (例: 「+」、「_」)、時間内の冗長な :00 の削除 (例: 午後 7 時対午後 7 時)、米国/英国英語の同等スペルの追加 (例: totaled vs. 1405553272) が含まれます。合計)、データセット内のあいまいな固有名詞の同等のスペルを受け入れました (例: Mateo vs. Matteo)。これにより、表面レベルの書式設定の選択ではなく、実際の転写精度に基づいてモデルが評価されるようになります。

新しい重み付けは、50% AA-AgentTalk、25% VoxPopuli-Cleaned-AA、25% Earnings22-Cleaned-AA です。

Celebrity Scribe v2 が AA-WER v2.0 の 2.3% で首位に立っており、続いて Google の Gemini 3 Pro が 2.9%、Mistral の Voxtral Small が 3.0%、Google の Gemini 3 Flash が 3.1%、そして イレブンラボ Scribe v1 が 3.2% となっています。イレブンラボの Scribe v2 は、3 つのコンポーネント データセットのうち 2 つ、AA-AgentTalk と Earnings22-Cleaned-AA でリードしており、Google の Gemini 3 Pro は VoxPopuli-Cleaned-AA でリードしています。

パフォーマンスはデータセットによって異なり、モデルの特有の強みが明らかになります。音声エージェント向けの AA-AgentTalk のスピーチでは、トップ モデルは Celebrities Scribe v2 (1.6%)、Google Gemini 3 Pro (1.7%)、AssemblyAI Universal-3 Pro (2.3%) でした。 Earnings22-Cleaned-AA の企業決算報告では、上位モデルは Celebrities Scribe v2 (4.1%)、NVIDIA Parakeet TDT 0.6B V3 (4.9%)、Mistral Voxtral Small (4.9%) でした。 VoxPopuli-Cleaned-AA の議会議事録では、トップ モデルは Google Gemini 3 Pro (1.7%)、イレブンラボ Scribe v2 (1.8%)、および Mistral Voxtral Small (1.8%) です。

記事の内容

グラウンド トゥルース トランスクリプトのクリーニングは、測定された WER に大きな影響を与え、VoxPopuli よりも Earnings22 での改善が大きかった。すべてのモデルにおいて、VoxPopuli で参照転記エラーを修正すると、WER が平均 3.5 パーセント ポイント減少し、Earnings22 では平均約 5.6 パーセント ポイントの減少が見られました。たとえば、Celebrities Scribe v2 では VoxPopuli-Cleaned-AA で 6.1% から 1.8% に、Earnings22-Cleaned-AA では 9.7% から 4.1% に低下しましたが、Google Gemini 2.5 Flash では VoxPopuli WER が 10.8% から 2.6% に、Earnings22 WER が 14.3% から 9.1% に低下しました。 Mistral Voxtral Small は、VoxPopuli-Cleaned-AA では 6.4% から 1.8% に、Earnings22-Cleaned-AA では 11.3% から 4.9% に改善しました。

記事の内容

VoxPopuli オーディオ サンプルを聞いて、クリーンアップされたものと元のトランスクリプトを比較してください。

価格は STT 市場によって大きく異なります。 Mistral の Voxtral Mini (1,000 分あたり 1 ドル、AA-WER 3.7%) と Hathora 経由の NVIDIA Parakeet TDT 0.6B V3 (1,000 分あたり 1.32 ドル、AA-WER 4.2%) は高い価値を提供しますが、イレブンラボの Scribe v2 は 1,000 分あたり 6.67 ドルで 2.3% で AA-WER インデックスをリードしています。新しいモデルは、ますます競争力の高い価格帯で高い精度を実現しています。

記事の内容

AA-WER v2.0、AA-AgentTalk、およびクリーン化されたデータセットの詳細については、以下をご覧ください。

完全な結果の内訳:

ハグ顔の VoxPopuli-Cleaned-AA:

Earnings22-Cleaned-AA (ハグフェイス):

方法論: /methodology

人工分析に関するページ:

#AAWER #v2.0 #Speech #Text #精度ベンチマークと音声エージェントに向けられた音声に焦点を当てた新しい独自のデータセットである #AAAgentTalk #を発表

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。