日本語版
最新ニュース
世界

音声認識テクノロジーは構音障害を持つ人々にとって大きな効果を示しています

マーク・ハセガワ・ジョンソン氏は、最新プロジェクトのデータを徹底的に調べていたところ、エッグ・フロランタンのレシピを発見して嬉しい驚きを覚えました。何百時間にも及ぶ録音された音声をふるいにかければ、宝の一つか二つが見つかるだろう、と彼は言う。 ハセガワ・ジョンソン氏は、言語障害を持つ人々にとって音声認識デバイスをより便利にするためのイリノイ大学アーバナ・シャンペーン校の取り組みである音声アクセシビリティ・プロジェクトを主導しています。 このプロジェクトの最初に発表された研究では、研究者らは自動音声認識装置に 151 時間の音声を聞くよう依頼しました。ほぼ6日半 -;パーキンソン病に関連した言語障害を持つ人々からの録音。彼らのモデルは、パーキンソン病患者の話を聞いていない対照モデルよりも 30% 高い精度で、同様の録音の新しいデータセットを転写しました。 この研究は、 音声、言語、聴覚研究のジャーナル。 研究で使用された音声録音は、音声認識デバイスの改善を目指す研究者、非営利団体、企業に無料で利用可能です。 「私たちの結果は、非定型音声の大規模なデータベースが障害のある人々の音声技術を大幅に改善できることを示唆しています」と、イリノイ大学の電気工学およびコンピュータ工学の教授であり、同大学のベックマン先端科学技術研究所の研究員でもあるハセガワ・ジョンソン氏は述べた。プロジェクトが格納されている場所。 「他の組織がこのデータをどのように利用して音声認識デバイスをより包括的なものにするかを見るのを楽しみにしています。」 スマートフォンや仮想アシスタントなどのマシンは、自動音声認識を使用して発声から意味を理解し、プレイリストをキューに登録したり、ハンズフリー メッセージを口述したり、仮想会議にシームレスに参加したり、友人や家族と明確にコミュニケーションしたりすることができます。 音声認識テクノロジーは誰にとってもうまく機能するわけではありません。特に、パーキンソン病のような神経運動障害のある人は、構音障害と総称される、さまざまな緊張、ろれつが回らない、または調和のとれない発話パターンを引き起こす可能性があります。 「残念ながら、これは、音声制御デバイスを最も必要とする多くの人々が、それらをうまく使用するのに最も困難に直面する可能性があることを意味します」とハセガワ・ジョンソン氏は述べた。 「既存の研究から、誰かの声で ASR をトレーニングすると、ASR がその声をより正確に理解し始めることがわかっています。私たちは、自動音声認識装置を、パーキンソン病による構音障害のある人々を理解できるようにトレーニングできるか、ということを、少人数のグループに公開することで尋ねました。同じような話し方をする人はいますか?」 長谷川ジョンソン氏らは、パーキンソン病に関連するさまざまな程度の構音障害を持つ成人約250人を募集した。研究に参加する前に、参加予定者は言語聴覚士と面会し、彼らの適格性を評価しました。 チームの言語聴覚士であるクラリオン・メンデス氏は、「コミュニケーション障害、特に進行性の障害に長い間苦しんできた人の多くは、日常のコミュニケーションから遠ざかる可能性がある」と述べた。 「彼らは、コミュニケーションに影響がありすぎて有意義な会話ができないと考え、独自の考え、ニーズ、アイデアを共有する頻度がますます少なくなっている可能性があります。 「まさに私たちが探している人材です」と彼女は言った。 選ばれた参加者はパソコンやスマートフォンを使って音声録音を提出。彼らは自分のペースで作業し、オプションで介護者の援助を受けながら、「目覚ましをセットして」などの使い古された音声コマンドを繰り返したり、小説の一節を暗唱したり、「4人分の朝食を作る手順を説明してください」のような自由回答の質問に意見したりしました。 。」 後者に応じて、ある参加者は卵をフィレンツェ風にする手順を列挙しました。オランデーズソースとすべて -;一方、現実的にテイクアウトを注文するようアドバイスする人もいた。 「多くの参加者から、参加プロセスが楽しかっただけでなく、家族と再びコミュニケーションをとる自信が持てるようになったという声を聞きました」とメンデス氏は語った。 「このプロジェクトは、多くの参加者とその愛する人たちに、希望、興奮、そしてエネルギー、人間特有の特質をもたらしました。」 同氏は、チームはパーキンソン病の専門家やコミュニティメンバーと相談して、参加者の生活に関連したコンテンツを開発したと述べた。プロンプトは具体的かつ自発的でした。たとえば、薬の名前を認識するように音声アルゴリズムをトレーニングすると、エンド ユーザーが薬局とコミュニケーションを取るのに役立つ可能性があり、カジュアルな会話のきっかけは毎日のおしゃべりのリズムを模倣します。 「私たちは参加者にこう言います。全力を注ぐことでスピーチをより明瞭にできることはわかっていますが、おそらく他の人のために自分のことを理解してもらうことに疲れているでしょう。リラックスして、まるで自分が話しているかのようにコミュニケーションするようにしてください。」ソファで家族とおしゃべりしているよ」とメンデスは語った。 音声アルゴリズムがどれだけよく聞いて学習したかを測定するために、研究者らはサンプルを 3 つのセットに分割しました。 190…

音声認識テクノロジーは構音障害を持つ人々にとって大きな効果を示しています

1727489416
2024-09-28 01:52:00

マーク・ハセガワ・ジョンソン氏は、最新プロジェクトのデータを徹底的に調べていたところ、エッグ・フロランタンのレシピを発見して嬉しい驚きを覚えました。何百時間にも及ぶ録音された音声をふるいにかければ、宝の一つか二つが見つかるだろう、と彼は言う。

ハセガワ・ジョンソン氏は、言語障害を持つ人々にとって音声認識デバイスをより便利にするためのイリノイ大学アーバナ・シャンペーン校の取り組みである音声アクセシビリティ・プロジェクトを主導しています。

このプロジェクトの最初に発表された研究では、研究者らは自動音声認識装置に 151 時間の音声を聞くよう依頼しました。ほぼ6日半 -;パーキンソン病に関連した言語障害を持つ人々からの録音。彼らのモデルは、パーキンソン病患者の話を聞いていない対照モデルよりも 30% 高い精度で、同様の録音の新しいデータセットを転写しました。

この研究は、 音声、言語、聴覚研究のジャーナル。 研究で使用された音声録音は、音声認識デバイスの改善を目指す研究者、非営利団体、企業に無料で利用可能です。

「私たちの結果は、非定型音声の大規模なデータベースが障害のある人々の音声技術を大幅に改善できることを示唆しています」と、イリノイ大学の電気工学およびコンピュータ工学の教授であり、同大学のベックマン先端科学技術研究所の研究員でもあるハセガワ・ジョンソン氏は述べた。プロジェクトが格納されている場所。 「他の組織がこのデータをどのように利用して音声認識デバイスをより包括的なものにするかを見るのを楽しみにしています。」

スマートフォンや仮想アシスタントなどのマシンは、自動音声認識を使用して発声から意味を理解し、プレイリストをキューに登録したり、ハンズフリー メッセージを口述したり、仮想会議にシームレスに参加したり、友人や家族と明確にコミュニケーションしたりすることができます。

音声認識テクノロジーは誰にとってもうまく機能するわけではありません。特に、パーキンソン病のような神経運動障害のある人は、構音障害と総称される、さまざまな緊張、ろれつが回らない、または調和のとれない発話パターンを引き起こす可能性があります。

「残念ながら、これは、音声制御デバイスを最も必要とする多くの人々が、それらをうまく使用するのに最も困難に直面する可能性があることを意味します」とハセガワ・ジョンソン氏は述べた。

「既存の研究から、誰かの声で ASR をトレーニングすると、ASR がその声をより正確に理解し始めることがわかっています。私たちは、自動音声認識装置を、パーキンソン病による構音障害のある人々を理解できるようにトレーニングできるか、ということを、少人数のグループに公開することで尋ねました。同じような話し方をする人はいますか?」

長谷川ジョンソン氏らは、パーキンソン病に関連するさまざまな程度の構音障害を持つ成人約250人を募集した。研究に参加する前に、参加予定者は言語聴覚士と面会し、彼らの適格性を評価しました。

チームの言語聴覚士であるクラリオン・メンデス氏は、「コミュニケーション障害、特に進行性の障害に長い間苦しんできた人の多くは、日常のコミュニケーションから遠ざかる可能性がある」と述べた。 「彼らは、コミュニケーションに影響がありすぎて有意義な会話ができないと考え、独自の考え、ニーズ、アイデアを共有する頻度がますます少なくなっている可能性があります。

「まさに私たちが探している人材です」と彼女は言った。

選ばれた参加者はパソコンやスマートフォンを使って音声録音を提出。彼らは自分のペースで作業し、オプションで介護者の援助を受けながら、「目覚ましをセットして」などの使い古された音声コマンドを繰り返したり、小説の一節を暗唱したり、「4人分の朝食を作る手順を説明してください」のような自由回答の質問に意見したりしました。 。」

後者に応じて、ある参加者は卵をフィレンツェ風にする手順を列挙しました。オランデーズソースとすべて -;一方、現実的にテイクアウトを注文するようアドバイスする人もいた。

「多くの参加者から、参加プロセスが楽しかっただけでなく、家族と再びコミュニケーションをとる自信が持てるようになったという声を聞きました」とメンデス氏は語った。 「このプロジェクトは、多くの参加者とその愛する人たちに、希望、興奮、そしてエネルギー、人間特有の特質をもたらしました。」

同氏は、チームはパーキンソン病の専門家やコミュニティメンバーと相談して、参加者の生活に関連したコンテンツを開発したと述べた。プロンプトは具体的かつ自発的でした。たとえば、薬の名前を認識するように音声アルゴリズムをトレーニングすると、エンド ユーザーが薬局とコミュニケーションを取るのに役立つ可能性があり、カジュアルな会話のきっかけは毎日のおしゃべりのリズムを模倣します。

「私たちは参加者にこう言います。全力を注ぐことでスピーチをより明瞭にできることはわかっていますが、おそらく他の人のために自分のことを理解してもらうことに疲れているでしょう。リラックスして、まるで自分が話しているかのようにコミュニケーションするようにしてください。」ソファで家族とおしゃべりしているよ」とメンデスは語った。

音声アルゴリズムがどれだけよく聞いて学習したかを測定するために、研究者らはサンプルを 3 つのセットに分割しました。 190 人の参加者からなる最初のセット、または記録された 151 時間でモデルがトレーニングされました。パフォーマンスが向上するにつれて、研究者らは、モデルを 2 番目の小規模な記録セットに導入することで、モデルが本格的に学習している (参加者の応答を記憶しているだけではない) ことを確認しました。 2 番目のセットでモデルのパフォーマンスがピークに達したとき、研究者はテスト セットでモデルに挑戦しました。

研究チームのメンバーは、モデルの動作を確認するために、参加者あたり平均 400 件の録音を手動で文字に起こしました。

彼らは、トレーニング セットを聞いた後、ASR システムがテスト セットからの録音を 23.69% の単語誤り率で転記したことを発見しました。比較のために、パーキンソン病ではない人の音声サンプルで訓練されたシステムは、単語誤り率 36.3% でテストセットを書き起こしました。精度は約 30% 低下します。

テストセット内のほぼすべての個人でエラー率も減少しました。異常に早口で話したり、吃音したりするなど、パーキンソン病の典型的な話し方ではない話者でも、わずかな改善が見られました。

「これほど劇的な効果が得られたことに興奮しました」とハセガワ・ジョンソン氏は語った。

彼は、参加者のフィードバックによって彼の熱意がさらに高まったと付け加えました。

「この技術の将来に興味を持っていた参加者と話をしました」と彼は語った。 「それがこのプロジェクトの素晴らしいところです。スマート スピーカーや携帯電話が自分のことを理解してくれる可能性について、人々がどれほど興奮しているかを見ることができます。それが私たちが本当にやろうとしていることです。」

ソース:

ベックマン先端科学技術研究所

#音声認識テクノロジーは構音障害を持つ人々にとって大きな効果を示しています

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。