1716587584
2024-05-24 21:34:28
ノイズキャンセリングヘッドホンは、聴覚の白紙状態を作り出すのに非常に優れている。しかし、装着者の周囲の特定の音を消去する方法は、研究者にとって依然として課題となっている。たとえば、Apple の最新版 AirPods Pro は、装着者が会話中であることを感知して、自動的に音量を調整するが、誰の話をいつ聞くかは、ユーザーがほとんど制御できない。
ワシントン大学の研究チームは、ヘッドホンを装着したユーザーが、話している人を3~5秒間見つめて「登録」できる人工知能システムを開発した。「Target Speech Hearing」と呼ばれるこのシステムは、周囲の他の音をすべてキャンセルし、登録した話者の声だけをリアルタイムで再生する。たとえ、聞き手が騒がしい場所で動き回って話者と顔を合わせなくなったとしてもだ。
研究チームは、5月14日にホノルルで開催されたACM CHI コンピューティングシステムにおけるヒューマンファクターに関する会議で研究結果を発表しました。この概念実証デバイスのコードは、他の人が利用するために公開されています。このシステムは市販されていません。
「現在、AI は質問に答えるウェブベースのチャットボットだと考えられがちです」と、ワシントン大学ポール・G・アレン コンピュータサイエンス&エンジニアリング学部の教授で、論文の主任著者であるシャム・ゴラコタ氏は語る。「しかし、このプロジェクトでは、ヘッドフォンを装着している人の聴覚を、その人の好みに応じて変更する AI を開発しています。私たちのデバイスを使えば、騒がしい環境で大勢の人が話していても、一人の話し手の声がはっきりと聞こえるようになります。」
このシステムを使用するには、マイク付きの市販のヘッドホンを装着した人が、話している人に頭を向けながらボタンをタップします。すると、話者の声の音波がヘッドセットの両側のマイクに同時に届きます。誤差は 16 度です。ヘッドホンはその信号を内蔵コンピューターに送信し、そこでチームの機械学習ソフトウェアが目的の話者の声のパターンを学習します。システムはその話者の声をキャッチし、話者が動き回っても、聞き手に向けて再生し続けます。話者が話し続けると、登録した声に集中するシステムの能力が向上し、システムにトレーニング データがさらに提供されます。
研究チームは21人の被験者を対象にシステムをテストし、被験者は登録された話者の声の明瞭度を、平均してフィルタリングされていない音声のほぼ2倍と評価した。
この研究は、チームがこれまでに行ってきた「意味的聴覚」研究に基づいている。この研究では、ユーザーが聞きたい特定の音の種類(鳥や声など)を選択し、環境内の他の音をキャンセルすることができた。
現在、TSH システムは一度に 1 人のスピーカーしか登録できず、対象スピーカーの声と同じ方向から別の大きな声が聞こえない場合にのみスピーカーを登録できます。ユーザーが音質に満足できない場合は、スピーカーを再度登録して明瞭度を向上させることができます。
チームは将来的にこのシステムをイヤホンや補聴器に拡張する取り組みを進めている。
この論文の共著者は、ワシントン大学アレン校の博士課程学生である Bandhav Veluri、Malek Itani、Tuochao Chen、および AssemblyAI の研究ディレクターである Takuya Yoshioka です。この研究は、Moore Inventor Fellow 賞、Thomas J. Cabel 寄付教授職、およびワシントン大学 CoMotion Innovation Gap Fund の資金提供を受けて行われました。
#AIヘッドフォンは装着者が群衆の中の1人の人物を一度見るだけでその人の話を聴くことができる