日本語版
最新ニュース
世界

スマートヘッドフォンが「カクテルパーティーの問題」を解決するかもしれない

研究者は、騒々しい音環境の中で着用者のすべての会話相手を積極的に隔離するスマートヘッドフォンを開発しました 混雑した部屋で会話をすると、多くの場合、イライラする「カクテル パーティーの問題」、つまり会話相手の声を喧騒から分離するという課題が生じます。これは精神的に負担のかかる状況であり、聴覚障害によってさらに悪化する可能性があります。 新しいヘッドフォンは、会話のリズムを検出する AI モデルと、そのパターンに従わない音声やその他の不要な背景ノイズをミュートする別のモデルを搭載しています。このプロトタイプは既製のハードウェアを使用しており、わずか 2 ~ 4 秒の音声を使用して会話の相手を識別できます。 このシステムの開発者らは、この技術がいつか、補聴器、イヤホン、スマートグラスのユーザーが手動でAIの「注意」を向けることなくサウンドスケープをフィルタリングできるようになるだろうと考えている。 チームは、中国の蘇州で開催された自然言語処理の経験的手法に関する会議でこのテクノロジーを発表しました。基礎となるコードはオープンソースであり、 ダウンロード可能。 「着用者が誰の話を聞いているかを特定する既存のアプローチは、主に注意を追跡するために脳に埋め込まれた電極を使用しています」と、主著者でワシントン大学ポール・G・アレン・スクール・オブ・コンピュータサイエンス&エンジニアリング教授のシャム・ゴラコタ氏は言う。 「私たちの洞察によると、特定のグループの人々と会話しているとき、私たちの会話は自然に交代のリズムに従うということです。そして、電極を埋め込むことなく、音声だけを使用して AI をトレーニングして、そのリズムを予測し追跡することができます。」 「プロアクティブ聴覚アシスタント」と呼ばれるプロトタイプのシステムは、ヘッドフォンを装着した人が話し始めると作動します。そこから、1 つの AI モデルが「誰がいつ話したか」分析を実行し、会話の重複が少ないものを探すことで会話参加者の追跡を開始します。次に、システムは結果を 2 番目のモデルに転送し、参加者を分離し、クリーンアップされた音声を装着者に再生します。このシステムは、ユーザーの混乱を招く音声遅延を回避するのに十分な速度を備えており、現在、装着者の音声に加えて 1 ~ 4 人の会話パートナーを使い分けることができます。 チームは 11 人の参加者とともにヘッドフォンをテストし、AI フィルターの有無にかかわらずノイズ抑制や理解力などの品質を評価しました。全体として、グループはフィルタリングされたオーディオをベースラインの 2 倍以上高く評価しました。 Gollakota 氏のチームはここ数年、AI を活用した聴覚アシスタントの実験を行ってきました。彼らは、着用者が目を向けたときに群衆の中からその人の音声を拾うことができるスマートヘッドフォンのプロトタイプを 1 つ開発し、もう…

スマートヘッドフォンが「カクテルパーティーの問題」を解決するかもしれない

1765918459
2025-12-16 18:56:00

研究者は、騒々しい音環境の中で着用者のすべての会話相手を積極的に隔離するスマートヘッドフォンを開発しました

混雑した部屋で会話をすると、多くの場合、イライラする「カクテル パーティーの問題」、つまり会話相手の声を喧騒から分離するという課題が生じます。これは精神的に負担のかかる状況であり、聴覚障害によってさらに悪化する可能性があります。

新しいヘッドフォンは、会話のリズムを検出する AI モデルと、そのパターンに従わない音声やその他の不要な背景ノイズをミュートする別のモデルを搭載しています。このプロトタイプは既製のハードウェアを使用しており、わずか 2 ~ 4 秒の音声を使用して会話の相手を識別できます。

このシステムの開発者らは、この技術がいつか、補聴器、イヤホン、スマートグラスのユーザーが手動でAIの「注意」を向けることなくサウンドスケープをフィルタリングできるようになるだろうと考えている。

チームは、中国の蘇州で開催された自然言語処理の経験的手法に関する会議でこのテクノロジーを発表しました。基礎となるコードはオープンソースであり、 ダウンロード可能

「着用者が誰の話を聞いているかを特定する既存のアプローチは、主に注意を追跡するために脳に埋め込まれた電極を使用しています」と、主著者でワシントン大学ポール・G・アレン・スクール・オブ・コンピュータサイエンス&エンジニアリング教授のシャム・ゴラコタ氏は言う。

「私たちの洞察によると、特定のグループの人々と会話しているとき、私たちの会話は自然に交代のリズムに従うということです。そして、電極を埋め込むことなく、音声だけを使用して AI をトレーニングして、そのリズムを予測し追跡することができます。」

「プロアクティブ聴覚アシスタント」と呼ばれるプロトタイプのシステムは、ヘッドフォンを装着した人が話し始めると作動します。そこから、1 つの AI モデルが「誰がいつ話したか」分析を実行し、会話の重複が少ないものを探すことで会話参加者の追跡を開始します。次に、システムは結果を 2 番目のモデルに転送し、参加者を分離し、クリーンアップされた音声を装着者に再生します。このシステムは、ユーザーの混乱を招く音声遅延を回避するのに十分な速度を備えており、現在、装着者の音声に加えて 1 ~ 4 人の会話パートナーを使い分けることができます。

チームは 11 人の参加者とともにヘッドフォンをテストし、AI フィルターの有無にかかわらずノイズ抑制や理解力などの品質を評価しました。全体として、グループはフィルタリングされたオーディオをベースラインの 2 倍以上高く評価しました。

Gollakota 氏のチームはここ数年、AI を活用した聴覚アシスタントの実験を行ってきました。彼らは、着用者が目を向けたときに群衆の中からその人の音声を拾うことができるスマートヘッドフォンのプロトタイプを 1 つ開発し、もう 1 つは着用者から一定の距離内のすべての音をミュートして「サウンドバブル」を作成するスマートヘッドフォンのプロトタイプを開発しました。

エクスペリエンスを改善するには、まだ多くの作業が残っています。会話がダイナミックになればなるほど、参加者がお互いに話したり、長い独り言を話したりするため、システムはより困難になる可能性があります。参加者が会話に参加したり会話から退出したりすることには別のハードルが存在しますが、Gollakota 氏は、現在のプロトタイプがこれらのより複雑なシナリオでいかにうまく機能するかに驚きました。著者らはまた、モデルは英語、北京語、日本語の対話でテストされており、他の言語のリズムではさらに微調整が必要になる可能性があることにも言及しています。

現在のプロトタイプでは、市販のオーバーザイヤー ヘッドフォン、マイク、回路が使用されています。 Gollakota 氏は最終的には、このシステムをイヤホンや補聴器内の小さなチップ上で実行できるほど小型化することを期待しています。 MobiCom 2025 で発表された同時研究で、著者らは小型補聴器デバイス上で AI モデルを実行できることを実証しました。

この研究は、ムーア発明フェロー プログラムから資金提供を受けました。

#スマートヘッドフォンがカクテルパーティーの問題を解決するかもしれない

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。