1736959701
2025-01-15 16:32:00
Meta は、研究者らが主張する機械学習モデルを開発し、約 36 の言語間でほぼ瞬時に音声から音声への翻訳を実現できると主張しています。
バベルフィッシュを彷彿とさせる 銀河ヒッチハイク ガイド、基礎モデル SEAMLESSM4T は、450 万時間の録音された人間の音声でトレーニングされ、インターネット音声の断片を利用することで面倒なデータの注釈を回避する「賢明な」アプローチを採用しています。
を提示する 紙 今日のジャーナルNatureで、Facebookの親会社のチームは、他のアプリケーションを構築できる比較的オープンなモデルが、オンデマンドの「さまざまなコンテキストにわたる多言語交換の合理化」をサポートできる可能性があると述べた。
研究チームはまた、膨大な量のトレーニング データに注釈を付けることを避けるために、新しい自動化技術も使用しました。
「SEAMLESS チームの最も賢明な戦略の 1 つは、言語間で一致するペアをトレーニングするためにインターネットを「マイニング」することでした。たとえば、ある言語の音声スニペットが別の言語の字幕と一致するなどです。著者らは、信頼できるとわかっているいくつかのデータから始めて、 2 つのコンテンツ (ビデオ クリップと対応する字幕など) が実際に意味的に一致するときを認識するためのモデルです」と Alumäe 氏は説明しました。
この技術により、Meta のシームレス コミュニケーション チームは、テキストが一致する約 443,000 時間の音声を収集し、約 30,000 時間の音声ペアを調整し、モデルをさらにトレーニングするために使用しました。 Alumäe 氏は、このモデルに関する Meta のオープン性のレベルを賞賛しました。これは、他のアプリケーションの作成に使用できる大規模な言語モデルの Llama ファミリに似ています。 「このレベルのオープン性は、これらのモデルをゼロから構築するのに必要な膨大な計算リソースが不足している研究者にとって、大きな利点です。」
しかし、LLaMA-3の「明らかに非オープンな使用制限」を理由に批判する人もいる。
Meta の新しいモデルは、最大 100 の言語を音声からテキストに翻訳することもできると言われています。アルマエ氏は、この数字は素晴らしいものの、世界中で話されている 7,000 の言語にはかなり及ばないと指摘しました。
「また、このツールは、人間が比較的簡単に対処できる多くの状況、たとえば騒がしい場所での会話や、なまりの強い人々の間での会話などでは困難を伴います。しかし、実世界のデータを利用する著者らの方法は、音声テクノロジーへの有望な道を切り開くでしょう。 SFの世界に匹敵するものだ」と彼は語った。
「将来の取り組みでは、音声技術の研究者がパフォーマンスの格差を改善し、ユーザーがこれらのモデルに関連する潜在的な利点と害について十分な情報を得ることができるようにする必要があります」と彼女は述べた。論文の中で、メタは言語の「毒性」とジェンダーバイアスをどのように測定したかについて説明している。
研究者らはまた、自然な音声には「さらなる研究に値する一連の韻律、つまりリズム、強勢、イントネーションやトーン、そして感情的な要素が含まれている」とも述べた。
彼らはさらに、「有機的で自然に感じられる S2ST システムを作成するには、表現力を維持する出力生成にさらなる研究が向けられるべきです。さらに、バベル フィッシュを完全に実現するには、低遅延音声翻訳の研究へのより深い投資が必要です。ストリーミングを有効にする(つまり、入力文が表示されるときに段階的に翻訳する)ことで、教育機関全体でこれらのシステムの採用が増える可能性があります。SEAMLESSM4T がこれらの研究分野の両方に新たな可能性を開くことを期待しています。」 ®
#メタ #モデルは音声から音声への翻訳を提供します #Register