日本語版
最新ニュース
世界

AlibabaはThinkSoundを紹介します:ビデオ用のリアルなオーディオを生成するAIモデル

| 2025年7月16日に公開 ビデオコンテンツ用の高品質のオーディオを作成することは、多くの技術的および創造的な課題を提示し、初心者と経験豊富なオーディオ専門家の両方に影響を与えます。プロデューサーは、多くの場合、ノイズ管理、対話とサウンドエフェクトのバランスをとる、予算と時間の制約を満たし、創造的な一貫性を維持するなどの問題に取り組んでいます。芸術的なビジョンを、視覚的ダイナミクス、音響環境、タイミングを正確に反映するまとまりのある最終製品に変換します。 これらの課題に対処するために、 AlibabaのTongyi Speech Labが紹介しました 思考サウンド、高度なオーディオ生成と編集のためのチェーン(COT)推論を利用する新しいオープンソースマルチモーダルLLM。 ThinkSoundは、ビデオコンテンツに合わせて特別に調整されたオーディオ制作に対する構造化されたインタラクティブなアプローチを提供します。 モデル、3つのコンパクトサイズで利用可能 - 1.3b、724m、および533mパラメーター - ビデオからオーディオの生成、テキストベースのオーディオ編集、およびインタラクティブなオーディオ作成を、エッジデバイスでもサポートしています。 ThinkSoundは、人間のサウンドデザイナーのマルチステージワークフローを模倣し、生成されたオーディオが生産全体で文脈的に正確で、まとまりがあり、高品質のままであることを保証します。このモデルは、最初にビデオの視覚的ダイナミクスを分析し、対応する音響属性を論理的に解釈し、次にコンテキストに適したオーディオを合成します。 革新的なアプローチを通じて、ThinkSoundは、ユーザーが詳細で一貫したサウンドスケープを作成し、直感的なユーザーインタラクションを通じて生成されたオーディオを改良し、自然言語の指示を使用して特定のオーディオセグメントを編集し、創造的な意図と自動オーディオ制作のギャップを効果的に埋めることができます。 さらに、Alibabaの研究チームが紹介しました オーディオコット、視覚コンテンツ、テキストの説明、およびサウンド合成の間のアライメントを強化するオーディオ固有のCOTアノテーションを備えた大規模なマルチモーダルデータセット。 ThinkSoundが達成することが広範な評価が実証されています 最先端のパフォーマンス ビデオからオーディオの世代では、文脈的に正確で正確にタイミングのあるサウンドスケープを提供します。このモデルは、従来のオーディオ品質メトリックとCOTベースの評価に優れています。さらに、映画のオーディオ生成機能を評価するベンチマークであるMovieGenオーディオベンチでは、ThinkSoundは他の主要なモデルを大幅に上回ります。 vggsoundテストセットの既存のビデオからオーディオベースラインとのThinkSound Foundationモデルの比較。 ↓はより良いことを示し、↑より高いことを示します。 ThinkSoundは、さまざまなビデオ生成モデルとシームレスに統合して、合成されたビデオ用のリアルなナレーションやサウンドトラックを提供できます。洗練されたオーディオ生成機能は、映画やテレビのサウンドデザイン、オーディオポストプロダクション、ゲームや仮想現実の没入型サウンドエクスペリエンスにおける重要な潜在的なアプリケーションを提供します。 ThinkSoundがオープンソースで利用可能になりました 顔を抱き締める、 ギルブ そしてアリババの モデルスタジオ。 MovieGenオーディオベンチでの分散式評価。 #AlibabaはThinkSoundを紹介しますビデオ用のリアルなオーディオを生成するAIモデル

AlibabaはThinkSoundを紹介します:ビデオ用のリアルなオーディオを生成するAIモデル

1752631311
2025-07-16 01:48:00

|

2025年7月16日に公開

ビデオコンテンツ用の高品質のオーディオを作成することは、多くの技術的および創造的な課題を提示し、初心者と経験豊富なオーディオ専門家の両方に影響を与えます。プロデューサーは、多くの場合、ノイズ管理、対話とサウンドエフェクトのバランスをとる、予算と時間の制約を満たし、創造的な一貫性を維持するなどの問題に取り組んでいます。芸術的なビジョンを、視覚的ダイナミクス、音響環境、タイミングを正確に反映するまとまりのある最終製品に変換します。

これらの課題に対処するために、 AlibabaのTongyi Speech Labが紹介しました 思考サウンド、高度なオーディオ生成と編集のためのチェーン(COT)推論を利用する新しいオープンソースマルチモーダルLLM。 ThinkSoundは、ビデオコンテンツに合わせて特別に調整されたオーディオ制作に対する構造化されたインタラクティブなアプローチを提供します。 モデル、3つのコンパクトサイズで利用可能 – 1.3b、724m、および533mパラメーター – ビデオからオーディオの生成、テキストベースのオーディオ編集、およびインタラクティブなオーディオ作成を、エッジデバイスでもサポートしています。

ThinkSoundは、人間のサウンドデザイナーのマルチステージワークフローを模倣し、生成されたオーディオが生産全体で文脈的に正確で、まとまりがあり、高品質のままであることを保証します。このモデルは、最初にビデオの視覚的ダイナミクスを分析し、対応する音響属性を論理的に解釈し、次にコンテキストに適したオーディオを合成します。

革新的なアプローチを通じて、ThinkSoundは、ユーザーが詳細で一貫したサウンドスケープを作成し、直感的なユーザーインタラクションを通じて生成されたオーディオを改良し、自然言語の指示を使用して特定のオーディオセグメントを編集し、創造的な意図と自動オーディオ制作のギャップを効果的に埋めることができます。

さらに、Alibabaの研究チームが紹介しました オーディオコット、視覚コンテンツ、テキストの説明、およびサウンド合成の間のアライメントを強化するオーディオ固有のCOTアノテーションを備えた大規模なマルチモーダルデータセット。

ThinkSoundが達成することが広範な評価が実証されています 最先端のパフォーマンス ビデオからオーディオの世代では、文脈的に正確で正確にタイミングのあるサウンドスケープを提供します。このモデルは、従来のオーディオ品質メトリックとCOTベースの評価に優れています。さらに、映画のオーディオ生成機能を評価するベンチマークであるMovieGenオーディオベンチでは、ThinkSoundは他の主要なモデルを大幅に上回ります。

シンニングサウンド1vggsoundテストセットの既存のビデオからオーディオベースラインとのThinkSound Foundationモデルの比較。 ↓はより良いことを示し、↑より高いことを示します。

ThinkSoundは、さまざまなビデオ生成モデルとシームレスに統合して、合成されたビデオ用のリアルなナレーションやサウンドトラックを提供できます。洗練されたオーディオ生成機能は、映画やテレビのサウンドデザイン、オーディオポストプロダクション、ゲームや仮想現実の没入型サウンドエクスペリエンスにおける重要な潜在的なアプリケーションを提供します。

ThinkSoundがオープンソースで利用可能になりました 顔を抱き締めるギルブ そしてアリババの モデルスタジオ

ThinkSound 2MovieGenオーディオベンチでの分散式評価。

#AlibabaはThinkSoundを紹介しますビデオ用のリアルなオーディオを生成するAIモデル

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。