1733354790
2024-12-04 13:05:00
年の初めに、 OpenAIがSoraを導入、テキスト プロンプトから現実的で想像力豊かなシーンを作成できる新しい AI ビデオ制作モデル。 OpenAI は Sora の一般公開を遅らせましたが、Runway や Luma を含むいくつかの AI スタートアップ企業がここ数カ月でそれぞれ独自のビデオ制作モデルをリリースするのを見てきました。
さて、中国の巨人 テンセント それを発表した 渾源ビデオ、オープンソースでもある最先端のビデオ制作モデル。これは、誰もがオープンに利用できる推論コードとモデルの重みを備えた、初の主要なオープンソース ビデオ生成モデルです。
テンセントは次のように主張している。 渾源ビデオ 高いビジュアル品質、モーションの多様性、テキストとビデオの配置、出力の安定性を備えた、主要なクローズドソース モデルと同等のビデオを生成できます。 130 億を超えるパラメータがあり、すべてのオープンソースビデオ生成モデルの中で最大です。の 渾源ビデオ には、データ キュレーション、画像とビデオの共同モデル トレーニング、大規模なモデルのトレーニングと推論をサポートする効率的なインフラストラクチャを統合するフレームワークが含まれています。
Tencent はまた、専門家による人間の評価を使用してモデルをテストしました。評価結果によると、HunyuanVideo は以下を含むすべての主要なクローズド ソース モデルよりも優れています。 滑走路 Gen-3 そしてルマ1.6。
Tencent は、テキスト、画像、ビデオを生成するために別個のモデルを使用する代わりに、次の異なる技術を使用して、既存のモデルと比較してビデオ品質を向上させました。
HunyuanVideo は Transformer 設計を導入し、統合された画像とビデオの制作にフルアテンション メカニズムを使用しています。具体的には、ビデオ生成にハイブリッド「デュアルストリームからシングルストリーム」モデル設計を使用します。デュアルストリーム フェーズでは、ビデオ ポイントとテキスト ポイントが複数の Transformer ブロックを通じて独立して処理され、各モードが干渉することなく独自の適切な変調メカニズムを学習できるようになります。シングルストリーム フェーズでは、ビデオ チップとテキスト チップを連結し、それらを後続の Transformer ブロックに供給して、効率的なマルチモーダル情報融合を実現します。この設計は、視覚情報とセマンティック情報の間の複雑な相互作用を捉え、モデルの全体的なパフォーマンスを向上させます。
HunyuanVideo の立ち上げは、制作テクノロジーの民主化に向けた重要な一歩を示しています AI ビデオ。
[via]
#Tencent #のオープンソース #ビデオ制作モデルは感動的です