日本語版
最新ニュース
世界

AI SystemStreamDit 16 fps 512pでテキストからライブストリームビデオを生成する

まとめ StreamDitと呼ばれる新しいAIシステムは、テキストの説明からライブストリームビデオを生成し、ゲームやインタラクティブなメディアの新しい可能性を開きます。 ビデオ:Kodiara et al。 チームはさまざまなユースケースを紹介しました。 StreamDitは、その場で1分間のビデオを生成し、インタラクティブなプロンプトに応答し、既存のビデオをリアルタイムで編集することもできます。あるデモでは、ビデオの豚が猫に変身し、背景は同じままでした。広告 デコーダーニュースレター 最も重要なAIニュースは、受信トレイに直接ニュースです。 ✓毎週 ✓無料 ✓いつでもキャンセルします テキストプロンプトを使用して、StreamDitは、入力ビデオのランニングピッグを出力ストリームの猫に変換し、リアルタイムのプロンプトベースのビデオ編集を実証します。 |画像:Kodiara et al。 共有 私たちの記事をお勧めします 共有 StreamDitは、バッファーを固定参照フレームと短いチャンクに分割します。自動シーケンスの視覚化は、除去が進むにつれて(緑から赤へ)画像の類似性が低下することを示しています。 |画像:Kodiara et al。 汎用性のためのトレーニング トレーニングプロセスは、汎用性を向上させるように設計されています。単一のビデオ作成方法に焦点を当てる代わりに、モデルは3,000の高品質ビデオと260万のビデオのより大きなデータセットを使用して、いくつかのアプローチでトレーニングされました。 128 NVIDIA H100 GPUでトレーニングが行われました。研究者たちは、1〜16フレームの塊のサイズを混合することで最良の結果が生じることを発見しました。 リアルタイムのパフォーマンスを実現するために、チームは、必要な計算ステップの数を128からわずか8に削減する加速手法を導入し、画質に最小限の影響を与えました。アーキテクチャは効率のために最適化されています。すべての画像要素を他のすべての画像要素と相互作用させるのではなく、情報はローカル地域間でのみ交換されます。 Head-tigh-Headの比較では、StreamDitは、特に多くの動きを持つビデオの場合、ReusediffuseやFIFO拡散などの既存の方法を上回りました。他のモデルは静的シーンを作成する傾向がありましたが、StreamDitはより動的で自然な動きを生成しました。 人間の評価者は、動きの流動性、アニメーションの完全性、フレーム間の一貫性、および全体的な品質に関するシステムのパフォーマンスを評価しました。すべてのカテゴリで、StreamDitは8秒の512pビデオでテストされたときにトップになりました。おすすめ 人間の評価者は、動きの自然性、動きの完全性、フレームの一貫性、および全体的な経験を評価しました。 |画像:Kodiara et al。 より大きなモデル、より良い品質 -…

AI SystemStreamDit 16 fps 512pでテキストからライブストリームビデオを生成する

1752412241
2025-07-13 12:43:00

まとめ

StreamDitと呼ばれる新しいAIシステムは、テキストの説明からライブストリームビデオを生成し、ゲームやインタラクティブなメディアの新しい可能性を開きます。

ビデオ:Kodiara et al。

チームはさまざまなユースケースを紹介しました。 StreamDitは、その場で1分間のビデオを生成し、インタラクティブなプロンプトに応答し、既存のビデオをリアルタイムで編集することもできます。あるデモでは、ビデオの豚が猫に変身し、背景は同じままでした。

広告

デコーダーニュースレター

最も重要なAIニュースは、受信トレイに直接ニュースです。

✓毎週

✓無料

✓いつでもキャンセルします

4つのフレーム:ランニングピッグ(上)と出力フレームの入力ビデオは、落書き路地でプロンプト(下)を介して猫に変換されました。テキストプロンプトを使用して、StreamDitは、入力ビデオのランニングピッグを出力ストリームの猫に変換し、リアルタイムのプロンプトベースのビデオ編集を実証します。 |画像:Kodiara et al。

共有

私たちの記事をお勧めします

共有

K参照フレームとnチャンクへの概略バッファー除算。これに加えて、相関値が減少する自動デノイーズステップStreamDitは、バッファーを固定参照フレームと短いチャンクに分割します。自動シーケンスの視覚化は、除去が進むにつれて(緑から赤へ)画像の類似性が低下することを示しています。 |画像:Kodiara et al。

汎用性のためのトレーニング

トレーニングプロセスは、汎用性を向上させるように設計されています。単一のビデオ作成方法に焦点を当てる代わりに、モデルは3,000の高品質ビデオと260万のビデオのより大きなデータセットを使用して、いくつかのアプローチでトレーニングされました。 128 NVIDIA H100 GPUでトレーニングが行われました。研究者たちは、1〜16フレームの塊のサイズを混合することで最良の結果が生じることを発見しました。

リアルタイムのパフォーマンスを実現するために、チームは、必要な計算ステップの数を128からわずか8に削減する加速手法を導入し、画質に最小限の影響を与えました。アーキテクチャは効率のために最適化されています。すべての画像要素を他のすべての画像要素と相互作用させるのではなく、情報はローカル地域間でのみ交換されます。

Head-tigh-Headの比較では、StreamDitは、特に多くの動きを持つビデオの場合、ReusediffuseやFIFO拡散などの既存の方法を上回りました。他のモデルは静的シーンを作成する傾向がありましたが、StreamDitはより動的で自然な動きを生成しました。

人間の評価者は、動きの流動性、アニメーションの完全性、フレーム間の一貫性、および全体的な品質に関するシステムのパフォーマンスを評価しました。すべてのカテゴリで、StreamDitは8秒の512pビデオでテストされたときにトップになりました。

おすすめ

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。