1748580492
2025-05-27 12:45:00
AGI- Google I/O 2025年次会議中に、会社は明らかにしました 私は3を見ます生成されたクリップに同期したオーディオを作成することができるビデオの生成用の人工知能モデルの新しいバージョン。宣言したものによれば、VEO 3は、視覚シーンと一致するサウンドエフェクト、環境ノイズ、さらには対話を生成することができます。 Geminiアプリ内で入手できるVEO 3は、ウルトラプレーンに月額249.99ドルで登録されている人が使用できます。
ビデオは感銘を受け、本当に現実的です。 TiktokまたはYouTubeに乗って完全なデモをしてください。したがって、彼らは、現実とフィクション、真実と人工性を区別できないという新たな危険に関する新しい議論を生み出すという印象を与えます。 「初めて、私たちは人工知能のサイレント映画の時代を離れます」と彼は説明しました Google DeepmindのCEO、Demis Hassabis。 「キャラクターと環境を説明するVEO 3にプロンプトを提供することができます。また、対話を提案し、それらがどのようにプレイしなければならないかを指定することもできます。」要するに、映画ではないにしても、確かに非常に説得力のあるトレーラーを作成できます。
品質と自動同期
以前のバージョン(VEO 2)と比較して、GoogleはVEO 3が生成された材料の品質を大幅に改善すると述べています。特に視覚的な影響を考慮する場合。しかし、本物の斬新さは、特殊なサイトで読むことは、モデルがビデオのピクセルを解釈して完全に同期したオーディオコンポーネントを生成する能力です。 いわゆる「ビデオからオーディオAI」について。
すでに2024年6月に、DeepMindは実際に、ビデオのサウンドトラックを作成するテクノロジーの開発を明らかにし、視覚的なクリップ、サウンドエフェクト、対話の転写のミックスでモデルをトレーニングしています。 Googleは、VEO 3のトレーニングに使用されるデータの正確なソースを指定していませんでしたが、Google自身が所有するYouTubeは決定的な役割を果たしている可能性があります。
業界への競争と効果
AIによって生成されたビデオ市場はますます混雑しており、Runway、Genmo、Lighthks、Pika、Higgsfield、Kling、Snails、Giariesなどの新興企業などのスタートアップは、ペースで新しいモデルをリリースするOpeniiやAlibabaなどです。多くの場合、モデル間の違いは最小限です。しかし、統合されたオーディオ生成、エドガジットは書いています。 VEO 3のターニングポイントを表すことができます約束が保持されている場合。
フロー:映画の新しいツール
同じ会議の中で、GoogleはAIに基づいた新しいフィルマキングツールであるFlowを発表しました。これは、家の最も高度なモデル、Veo、Imagen(画像用)、Gemini(言語の処理用)で動作するように設計されています。 「Flowは、時間が遅くなり、創造が流動的で繰り返し、可能性に満ちているという感覚に触発されています」とGoogleは彼のブログで説明します。
Flowを使用すると、クリエイティブは自然言語を使用してシーンまたはクリップを説明でき、システムは相互接続モデルを使用して結果を生成します。それは可能です:個人資産(画像、文字、スタイル)を使用します。画像で元の要素を生成します。スタイルの一貫性を備えた複数のシーンですでに作成された資産を統合します。画像からシーンを開始します。オブジェクトを追加または削除します。ポートレートから風景に移動します。部屋の動きを確認します(ローテーション、ドリー、ズーム)。現時点では、Flowは米国のProおよびUltraの購読者のみが利用できますが、Googleにはグローバルな拡大が含まれています。
#Googleの新しいビデオは印象的です