業界をリードする AI に関する最新情報や独占コンテンツを入手するには、毎日および毎週のニュースレターにご登録ください。 もっと詳しく知る
研究者らは メタ そして オックスフォード大学 単一の画像やテキストの説明から高品質の 3D オブジェクトを生成できる強力な AI モデルを開発しました。
このシステムは 3D のこれは、仮想現実、ゲーム、デジタルデザインなどの分野を変革する可能性のあるスケーラブルな 3D AI に向けた大きな一歩です。
ジュンリン・ハン、フィリッポス・コッキノス、フィリップ・トールの 3 人が率いる研究チームは、AI の長年の課題である、オンラインで入手できる膨大な量の 2D 画像やテキストに比べて 3D トレーニング データが不足しているという課題に取り組んでいます。彼らの斬新なアプローチでは、事前トレーニング済みのビデオ AI モデルを活用して合成 3D データを生成し、より強力な 3D 生成システムをトレーニングできます。
3次元の解放: VFusion3Dがデータギャップを埋める方法
「基礎となる 3D 生成モデルの開発における主な障害は、3D データの入手可能性が限られていることです」と研究者らは論文で説明しています。
これを克服するために、研究者たちは既存のビデオ AI モデルを微調整してマルチビュー ビデオ シーケンスを作成し、基本的に複数の角度からオブジェクトを想像するようにモデルに教えました。その後、この合成データを使用して VFusion3D をトレーニングしました。
結果は本当に印象的です。テストでは、人間の評価者が、以前の最先端システムと比較して、VFusion3D の 3D 再構築を 90% 以上高く評価しました。このモデルは、わずか数秒で 1 枚の画像から 3D アセットを生成できます。

ピクセルからポリゴンへ: スケーラブルな 3D AI の可能性
おそらく最も興味深いのは、このアプローチのスケーラビリティです。より強力なビデオ AI モデルが開発され、微調整に使用できる 3D データが増えるにつれて、研究者は VFusion3D の機能が急速に向上し続けると予想しています。
この画期的な進歩は、最終的には 3D コンテンツに依存する業界全体でイノベーションを加速させる可能性があります。ゲーム開発者は、これを使用してキャラクターや環境を迅速にプロトタイプ化できます。建築家や製品デザイナーは、コンセプトを 3D ですばやく視覚化できます。また、VR/AR アプリケーションは、AI によって生成された 3D アセットによって、はるかに没入感を高めることができます。
VFusion3D を実際に体験: 3D 世代の未来を垣間見る
VFusion3Dの機能を実際に体験するために、 公開デモ (Gradio 経由で Hugging Face から入手可能)。
インターフェースはわかりやすく、ユーザーは自分の画像をアップロードするか、ピカチュウやダース・ベイダーなどの象徴的なキャラクターや、バックパックを背負った豚などの風変わりなオプションを含む、あらかじめ読み込まれたサンプルから選択することができます。
プリロードされたサンプルは非常に優れたパフォーマンスを発揮し、3D モデルを生成し、元の 2D 画像の本質と詳細を驚くほど正確に捉えたビデオをレンダリングしました。
しかし、本当のテストは、カスタム画像をアップロードしたときでした。AIで生成されたアイスクリームコーンの画像です。 旅の途中驚いたことに、VFusion3D はこの合成画像を、プリロードされたサンプルと同等かそれ以上にうまく処理しました。数秒以内に、テクスチャの詳細と適切な深さを備えた、アイスクリーム コーンの完全な 3D モデルが生成されました。
この体験は、VFusion3D がクリエイティブ ワークフローに与える潜在的な影響を浮き彫りにしています。デザイナーやアーティストは、時間のかかる手動の 3D モデリング プロセスを省略し、代わりに AI が生成した 2D コンセプト アートをインスタント 3D プロトタイプの出発点として使用できます。これにより、ゲーム開発、製品設計、視覚効果などの分野でのアイデア創出と反復のプロセスが大幅に加速される可能性があります。
さらに、AI 生成の 2D 画像を処理するシステムの能力は、初期のコンセプトから最終的な 3D アセットまで、3D コンテンツ作成のパイプライン全体が AI 駆動になる未来を示唆しています。これにより、3D コンテンツ作成が民主化され、個人や小規模なチームが、これまでは多大なリソースを持つ大規模なスタジオでしか実現できなかった規模で、高品質の 3D アセットを作成できるようになります。
ただし、結果は素晴らしいものの、まだ完璧ではないことに注意することが重要です。細かい詳細が失われたり、誤解されたりする可能性があります。また、複雑または珍しいオブジェクトでは、依然として課題が生じる可能性があります。それでも、このテクノロジーがクリエイティブ産業を変革する可能性は明らかであり、今後数年間でこの分野で急速な進歩が見られる可能性があります。
今後の課題と展望
素晴らしい機能を備えているにもかかわらず、この技術には限界がないわけではありません。研究者らは、このシステムは車両やテキストなどの特定のオブジェクトの種類ではうまく機能しないことがあると述べています。彼らは、ビデオ AI モデルの今後の開発がこれらの欠点の解決に役立つかもしれないと示唆しています。
AI がクリエイティブ産業に変革をもたらし続ける中、Meta の VFusion3D は、データ生成に対する巧妙なアプローチが機械学習の新たな境地を切り開くことができることを実証しています。このテクノロジーがさらに改良されれば、世界中のデザイナー、開発者、アーティストが強力な 3D 作成ツールを手にできるようになります。
VFusion3Dの詳細を説明した研究論文が、 ヨーロッパコンピュータビジョン会議 (ECCV)2024年までにコードが作成された 公開されている GitHub で公開され、他の研究者がこの研究を基に研究を進めることができるようになりました。この技術が進化し続けることで、3D コンテンツ作成の可能性の限界が再定義され、業界を変革し、創造的表現の新たな領域が拓かれる可能性があります。