1766091489
2025-12-18 20:33:00
新しいアプローチにより、すでにオンラインで共有されている日常の写真から本物のような 3D 環境を視覚化することが容易になり、ゲーム、バーチャルツーリズム、文化保存などの業界に新たな可能性が開かれます。
アフェルブッフ=エロルム・ハダルコーネル工科大学の助教授である同氏は、「WildCAT3D」の研究チームの一員です。これは、たった 1 枚の既存の写真からシーンのリアルな角度を作成する技術である、ノベル ビュー合成 (NVS) の可能性を大幅に拡張する新しいフレームワークです。
作品、12月4日に発表されました。 神経情報処理に関するカンファレンスとワークショップでは、現在の 3D 画像生成テクノロジーの重要な制限に焦点を当てています。ほとんどのシステムは、人々が実際にオンラインで撮影して共有している乱雑で一貫性のない画像とはまったく似ていない、注意深く厳選された小規模なデータセットからしか学習できません。
WildCAT3D は、自由に利用できる画像の大規模なコレクション (観光客のスナップショット) を使用してコンピューターをトレーニングする方法を示しています。さまざまな天候、照明、季節で撮影された写真。または部分的に隠れたシーン。これらはまさに、仮想観光、ビデオ ゲーム、歴史的保存、没入型マッピングなどのアプリケーションを強化できる種類の画像ですが、従来、既存のモデルで使用するには矛盾が多すぎました。
「主な課題は、自然界のインターネット コレクションから学習できるマルチビュー拡散モデルを設計する方法でした。そこでは、シーンの観察が、たとえば、照明、天候、一時的な物体などで大きな変化を示します」と、コーネル大学コンピューティング情報科学大学にも所属するアフェルブッフ=エロール氏は述べています。
WildCAT3D は、人工知能がシーン内で重要なことに集中できるように支援します。このシステムは、照明、天候、カメラ角度の変化によって混乱するのではなく、そのような視覚的な違いを一時的な詳細として扱いながら、場所の安定した構造を認識することを学習します。
このアプローチにより、現実世界の設定ではるかに便利になります。 WildCAT3D は、1 枚の写真を撮影して、同じ場所の複数のリアルなビューを生成できるため、1 回だけ撮影されたシーンを「歩き回る」ことが可能になります。この機能により、より豊かな仮想観光体験、より没入型のビデオ ゲーム、現実世界の場所のより正確なデジタル再構成への扉が開かれます。
また、クリエイターや研究者は、さまざまな天候や照明条件の下でシーンがどのように見えるかを簡単に調べることができます。この柔軟性は、文化的ランドマークを保存したり、建設または修復する前に環境を計画したり、高価で慎重に管理された写真撮影を必要とせずにリアルな仮想空間を作成したりする場合に特に価値があります。
Averbuch-Elor 氏は、この取り組みを、高品質の 3D シーン作成をよりアクセスしやすくし、カスタム データセットを持つ専門チームだけでなく、一般的な写真を持っている人なら誰でもリアルなデジタル世界を構築できるようにするためのステップであると考えています。
「私たちの研究が、許可されたインターネット データから直接学習する 3D 一貫性のある生成フレームワークへの移行を促進し、厳しく厳選されたマルチビュー データセットへのこの分野の依存を減らすことを願っています」と彼女は述べた。
この研究は、Meta AI とテルアビブ大学の研究者と共同で実施されました。
アンドリュー・クラークはコーネル工科大学のライターです。
#研究者は写真から #シーンを簡単に視覚化できるようにします