日本語版
最新ニュース
科学&テクノロジー

D4RT: 統合された高速 4D シーンの再構築と追跡

4D シーンの再構築と時空を超えた追跡のための統合 AI モデルである D4RT を紹介します。私たちは世界を見るたびに、記憶と予測という並外れた偉業を成し遂げます。私たちは物事を、ある時点でのありのままに、ほんの少し前にそうであったように、そして次の瞬間にどうなるのかを見て理解します。私たちの世界に関するメンタル モデルは現実を永続的に表現しており、私たちはそのモデルを使用して、過去、現在、未来の間の因果関係について直感的な結論を導き出します。機械が私たちと同じように世界を認識できるようにするために、機械にカメラを装備することができますが、それは入力の問題を解決するだけです。この入力を理解するには、コンピューターは複雑な逆問題を解決する必要があります。つまり、一連の平面 2D 投影であるビデオを撮影し、動きのある豊かな立体的な 3D 世界を復元または理解する必要があります。本日ご紹介するのは、 D4RT (動的 4D 再構成および追跡)、動的なシーンの再構築を単一の効率的なフレームワークに統合する新しい AI モデルで、人工知能の次のフロンティア、つまり動的な現実の全体的な認識に私たちを近づけます。四次元への挑戦2D ビデオでキャプチャされた動的なシーンを理解するために、AI モデルは、空間の 3 次元と時間の 4 次元を移動するすべてのオブジェクトのすべてのピクセルを追跡する必要があります。さらに、この動きをカメラの動きから解きほぐし、オブジェクトが互いに後ろに移動したり、フレームから完全に離れたりした場合でも、一貫した表現を維持する必要があります。従来、このレベルのジオメトリとモーションを 2D ビデオからキャプチャするには、計算集約型のプロセス、または特殊な AI モデルのパッチワーク (深度用、動きやカメラ アングル用など) が必要であり、その結果、AI の再構築が遅く断片化することになります。D4RT の仕組み: クエリベースのアプローチD4RT は、統合されたエンコーダーとデコーダーの Transformer アーキテクチャとして動作します。エンコーダはまず入力ビデオを処理して、シーンのジオメトリとモーションを圧縮して表現します。異なるタスクに個別のモジュールを使用していた古いシステムとは異なり、D4RT は、単一の基本的な質問を中心とした柔軟なクエリ メカニズムを使用して、必要なものだけを計算します。「どこですか…

D4RT: 統合された高速 4D シーンの再構築と追跡

4D シーンの再構築と時空を超えた追跡のための統合 AI モデルである D4RT を紹介します。

私たちは世界を見るたびに、記憶と予測という並外れた偉業を成し遂げます。私たちは物事を、ある時点でのありのままに、ほんの少し前にそうであったように、そして次の瞬間にどうなるのかを見て理解します。私たちの世界に関するメンタル モデルは現実を永続的に表現しており、私たちはそのモデルを使用して、過去、現在、未来の間の因果関係について直感的な結論を導き出します。

機械が私たちと同じように世界を認識できるようにするために、機械にカメラを装備することができますが、それは入力の問題を解決するだけです。この入力を理解するには、コンピューターは複雑な逆問題を解決する必要があります。つまり、一連の平面 2D 投影であるビデオを撮影し、動きのある豊かな立体的な 3D 世界を復元または理解する必要があります。

本日ご紹介するのは、 D4RT (動的 4D 再構成および追跡)、動的なシーンの再構築を単一の効率的なフレームワークに統合する新しい AI モデルで、人工知能の次のフロンティア、つまり動的な現実の全体的な認識に私たちを近づけます。

四次元への挑戦

2D ビデオでキャプチャされた動的なシーンを理解するために、AI モデルは、空間の 3 次元と時間の 4 次元を移動するすべてのオブジェクトのすべてのピクセルを追跡する必要があります。さらに、この動きをカメラの動きから解きほぐし、オブジェクトが互いに後ろに移動したり、フレームから完全に離れたりした場合でも、一貫した表現を維持する必要があります。従来、このレベルのジオメトリとモーションを 2D ビデオからキャプチャするには、計算集約型のプロセス、または特殊な AI モデルのパッチワーク (深度用、動きやカメラ アングル用など) が必要であり、その結果、AI の再構築が遅く断片化することになります。

D4RT の仕組み: クエリベースのアプローチ

D4RT は、統合されたエンコーダーとデコーダーの Transformer アーキテクチャとして動作します。エンコーダはまず入力ビデオを処理して、シーンのジオメトリとモーションを圧縮して表現します。異なるタスクに個別のモジュールを使用していた古いシステムとは異なり、D4RT は、単一の基本的な質問を中心とした柔軟なクエリ メカニズムを使用して、必要なものだけを計算します。

「どこですか 与えられたピクセル 見つかったビデオから 3D空間で 任意で 時間から見ると 選択したカメラ?」

基礎を築く 私たちの以前の仕事、軽量デコーダは、この表現をクエリして、提示された質問の特定のインスタンスに答えます。クエリは独立しているため、最新の AI ハードウェアで並列処理できます。これにより、ほんの数点を追跡する場合でも、シーン全体を再構築する場合でも、D4RT は非常に高速かつスケーラブルになります。

#D4RT #統合された高速 #シーンの再構築と追跡

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。