1773708287
2026-03-16 23:45:00
Apple の研究者は、さまざまな視野角にわたって反射、ハイライト、その他の効果の一貫性を保ちながら、単一の画像から 3D オブジェクトを再構成する AI モデルを作成しました。詳細は次のとおりです。
ちょっとした文脈
機械学習における潜在空間の概念はまったく新しいものではありませんが、トランスフォーマー アーキテクチャに基づく AI モデル、そして最近ではワールド モデルの爆発的な増加により、近年これまで以上に人気が高まっています。
一言で言えば (全体像を説明するには若干不正確になる危険がありますが)、「潜在スペース」または「埋め込みスペース」は、次の場合に何が起こるかを説明する用語です。
- 情報を要約して概念を数値的に表現します。
- これらの数値を多次元空間で整理すると、異なる次元ごとに数値間の距離を計算できるようになります。
それでも抽象的すぎると思われる場合は、典型的な例として、トークン「キング」の数学的表現を取得し、トークン「男性」の数学的表現を減算し、トークン「女性」の数学的表現を加算すると、最終的にトークン「クイーン」の一般的な多次元領域にたどり着きます。
実際には、情報を数学的表現として潜在空間に保存すると、それらの間の距離を測定し、生成されるべきものの確率を推定することがより速く、より少ない計算コストで行われます。
以下は、別の例えを使用して潜在空間を説明する短いビデオです。
上記の例は潜在スペースにテキストを保存することに焦点を当てていますが、同じ考え方を他の多くの種類のデータに適用できます。そこで、Apple の研究が始まります。
LiTo: サーフェス ライト フィールドのトークン化
Apple の新しい研究では、 LiTo: サーフェス ライト フィールドのトークン化、研究者らは「オブジェクトの幾何学形状とビュー依存の外観を共同でモデル化する 3D 潜在表現を提案しています」。
言い換えれば、彼らは、3 次元オブジェクトを再構成する方法だけでなく、オブジェクトと相互作用する光がさまざまな角度からどのように見えるべきかを潜在空間で表現する方法を作成しました。
彼らは次のように説明しています。
これまでの研究のほとんどは、3D ジオメトリの再構築またはビューに依存しない拡散の外観の予測のいずれかに重点を置いているため、現実的なビューに依存する効果を捉えるのに苦労しています。私たちのアプローチは、RGB 深度画像が表面ライト フィールドのサンプルを提供することを利用しています。この表面ライト フィールドのランダムなサブサンプルを潜在ベクトルのコンパクトなセットにエンコードすることにより、私たちのモデルは、統一された 3D 潜在空間内でジオメトリと外観の両方を表現することを学習します。この表現は、複雑な照明の下での鏡面ハイライトやフレネル反射などのビュー依存の効果を再現します。
さらに、研究者らは、3D 再構築を可能にするためにさまざまな角度からの画像を必要とする一般的な方法ではなく、単一の画像からこれらすべてを実行できるようにモデルをトレーニングすることに成功しました。
方法全体は高度に技術的であり、研究で詳細に説明されていますが、潜在空間がどのように機能するかを理解すれば、中心となるアイデアは実際には比較的単純です。
- まず、エンコーダーはオブジェクトに関する情報を潜在空間内のコンパクトな表現に圧縮します。そのため、目に見えるすべての詳細を保存する代わりに、オブジェクトの形状と光がその表面とどのように相互作用するかを凝縮した数学的記述を学習します。
- 次に、デコーダはその逆の処理を行います。そのコンパクトな表現から完全な 3D オブジェクトを再構築し、ジオメトリと、反射やハイライトなどの照明効果がさまざまな視野角からどのように表示されるかの表現の両方を生成します。
リトのトレーニング
モデルをトレーニングするために、研究者らは 150 の異なる視野角と 3 つの照明条件からレンダリングされた数千のオブジェクトを選択しました。
次に、そのすべての情報をモデルに直接フィードする代わりに、システムはこれらのサンプルの小さなサブセットをランダムに選択し、それらを潜在表現に圧縮しました。
次に、デコーダは、データのそのサブセットから、オブジェクト全体と、さまざまな角度や照明条件下でのその外観を再構築するようにトレーニングされました。

トレーニングの過程で、システムはオブジェクトのジオメトリと、見る方向に応じてその外観がどのように変化するかの両方を捉えた潜在表現を学習しました。
それが完了すると、オブジェクトの単一の画像を取得し、それに対応する潜在的な表現を予測する別のモデルをトレーニングしました。次に、デコーダは、視野角の変化に応じてその外観がどのように変化するかを含め、完全な 3D オブジェクトを再構築します。
ここでは、Apple が プロジェクトページ:
必ず プロジェクトページをチェックしてくださいこの投稿の注目の画像にあるように、ここでは LiTo と TRELLIS の対話型の比較を並べて読み込むこともできます。
そして、完全な研究のために、 このリンクをたどってください。
Amazonでチェックしてみる価値あり


FTC: 当社は収入を得る自動アフィリエイト リンクを使用しています。 もっと。
#新しい #Apple #モデルはリアルな照明効果で #オブジェクトを再現します