科学・技術
Lift4D:ワイルドな環境での4D再構築に向けた単一視点3D推定の調和
Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild (lift4d.github.io)
要約
Lift4Dは、単一のモノキュラー動画から、カメラで観察されていない領域を含む動的オブジェクトの完全な形状、外観、変形を再構築するテスト時最適化フレームワークです。既存の単一視点3D再構築モデルを適応させ、一時的に一貫性のあるフレームごとの予測を生成し、これを変形可能な3D Gaussian Splatting表現の初期化に利用します。このアプローチにより、大規模な変形やオクルージョンを伴う複雑なワイルドなシナリオでも、従来の4D再構築手法を大幅に改善します。
全文翻訳
Lift4D:ワイルドな環境での4D再構築に向けた単一視点3D推定の調和
arXiv コード
Lift4Dは、ワイルドな単眼ビデオから、カメラで観察されていない領域を含むシーン内の動的オブジェクトの完全な形状、外観、変形を再構築します。
概要
単眼ビデオから完全な動的オブジェクトを再構築するには、直接観察からの視覚的キューと、形状および外観に関するデータ駆動型事前分布を統合する必要があります。既存のアプローチは、視覚入力からフレームごとの3D表現を直接予測するように学習するか、ビデオの証拠に基づいて後で変形および洗練される3D表現を初期化します。しかし、前者は4Dトレーニングデータの希少性によって制約され、後者は初期再構築にのみ事前分布を利用し、その後はビデオ監視のみに依存します。どちらも、大きな変形やオクルージョンを伴う複雑なワイルドなシナリオをうまく処理できません。私たちは、両方の制限に対処するテスト時最適化フレームワークであるLift4Dを提案します。まず、既存の単一視点3D再構築モデルを適応させ、因果的潜在条件付けを介して時間的に一貫性のあるフレームごとの予測を生成し、変形可能な3D Gaussian Splatting表現の一貫した初期化を提供します。次に、オクルージョン考慮型最適化を通じてこの表現をインプットビデオに一致するように「彫刻」し、ビュー条件付き拡散事前分布を使用して未観察領域を補完しながら、可視表面の詳細を忠実に回復します。Lift4Dは、特に重度のオクルージョンと非剛体運動を伴う挑戦的なワイルドなシーケンスにおいて、従来の4D再構築手法を明確に改善することを実証します。
ワイルドな環境で完全な4Dを再構築
以下からシーンを選択し、インタラクティブビューアでその完全な4D再構築を探索してください。クリック&ドラッグで軌道を描き、スクロールでズームします。サムネイルをクリックしてシーンを切り替えてください。一部のシーンはサイズが大きいため、しばらくお待ちください。
手法
単一視点再構築事前分布
Image-to-3D DiT
Image-to-3D DiT
Image-to-3D DiT
因果的潜在伝播
↓
Gaussian SplatDecoder
↓
フレームごとの3D再構築
入力ビデオ
完全な4D再構築
正準ガウス分布 + 変形ノード
詳細な外観変形ノード
オクルージョン考慮型外観損失
インペインティング ← シーン深度 / フレームごとの3D
オクルージョン補完フレーム
ノイズの多い変形3DGSレンダリング
↓
新規視点拡散事前分布
↓
新規視点サンプル + (−) レンダリング監視
単眼入力ビデオから、Image-to-3D DiTは、因果的潜在伝播を通じて時間的に一貫性のあるフレームごとの3D再構築を生成します。各フレームの3D潜在は、新しいノイズと以前のノイズ除去された潜在を混合することによって初期化され、出力は独立したガウシアンスプラットのセットにデコードされます。これらのフレームごとの予測セットを、正準ガウス分布と2組のスパースな変形ノードによってアニメーション化された単一の4D完全Gaussian Splat再構築に統合します。最初のセットは、フレームごとの再構築された形状に対する再構築損失(ℒrec)を通じてフレームごとの出力に適合され、その後、色と2組目の詳細な外観変形ノードを、オクルージョン補完フレームとレンダリング損失に対して最適化することによって外観が洗練されます。4D再構築はランダムな新規視点からレンダリングされ、ノイズが加えられ、新規視点拡散事前分布が、フレームごとの3D出力を使用してオクルージョンが補完されたフレームを条件付けとしてノイズを除去します。結果として得られるノイズ除去された新規視点サンプル蒸留と、可視ピクセルに対するレンダリング損失が、フレーム間で可視の詳細を集約し、オクルージョンされた領域や未観察領域を幻覚的に補完する外観監視信号(ℒapp)を供給します。
比較
Lift4Dは、合成フッテージとワイルドなフッテージの両方で、従来の4D再構築ベースラインを上回り、完全な時間的に一貫性のある形状、よりシャープな外観、そして重度のオクルージョン下でもより正確な動きを実現します。
BibTeX
@article{litman2026lift4d,
author = {Litman, Yehonathan and Ma, Xiaoxuan and Shah, Manan and Ugrinovic, Nicol{'}as and Kitani, Kris and De la Torre, Fernando and Tulsiani, Shubham},
title = {Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild},
journal = {arXiv},
year = {2026},
}