AI・機械学習
テスト時間学習による3D再構成
Test-time training 3D reconstruction (github.com)
要約
「TTT3R: 3D Reconstruction as Test-Time Training」は、CUT3Rモデルの長さ一般化能力を向上させるためのシンプルな状態更新ルールを提案する研究です。GitHubリポジトリでは、プロジェクトのセットアップ方法、チェックポイントのダウンロード、および推論デモの実行方法が説明されています。この手法は、3D再構成タスクにおいて、テスト時にモデルを適応させることで性能を高めることを目指しています。
全文翻訳
TTT3R: 3D Reconstruction as Test-Time Training
Xingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger, Anpei Chen
TL;DR: CUT3Rの長さ一般化能力を向上させるためのシンプルな状態更新ルール。
ttt3r.mp4
はじめに
インストール
TTT3Rをクローンします。
git clone https://github.com/Inception3D/TTT3R.git
cd TTT3R
環境を作成します。
conda create -n ttt3r python=3.11 cmake=3.14.0
conda activate ttt3r
conda install pytorch torchvision pytorch-cuda=12.1 -c pytorch -c nvidia # ご使用のシステムに合ったCUDAバージョンを使用してください
pip install -r requirements.txt # pytorch dataloaderに関する問題は、https://github.com/pytorch/pytorch/issues/99625 を参照してください
conda install 'llvm-openmp<16' # 評価用
pip install evo
pip install open3d
RoPEのCUDAカーネルをコンパイルします(CroCo v2と同様)。
cd src/croco/models/curope/
python setup.py build_ext --inplace
cd ../../../../
ダウンロード
チェックポイント
CUT3Rは4〜64ビューで学習済みのチェックポイントを提供します: cut3r_512_dpt_4_64.pth。
ウェイトをダウンロードするには、以下のコマンドを実行してください。
cd src
gdown --fuzzy https://drive.google.com/file/d/1Asz-ZB3FfpzZYwunhQvNPZEUA8XUNAYD/view?usp=drive_link
cd ..
推論デモ
推論デモを実行するには、以下のコマンドを使用できます。
# 入力はフォルダまたはビデオにすることができます
# 以下のスクリプトは、TTT3Rで推論を実行し、ポート8080でviserを使用して出力を視覚化します
CUDA_VISIBLE_DEVICES=6 python demo.py --model_path MODEL_PATH --size 512 \
--seq_path SEQ_PATH --output_dir OUT_DIR --port 8080 \
--model_update_type ttt3r --frame_interval 1 --reset_interval 100 \
--downsample_factor 1000 --vis_threshold 5.0
# 例:
CUDA_VISIBLE_DEVICES=6 python demo.py --model_path src/cut3r_512_dpt_4_64.pth --size 512 \
--seq_path examples/westlake.mp4 --output_dir tmp/taylor --port 8080 \
--model_update_type ttt3r --frame_interval 1 --reset_interval 100 \
--downsample_factor 100 --vis_threshold 6.0
CUDA_VISIBLE_DEVICES=6 python demo.py --model_path src/cut3r_512_dpt_4_64.pth --size 512 \
--seq_path examples/taylor.mp4 --output_dir tmp/taylor --port 8080 \
--model_update_type ttt3r --frame_interval 1 --reset_interval 50 \
--downsample_factor 100 --vis_threshold 10.0
出力結果はoutput_dirに保存されます。
評価
詳細については、eval.mdを参照してください。
謝辞
私たちのコードは、以下の素晴らしいリポジトリに基づいています。
CUT3R
Easi3R
DUSt3R
MonST3R
Spann3R
Viser
著者らがコードを公開してくれたことに感謝します!
引用
もし私たちの研究が役立つと思われたら、以下を引用してください。
@article{chen2025ttt3r,
title={TTT3R: 3D Reconstruction as Test-Time Training},
author={Chen, Xingyu and Chen, Yue and Xiu, Yuliang and Geiger, Andreas and Chen, Anpei},
journal={arXiv preprint arXiv:2509.26645},
year={2025}
}