HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

テスト時間学習による3D再構成

Test-time training 3D reconstruction (github.com)

14 pointsby soupspaces1 コメント

要約

「TTT3R: 3D Reconstruction as Test-Time Training」は、CUT3Rモデルの長さ一般化能力を向上させるためのシンプルな状態更新ルールを提案する研究です。GitHubリポジトリでは、プロジェクトのセットアップ方法、チェックポイントのダウンロード、および推論デモの実行方法が説明されています。この手法は、3D再構成タスクにおいて、テスト時にモデルを適応させることで性能を高めることを目指しています。

全文翻訳

TTT3R: 3D Reconstruction as Test-Time Training Xingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger, Anpei Chen TL;DR: CUT3Rの長さ一般化能力を向上させるためのシンプルな状態更新ルール。 ttt3r.mp4 はじめに インストール TTT3Rをクローンします。 git clone https://github.com/Inception3D/TTT3R.git cd TTT3R 環境を作成します。 conda create -n ttt3r python=3.11 cmake=3.14.0 conda activate ttt3r conda install pytorch torchvision pytorch-cuda=12.1 -c pytorch -c nvidia # ご使用のシステムに合ったCUDAバージョンを使用してください pip install -r requirements.txt # pytorch dataloaderに関する問題は、https://github.com/pytorch/pytorch/issues/99625 を参照してください conda install 'llvm-openmp<16' # 評価用 pip install evo pip install open3d RoPEのCUDAカーネルをコンパイルします(CroCo v2と同様)。 cd src/croco/models/curope/ python setup.py build_ext --inplace cd ../../../../ ダウンロード チェックポイント CUT3Rは4〜64ビューで学習済みのチェックポイントを提供します: cut3r_512_dpt_4_64.pth。 ウェイトをダウンロードするには、以下のコマンドを実行してください。 cd src gdown --fuzzy https://drive.google.com/file/d/1Asz-ZB3FfpzZYwunhQvNPZEUA8XUNAYD/view?usp=drive_link cd .. 推論デモ 推論デモを実行するには、以下のコマンドを使用できます。 # 入力はフォルダまたはビデオにすることができます # 以下のスクリプトは、TTT3Rで推論を実行し、ポート8080でviserを使用して出力を視覚化します CUDA_VISIBLE_DEVICES=6 python demo.py --model_path MODEL_PATH --size 512 \ --seq_path SEQ_PATH --output_dir OUT_DIR --port 8080 \ --model_update_type ttt3r --frame_interval 1 --reset_interval 100 \ --downsample_factor 1000 --vis_threshold 5.0 # 例: CUDA_VISIBLE_DEVICES=6 python demo.py --model_path src/cut3r_512_dpt_4_64.pth --size 512 \ --seq_path examples/westlake.mp4 --output_dir tmp/taylor --port 8080 \ --model_update_type ttt3r --frame_interval 1 --reset_interval 100 \ --downsample_factor 100 --vis_threshold 6.0 CUDA_VISIBLE_DEVICES=6 python demo.py --model_path src/cut3r_512_dpt_4_64.pth --size 512 \ --seq_path examples/taylor.mp4 --output_dir tmp/taylor --port 8080 \ --model_update_type ttt3r --frame_interval 1 --reset_interval 50 \ --downsample_factor 100 --vis_threshold 10.0 出力結果はoutput_dirに保存されます。 評価 詳細については、eval.mdを参照してください。 謝辞 私たちのコードは、以下の素晴らしいリポジトリに基づいています。 CUT3R Easi3R DUSt3R MonST3R Spann3R Viser 著者らがコードを公開してくれたことに感謝します! 引用 もし私たちの研究が役立つと思われたら、以下を引用してください。 @article{chen2025ttt3r, title={TTT3R: 3D Reconstruction as Test-Time Training}, author={Chen, Xingyu and Chen, Yue and Xiu, Yuliang and Geiger, Andreas and Chen, Anpei}, journal={arXiv preprint arXiv:2509.26645}, year={2025} }