
비디오 편집에서 사전학습 확산모델을 시험 시점에 조금만 조정해 쓰는 방식은 강력한 도구로 떠올랐지만, 이번 arXiv 프리프린트는 그 과정에 구조적 충돌이 있다고 본다. 생성모델은 분포 전체를 옮기는 성격을 지니는 반면, 표준 테스트타임 튜닝은 단일 지점 최적화에 치우쳐 있다는 설명이다. 연구진은 이 불일치가 ‘Prior Collapse’를 유발해 텍스트 조건과 공간 잠재표현을 버리고 원본 영상으로 수렴하거나, 서로 다른 영역의 특징을 뒤섞는다고 주장한다.
이에 제안된 ElasticTTT는 생성 사전분포를 보존하는 쪽에 초점을 맞춘 프레임워크다. 핵심 구성은 세 가지로, 날카로운 기억 최소값을 막는 Target Distribution Regularization, 원본 편향에서 벗어나도록 유도하는 Contrastive CFG, 그리고 편집되지 않은 영역을 지키는 Asynchronous Noise Schedule이다. 초록은 이 조합이 기저 모델의 생성 사전을 유지한 채 원샷 비디오 편집에서 상태 최고 성능을 냈다고 요약한다.
본문의 실험 절에서는 다양한 비디오 편집 모델과 비교한 광범위한 평가가 제시된다. 동일한 설정에서 Wan2.1-1.3B 계열을 비교하면, baseTTT의 VQ 5.34·IA 6.15·SP 3.63·OVL 5.39가 ElasticTTT의 6.19·7.50·5.23·6.68로 바뀐다. Wan2.2-5B에서도 baseTTT 5.05·5.09·4.40·4.91에 비해 ours는 6.47·7.75·3.68·7.00으로 보고됐다. 수치는 모두 VQ, IA, SP, OVL 지표이며, 비교군과 함께 표 2에 정리돼 있다.
개별 설계의 기여도도 따로 분리해 확인했다. Wan2.1-1.3B 설정의 ablation에서 full 모델은 6.19·7.50·5.23·6.68을 기록했고, w/o smooth transition은 6.07·7.37·5.09·6.56, w/o Async-NS는 5.62·6.55·3.50·6.23, w/o TDR는 6.13·7.45·5.36·6.64, w/o contrastive CFG는 6.06·7.01·5.64·6.52였다. 별도 표에서는 70 TTT steps 조건에서도 ElasticTTT가 6.08·7.02·4.68·6.68로 다른 재구현 baseline보다 높은 값을 보였다.
평가 환경과 범위도 함께 제시된다. 모든 실험은 단일 Nvidia pro6000 GPU에서 수행됐고, full method의 추론 시 오버헤드는 vanilla TTT 대비 약 7%로 적혀 있다. 이 중 약 5%는 Contrastive CFG, 2%는 Async-NS에서 발생한다고 본문은 설명한다. 자동 평가는 각 비디오에서 8프레임을 균일 샘플링해 진행했고, 인간평가와 VLM 평가의 상관 분석도 포함됐다. 표본 수는 n=25 video clips이며, 상관계수 식과 자유도 df=23이 명시돼 있다.
| 비교 조건 | VQ/IA/SP/OVL | 출처 |
|---|---|---|
| Wan2.1-1.3B baseTTT | 5.34 / 6.15 / 3.63 / 5.39 | p.11 | Table 2 |
| Wan2.1-1.3B ours | 6.19 / 7.50 / 5.23 / 6.68 | p.11 | Table 2 |
| Wan2.2-5B baseTTT | 5.05 / 5.09 / 4.40 / 4.91 | p.11 | Table 2 |
| Wan2.2-5B ours | 6.47 / 7.75 / 3.68 / 7.00 | p.11 | Table 2 |
| Wan2.1-1.3B ablation full / w/o Async-NS / w/o TDR / w/o contrastive CFG | 6.19 / 7.50 / 5.23 / 6.68 ; 5.62 / 6.55 / 3.50 / 6.23 ; 6.13 / 7.45 / 5.36 / 6.64 ; 6.06 / 7.01 / 5.64 / 6.52 | p.12 | ablation table |
자료: STORIUM 정리
소속 정보는 첫 페이지에 College of AI, Tsinghua University와 Beijing Academy of Artificial Intelligence가 함께 적혀 있다. 다만 초록과 실험 요약만으로는 외부 검증의 최종 범위를 일반화하기 어렵다. 논문은 제출 시점에 동료검토 전 arXiv 프리프린트 상태이며, 성능 수치와 비교군은 원문 표와 절에 한정해 읽는 편이 적절하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














