Wan-Dancer는 음악·텍스트·참고 이미지를 조건으로 다섯 장르에서 1분을 넘는 720p·30fps 춤 영상을 생성했고 최대 160초 예시를 제시했다. 정량 비교는 end-to-end 기준선 X-Dancer와 MusicInfuser로 제한됐다. 보고된 평균은 춤 품질 8.46, 영상 품질 7.46, 프롬프트 정렬 9.03이다.

긴 영상의 시간 드리프트·정체성 불일치·반복 동작을 줄이기 위해 전역 키프레임 계획과 국소 시간 정제를 분리했다. 전체 음악으로 장기 동작 구조를 먼저 잡고 세부 프레임을 보완하며, 절대 시간을 RoPE에 매핑하는 dynamic frame rate adaptation으로 정렬한다. optical-flow loss와 motion-speed control은 빠른 동작의 번짐과 세부 손실을 겨냥한다.
자체 데이터는 최소 720p·30fps인 약 200시간 영상이며 Chinese Classical, K-Pop, Latin, Tap, Street dance를 거의 균등한 시간으로 구성했다. 원본은 5초 창과 50% 중첩으로 나눴고 Librosa 오디오 특징과 SEA-RAFT optical flow mask를 사용했다. 320×544 사전학습은 A100 128개에서 2만 스텝, 720p 미세조정은 같은 GPU 수에서 4000스텝으로 진행했으며 둘 다 학습률 1×10−5였다. 맞춤 안무 LoRA는 참고 영상 16개, 800스텝, 1×10−4, rank 32 설정이다.
세부 점수는 스타일 정렬 8.33, 비트 정렬 8.73, 신체 재현 9.01, 동작 사실성 9.23, 안무 복잡성 6.98이었다. MusicInfuser는 7.43, 7.26, 4.76, 6.89, 4.80이었다. Wan-Dancer 영상 품질의 imaging quality는 6.84, aesthetic quality는 7.91, consistency는 7.63으로 제시됐다.
| 모델 | 스타일 정렬 | 비트 정렬 | 신체 재현 | 동작 사실성 | 안무 복잡성 |
|---|---|---|---|---|---|
| Wan-Dancer | 8.33 | 8.73 | 9.01 | 9.23 | 6.98 |
| MusicInfuser | 7.43 | 7.26 | 4.76 | 6.89 | 4.80 |
자료: STORIUM 정리
얼굴 일관성을 위한 face-embedding constraint, multimodal semantic encoder, 다인 무용의 inter-dancer interaction은 아직 구현 결과가 아니라 후속 과제다. Tongyi Lab의 Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang이 공개한 arXiv:2607.09581v1 프리프린트이며 동료심사 게재 여부는 제시되지 않았다.
저작권자 © STORIUM 무단전재 및 재배포 금지














