인간-객체 중심 영상 개인화는 주어진 인물이나 사물을 바탕으로, 장면 안에서의 상호작용까지 맞춰 생성하는 과제다. arXiv 프리프린트 HOMIE는 이 분야에서 부딪히는 두 가지 한계를 함께 겨냥한다. 하나는 객체가 로고처럼 추상적 개념일 때도 인물과 객체의 관계를 정확히 담아내면서 주체 충실도를 유지하는 일이고, 다른 하나는 OCR 맵이나 멀티뷰처럼 같은 주체를 가리키는 참조가 들어왔을 때 그 잠재적 대응을 제대로 읽어내는 일이다.
논문은 기존 방법들이 주체 간 개인화에 치우친 나머지, 텍스트 인코더의 제어 가능성을 해치지 않으면서 참조 수준의 관계 지식을 추출하는 통합 전략이 부족했다고 본다. 이에 HOMIE는 inter-subject와 intra-subject 입력을 하나의 프레임워크로 처리하고, MLLM에서 얻은 의미 특징을 VAE 토큰과 더 잘 맞추기 위해 self-attention 안에 global multimodal guidance를 넣었다. 또 modality-reference embedding으로 MLLM 특징 토큰과 VAE 토큰을 구분하고, 참조 이미지 토큰을 연결하도록 설계했다.

검증은 다양한 HOCVP 작업 전반에서 이뤄졌다. 메인 정량 비교 표에서는 Kling 1.6, VACE, MAGREF, SkyReels-A2, SkyReels-V3, Phantom, HuMo, BindWeave, FFGO, UniVideo, VINO와 함께 비교했으며, HOMIE-Wan2.1-14B는 AES 0.508, MS 0.994, GMEScore 0.691, Face-Sim 0.786, DINO-I 0.543, Obj-Sim 0.891, OCR Acc. 0.452를 기록했다. HOMIE-Wan2.2-14B는 AES 0.525, MS 0.997, GMEScore 0.696, Face-Sim 0.760, DINO-I 0.537, Obj-Sim 0.877, OCR Acc. 0.431로 제시됐다.
참조 일관성 관련 세부 지표도 별도로 보고됐다. 같은 쪽의 정량 비교에서 VACE는 DINOrec 0.642, DINOacc 0.551, Phantom은 0.633과 0.553, BindWeave는 0.614와 0.546, SkyReels-V3는 0.654와 0.558이었다. 이에 비해 Ours(Wan2.1)은 0.685와 0.582, Ours(Wan2.2)는 0.696과 0.560으로 적혔다. 정성 비교 그림에서는 더 많은 주체와 추상적 내용 개인화를 포함한 inter-subject 결과를 보여줬다.
데이터 구성도 함께 공개됐다. 확대된 100K 샘플 multi-subject 데이터셋에서 약 40K개의 고해상도 720P 샘플을 추가로 골랐고, video-consistency subset은 단일 주체 데이터셋 300K 샘플과 다중 주체 데이터셋 80K 샘플로 나뉜다. 학습 비용 비교 표에서는 HOMIE-Wan2.1이 5.5k steps, 10k A100 hours로 적혀 있으며, Phantom은 30k A100 hours, VACE는 128 A100 GPUs에서 200k steps, BindWeave는 512 xPUs에서 6k steps, UniVideo는 총 35k steps, VINO는 총 40k steps로 제시됐다.
| 항목 | 값 | 근거 위치 |
|---|---|---|
| 학습 데이터 분할 | single-subject 300K, multi-subject 80K | p.6 |
| 고해상도 하위셋 | 약 40K, 720P | p.6 |
| Wan2.1 기반 정량 결과 | AES 0.508, MS 0.994, GMEScore 0.691, Face-Sim 0.786, DINO-I 0.543, Obj-Sim 0.891, OCR Acc. 0.452 | p.6, Table 4 (4 Experiments) |
| Wan2.2 기반 정량 결과 | AES 0.525, MS 0.997, GMEScore 0.696, Face-Sim 0.760, DINO-I 0.537, Obj-Sim 0.877, OCR Acc. 0.431 | p.6, Table 4 (4 Experiments) |
| 학습 비용 | HOMIE-Wan2.1: 5.5k steps, 10k A100 hours | p.17, Table 6 |
자료: STORIUM 정리
이 문서가 스스로 밝히는 범위 안에서는, HOMIE가 Wan2.1과 Wan2.2 기반 설정에서 기존 방법보다 더 나은 성능을 보였다는 것이 핵심이다. 이 수치들은 모두 저널 게재 전의 프리프린트 실험 결과이며, 표와 그림에 나타난 비교군·지표·데이터 규모를 넘어서는 세부 조건은 원문 카드에 없다.
저작권자 © STORIUM 무단전재 및 재배포 금지














