Co-VGGT는 카메라 자세나 깊이 입력 없이 RGB만으로 두 이미지가 같은 표면을 함께 보는지 추정한다. Gibson pairwise에서 IoU* 0.85·AUC 0.78, HM3D에서 0.84·0.78을 기록했다는 arXiv:2607.09503v1의 결과다.
VGGT 백본은 전부 동결하고 projector·summarizer·expert·gate로 이뤄진 층별 Mixture-of-Experts 헤드 약 7.5M 매개변수만 학습한다. 내부 분석에서는 초기 층이 3D-aware 표현을 만들고 후반 층이 공가시성 판단에 기여했으며 L17이 비공가시성 쌍을 라우팅하는 negative anchor로 관측됐다. 이는 게이팅 상관관계에 근거한 해석이지 인과 설명은 아니다.

평가는 Co-VisiON의 렌더링 실내 자료로 이뤄졌다. Gibson은 85개 장면·33,849개 라벨 쌍, HM3D는 755개 장면·210,008개 쌍이며 학습과 검증 장면은 분리됐다. multiview IoU*/AUC는 Gibson 0.74/0.73, HM3D 0.76/0.74였다.
중첩 10% 미만의 pairwise hard 구간에서 Graph IoU는 Co-VGGT 0.84, GPT-4o 0.34였다. Gibson 검증의 보정값은 ECE 0.030, Brier 0.043이었다. 부록에서는 Gibson 20개 장면에서 점수 상위 30% 이미지쌍만 COLMAP에 넣어 등록 이미지 83%, 포인트 70%, 검증 비율 0.966, 재투영 오차 0.270, 37.8초를 기록했다.
| 설정·데이터셋 | IoU* | AUC |
|---|---|---|
| Pairwise · Gibson | 0.85 | 0.78 |
| Pairwise · HM3D | 0.84 | 0.78 |
| Multiview · Gibson | 0.74 | 0.73 |
| Multiview · HM3D | 0.76 | 0.74 |
자료: STORIUM 정리
COLMAP 결과는 완전한 재구성 우위가 아니라 pair selection 전처리 가능성을 보는 보조 실험이다. 학습·평가가 모두 렌더링된 실내 장면이어서 실제 촬영, 실외, 다른 센서 조건의 일반화는 검증되지 않았다. 인간 기준보다 높은 일부 수치도 절대적 상한을 넘었다는 의미로 해석할 수 없다.
저작권자 © STORIUM 무단전재 및 재배포 금지














