3D 장면을 만들어내는 생성 모델은 입력이 듬성듬성해도 그럴듯한 기하를 복원할 수 있어야 한다. 그런데 기존의 시각적 기하 기반 파운데이션 모델은 강한 3D 사전지식을 제공하면서도, 입력 뷰가 뒷받침하는 범위를 넘는 기하를 새로 생성하는 방식은 아니었다. arXiv 프리프린트인 이번 연구는 이 간극을 VGGT의 잠재공간에서 직접 흐름 매칭을 수행하는 방식으로 메우려 한다.
핵심은 명시적 표현으로 곧장 내려가지 않는 점이다. 가우시안, 메시, 비디오 VAE 잠재표현을 택하지 않고, VGGT가 학습한 3D priors를 그대로 활용하는 잠재 생성 틀을 세웠다. 문제는 VGGT 토큰이 표준 유클리드 공간이 아니라 고차원 구면들의 곱(product of hyperspheres)에 놓인다는 점이다. 그래서 유클리드 flow matching은 맞지 않고, 연구진은 네 개의 zero-mean hypersphere로 이뤄진 매니폴드 위에 정의된 Riemannian Flow Matching을 제안한다.

방법은 VGGT의 multi-scale encoder와 정렬되도록 설계됐다. 이렇게 생성된 토큰은 동결된 decoding heads가 요구하는 유효 데이터 매니폴드에 머무르게 된다. 본문 2쪽의 개요 그림과 5쪽의 식에서는 조건부 손실과 매니폴드 상 적분 경로를 설명하며, 잠재 상태를 exponential map으로 업데이트하는 Riemannian ODE solver도 함께 사용한다.
검증은 RealEstate10K, ScanNet++, ETH3D에서 이뤄졌다. 6쪽에 따르면 RE10K 테스트 분할에서 무작위로 뽑은 50개 장면과 ScanNet++의 사용 가능한 50개 평가 장면을 썼다. RE10K의 새로운 뷰 생성 표에서는 high overlap, low overlap 설정과 one-sided/two-sided 조건별로 Gen3R, DepthSplat과 비교했을 때 PSNR, SSIM, LPIPS, FID를 제시했다. 예를 들어 two-sided, N=2에서 Ours는 high overlap PSNR 18.12, SSIM 0.661, LPIPS 0.163, FID 30.49를 보였고, low overlap에서는 PSNR 16.67, SSIM 0.615, LPIPS 0.151, FID 57.00을 기록했다.
기하 평가에서도 수치가 제시됐다. 7쪽의 표에서는 RMSE, ARel, δ, FID를 사용했고, 예를 들어 one-sided, N=4에서 Ours는 high overlap RMSE 0.191, ARel 0.085, δ 0.924, FID 24.13을 보였다. 같은 조건의 low overlap에서는 RMSE 0.275, ARel 0.118, δ 0.857, FID 45.31이었다. 또 8쪽 본문은 high-to-low overlap 전환 시 δ 정확도 저하가 Ours에서 최악 7.3%로 가장 작았다고 적었다. DepthSplat(two-sided, N=4)은 14.9%, Gen3R(two-sided, N=2)은 18.1% 감소였다.
| 비교 축 | 주요 수치 | 근거 위치 |
|---|---|---|
| RE10K novel view generation, two-sided N=2, Ours | PSNR 18.12 / SSIM 0.661 / LPIPS 0.163 / FID 30.49 | p.8, Table 3 |
| RE10K novel view generation, two-sided N=4, Ours | PSNR 18.50 / SSIM 0.675 / LPIPS 0.180 / FID 15.23 | p.8, Table 3 |
| ScanNet++ point map evaluation, one-sided N=4, Ours | RMSE 0.191 / ARel 0.085 / δ 0.924 / FID 24.13 | p.7, Table 2 |
| Overlap degradation statement | worst-case δ drop 7.3% for Ours vs 14.9% DepthSplat vs 18.1% Gen3R | p.8, paragraph below Table 3 |
자료: STORIUM 정리
10쪽 결론은 이 모델이 context view에 순서를 두지 않으며, 한 장의 unposed view만으로도 작동하고, 상대적 target pose만 필요하다고 정리한다. 같은 쪽의 비교 표에서는 RGB와 depth에서 Euclidean flow와의 대조도 제시됐다. 그러나 모든 수치는 프리프린트 내부 평가에 해당하며, 외부 동료심사는 아직 거치지 않았다.
연구 원문은 arXiv:2607.19120에서 확인할 수 있다. 프리프린트 결과는 동료평가와 후속 재현을 거치며 달라질 수 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














