희귀 주행 사건 53개의 AlpaSim 폐루프 평가에서 Alpamayo R1 평균 점수는 추가 학습 없이 0.534, OpenLongTail 합성 데이터로 미세조정했을 때 0.748, 실제 GT 다중 시점 데이터로 학습했을 때 0.764였다. 합성 데이터 조건의 충돌률은 0.0%였다. OpenLongTail은 이 차이를 단안 현장 영상을 타깃 카메라 리그용 다중 시점 자료로 바꾸는 문제로 다룬다.
입력 영상에서는 MapAnything으로 미터 스케일 ego-trajectory를 복원하고 칼만 필터와 Rauch-Tung-Striebel 스무더로 흔들림을 줄인다. 이어 Wan 2.1-VACE 기반 확산 모델이 Plücker ray 기하, 시간적 depth warp, cross-view memory bank를 이용해 다섯 개 비전면 시점을 합성한다. LoRA 적응과 flow-matching 목적함수로 학습했다.

학습 자료는 NVIDIA PhysicalAI-Autonomous-Vehicles, PandaSet, nuScenes에서 모은 20만 개가 넘는 주행 클립과 약 5만 개 장면이다. 생성 백본은 NVIDIA H200 GPU 32개에서 약 96시간 미세조정했다. 외부 평가에는 Waymo E2E 전면 영상과 Nexar 군중제보 대시캠 영상도 사용했다.
외부 Waymo E2E 자료를 섞은 학습에서는 보행자 0.689, 이례 차량 0.765, 작업 구역 0.950으로 지표가 개선됐다. 반면 복잡 교차로 구간은 일부 저하됐다. 성능이 데이터 출처와 사건 유형에 따라 한 방향으로만 움직이지 않았다는 뜻이다.
| Alpamayo R1 조건 | 평균 AlpaSim Score↑ | 평균 충돌률↓ |
|---|---|---|
| 추가 학습 없음 | 0.534 | 58.8% |
| 실제 NV GT로 SFT | 0.764 | 0.0% |
| OpenLongTail NV 합성으로 SFT | 0.748 | 0.0% |
자료: STORIUM 정리
시점 합성 평가에서는 보이지 않은 장면의 cross-left PSNR 13.28, rear-tele LPIPS 0.639, GeoKPM µ 82.41을 보고했다. 비교 대상은 TrajectoryCrafter, Gen3C, ReCamMaster, Vista4D다. 포즈 복원 지표는 미터 스케일 ATE 2.212, RPE-r 0.129, RPE-t 23.05, RotErr 0.340, Jerk 283.9, Acc.Var 5.96으로 제시됐다.
지원 범위는 전면 영상이 있고 그 영상에서 ego-motion을 복원할 수 있는 경우다. 합성 자료가 실제 멀티카메라 로그를 완전히 대체한다는 결론도 아니다. 텍사스 A&M대, 엔비디아, 스탠퍼드대 등의 연구진은 코드, 체크포인트, 변환 도구와 생성 데이터를 공개하겠다고 밝혔으며, arXiv:2607.09655는 동료검토 전 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














