실제 로봇이 물체와 상호작용한 기록을 시뮬레이션 가능한 디지털 트윈으로 옮기는 일은 단순한 시각 복원보다 훨씬 복잡하다. 이 논문은 장면 기하와 물체 상태를 복원하고, 물리 파라미터를 추정한 뒤, actor·object·camera·pose·trajectory를 하나의 실행 가능한 물리 시뮬레이션으로 묶는 과정을 다룬다. 현재의 흐름은 시각 기반 모델의 수동 조정, 메시 정리, 좌표계 정렬, 도구 간 연결 작업에 크게 기대고 있다. 이러한 한계를 겨냥해 제안된 Agentic Real2Sim은 비전-언어 에이전트를 이용해 실제 영상 기록을 시뮬레이션 가능한 episodic twin으로 변환한다.
핵심은 단일 단계의 재구성이 아니라, 관측·기하·로봇 상호작용·물체 상태를 함께 보존하는 쪽에 있다. 프리프린트는 이 틀을 DROID 로봇 조작 에피소드의 MuJoCo 트윈 변환으로 먼저 제시하고, 이어서 변형 가능한 물체 상호작용과 휴머노이드 모션까지 같은 개념으로 확장한다. 서로 다른 도메인에 따로 존재하던 Real2Sim 파이프라인을 하나의 에이전틱 절차로 묶었다는 점에서, 논문은 이를 대규모 변환을 향한 첫 단계로 설명한다.

검증 범위도 분명하다. DROID-100에서는 네 가지 VLM 백엔드를 비교했고, 공개 가중치 31B 모델이 독점형 백엔드와 비슷한 replay-success 결과를 보이면서 모델 비용은 최대 31.4배 낮았다. 결론부에서는 같은 비교를 다시 요약하며, 공개 31B 백엔드가 GPT-5.4 대비 약 3%의 모델 비용으로 관찰된 replay-success outcome을 맞췄다고 적었다. 절대 replay success는 모든 백엔드에서 50% 미만이었고, 남은 여지가 주로 VLM 선택보다 상위의 시각·시뮬레이션 구성 요소에 있다고 해석한다.
구성 면에서는 도구와 의사결정을 분리했다. 1차적으로는 SAM 3의 분할, SAM 3D의 3D 자산 복원, FoundationStereo의 깊이 추정, FoundationPose의 6D 포즈 추적 같은 교체 가능한 도구를 붙이고, 그 위에서 bounded·schema-constrained VLM 질의가 다음 행동을 고른다. DROID 변환 단계에서는 보정된 장면을 MuJoCo에 적재한 뒤 객체 이동에 대한 결정적 탐색이나, 재생 증거를 바탕으로 한 LLM 보정 루프를 수행한다. 구조 자체가 재사용 가능한 기저 도구와 고수준 판단을 나눠 설계된 셈이다.
확장 실험은 변형체와 휴머노이드로 이어졌다. 변형체 어댑터는 강체 포즈 추적 대신 기하·입자·스프링·물질 상태를 추적하고, 시뮬레이터 롤아웃으로 복원된 파라미터가 관측된 변형을 재현하는지 점검한다. 휴머노이드 어댑터는 물체 중심 장면 준비를 모션 컨텍스트 검색과 embodiment별 초기화, retargeted reference motion과의 폐루프 재생으로 바꾼다. 프리프린트는 이 세 도메인을 함께 평가해, 기존에 분리돼 다뤄지던 Real2Sim 계열을 하나의 일반화된 물리 세계 모델링 절차로 묶을 수 있음을 보였다. 이 작업이 겨냥하는 활용처는 로봇 정책 학습과 평가다. 연구진은 변환된 합성 DROID 에피소드를 downstream robotics task용 시뮬레이션 자산으로 쓰고자 하며, 실제 세계와 정렬된 트윈을 통해 학습과 검증을 돕겠다고 밝힌다. 본문에서 보고된 수치는 주로 DROID-100과 선택된 시뮬레이션 설정에 한정되며, 절대 성공률은 50% 미만이라는 점도 함께 제시된다. 공개 31B 백엔드의 비용 우위와 도메인 확장 가능성은 확인됐지만, 신뢰성과 재생 안정성의 체계적 평가는 여전히 남은 과제로 적시됐다.
| 항목 | 원문 값 | 근거 위치 |
|---|---|---|
| 첫 단계 적용 도메인 | DROID robot manipulation episodes → MuJoCo-simulated episodic twins | p.2 contributions; p.6 Converting DROID Episodes |
| 비용 비교 | open 31B VLM backend cost up to 31.4× lower than frontier models; about 3% of GPT-5.4’s model cost | p.2 contributions; p.10 Conclusions, Limitations and Future Work; p.1 abstract |
| DROID-100 성능 비교 | open 31B VLM achieves comparable observed replay-success outcomes to proprietary backends | p.2 contributions; p.10 Conclusions, Limitations and Future Work |
| 확장 검증 범위 | rigid-object manipulation, deformable-object interaction, humanoid motion scenes | p.1 abstract; p.2 contributions |
자료: STORIUM 정리
저작권자 © STORIUM 무단전재 및 재배포 금지














