멀티모달 대형 언어모델(MLLM)의 공간이해를 높이기 위해, 외부 기초모델에서 얻은 시각 사전정보를 더하는 방식이 널리 쓰여 왔다. 그런데 이 논문은 서로 다른 기초모델이 같은 장면에서도 다른 단서를 잡아내며, 과제별로 강점이 갈린다는 점을 먼저 보인다. 이 연구는 2026년 7월 16일 arXiv에 제출된 v1 프리프린트이며, 학회·저널 게재 여부는 명시되지 않았다.
이에 따라 제안된 ViPS는 여러 시각 사전정보(prior)를 한 모델 안에서 조화롭게 합치는 다중 전문가 프레임워크다. 핵심은 두 가지다. 먼저 Efficient Prior Proxy가 여러 기초모델의 사전정보를 모델별 독립 추론 없이 근사한다. 이어 Dynamic Prior Fusion이 입력 질문의 맥락에 맞게 사전정보의 가중치를 정하고, 이를 MLLM의 이미지 토큰에 주입한다.
연구진은 VGGT, DepthAnything3, TraceAnything, Wan2.1, RADIO를 포함한 다섯 개 기초모델의 시각 사전정보를 사용했다. 실험은 공간추론용 VSI-Bench와 ScanRefer, Multi3DRefer, Scan2Cap, ScanQA, SQA3D를 포함한 ScanNet 계열 3D 벤치마크에서 이뤄졌다. VSI-Bench에서는 Qwen2-VL-7B와 Qwen3-VL-8B를, 그 외 실험에서는 Qwen2-VL-7B를 기본 MLLM으로 썼다.

수치상 ViPS(Qwen2-VL-7B)는 VSI-Bench 평균 63.8%를 기록해, 기존 최고 공간강화 모델 VLM-3R의 57.2%를 넘었다. 세부적으로는 객체 수 세기 71.5%, 절대거리 60.8%, 물체 크기 70.7%, 방 크기 71.6%, 상대거리 65.5%, 상대방향 84.7%, 이동경로 51.0%, 출현순서 34.3%였다. 한편 출현순서에서는 VG-LLM-8B가 더 높았다. Qwen3-VL-8B 변형도 평균 63.8%를 유지했고, 절대거리 82.6%, 물체 크기 81.4%, 경로계획 46.2%, 출현순서 58.3%를 보였다.
ScanNet 계열 3D 이해에서도 ViPS는 ScanRefer 64.6% Acc@0.25와 57.6% Acc@0.5, Multi3DRefer 62.0% F1@0.25와 56.5% F1@0.5를 기록했다. Scan2Cap은 85.5 C@0.5와 107.9 CIDEr, ScanQA는 31.6 EM, SQA3D는 62.5 EM이었다. 표 3의 절제 실험에서는 각 사전정보를 하나씩 추가한 경우 모두 기준선보다 높았고, 다섯 개를 함께 쓴 전체 ViPS가 모든 열에서 가장 높은 값을 보였다.
| 구성 | 원문 수치 | 비교·맥락 | 근거 위치 |
|---|---|---|---|
| VSI-Bench 평균 성능(qwen2-vl-7b) | 63.8% | 기존 최고 VLM-3R 57.2% 대비 높음 | Table 1 |
| ScanRefer 성능 | 64.6% Acc@0.25, 57.6% Acc@0.5 | 3D 시각 근거화 | Table 2 |
| Scan2Cap·ScanQA·SQA3D 성능 | Scan2Cap 85.5 C@0.5·107.9 CIDEr, ScanQA 31.6 EM, SQA3D 62.5 EM | 캡셔닝·질의응답 지표를 구분해 해석 | Table 2 |
| Efficient Prior Proxy 추론비용 | 약 1× | 기초모델별 독립 순전파 약 5× 설정 대비 | Table 5 |
| 학습 데이터 규모(VSI-Bench) | 207,658개 지시 미세조정 QA 쌍 | ScanNet++ QA 135,119, ScanNet QA 51,630, 거리추정 16,805, 경로계획 4,104 | Appendix A.2 |
자료: STORIUM 정리
구조 설계의 효과도 절제 실험으로 확인됐다. 표 4에서 제로 초기화 합성곱을 빼면 ScanQA가 30.8 EM으로 유지되더라도 Scan2Cap은 76.4 C@0.5로 떨어졌고, 단순 합산도 전체 모델보다 낮았다. 표 5에서는 Efficient Prior Proxy가 독립 순전파로 실제 기초모델 사전정보를 뽑는 상한선 대비 성능 저하는 작으면서도, 추론 비용을 약 5배에서 1배 수준으로 낮췄다고 보고했다. 한편 학습은 7B급 기본 MLLM과 수십만 샘플 규모에 머물렀고, 실제 로봇·체화 AI 환경 검증은 아직 남아 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














