DIOR 탐지에서 SAM 3의 전체 mAP는 Text-Only 11.67, Box-Only 66.55, Text+Box 63.79였다. AP@50은 같은 순서로 16.79, 79.51, 75.29였다. ground-truth negative suppression을 쓰는 oracle을 더하면 Text+Oracle은 mAP 13.11·AP@50 19.21, Text+Box+Oracle은 64.61·76.71이었다. 박스가 텍스트보다 큰 폭으로 앞섰고, oracle은 실제 배포 조건이 아닌 분석용 설정이다.

Mohammad Dabaja와 Turgay Celik는 AID를 장면 분류, DIOR를 객체 탐지, iSAID를 인스턴스 분할에 배정해 추가 학습 없는 zero-shot·one-shot 조건을 비교했다. AID 30개 클래스에서 분리형 presence head의 presence score 정확도는 37.26%, conditional localisation score는 28.25%, 곱한 confidence score는 38.70%였다. farmland는 77.03%·10.00%·65.95%, river는 44.15%·87.07%·59.51%로 점수별 강점이 클래스마다 달랐다.
iSAID의 mAP는 Text-Only 11.85, Box-Only 32.77, Text+Box 35.54, Text+Oracle 12.70, Text+Box+Oracle 36.30이었다. AP@50은 각각 22.73, 57.20, 61.65, 24.15, 63.09였다. GZSI 프록시에서는 Base AP50 59.14, Novel AP50 30.49, 조화평균 40.24였고 oracle은 60.97, 31.88, 41.87로 소폭 높았다.
| 데이터셋·구성 | mAP | AP@50 |
|---|---|---|
| DIOR Text-Only | 11.67 | 16.79 |
| DIOR Box-Only | 66.55 | 79.51 |
| DIOR Text+Box | 63.79 | 75.29 |
| iSAID Text-Only | 11.85 | 22.73 |
| iSAID Text+Box+Oracle | 36.30 | 63.09 |
자료: STORIUM 정리
DIOR GZSD 비교의 SAM 3는 mAP 61.15, Base AP50 76.03, Novel AP50 1.67, 조화평균 3.26이었다. oracle에서는 62.66, 77.62, 2.84, 5.48이었다. 논문은 시각 프롬프트가 상공 영상의 복잡한 기하에 정렬을 돕는 반면 텍스트 프롬프트의 지면 수준 의미 편향이 좌표 회귀를 방해할 수 있다고 해석했다.
평가는 학습 없는 제한된 조건이며 sub-pixel 해상도, 상공 장면의 semantic blind spot, 작은 물체와 모호한 경계 문제가 남는다. LoRA를 이용한 text encoder·multimodal decoder 미세조정과 vision-language contrastive realignment는 제안된 후속 과제이지 이번 결과가 아니다. 문서는 arXiv:2607.09583v1 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














