배경에 숨은 물체를 참조 이미지로 찾아 분할할 때 점 프롬프트가 조금만 빗나가도 결과가 무너질 수 있다. GFR-SAM은 과제별 추가 학습 없이 전체 참조 예시를 사용해 후보를 만들고, 배경을 거른 뒤 경계를 다듬는 Generate-Filter-Refine 파이프라인이다.
생성 단계는 목표 이미지의 점 좌표 대신 참조 이미지를 SAM3에 주고 이미지 간 문맥 추론으로 후보 마스크를 얻는다. 필터 단계는 DINOv3 특징으로 후보 영역과 참조 물체의 프로토타입 정렬을 비교한다. 마지막에는 선택된 마스크의 경계 상자와 텍스트 프롬프트를 함께 써 세부 경계와 여러 인스턴스 회수를 보완한다.

R2C7K 벤치마크에서 가중 F-측정값 Fβw는 기존 학습 없는 방법보다 8.7% 높았고 일부 감독학습 최신 방법과 경쟁하는 결과를 냈다. 별도 파라미터 최적화나 Ref-COD 전용 주석 없이 범용 기반모델을 조합한 조건의 상대 향상이다.
성능은 SAM3와 DINOv3의 사전학습 표현, 참조 예시 품질, 최초 후보에 목표가 포함된다는 조건에 의존한다. 참조와 목표의 외형 차이가 크거나 배경 특징이 비슷하면 필터가 실패할 수 있고, 세 대형 구성요소를 순차 실행하는 비용도 경량 모델과 비교해야 한다.
8.7%는 R2C7K 한 벤치마크의 무학습 기준 대비 값이지 야생 환경 전체의 신뢰도가 아니다. 의료·감시 적용에는 오탐과 누락, 참조 예시 수의 민감도를 다시 평가해야 한다. 공개 PDF는 ACM MM 2026 프로시딩 형식이지만 DOI가 자리표시자로 남아 있어 최종 서지 상태는 별도 확인이 필요하다. arXiv 식별자는 2607.11732다.
저작권자 © STORIUM 무단전재 및 재배포 금지












