멀티모달 대규모 언어모델이 특정 영역을 설명하고, 그 설명을 다시 공간적으로 찾아내는 일을 하나의 닫힌 고리로 묶는 강화학습 틀이 제안됐다. 이 arXiv v1 프리프린트는 Cycle Group Relative Policy Optimization(CycleGRPO)을 통해 지역 이해와 위치 추정을 동시에 최적화하는 방식을 다룬다. 핵심은 하나의 모델이 먼저 캡션을 생성하는 actor로, 곧바로 그 문장을 다시 마스크로 복원해 스스로 채점하는 critic으로 작동한다는 점이다.
연구진은 지역 캡셔닝과 참조 위치 추정이 본질적으로 서로의 역문제라는 점에 주목했다. 입력은 이미지와 마스크, 또는 이미지와 텍스트 설명으로 나뉘지만, CycleGRPO는 “region → text → region” 순환을 통해 텍스트의 품질을 공간 복원 정확도로 측정한다. 이때 텍스트 정답은 필요하지 않고, 마스크나 바운딩 박스 같은 지역 입력만으로 학습이 진행된다. 외부 LLM 판정자나 작업별 머리 구조에 기대지 않는 점도 이 틀의 특징이다.

구현은 SAMTok 위에서 이뤄졌다. SAMTok의 이산 마스크 토크나이저는 임의의 마스크를 토큰 시퀀스로 바꿔 같은 어휘 공간에서 캡션과 마스크를 함께 다루게 한다. 실험 설정에서는 DenseWorld에서 가져온 2만 장의 이미지와 객체 마스크, 그리고 GRES의 1천 개 no-target 표현을 학습 코퍼스로 사용했다. 학습은 1 epoch, 총 배치 크기 128, 캡션 그룹 크기 G=6, 위치 추적 롤아웃 K=6으로 진행됐고, AdamW를 학습률 1×10^-6, weight decay 1×10^-2로 돌렸다.
평가는 별도 작업별 미세조정 없이 DLC-Bench, GAR-Bench-VQA, GCG, GRES, GroundingSuite에서 이뤄졌다. DLC-Bench mask-to-text에서 SAMTok의 평균 점수는 61.9에서 67.7로 올랐고, GRPO의 63.4보다 높았다. GroundingSuite text-to-mask에서는 전체 정확도가 57.5%에서 67.6%로 상승했다. GRES에서는 평균 gIoU가 71.2에서 78.2로 뛰었고, N-acc는 58.7%에서 92.1%로 높아졌다. GCG에서는 Val CIDEr가 48.2에서 54.7, Recall이 46.6에서 49.6으로 증가했다.
세부적으로는 GAR-Bench-VQA 전체 정확도가 64.2%에서 65.1%로 개선됐고, 특히 Perception과 Non-Entity 항목에서 각각 58.0%에서 62.3%, 54.1%에서 57.4%로 올랐다. 반면 Position은 58.3%에서 55.1%로, Relation은 83.2%에서 82.2%로 내려갔다. 논문은 마스크 복원이 속성 설명에는 더 민감하지만 공간 관계 표현에는 덜 직접적이기 때문이라고 해석한다. 또 표 6의 절제 실험에서는 캡셔닝만 최적화한 경우와 위치 추정만 최적화한 경우가 각각 자기 과제에서만 개선된 반면, CycleGRPO는 DLC-Bench 68.0, GroundingSuite 68.5로 두 축을 함께 끌어올렸다.
| benchmark | 비교 지표 | CycleGRPO 수치 |
|---|---|---|
| DLC-Bench | Avg. score, SAMTok 61.9→67.7; GRPO 63.4 | 67.7 |
| GroundingSuite | Overall accuracy, SAMTok 57.5%→67.6%; GRPO 62.7% | 67.6% |
| GRES | Avg. gIoU 71.2→78.2; N-acc 58.7%→92.1% | 78.2 / 92.1% |
| GAR-Bench-VQA | Overall accuracy 64.2%→65.1%; Perception 58.0%→62.3% | 65.1% |
| GCG | Val CIDEr 48.2→54.7; Recall 46.6→49.6 | 54.7 / 49.6 |
자료: STORIUM 정리
비교 결과는 단순한 GRPO와의 차이를 분명히 보여준다. DLC-Bench에서 일반 GRPO는 평균 63.4였지만 CycleGRPO는 67.7까지 갔고, GRES에서는 일반 GRPO가 평균 IoU 70.8, N-acc 97.9%였던 데 비해 CycleGRPO는 IoU 78.2, N-acc 92.1%를 기록했다. 문장 생성이 쉬운 방향으로 치우치면 정밀한 공간 복원이 약해질 수 있다는 점을 이 순환 보상이 완화한 셈이다. 코드와 모델은 공개됐지만, 논문의 수치는 모두 내부 벤치마크 평가에 한정된 결과다.
1차 출처: https://arxiv.org/abs/2607.11581
저작권자 © STORIUM 무단전재 및 재배포 금지














