• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

지역 설명과 위치 추정을 한 모델이 서로 검증하는 강화학습 틀, SAMTok 기반 CycleGRPO의 다과제 평가

유지율 리포터 작성: 유지율 리포터
2026년 07월 15일 18시 05분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

멀티모달 대규모 언어모델이 특정 영역을 설명하고, 그 설명을 다시 공간적으로 찾아내는 일을 하나의 닫힌 고리로 묶는 강화학습 틀이 제안됐다. 이 arXiv v1 프리프린트는 Cycle Group Relative Policy Optimization(CycleGRPO)을 통해 지역 이해와 위치 추정을 동시에 최적화하는 방식을 다룬다. 핵심은 하나의 모델이 먼저 캡션을 생성하는 actor로, 곧바로 그 문장을 다시 마스크로 복원해 스스로 채점하는 critic으로 작동한다는 점이다.

연구진은 지역 캡셔닝과 참조 위치 추정이 본질적으로 서로의 역문제라는 점에 주목했다. 입력은 이미지와 마스크, 또는 이미지와 텍스트 설명으로 나뉘지만, CycleGRPO는 “region → text → region” 순환을 통해 텍스트의 품질을 공간 복원 정확도로 측정한다. 이때 텍스트 정답은 필요하지 않고, 마스크나 바운딩 박스 같은 지역 입력만으로 학습이 진행된다. 외부 LLM 판정자나 작업별 머리 구조에 기대지 않는 점도 이 틀의 특징이다.

Figure 1: Concept comparison of Reinforcement Learning paradigms for region-level tasks. (A) Captioning tasks typically rely on external LLMs to judge the text quality, which is vulnerable to reward hacking. (B) Localization tasks use objective rule-based functions (e.g., IoU). Both (A) and (B) heavily depend on un- scalable high-quality text-mask pairs. (C) We let a single model act as both the actor (generating captions) and its own critic (referring its own text back into masks). This cycle consistency provides intrinsic reward signals, bypassing external judges and the need for text ground truths. 출처: 원문

구현은 SAMTok 위에서 이뤄졌다. SAMTok의 이산 마스크 토크나이저는 임의의 마스크를 토큰 시퀀스로 바꿔 같은 어휘 공간에서 캡션과 마스크를 함께 다루게 한다. 실험 설정에서는 DenseWorld에서 가져온 2만 장의 이미지와 객체 마스크, 그리고 GRES의 1천 개 no-target 표현을 학습 코퍼스로 사용했다. 학습은 1 epoch, 총 배치 크기 128, 캡션 그룹 크기 G=6, 위치 추적 롤아웃 K=6으로 진행됐고, AdamW를 학습률 1×10^-6, weight decay 1×10^-2로 돌렸다.

평가는 별도 작업별 미세조정 없이 DLC-Bench, GAR-Bench-VQA, GCG, GRES, GroundingSuite에서 이뤄졌다. DLC-Bench mask-to-text에서 SAMTok의 평균 점수는 61.9에서 67.7로 올랐고, GRPO의 63.4보다 높았다. GroundingSuite text-to-mask에서는 전체 정확도가 57.5%에서 67.6%로 상승했다. GRES에서는 평균 gIoU가 71.2에서 78.2로 뛰었고, N-acc는 58.7%에서 92.1%로 높아졌다. GCG에서는 Val CIDEr가 48.2에서 54.7, Recall이 46.6에서 49.6으로 증가했다.

세부적으로는 GAR-Bench-VQA 전체 정확도가 64.2%에서 65.1%로 개선됐고, 특히 Perception과 Non-Entity 항목에서 각각 58.0%에서 62.3%, 54.1%에서 57.4%로 올랐다. 반면 Position은 58.3%에서 55.1%로, Relation은 83.2%에서 82.2%로 내려갔다. 논문은 마스크 복원이 속성 설명에는 더 민감하지만 공간 관계 표현에는 덜 직접적이기 때문이라고 해석한다. 또 표 6의 절제 실험에서는 캡셔닝만 최적화한 경우와 위치 추정만 최적화한 경우가 각각 자기 과제에서만 개선된 반면, CycleGRPO는 DLC-Bench 68.0, GroundingSuite 68.5로 두 축을 함께 끌어올렸다.

benchmark 비교 지표 CycleGRPO 수치
DLC-Bench Avg. score, SAMTok 61.9→67.7; GRPO 63.4 67.7
GroundingSuite Overall accuracy, SAMTok 57.5%→67.6%; GRPO 62.7% 67.6%
GRES Avg. gIoU 71.2→78.2; N-acc 58.7%→92.1% 78.2 / 92.1%
GAR-Bench-VQA Overall accuracy 64.2%→65.1%; Perception 58.0%→62.3% 65.1%
GCG Val CIDEr 48.2→54.7; Recall 46.6→49.6 54.7 / 49.6

자료: STORIUM 정리

비교 결과는 단순한 GRPO와의 차이를 분명히 보여준다. DLC-Bench에서 일반 GRPO는 평균 63.4였지만 CycleGRPO는 67.7까지 갔고, GRES에서는 일반 GRPO가 평균 IoU 70.8, N-acc 97.9%였던 데 비해 CycleGRPO는 IoU 78.2, N-acc 92.1%를 기록했다. 문장 생성이 쉬운 방향으로 치우치면 정밀한 공간 복원이 약해질 수 있다는 점을 이 순환 보상이 완화한 셈이다. 코드와 모델은 공개됐지만, 논문의 수치는 모두 내부 벤치마크 평가에 한정된 결과다.

1차 출처: https://arxiv.org/abs/2607.11581

저작권자 © STORIUM 무단전재 및 재배포 금지

유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

서울 국립중앙도서관 사서연수관과 국제회의장 자료사진
산업 적용

국립중앙도서관, DCMI 2026 개최…AI 메타데이터 논의

2026년 07월 29일 12시 43분
미 국토안보부 청사에서 회의 중인 앤드루 가바리노 하원 국토안보위원장
정책·윤리

미 하원, 에어비앤비·커서의 중국 AI 모델 사용 조사 착수

2026년 07월 29일 12시 24분
LG유플러스 통합관제센터 앞에서 정보보호백서 2025를 소개하는 정보보안센터 임직원
산업 적용

LG유플러스, 2028년 에이전틱 SOC 전환 추진…7000억원은 정보보호 전반

2026년 07월 29일 12시 06분
엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부
반도체·인프라

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
Next Post
홍콩중문대학교 공식 로고

LLM으로 100개 멀티씬 게임 세계를 만든 MAGIC, 포털 연결·이동 가능성·전환 검증까지 묶다

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
서울 국립중앙도서관 사서연수관과 국제회의장 자료사진

국립중앙도서관, DCMI 2026 개최…AI 메타데이터 논의

2026년 07월 29일 12시 43분
미 국토안보부 청사에서 회의 중인 앤드루 가바리노 하원 국토안보위원장

미 하원, 에어비앤비·커서의 중국 AI 모델 사용 조사 착수

2026년 07월 29일 12시 24분
LG유플러스 통합관제센터 앞에서 정보보호백서 2025를 소개하는 정보보안센터 임직원

LG유플러스, 2028년 에이전틱 SOC 전환 추진…7000억원은 정보보호 전반

2026년 07월 29일 12시 06분
엔비디아 품질 인증을 받은 LG전자 600kW급 냉각수 분배 장치 CDU의 외관과 내부

LG전자, 600kW급 CDU로 국내 첫 엔비디아 품질 인증

2026년 07월 29일 11시 44분
미국 오리건 AWS 데이터센터 단지 자료사진

AWS 주간 업데이트…Claude Opus 5와 장기 실행 Lambda 추가

2026년 07월 29일 11시 34분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,484)
  • AI 서비스·툴 (828)
  • 반도체·인프라 (538)
  • 빅테크·기업 (567)
  • 산업 적용 (419)
  • 스타트업·투자 (251)
  • 정책·윤리 (458)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

서울 국립중앙도서관 사서연수관과 국제회의장 자료사진

국립중앙도서관, DCMI 2026 개최…AI 메타데이터 논의

2026년 07월 29일 12시 43분
미 국토안보부 청사에서 회의 중인 앤드루 가바리노 하원 국토안보위원장

미 하원, 에어비앤비·커서의 중국 AI 모델 사용 조사 착수

2026년 07월 29일 12시 24분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.