베이징대 연구진은 사람-사물 상호작용(HOI) 탐지를 위한 훈련 없는 프레임워크 ‘AgentHOI’를 arXiv 프리프린트로 공개했다. 이 방법은 HOI 데이터로 추가 학습하거나 파라미터를 미세조정하지 않고, 멀티모달 대형언어모델과 그라운딩 모델을 조합해 ⟨사람, 동작, 사물⟩ 삼중항을 추론한다. 논문은 HICO-DET 테스트셋 9,658장, 600개 HOI 범주와 118개 동작, 80개 사물 범주에서 제로샷 성능을 평가했고, 추가로 스타일 변환과 화질 저하를 적용한 분포 이동 조건도 따로 측정했다. 저자들은 이 설정에서 AgentHOI가 감독학습·약지도 학습 계열과 비교해 일부 분할에서 더 높은 수치를 보였다고 보고했다.
구성은 두 단계다. 먼저 MLLM이 이미지와 사전 정의된 동작·사물 집합을 바탕으로 상호작용 후보를 텍스트로 생성하고, 이후 GroundingDINO가 사람과 사물의 위치를 찾는다. 여기에 세 차례 질의로 상호작용을 보완하는 문맥 인지 다중 라운드 추론과, 외형·위치·관계 묘사를 덧붙여 같은 종류의 인스턴스를 구분하는 다면적 위치결정 모듈을 더했다. 절제 실험에서 기본형 AgentHOI-Base의 HICO-DET 기본 설정 mAP는 19.44였고, 다중 라운드 추론 추가 시 23.20, 위치결정 모듈까지 포함한 최종형은 29.61이었다. 구현 세부로는 GPT-4o와 GroundingDINO를 사용했고, 별도 비교에서 Qwen2.5-VL-72B를 넣었을 때도 26.12 mAP를 기록했다.

정량 결과를 보면 HICO-DET 원본 테스트셋의 제로샷 분할에서 AgentHOI는 UV 29.85, UO 33.70, RF-UC 38.64, NF-UC 28.04를 기록했다. 논문 표 기준으로 원본 조건에서 UV와 RF-UC는 비교 모델 중 가장 높았지만, NF-UC는 HOLa의 35.25보다 낮았고 UO도 HOLa의 36.45보다 낮았다. 분포 이동 평가에서는 스타일 변환 이미지에서 UV 26.45, UO 28.34, RF-UC 32.55, NF-UC 23.05였고, 화질 저하 이미지에서는 UV 27.61, UO 28.99, RF-UC 34.79, NF-UC 24.56이었다. 또 SWIG-HOI에서는 Full 13.00, Rare 13.01, Non-Rare 14.45, Unseen 11.61을 보고했으며, 논문은 이 Unseen 수치가 CMD-SE의 10.70을 넘고 SGC-Net의 12.46보다는 낮다고 적었다.
| 항목 | 조건 | 결과 |
|---|---|---|
| HICO-DET 제로샷 | 원본 테스트셋, UV | AgentHOI 29.85, HOLa 27.91 |
| HICO-DET 제로샷 | 원본 테스트셋, RF-UC | AgentHOI 38.64, HOLa 30.61 |
| HICO-DET 기본 설정 | 약지도 비교, Full mAP | AgentHOI 29.61, OpenCat 25.82, Weakly-HOI 25.70 |
| SWIG-HOI | Unseen | AgentHOI 11.61, CMD-SE 10.70, SGC-Net 12.46 |
자료: STORIUM 정리
한계도 함께 적시됐다. AgentHOI는 추론 단계에서 이미지마다 MLLM 질의를 수행하므로, 약 195M 파라미터의 감독학습 탐지기 HOLa가 이미지당 약 0.1초가 걸린다는 비교와 달리 더 높은 추론 비용을 가진다. 사용한 GPT-4o의 모델 크기는 공개되지 않았고, GroundingDINO는 약 175M 파라미터로 기술됐다. 또한 결과는 arXiv:2607.13881v1 프리프린트 기준이며 동료심사 전이다. 논문은 HICO-DET의 NF-UC에서 낮은 성능을 일부 미주석 no_interaction 범주 문제와 연결해 해석했고, 정성 예시에서는 데이터셋 주석이 불완전할 수 있다고 설명했다. 코드 저장소는 공개됐지만, 기사에서 인용한 모든 수치는 논문 표와 본문에 보고된 오프라인 평가값이다.
저작권자 © STORIUM 무단전재 및 재배포 금지














