산업 공정의 이상은 한 장면만 봐서는 드러나지 않을 때가 있다. 치약 튜브가 눌리고 변형된 뒤 미세한 누출이 생기는 식이다. 카네기멜런대·앨라배마대 버밍엄·그리피스대 연구진은 이런 시간 흐름을 객체별로 추적하는 O-VAD를 제안했다. 논문은 2026년 7월 20일 arXiv에 공개됐으며 ECCV 2026 채택작이다.
O-VAD는 대상 산업의 정상 영상으로 다시 학습하거나 도메인 지식을 프롬프트에 넣지 않는 무학습 방식이다. 먼저 여러 프레임에서 VLM으로 객체를 찾고 SAM으로 마스크를 만든다. 이어 CropFormer와 SAM2를 이용해 객체별 시공간 궤적을 구성하고, 누락된 추적은 의미 유사도와 공간 근접성으로 보완한다. 이 과정에서 VLM은 객체의 상태 변화와 객체 사이 상호작용을 기록한다.

마지막 판단에는 시작·중간·종료 키 프레임 세 장을 쓴다. 시스템은 관찰, 기대 상태, 실제 변화 비교, 원인, 분류, 심각도 순서로 한 차례 VLM 추론을 수행한다. 원문에 제시된 임계값은 고신뢰 후보 0.8, 저신뢰 후보 0.2, 사후 검증 유지 기준 0.3이다. 확신도가 높은 탐지는 바로 남기고 낮은 후보는 버리며, 그 사이 후보만 다시 확인한다.
연구진은 Phys-AD·LiquidAD·IPAD 세 데이터셋에서 O-VAD를 전통적 VAD, 직접 프롬프팅, 에이전트형 워크플로와 비교했다. 영상 단위 AUC는 각각 0.584, 0.692, 0.565로 보고됐다. 최대 8개의 피펫이 동시에 등장하는 LiquidAD에서는 객체별 상태 궤적을 추적해 무학습 방법 중 가장 높은 영상 단위 AUROC를 기록했다. 상태 추적을 제거한 실험에서는 네 범주 중 세 범주의 정밀도·재현율·F1이 모두 0으로 떨어졌고, 고무밴드 범주의 재현율은 0.033, F1은 0.065였다.
| 데이터셋 | 평가 단위 | O-VAD AUC |
|---|---|---|
| Phys-AD | 영상 | 0.584 |
| LiquidAD | 영상 | 0.692 |
| IPAD | 영상 | 0.565 |
자료: STORIUM 정리
수치는 저자들이 구성한 세 데이터셋 평가에서 나온 결과다. 실제 공장에 장기간 배치한 성과나 다른 공정으로의 일반화까지 입증한 것은 아니다. O-VAD도 객체 분할·추적 모델과 VLM의 판단 품질에 의존하며, 작은 물체가 가려지거나 상태 변화가 불규칙하면 오류가 누적될 수 있다고 논문은 설명한다. ECCV 채택 여부와 별개로 현장 적용 범위는 추가 검증이 필요하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














