
영상 이상탐지는 드문 사건을 촘촘히 라벨링하기 어려워 학습 기반 방법이 늘 비용과 재학습 부담을 안고 있다. arXiv 프리프린트인 이 연구는 대형 비전-언어 모델의 무학습 추론을 활용하되, 전체 영상을 한 번에 판단하는 방식이 놓칠 수 있는 단서를 줄이기 위해 CSI-VAD를 제안한다.
핵심은 영상을 환경, 객체, 시간의 세 맥락으로 분해하는 데 있다. 환경 분기는 시작·중간·끝의 세 키프레임을 바탕으로 장면 수준 단서를 읽고, 객체 분기는 10 FPS로 샘플링한 프레임에서 탐지와 추적을 통해 객체 중심 정보를 만든다. 시간 분기는 프레임별 캡션을 생성한 뒤 유사도 하락을 기준으로 구간을 나누고, 각 구간을 요약해 사건 흐름을 반영한다.
이렇게 얻은 맥락별 결과는 별도 가지에서 이상 여부, 점수, 설명으로 산출된다. 주목할 점은 미리 정해진 이상 사건 프롬프트나 데이터셋별 튜닝 없이, 맥락별 시각 단서만으로 판단을 구성했다는 점이다. 점수 결합은 최대값·평균·Noisy-OR 세 방식, 라벨 결합은 1개 이상, 2개 이상, 3개 모두의 합의 규칙으로 다뤘다.
검증은 UCF-Crime과 UBnormal의 비디오 수준 평가로 진행됐다. UCF-Crime은 테스트 분할 290편(이상 140, 정상 150), UBnormal은 테스트 211편(정상 53, 이상 158)으로 구성됐다. 점수 평가는 AUC-ROC를, 이진 분류는 Accuracy, Precision, Recall, F1을 사용했고, 모든 실험은 단일 NVIDIA A100 GPU 80GB에서 수행됐다.
수치상 UCF-Crime의 256프레임 조건에서 Ours256의 Mean Ensemble과 Noisy-OR는 각각 AUC-ROC 92.90%, 92.88%로 제시됐고, 같은 표에서 Direct holistic baseline은 88.39%였다. 또한 UCF-Crime 비교표에서는 Ours256의 Mean Ensemble 92.90%와 Noisy-OR 92.88%가 DUAL VAD 92.33%를 넘었다. UBnormal에서는 256프레임에서 Ours의 Mean Ensemble과 Noisy-OR가 모두 71.56%로, baseline 58.66%보다 높았다.
| 구성 | 내용 | 근거 위치 |
|---|---|---|
| 환경 분기 | 시작·중간·끝의 3개 키프레임으로 환경 맥락을 구성하고 LVLM으로 Ce를 얻음 | p.2 | source_excerpt / Environment module |
| 객체 분기 | 10 FPS 샘플링, 객체 탐지와 StrongSORT 추적으로 객체 중심 오버레이 프레임을 구성 | p.2 | source_excerpt / Object-Centric Tracking Module; p.3 | source_excerpt |
| 시간 분기 | 프레임별 캡션 생성 후 유사도 하락 기준으로 구간을 나눠 LLM이 시간 맥락 Ct를 요약 | p.2 | source_excerpt / Event-Aware Time Module |
| 검증 데이터 | UCF-Crime 테스트 290편(이상 140, 정상 150), UBnormal 테스트 211편(정상 53, 이상 158) | p.3 | source_excerpt / Experiments |
| 대표 성능 | UCF-Crime 256프레임에서 Ours256 Mean Ensemble 92.90%, Noisy-OR 92.88%; UBnormal 256프레임에서 Ours Mean/Noisy-OR 71.56% | p.4 | source_excerpt; p.5 | source_excerpt / Table III |
자료: STORIUM 정리
라벨 결합에서는 32프레임 기준 OR 규칙이 두 벤치마크에서 가장 좋은 전체 분류 성능을 보였다. UCF-Crime에서 OR은 Accuracy 0.83, Precision 0.93, Recall 0.69, F1 0.80이었고, UBnormal에서는 0.48, 1.00, 0.30, 0.47이었다. 연구진은 Burglary, Assault, Shoplifting 등 일부 범주에서 특히 큰 향상을 보고했지만, 짧은 이상 사건이 성긴 샘플링에 의해 빠질 수 있다는 한계도 함께 제시했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














