톈진중의약대와 베이징사범대 등 연구진이 가시광 영상과 이벤트 카메라 신호를 함께 쓰는 영상 이상탐지 데이터셋 ‘TJUTCM Pha’와 탐지 모델 ‘E-VAD’를 제안했다. 이벤트 카메라는 픽셀 밝기 변화를 비동기로 기록해 빠른 움직임이나 저조도에서 일반 카메라가 놓치는 시간 정보를 보완한다.
TJUTCM Pha는 제약 실험실과 생산 현장에서 수집한 영상 37만6,368프레임, 이벤트 63억건으로 구성됐다. 밝고 어두운 환경, 단순·복잡한 배경, 빠르고 미세한 동작을 포함하며 이상행동을 13개 범주로 나눴다. 데이터의 85%를 학습, 15%를 시험에 사용했다. 연구진은 공개 영상으로부터 이벤트를 합성한 ShanghaiTech-Event도 별도 비교군으로 만들었다.
E-VAD는 CLIP ViT-L/14로 영상·이벤트·텍스트 특징을 768차원 공간에 맞추는 대조학습을 수행한다. 이후 적응형 가중 융합 모듈이 영상의 공간 의미와 이벤트의 시간 단서를 장면별로 조정한다. 평가는 프레임 수준 AUC와 임계값 0.5에서의 오경보율로 진행했고, 일부 기존 모델은 같은 영상·이벤트 입력으로 다시 학습했다.
자체 TJUTCM Pha 시험에서 E-VAD는 AUC 82.25%, 오경보율 0.00%를 보고했다. 비교한 멀티모달 방법의 AUC 67.34~73.78%보다 8.47~10.11%포인트 높다. 구성요소 제거 실험에서는 영상만 75.30%, 이벤트만 78.15%, 두 입력의 단순 결합 80.91%, 멀티모달 사전학습까지 적용한 전체 모델 82.25%로 측정됐다.

| 항목 | 논문 보고값 | 조건 |
|---|---|---|
| 데이터 규모 | 영상 376,368프레임·이벤트 63억건 | TJUTCM Pha |
| E-VAD | AUC 82.25%·FAR 0.00% | 프레임 수준, 임계값 0.5 |
| 영상만 | AUC 75.30% | 구성요소 제거 |
| 이벤트만 | AUC 78.15% | 구성요소 제거 |
| 단순 결합 | AUC 80.91% | 구성요소 제거 |
ShanghaiTech에서는 AUC 98.67%, UCF-Crime에서는 88.75%였다. 그러나 ShanghaiTech-Event는 실제 센서가 아니라 화면 재촬영·합성으로 만든 신호여서 센서 잡음과 이벤트 희소성을 온전히 반영하지 못한다. TJUTCM Pha도 한 종류의 제약 현장과 13개 행위에 집중했고, 공개 링크는 논문에서 추후 제공으로 표시됐다. 결과는 2026년 7월 arXiv 사전논문 기준이며 동료평가와 외부 재현은 확인되지 않았다. 이 결과는 동료 검토 전 프리프린트에 담긴 연구진의 보고이므로 후속 검증이 필요하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














