비전 트랜스포머는 이미지 분류에서 강한 성능을 보여왔지만, 주의를 객체보다 배경에 넓게 퍼뜨려 우연한 상관에 기대는 경우가 적지 않다. 이 논문은 그런 한계를 겨냥해, 소프트맥스가 버리던 음의 query-key 상관을 억제 신호로 되살린 Inhibited Self-Attention(ISA)을 제안한다. 생물학적 시각계의 억제 기제에서 영감을 받은 방식으로, 각 패치 쌍의 raw attention을 바탕으로 softmax와 softmin을 함께 계산하고 두 분포의 경쟁으로 최종 attention을 다시 가중한다. 핵심은 표준 self-attention이 양의 값만 남기는 반면, ISA는 관련성이 낮은 특징을 누르고 관심 대상을 더 또렷하게 드러내도록 설계됐다는 점이다. 구현상으로는 기존 self-attention을 각 ViT 층에 그대로 대체하는 drop-in 방식이며, 추가 파라미터나 FLOPs가 없다고 설명한다. 억제 강도 α는 학습 가능한 매개변수로 두고 초기값 1로 시작했다. 이 논문은 동료검토 전 arXiv 프리프린트다.
평가는 ImageNet-1k, ImageNet-Segmentation, ImageNet-Watermark, ImageNet-Renditions, Waterbirds, ImageNet-C, ImageNet-¯C, COCO까지 넓게 잡았다. 연구팀은 object-centric selectivity, shortcut reliance, out-of-distribution generalization을 함께 보겠다고 했고, 이를 위해 새 지표 Attention-on-Objects(AoO)도 제안했다. AoO는 ImageNet-S의 분할 마스크를 이용해 객체 영역에 쏠린 attention의 비율을 계산하며, 단일 최고점만 보는 Pointing Game보다 전체 attention mass를 반영한다.

수치에서는 ISA가 대체로 기존 ViT-S/16보다 초점과 강건성에서 우세했다. ImageNet-1k top-1 accuracy는 ViT-S/16 78.9±0.1%, ISA-ViT-S/16 79.0±0.1%였고, cross-entropy loss는 0.890±0.0과 0.889±0.0이었다. ImageNet-W에서 accuracy degradation을 뜻하는 IN-W Gap은 ViT-S/16 -10.0±0.8, ISA-ViT-S/16 -9.3±0.4였고, carton class의 accuracy 증가폭인 Carton Gap은 28.7±6.4와 27.0±3.1이었다. ImageNet-R accuracy는 39.4±0.1%에서 40.4±0.1%로 올랐다. DeiT 계열에서도 비슷한 경향이 나타나, DeiT-S는 79.9±0.0%였고 ISA-DeiT-S는 80.1±0.1%였다.
배경 의존성을 본 Waterbirds에서는 ISA-ViT-S/16의 전체 accuracy가 90.5%로, ViT-S/16의 89.5%보다 높았다. 그룹별 정확도는 네 집단 중 0/1/2/3이 각각 94.6/88.8/83.8/89.2%였고, ViT-S/16은 94.2/87.0/81.6/89.6%였다. 특히 훈련 시 비자연적 배경이 들어간 그룹 1과 2에서 ISA가 더 높은 정확도를 보였다고 요약했다. 깨짐 강건성은 ImageNet-C와 ImageNet-¯C에서 relative mean Corruption Error(rmCE)를 기준으로 비교했으며, ISA가 두 벤치마크에서 모든 모델군 중 최고 rmCE를 보였다고 적었다.
| 모델 | ImageNet-1k / ImageNet-W / ImageNet-R | 비고 |
|---|---|---|
| ViT-S/16 | 78.9 ± 0.1% / -10.0 ± 0.8 / 39.4 ± 0.1% | 3회 독립 실행 평균, Table 1 |
| ISA-ViT-S/16 | 79.0 ± 0.1% / -9.3 ± 0.4 / 40.4 ± 0.1% | 3회 독립 실행 평균, Table 1 |
| ViT-S/16 | 89.5% / 94.2, 87.0, 81.6, 89.6% | Waterbirds 전체 정확도 및 그룹 0/1/2/3, Table 2 |
| ISA-ViT-S/16 | 90.5% / 94.6, 88.8, 83.8, 89.2% | Waterbirds 전체 정확도 및 그룹 0/1/2/3, Table 2 |
자료: STORIUM 정리
객체 탐지에서는 COCO에 대해 ViT-DINO, DIFF-DINO와 비교했고, ViT backbone 내부에만 억제를 적용한 ISA-DINO를 사용했다. 탐지 성능은 mean average precision과 Attention-on-Detected-Objects(AoDO)로 본다고 했지만, 본문에 드러난 수치 표는 분류 실험 중심이다. Attention map 분석에서는 ISA가 객체 관련 영역에 더 국소적으로 반응하고 배경으로의 확산을 줄였으며, 마지막 층의 raw attention score 분포도 plain ViT보다 좁아져 한두 토큰에 쏠리는 현상이 완화됐다고 해석했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














