ImageNet100 validation set에서 FDT-S0.5는 50% fixation budget으로 clean 정확도 81.9%와 3.01 GMAC를 기록했다. 비교 대상 DeiT-S는 80.9%와 4.60 GMAC였으며, 논문이 계산한 연산량 감소율은 34.57%다. 모든 토큰을 쓰는 FDT1.0은 84.5%, 4.63 GMAC로 보고돼 foveation·fixation 자체의 추가 연산은 작다는 해석을 뒷받침했다.
Foveated Dynamic Transformer(FDT)는 인간 시각계의 포비에이션과 시선 고정에서 착안한 비전 트랜스포머다. Foveation 모듈이 여러 해상도의 query·key·value를 만들고, Fixation 모듈이 foveated-query 토큰 qfov에서 위치별 이진 결정을 낸다. MHSA는 선택된 토큰만 처리한 뒤 선택되지 않은 토큰과 다시 섞어 다음 블록으로 보낸다. 학습 때는 Gumbel-Softmax와 hard labeling으로 결정을 미분 가능하게 근사하고 fixation budget loss로 블록별 선택 비율을 맞춘다.

강건성은 서로 다른 세 설정으로 나눠 봐야 한다. 12종 적대적 공격과 Gaussian noise 1종에서는 clean 정확도를 제외한 공격 조건 평균이 DeiT 대비 27% 향상됐다고 보고했다. ImageNet100-C의 15종 교란과 다섯 심각도에서는 통합 평균이 DeiT-S 56.0%, FDT-S0.5 57.8%였고, 71.0%와 72.8%는 심각도 S1만의 평균이다. class-specific tint로 학습하고 일반 ImageNet100 validation set에서 시험한 쇼트컷 설정에서도 FDT가 더 강건하다는 결과를 제시했다.
| 모델 | Clean 정확도(%) | 공격 평균(%) | 자연 교란 평균(%) | GMAC |
|---|---|---|---|---|
| DeiT-S | 80.9 | 26.3 | 56.0 | 4.60 |
| FDT-S0.5 | 81.9 | 33.3 | 57.8 | 3.01 |
| FDT-S1.0 | 84.5 | 32.5 | 62.9 | 4.63 |
자료: STORIUM 정리
feature inversion 예시는 FDT의 재구성이 DeiT보다 객체 구조를 더 선명하게 보인다는 정성 비교다. 이 결과를 생물학적으로 충실한 시각 모형의 검증으로 읽어서는 안 된다. 실험 범위도 ImageNet100 계열 이미지 분류와 제시된 fixation budget에 한정되며, wall-clock latency와 다른 과제·데이터셋 일반화는 검증하지 않았다. 문서는 arXiv:2607.09480v1 [cs.CV] 사전출판본이다.
저작권자 © STORIUM 무단전재 및 재배포 금지











