온라인 필기 인식은 펜 끝 좌표의 시계열을 입력으로 다룬다. Kyushu University 연구진은 이 특성을 겨냥해, 이미지 분류에 쓰이던 가산형 교란 대신 시간축을 편집하는 적대적 공격을 제안했다. 논문 arXiv:2607.12500v1 [cs.LG]는 2026년 7월 14일 공개됐으며, 제목은 “Adversarial Attacks on Online Handwriting using Salience-based Temporal Editing”이다.
제안한 AITE(Adversarial Iterative Temporal Editing)는 입력 시계열에서 매 반복마다 한 점을 삽입하고 한 점을 삭제해 길이를 유지한다. 편집 위치는 Gradient-weighted Class Activation Maps(Grad-CAM)으로 추정한 temporal salience를 바탕으로 정한다. 원래 클래스 판정에 강하게 기여한 시점을 우선적으로 건드려, 형태와 매끄러움을 가능한 한 보존한 채 오분류를 유도하는 방식이다.

평가는 Unipen과 CASIA-OLHWDB 1.1에서 이뤄졌다. Unipen은 1A/1B/1C 세 하위 집합을 사용했고 각 시퀀스를 T=50으로 정규화했다. 1A는 11,650 train / 1,300 test, 1B와 1C는 각각 11,063 train / 1,235 test였다. CASIA-OLHWDB 1.1은 3,755 클래스와 300 writers로 구성되며, 테스트 분할은 224,559 samples였다. CASIA는 stroke-end와 character-end sentinel을 제거한 뒤 좌표를 [-1,1]로 정규화하고, 원래 variable length를 유지했다. 모든 모델은 Adam, initial learning rate 10^-3, 10,000 training iterations로 학습했다.
비교군은 FGSM, BIM, PGD, CW와 전이 지향 기법인 MI-FGSM, NI-FGSM, 1D-TI-MI-FGSM이었다. 화이트박스에서는 BIM, PGD, CW가 대체로 정확도를 크게 낮췄고, CW는 Unipen에서 0.69%~5.96%, CASIA에서 0.71%까지 떨어뜨렸다. 그러나 이런 결과는 블랙박스 전이로 잘 이어지지 않았다. 예를 들어 Transformer 대상에서 CW의 정확도는 모든 데이터셋에서 93%를 넘었다.
AITE는 one-shot black-box에서 더 강한 전이를 보였다. CASIA에서는 1D CNN-4, BLSTM-2, Transformer 정확도를 각각 52.5%, 53.6%, 47.9%로 낮췄고, Unipen에서는 1A 58.2%~70.2%, 1B 60.3%~65.0%, 1C 59.7%~70.5%였다. 시각적 유사성 평가에서는 온라인 필기 샘플을 64×64 회색조 이미지로 렌더링해 L2와 SSIM을 비교했으며, AITE의 SSIM은 Unipen 1A/1B/1C에서 0.746/0.808/0.809, CASIA에서 0.618이었다. 반면 CASIA의 CW는 SSIM 0.812로 가장 높았다.
| 구분 | 값 | 원문 위치 |
|---|---|---|
| Unipen 1A | 11,650 train / 1,300 test, T=50 | Section 5.1 |
| Unipen 1B | 11,063 train / 1,235 test, T=50 | Section 5.1 |
| Unipen 1C | 11,063 train / 1,235 test, T=50 | Section 5.1 |
| CASIA-OLHWDB 1.1 | 3,755 classes, 300 writers, test 224,559 samples | Section 5.1 |
| CASIA black-box target CNN | clean test accuracy 94.8% | Section 5.2 |
자료: STORIUM 정리
논문은 gradient 기반 선택보다 salience 기반 선택이 temporal editing에 더 적합하다고 해석했다. 또 일부 샘플은 삽입 한 번과 삭제 한 번, 즉 한 번의 반복만으로도 분류가 바뀌었다. 결론에서 실험에서는 이 접근이 문자 수준의 온라인 필기 인식에서 시간축 구조를 고려한 위협 모델이 될 수 있다고 보았고, 향후 word-와 sentence-level 확장, 인간 평가, 방어 기법 검토가 필요하다고 적었다.
저작권자 © STORIUM 무단전재 및 재배포 금지














