필기 데바나가리 문자 인식에서 100만 개 남짓한 매개변수만으로 표준 벤치마크의 상단을 다시 쓴 결과가 나왔다. arXiv 프리프린트인 이 연구는 DHCD 46분류에서 1.11M 파라미터의 경량 합성곱 신경망을 제안해 99.73%를 기록했다고 보고한다. 이는 기존 최고 수준보다 15.6배 작은 규모다.
관심을 끄는 지점은 정확도 숫자 자체보다, 그 숫자 주변에서 벌어진 검증이다. 연구진은 DHCD의 홀드아웃 테스트 13,800장을 대상으로 여러 구성의 학생 모델과 교사 앙상블을 비교했는데, 모든 조합이 같은 11개 오류 바닥선에 묶였다고 적었다. exact McNemar 검정과 Wilson 신뢰구간을 적용해도 어느 설정도 통계적으로 분명한 우위를 보이지 않았다.

논문은 특히 99.7%대에서는 단순한 순위가 해석력을 잃는다고 본다. 본문에 따르면 최고 성능권의 여러 모델은 0.3%도 되지 않는 오분류 구간 안에 몰려 있었고, 1.11M 파라미터 학생은 17.32M 파라미터의 가까운 대형 기준선과도 동률 수준을 보였다. 교사 지식 증류가 없는 감독학습 설정에서도 McNemar p값은 0.701로 보고됐다.
범위를 DHCD 밖으로 넓히면 결과는 달라진다. 같은 10개 숫자 머리로 CMATERdb digits에 제로샷 적용했을 때 평균 정확도는 76.6%였고, 미세조정 후에는 97.8%까지 올랐다. 문헌은 또 손상 강건성 측정에서 평균 손상 정확도 75.7%를 보였다고 적으며, 대형 기준선의 38.7%보다 높다고 비교한다.
| 항목 | 값 | 근거 단서 |
|---|---|---|
| DHCD 46분류 주모델 | 1.11M parameters, 99.73% accuracy | p.1 abstract; p.6 Table 1 |
| 비교 기준선 | 17.32M parameters, 99.710% accuracy | p.6 Table 1; p.2 related work |
| 통계 비교 | McNemar p = 0.345 | p.1 abstract; p.6 Table 1 |
| DHCD 테스트 규모 | n = 13,800 | p.6 Table 1 |
| 교차영역 전이 | CMATERdb digits zero-shot 76.6%, fine-tuning 97.8% | p.1 abstract; p.8 source_excerpt |
자료: STORIUM 정리
효율성 면에서도 차이가 분명하다. 본문은 이 학생 모델이 기존 최상위 대비 CPU 지연시간이 9.5배 낮고, MAC 연산 수가 14.8배 적다고 밝힌다. 이 수치는 양자화나 가지치기 없이 얻은 값이며, 평가 프로토콜은 DHCD 테스트 분할에 대한 단일 순전파와 5개 시드 평균을 따른다. 코드와 산출물은 공개 저장소에 올라와 있지만, 여기서 확인되는 핵심 결론은 작게 만든 모델이 더 좋아졌다기보다, 이 벤치마크가 이미 포화에 가까워졌다는 점이다.
저작권자 © STORIUM 무단전재 및 재배포 금지











