임베디드 하드웨어에서 CNN을 더 효율적으로 돌리기 위해, 이 논문은 깊이(depth)·폭(width)·해상도(resolution)를 함께 줄이는 다차원 프루닝 프레임워크 TECO를 제안한다. 동료검토 전 arXiv 프리프린트 상태의 이 작업은, 단일 차원만 압축할 때 남는 중복을 줄이기 위해 차원 간 중요도를 함께 비교하는 방식을 핵심으로 삼는다.
우선 INES는 각 차원 내부에서 채널이나 레이어의 국소 중요도를 빠르게 추정하고, 각 차원에서 가장 덜 중요한 후보만 남긴다. 이후 ITES가 세 후보의 전역 중요도를 accuracy, MACs, on-device latency를 함께 반영한 지표로 다시 비교해 실제 제거 대상을 고른다. 지연 시간은 ResNet50을 여러 방식으로 줄여 샘플링한 뒤, MACs와 선형 관계를 갖는 차원별 모델로 추정해 평가 비용을 낮췄다.

실험은 ImageNet, CIFAR-10, 그리고 Jetson Nano·Jetson TX2·AGX Xavier 같은 엣지 플랫폼에서 수행됐다. ImageNet 표준 설정에서는 ResNet50을 120 epoch, SGD(momentum 0.9), batch size 1024, 초기 학습률 1.6, label smoothing 0.1로 학습했고, TECO-S는 1.05B MACs에서 top-1 73.07%, TECO-M은 2.24B MACs에서 75.68%, TECO-L은 2.87B MACs에서 76.34%를 기록했다.
비교군 대비 차이도 구체적이다. 저MAC 구간에서 TECO-S는 DECORE-4보다 top-1 정확도가 3.36%p 높았고 MACs는 약 12% 낮았다. GAL-1과 비교하면 정확도는 3.25%p 높고 MACs는 33.5% 줄었다. 온디바이스 지연에서는 Jetson TX2에서 HRank보다 정확도가 3.7%p 높았고, latency는 13.59 ms 대 13.12 ms로 비슷했다. Jetson Nano에서는 GAL 대비 정확도 1.12%p 향상, latency는 15.78 ms 대 31.56 ms였다.
CIFAR-10에서는 ResNet110을 baseline으로 200 epoch, batch size 128, 초기 학습률 0.1로 학습했다. TECO-Tiny는 108.60M MACs, 0.98M parameters, 2.94 ms latency, 93.94% top-1을 달성해, HRank-2의 79.30M MACs·3.49 ms·92.65%와 비교해 더 높은 정확도와 더 낮은 지연을 보였다. 저자들은 또한 ablation에서 INES와 ITES를 함께 쓸 때 pruning cost가 ITES 단독 대비 83.21% 줄었다고 보고했다.
| 구분 | 값 | 근거 |
|---|---|---|
| ImageNet TECO-S | 1.05B MACs, 73.07% Acc@1, 91.18% Acc@5 | Table I |
| ImageNet TECO-M | 2.24B MACs, 75.68% Acc@1, 92.79% Acc@5 | Table I |
| ImageNet TECO-L | 2.87B MACs, 76.34% Acc@1, 93.20% Acc@5 | Table I |
| CIFAR-10 TECO-Tiny | 108.60M MACs, 0.98M Params, 2.94 ms, 93.94% Acc@1 | Table II |
| Ablation: Ours (INES + ITES) | 2.24B MACs, 6.51 ms, 75.68% Acc@1, 30.12 hour cost | Table III |
자료: STORIUM 정리
해석 가능성 분석에서는 Grad-CAM으로 단일 차원 프루닝과 TECO를 비교했다. 단일 차원 방식은 입력의 일부 전경에만 주의를 두는 반면, TECO는 전경 전체를 더 넓게 활용하는 모습이 확인됐다고 설명한다. 같은 절차가 depth only, width only, resolution only 설정보다 더 나은 정확도-효율 균형을 만드는 근거로 제시됐다.
1차 출처: https://arxiv.org/abs/2607.11473
저작권자 © STORIUM 무단전재 및 재배포 금지














