
동형성(equivariance)을 갖는 네트워크는 가중치 공유를 통해 비전 과제에서 적은 파라미터로도 강한 성능을 낸다. 그러나 연산 효율까지 자동으로 따라오지는 않았다. 이 논문은 그 간극이 특히 EQ-Linear에서 두드러진다고 본다. EQ-Linear는 현대 동형성 구조에서 가장 기본적이고 자주 쓰이는 모듈이지만, 기존 구현은 구조화된 가중치를 밀집 행렬로 펼쳐 일반 dense 커널에 넘기기 때문에 FLOPs가 비동형성 선형층보다 작아지지 않는다.
연구진은 EQ-Linear를 그룹 차원에서는 순환합성곱, 채널 차원에서는 선형변환으로 해석한다. 이를 바탕으로 Flash EQ-Linear를 제안하고, 그룹별 discrete Fourier transform과 실수 DFT의 켤레대칭을 결합해 복잡도를 O(NDC)에서 O(NDC/T)로 낮춘다고 정리한다. 아울러 forward와 backward를 모두 지원하는 전용 CUDA 커널을 FP32와 FP16에 맞춰 마련했다.
성능 평가는 연산자 수준과 네트워크 수준으로 나뉜다. 연산자 수준에서 Flash EQ-Linear는 PyTorch의 F.linear 대비 forward 최대 2배 속도를 보였다. 표 1에 따르면 FP32에서 채널 수 64, 128, 256, 512, 1024, 2048의 forward latency(ms)는 Standard Linear가 0.11, 0.43, 1.52, 6.05, 24.48, 104.96이었고, Naive EQ-Linear는 0.11, 0.44, 1.54, 6.25, 25.16, 105.74였으며, Flash EQ-Linear는 0.07, 0.25, 0.79, 3.03, 11.92, 49.14였다. 같은 표에서 speedup/reduction은 최대 2.1배까지 제시된다.
역전파도 별도 표로 확인했다. 표 2의 FP32 backward latency(ms)는 채널 16, 32, 64, 128, 256, 512, 1024, 2048에서 Standard Linear가 0.17, 0.14, 0.16, 0.46, 1.67, 5.42, 20.80, 83.11, Naive EQ-Linear가 0.34, 0.33, 0.33, 0.53, 1.80, 5.68, 22.35, 89.34, Flash EQ-Linear가 0.14, 0.13, 0.13, 0.39, 1.29, 4.70, 17.79, 70.91이다. 표는 Naive 대비 최대 2.6배의 backward 속도를 보여준다. FP16에서도 같은 비교가 제시되지만, 카드에 나온 값만으로 보면 최대치는 2.6배가 아니라 표의 해당 구간별 수치에 따라 달라진다.
네트워크 수준 실험은 ImageNet-100에서 진행됐다. 표 3과 보조 표 20에서 Top-1 정확도, 파라미터 수, FLOPs, linear-layer latency, end-to-end latency, throughput을 함께 보고한다. 예를 들어 FP32에서 ViT-H는 ViT-H 81.3%, 631.1M 파라미터, 총 네트워크 FLOPs 254.7G, end-to-end latency 7.192ms였고, Flash EQ-ViT-H는 81.5%, 157.7M 파라미터, 100.1G, 4.304ms, 232 imgs/s였다. Swin-H에서도 Flash EQ-Swin-H는 88.3%, 164.0M 파라미터, 90.8G, 4.687ms, 213 imgs/s로 제시된다. 저자들은 이 결과가 정확도, 파라미터 효율, 추론 속도 세 축을 동시에 만족하는 첫 사례라고 주장하지만, 이는 동료검토 전 arXiv 프리프린트의 내부 비교 범위에 한정된 해석이다.
| 구분 | 비교 대상 | 원문 수치 | source_locator |
|---|---|---|---|
| FP32 forward latency, 채널 64→2048 | Standard Linear / Naive EQ-Linear / Flash EQ-Linear | 0.11, 0.43, 1.52, 6.05, 24.48, 104.96 / 0.11, 0.44, 1.54, 6.25, 25.16, 105.74 / 0.07, 0.25, 0.79, 3.03, 11.92, 49.14 ms | |
| FP32 backward latency, 채널 16→2048 | Standard Linear / Naive EQ-Linear / Flash EQ-Linear | 0.17, 0.14, 0.16, 0.46, 1.67, 5.42, 20.80, 83.11 / 0.34, 0.33, 0.33, 0.53, 1.80, 5.68, 22.35, 89.34 / 0.14, 0.13, 0.13, 0.39, 1.29, 4.70, 17.79, 70.91 ms | |
| ImageNet-100 inference, FP32 | ViT-H / Naive EQ-ViT-H / Flash EQ-ViT-H | 81.3% / 81.5% / 81.5%; 631.1M / 157.7M / 157.7M; 254.7G / 254.7G / 100.1G; 7.192 / 7.192 / 4.304 ms; 139 / 139 / 232 imgs/s | |
| Equivariance error, shape (32, 1024, 64, 4) | Standard Linear / Naive EQ-Linear / Flash EQ-Linear | Rel L2 1.4×10^100 / 1.4×10^−7 / 5.4×10^−8; NMSE 1.4×10^100 / 1.3×10^−7 / 4.0×10^−8; Max Abs 4.1×10^100 / 7.3×10^−7 / 3.2×10^−7; Mean Abs 6.5×10^−1 / 6.0×10^−8 / 1.9×10^−8; p99 Rel 6.4×10^1 / 7.5×10^−6 / 2.4×10^−6 |
자료: STORIUM 정리
정확성 검증도 포함됐다. 표 4에 따르면 shape (32, 1024, 64, 4)에서 FP32 equivariance error를 NMSE로 측정했고, Standard Linear는 Rel L2 1.4×10^100, NMSE 1.4×10^100, Max Abs 4.1×10^100, Mean Abs 6.5×10^−1, p99 Rel 6.4×10^1이었으며, Naive EQ-Linear는 각각 1.4×10^−7, 1.3×10^−7, 7.3×10^−7, 6.0×10^−8, 7.5×10^−6, Flash EQ-Linear는 5.4×10^−8, 4.0×10^−8, 3.2×10^−7, 1.9×10^−8, 2.4×10^−6이었다. 논문은 Flash EQ-Linear가 동형성을 정확히 보존하면서도 계산량과 지연을 줄였다고 정리한다.
저작권자 © STORIUM 무단전재 및 재배포 금지










