• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

그룹 DFT로 EQ-Linear를 가속한 Flash EQ-Linear, p4 특수화와 ImageNet-100·ViT/Swin에서 지연을 줄이다

유지율 리포터 작성: 유지율 리포터
2026년 07월 26일 13시 15분
Reading Time: 3 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter
그룹 DFT로 EQ-Linear를 가속한 Flash EQ-Linear, p4 특수화와 ImageNet-100·ViT/Swin에서 지연을 줄이다 논문의 Figure 1
Figure 1. Figure 1: Illustration of the EQ-Linear. The weight matrix W is constructed by cyclically shifting and replicating a set of learnable parameters ˜ W = [ ˜ W0, ˜ W1, · · · , ˜ WT−1] along the group dimension. 출처: arXiv:2607.21271

동형성(equivariance)을 갖는 네트워크는 가중치 공유를 통해 비전 과제에서 적은 파라미터로도 강한 성능을 낸다. 그러나 연산 효율까지 자동으로 따라오지는 않았다. 이 논문은 그 간극이 특히 EQ-Linear에서 두드러진다고 본다. EQ-Linear는 현대 동형성 구조에서 가장 기본적이고 자주 쓰이는 모듈이지만, 기존 구현은 구조화된 가중치를 밀집 행렬로 펼쳐 일반 dense 커널에 넘기기 때문에 FLOPs가 비동형성 선형층보다 작아지지 않는다.

연구진은 EQ-Linear를 그룹 차원에서는 순환합성곱, 채널 차원에서는 선형변환으로 해석한다. 이를 바탕으로 Flash EQ-Linear를 제안하고, 그룹별 discrete Fourier transform과 실수 DFT의 켤레대칭을 결합해 복잡도를 O(NDC)에서 O(NDC/T)로 낮춘다고 정리한다. 아울러 forward와 backward를 모두 지원하는 전용 CUDA 커널을 FP32와 FP16에 맞춰 마련했다.

성능 평가는 연산자 수준과 네트워크 수준으로 나뉜다. 연산자 수준에서 Flash EQ-Linear는 PyTorch의 F.linear 대비 forward 최대 2배 속도를 보였다. 표 1에 따르면 FP32에서 채널 수 64, 128, 256, 512, 1024, 2048의 forward latency(ms)는 Standard Linear가 0.11, 0.43, 1.52, 6.05, 24.48, 104.96이었고, Naive EQ-Linear는 0.11, 0.44, 1.54, 6.25, 25.16, 105.74였으며, Flash EQ-Linear는 0.07, 0.25, 0.79, 3.03, 11.92, 49.14였다. 같은 표에서 speedup/reduction은 최대 2.1배까지 제시된다.

역전파도 별도 표로 확인했다. 표 2의 FP32 backward latency(ms)는 채널 16, 32, 64, 128, 256, 512, 1024, 2048에서 Standard Linear가 0.17, 0.14, 0.16, 0.46, 1.67, 5.42, 20.80, 83.11, Naive EQ-Linear가 0.34, 0.33, 0.33, 0.53, 1.80, 5.68, 22.35, 89.34, Flash EQ-Linear가 0.14, 0.13, 0.13, 0.39, 1.29, 4.70, 17.79, 70.91이다. 표는 Naive 대비 최대 2.6배의 backward 속도를 보여준다. FP16에서도 같은 비교가 제시되지만, 카드에 나온 값만으로 보면 최대치는 2.6배가 아니라 표의 해당 구간별 수치에 따라 달라진다.

네트워크 수준 실험은 ImageNet-100에서 진행됐다. 표 3과 보조 표 20에서 Top-1 정확도, 파라미터 수, FLOPs, linear-layer latency, end-to-end latency, throughput을 함께 보고한다. 예를 들어 FP32에서 ViT-H는 ViT-H 81.3%, 631.1M 파라미터, 총 네트워크 FLOPs 254.7G, end-to-end latency 7.192ms였고, Flash EQ-ViT-H는 81.5%, 157.7M 파라미터, 100.1G, 4.304ms, 232 imgs/s였다. Swin-H에서도 Flash EQ-Swin-H는 88.3%, 164.0M 파라미터, 90.8G, 4.687ms, 213 imgs/s로 제시된다. 저자들은 이 결과가 정확도, 파라미터 효율, 추론 속도 세 축을 동시에 만족하는 첫 사례라고 주장하지만, 이는 동료검토 전 arXiv 프리프린트의 내부 비교 범위에 한정된 해석이다.

구분 비교 대상 원문 수치 source_locator
FP32 forward latency, 채널 64→2048 Standard Linear / Naive EQ-Linear / Flash EQ-Linear 0.11, 0.43, 1.52, 6.05, 24.48, 104.96 / 0.11, 0.44, 1.54, 6.25, 25.16, 105.74 / 0.07, 0.25, 0.79, 3.03, 11.92, 49.14 ms
FP32 backward latency, 채널 16→2048 Standard Linear / Naive EQ-Linear / Flash EQ-Linear 0.17, 0.14, 0.16, 0.46, 1.67, 5.42, 20.80, 83.11 / 0.34, 0.33, 0.33, 0.53, 1.80, 5.68, 22.35, 89.34 / 0.14, 0.13, 0.13, 0.39, 1.29, 4.70, 17.79, 70.91 ms
ImageNet-100 inference, FP32 ViT-H / Naive EQ-ViT-H / Flash EQ-ViT-H 81.3% / 81.5% / 81.5%; 631.1M / 157.7M / 157.7M; 254.7G / 254.7G / 100.1G; 7.192 / 7.192 / 4.304 ms; 139 / 139 / 232 imgs/s
Equivariance error, shape (32, 1024, 64, 4) Standard Linear / Naive EQ-Linear / Flash EQ-Linear Rel L2 1.4×10^100 / 1.4×10^−7 / 5.4×10^−8; NMSE 1.4×10^100 / 1.3×10^−7 / 4.0×10^−8; Max Abs 4.1×10^100 / 7.3×10^−7 / 3.2×10^−7; Mean Abs 6.5×10^−1 / 6.0×10^−8 / 1.9×10^−8; p99 Rel 6.4×10^1 / 7.5×10^−6 / 2.4×10^−6

자료: STORIUM 정리

정확성 검증도 포함됐다. 표 4에 따르면 shape (32, 1024, 64, 4)에서 FP32 equivariance error를 NMSE로 측정했고, Standard Linear는 Rel L2 1.4×10^100, NMSE 1.4×10^100, Max Abs 4.1×10^100, Mean Abs 6.5×10^−1, p99 Rel 6.4×10^1이었으며, Naive EQ-Linear는 각각 1.4×10^−7, 1.3×10^−7, 7.3×10^−7, 6.0×10^−8, 7.5×10^−6, Flash EQ-Linear는 5.4×10^−8, 4.0×10^−8, 3.2×10^−7, 1.9×10^−8, 2.4×10^−6이었다. 논문은 Flash EQ-Linear가 동형성을 정확히 보존하면서도 계산량과 지연을 줄였다고 정리한다.

저작권자 © STORIUM 무단전재 및 재배포 금지

Tags: CUDA 커널ImageNet-100그룹 DFT동형성 네트워크추론 지연
유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

표시할 내용이 없습니다
Next Post
상하이교통대학교 구성원들의 교내 교육 활동 현장

17시간 청두만다린 자료로 맞춘 음성 강제정렬기, 표준만다린 기준선과의 검증 결과

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.