
사전학습된 대형 언어모델을 그대로 가져와 계산량을 줄이는 방법이 다시 제안됐다. 이번 arXiv 프리프린트는 기존 가속 방식이 특정 과제 재조정이나 재학습에 의존해 적응 비용이 커진다는 문제를 짚고, 이를 덜기 위한 AdaDSF(Adaptive Depth Sparse Framework)를 제시한다. 핵심은 각 층의 입력·출력 은닉상태 사이 코사인 유사도를 근거로 층별 토큰 보존 비율을 정하고, 가벼운 라우터로 중요한 토큰만 선택하며, 희소 모델과 밀집 모델의 중간·최종 표현을 맞추는 정렬 목적함수를 더하는 방식이다.
논문은 Transformer 추론이 깊이에 선형, 시퀀스 길이에 제곱으로 비용이 늘어난다고 전제한다. AdaDSF는 이 구조를 바꾸지 않고도 off-the-shelf pre-trained LLM을 depth-sparse 모델로 전환하는 것을 목표로 한다. 방법 구성은 세 부분으로 나뉜다. similarity-driven layer-wise token retention, MLP 기반 token router를 둔 sparse module, 그리고 feature-preserving alignment training이다.
검증은 GPT-NeoX-130M과 Qwen2.5-0.5B, 1.5B에서 진행됐다. 과제는 Wikitext103 언어모델링과 ARC-Challenge, ARC-Easy, HellaSwag, PIQA, WinoGrande, OpenBookQA의 여섯 상식추론 벤치마크다. Qwen2.5는 GenQA, InfinityInstruct, OpenHermes2.5로 instruction tuning된 설정을 사용해 사전학습 자원이 없는 경우를 모사했다고 적었다.
GPT-NeoX-130M의 Wikitext103에서는 80% retention ratio에서 AdaDSF의 PPL이 18.9, dense baseline은 17.9였다. 같은 조건에서 MoD는 21.6, D-LLM은 2019.0, DLO는 19.6으로 보고됐다. FLOPs는 AdaDSF가 0.787×, dense는 1.000×였다. 70% retention ratio에서도 AdaDSF는 PPL 19.9와 0.680× FLOPs를 보였고, MoD는 24.0, D-LLM은 2078.0, DLO는 21.3이었다.
Qwen2.5 실험에서도 비슷한 경향이 나타났다. Qwen2.5-0.5B의 80% retention ratio에서 AdaDSF는 평균 정확도 49.1%, FLOPs 0.785×를 기록했고, MoD는 44.4%와 0.784×, DLO는 48.3%와 0.973×였다. Qwen2.5-1.5B에서는 AdaDSF가 평균 57.4%, FLOPs 0.901×로, MoD의 47.6%보다 높고 DLO의 56.6%보다 소폭 앞섰다. 논문은 같은 희소도에서 AdaDSF가 강한 기준선들보다 정확도 저하가 작다고 정리한다.
| 실험 설정 | 비교 대상 | 원문 수치 | 근거 위치 |
|---|---|---|---|
| GPT-NeoX-130M, Wikitext103, 80% retention ratio | AdaDSF / MoD / D-LLM / DLO / dense | PPL 18.9 / 21.6 / 2019.0 / 19.6 / 17.9, FLOPs 0.787× / 0.778× / 0.886× / 0.964× / 1.000× | p.9 Table 2 |
| Qwen2.5-0.5B, 80% retention ratio | AdaDSF / MoD / DLO | Avg 49.1% / 44.4% / 48.3%, FLOPs 0.785× / 0.784× / 0.973× | p.8 Table 1(a) |
| Qwen2.5-1.5B, 실험 표 | AdaDSF / MoD / DLO | Avg 57.4% / 47.6% / 56.6%, FLOPs 0.901× / 0.901× / 0.984× | p.8 Table 1(a) |
| 유사도 기반 배분 ablation, GPT-NeoX-AdaDSF | w/o τ / τ=0.25 / τ=0.1 / τ=0.05 | PPL 19.69 / 19.37 / 19.15 / 18.91 | p.9 Table 3 |
자료: STORIUM 정리
또한 유사도 기반 배분의 효과를 뗀 ablation에서 GPT-NeoX-AdaDSF의 PPL은 19.69였고, 온도 매개변수 τ를 조정해 18.91까지 낮아졌다. 손실 설계 비교에서는 causal loss의 20.14보다 제안 손실이 18.91로 더 낮았다. 저자들은 실험이 1.5B 파라미터까지에 한정됐다고 밝히며, 더 큰 7B+ 모델로의 확장을 향후 과제로 남겼다.
저작권자 © STORIUM 무단전재 및 재배포 금지














