BrainChip 연구자가 혼합전문가 모델의 전문가 전환을 훈련 단계에서 줄이는 StickyMoE를 제안했다. 메모리가 제한된 장치에서는 연속 토큰이 다른 전문가를 선택할 때마다 가중치를 느린 저장장치에서 빠른 메모리로 옮겨야 한다. 연구는 추론 캐시를 사후 조정하는 대신 인접 토큰의 라우팅 확률이 급격히 달라지지 않도록 학습 손실에 일관성 항을 더했다.
StickyMoE는 표준 상위 k개 전문가 라우터의 구조를 바꾸지 않고 언어모델 교차엔트로피와 부하균형 손실에 연속 게이트 분포 사이의 제곱거리와 가중치 λ를 추가한다. 소프트 제약과 구간 앵커를 결합한 변형도 함께 시험했다.
평가는 GPT-2 토크나이저로 처리한 WikiText-2에서 소형·중형 4전문가 MoE를 처음부터 학습했다. 훈련 자료는 36,718개 문서, 2,347,038토큰이고 어휘는 50,257개다. 기준 모델, 강제 구간 라우팅, 사후 라우터 미세조정, 단순화한 Oracle-MoE를 비교했다.

| 중형 모델 | 전환율 | 캐시 적중률 | 혼란도 |
|---|---|---|---|
| 기준 | 0.71 | 0.54 | 274.65 |
| StickyMoE λ=0.5 | 0.29 | 0.88 | 272.31 |
중형 모델에서 λ=0.5를 적용하자 전환율은 0.71에서 0.29로 낮아지고 전문가 슬롯 2개의 모의 LRU 캐시 적중률은 0.54에서 0.88로 올랐다. 논문은 이를 캐시 미스 3.92배 감소로 계산했다. 소형과 중형에서 전환율 감소는 최대 59%였고 중형 혼란도는 약 0.9% 개선됐다.
이 수치는 실제 장치의 처리량, 전력 소비, 메모리 대역폭 또는 토큰 지연 측정값이 아니다. 첫 번째 층의 전환율은 λ=0.5에서도 0.49보다 높았고 모든 토큰 경계를 똑같이 벌점 주기 때문에 문장·주제 전환에 필요한 전문가 변경도 억제할 수 있다.
논문은 2026년 7월 공개된 동료검토 전 프리프린트다. 10억 매개변수 이상 모델과 실제 하드웨어에서 같은 효과가 유지되는지는 확인되지 않았다. 공개된 결과는 품질과 라우팅 지역성을 소형·중형 MoE의 모의 캐시에서 함께 측정한 초기 실험이다.
저작권자 © STORIUM 무단전재 및 재배포 금지














