8B 멀티모달 교사의 감정 인식 능력을 1B 미만 모델로 옮기는 Light-MER가 공개됐다. 글래스고대학교·산둥대학교 등이 참여한 연구는 음성·영상·텍스트 단서를 결합해 감정을 분류하고 설명하는 생성형 모델의 배포 비용을 줄이는 데 초점을 맞췄다. 논문은 2026년 7월 14일 arXiv에 제출된 v1 프리프린트로 동료평가 전 결과다.
Light-MER는 Qwen3-8B 교사를 고정하고 Qwen3-0.6B 학생을 학습한다. Sliced Wasserstein Distance로 교사와 학생의 은닉상태 분포를 맞추는 SWD-H를 적용한 뒤, 감정 정확도·간결성·정보 밀도·완전성·반복 억제를 함께 보상하는 M-GRPO로 출력 설명을 조정한다. 실제 배포 모델의 총 파라미터는 8억5493만 개다.

9개 데이터셋을 묶은 주 평가에서 오디오+텍스트 Light-MER의 평균은 66.40으로 8B AffectGPT의 65.07보다 1.33점 높았다. 별도 전체 모듈 평가에서는 SWD-H와 M-GRPO를 모두 적용한 평균이 74.61, M-GRPO를 뺀 경우 74.16, SWD-H를 뺀 경우 70.61이었다. 개선 폭은 데이터셋과 입력 모달리티에 따라 달랐다.
추론 프로파일링에서 교사는 90억 파라미터, 1만902.6 GFLOPs, 최대 메모리 20.04GB를 사용했다. M-GRPO 학생은 8억5493만 파라미터, 988.8 GFLOPs, 2.54GB로 측정됐다. 서술 생성 시간은 샘플당 6.138초에서 3.105초로 줄었지만, 생성 단어 수도 104.4개에서 70.8개로 감소해 속도 비교에는 출력 길이 차이가 섞여 있다.
| 모델 | 파라미터 | FLOPs | 최대 메모리 | 서술 생성 시간 |
|---|---|---|---|---|
| Qwen3-8B 교사 | 9.00B | 10,902.6G | 20.04GB | 6.138초/샘플 |
| 0.6B SWD-H 학생 | 854.93M | 988.8G | 2.54GB | 4.621초/샘플 |
| 0.6B M-GRPO 학생 | 854.93M | 988.8G | 2.54GB | 3.105초/샘플 |
자료: STORIUM 정리
결과는 연구진이 정한 9개 감정 데이터셋과 자동·모델 기반 평가에 국한된다. 실제 로봇이나 스마트폰에서의 지연시간, 전력 소비, 다양한 언어·문화권 감정 표현은 보고되지 않았다. 따라서 “1B 미만이면 충분하다”는 일반 결론보다, 특정 증류·보상 설계가 이 평가군에서 교사 성능을 유지하며 계산량을 줄였다는 범위로 읽어야 한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














