멀티모달 감성분석에서는 언어, 음성, 시각 신호를 함께 다루면서도 각 모달리티의 단서를 해치지 않고 서로의 상호작용을 반영해야 한다. 2026년 7월 14일 공개된 arXiv 프리프린트는 이 두 목표가 보통 같은 융합 연산 안에서 뒤섞인다는 점에 주목해, 이를 구조적으로 나눈 SeRIn(Segregate, Refine, Integrate)을 제안한다.
이 방법은 융합 토큰을 모달리티별 경로로 분리하고, 각 경로가 자기 인코더 문맥에 맞춰 갱신되도록 한 뒤, 별도의 교차모달 경로가 이들의 진화를 읽어 모으도록 설계됐다. 핵심은 교차모달 정보가 초기에 섞여 들어가 단일 모달 표현을 오염시키지 않도록 하고, 완전한 상호작용은 최종 예측 단계로 미루는 데 있다.

실험은 중국어 벤치마크 CH-SIMS와 영어 벤치마크 CMU-MOSEI에서 진행됐다. 표 1에 따르면 SeRIn은 CH-SIMS에서 Acc2 84.30, F1 84.42, MAE 0.357, Corr 0.732, Acc3 71.77, Acc5 48.32를 기록했고, CMU-MOSEI에서는 Acc2 87.79, F1 87.78, MAE 0.493, Corr 0.810, Acc5 58.44, Acc7 56.52를 보였다. 비교군 DeepMLF의 수치는 CH-SIMS에서 Acc2 82.58, F1 82.77, MAE 0.363, Corr 0.713, Acc3 69.32, Acc5 44.29였고, CMU-MOSEI에서는 Acc2 86.77, F1 86.77, MAE 0.505, Corr 0.800, Acc5 57.48, Acc7 55.57였다.
연구진은 성능 향상이 단순히 파라미터 수 증가에서 나온 것이 아님을 보이기 위해 상호작용 토폴로지만 제거한 대조 실험도 제시했다. 계산 분석에서 SIMS 설정은 290 GFLOPs, 92M 파라미터, 평균 추론 시간 2.09 ± 0.64 ms/sample였고, DeepMLF는 243 GFLOPs와 42M 파라미터였다. MOSEI 설정에서는 SeRIn이 1702 GFLOPs, 183M 파라미터, 3.00 ± 0.76 ms/sample였고, DeepMLF는 1682 GFLOPs와 83M 파라미터였다. 논문은 추가 파라미터가 주로 MM Block과 Integration Head에 들어가며, 구조를 없앤 용량 맞춤 대조는 성능이 DeepMLF보다 낮아졌다고 적는다.
| 항목 | SeRIn | 비교/조건 |
|---|---|---|
| CH-SIMS 주요 지표 | Acc2 84.30, F1 84.42, MAE 0.357, Corr 0.732, Acc3 71.77, Acc5 48.32 | Table 1 |
| CMU-MOSEI 주요 지표 | Acc2 87.79, F1 87.78, MAE 0.493, Corr 0.810, Acc5 58.44, Acc7 56.52 | Table 1 |
| SIMS 계산 비용 | 290 GFLOPs, 92M parameters, 2.09 ± 0.64 ms/sample | Sec. 5.2 |
| MOSEI 계산 비용 | 1702 GFLOPs, 183M parameters, 3.00 ± 0.76 ms/sample | Sec. 5.2 |
| 훈련 설정 | GPT2-base(Ch-SIMS), GPT2-large(MOSEI); batch size 32; lr 1×10^-4; single NVIDIA A100 GPU | Sec. 5.1.3 |
자료: STORIUM 정리
게이트 분석도 포함됐다. 시각 정보가 손상된 조건에서 모달리티 재가중이 자발적으로 나타났으며, 별도 감독 없이도 경로별 중요도가 달라지는 양상이 관찰됐다. 모델은 고정된 언어모델 백본 위에 학습 가능한 융합 토큰과 내부 게이팅을 얹는 방식으로 구현됐고, CH-SIMS에는 Chinese GPT2-base, CMU-MOSEI에는 GPT2-large가 사용됐다. 논문 말미의 공개 코드는 GitHub의 SeRIn-MSA로 안내돼 있으나, 본문 기준으로는 동료검토 전 arXiv v1 프리프린트 상태다.
저작권자 © STORIUM 무단전재 및 재배포 금지














