벵골어 Moonshine-Base의 토큰 fertility를 9.16에서 1.30으로 낮추자 autoregressive sequence length가 85.8% 줄고 decoding instability가 해소됐다는 결과가 나왔다. 핵심 변경은 영어 중심 byte-level 토크나이저를 BUET BanglaBERT WordPiece로 교체하는 Tokenizer Transplantation이다. 논문은 형태론적으로 풍부한 비라틴 문자 언어가 긴 byte chain으로 분절되는 현상을 catastrophic autoregressive collapse의 원인으로 지목했다.

학습 순서는 기존 모델의 적응을 보존하도록 짰다. 882-hour Lipi-Ghor dataset에서 Moonshine-Base를 21 epoch 미세조정한 뒤 디코더 어휘와 임베딩 행렬을 바꿨고, 7 epoch 동안 학습률 2×10^-4로 복원한 다음 2×10^-5로 안정화했다. 오디오는 16kHz mono로 정규화하고 VAD로 무음·비발화 구간을 제거했다. 학습 중에는 무작위 64-sample validation subset에 beam width 4와 repetition penalty 1.2를 적용해 Greedy WER를 모니터링했다.
5% held-out Lipi-Ghor test set 5,931 utterances에서 제안 모델은 WER 21.54%, CER 10.79%를 기록했다. 표의 비교 모델 가운데 CER은 가장 낮았지만 WER은 Faster Whisper Medium의 21.28%보다 약간 높았다. Seamless M4T-v2, Whisper large-v3, Meta MMS 1B, Hishab TITU Conformer Large, Conformer Baseline도 같은 표에 포함됐다.
| 항목 | 모델 | 값 | 평가 기준 |
|---|---|---|---|
| 토큰 fertility | Original Moonshine | 9.16 | PDF Table 1 |
| 토큰 fertility | Transplanted Bengali (BUET) | 1.30 | PDF Table 1 |
| WER | Moonshine Base+이식 토크나이저 | 21.54% | Lipi-Ghor 5% held-out |
| CER | Moonshine Base+이식 토크나이저 | 10.79% | Lipi-Ghor 5% held-out |
| RTF | Moonshine Base+이식 토크나이저 | 0.0053 | 22-hour hidden test |
| RTF | Whisper-Medium | 0.0190 | 22-hour hidden test |
| RTF | Hishab-Titu Conformer | 0.0120 | 22-hour hidden test |
자료: STORIUM 정리
속도 평가는 별도의 DL Sprint 4.0 Bengali ASR competition 22-hour hidden test set에서 이뤄졌다. transplanted BanglaBERT tokenizer를 쓴 Moonshine-Base의 RTF는 0.0053이었고 Whisper-Medium 0.0190, Hishab-Titu Conformer 0.0120, vanilla Moonshine-tiny 0.0038과 비교됐다. 61.5M parameters 모델이 약 769M parameters의 Faster Whisper Medium에 근접한 효율·성능 균형을 보였다는 것이 논문의 해석이다. 수치와 붕괴 완화는 이 벵골어 파이프라인 안의 결과이며 다른 언어·데이터·모델로 일반화되지는 않았다. 문서는 arXiv:2607.09598v1이며, PDF에는 서울에서 열린 제43회 ICML의 PMLR 306 수록 논문(2026)으로 명시돼 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














