
음성학의 강제정렬은 발화·단어·음소 단위의 시간을 맞추는 핵심 절차지만, 기존 시스템은 소수 자원 언어 변종에 특화된 모델을 충분히 갖추지 못했다. 이 arXiv v1 프리프린트는 그 공백을 문제로 제기한다. 이 연구는 청두만다린을 사례로 삼아 텍스트 의존 정렬기와 텍스트 비의존 정렬기를 함께 학습하고, 표준만다린 기준선과의 차이를 전문가 주석 시험셋에서 확인했다.
학습에 쓴 핵심 자원은 약 17시간 분량의 청두만다린 음성 코퍼스와 맞춤형 G2P 사전이다. 마스터 데이터셋은 15명의 화자가 낭독한 15개 고품질 녹음으로 이루어졌고, 각 녹음은 0.6~1.7시간, 전체 길이는 약 17.7시간이며 샘플링 레이트는 24kHz였다. 사전은 마스터 데이터셋의 2876개 한자를 포괄하도록 구성됐고, Pypinyin과 DeepSeek-v3로 자동 주석을 단 뒤 전문가가 검토했다.
모델은 두 갈래로 짜였다. 텍스트 의존 방식인 Chengdu-MFA는 Montreal Forced Aligner 프레임워크를 활용한 GMM-HMM 음향 모델이고, 텍스트 비의존 방식인 Chengdu-FC는 사전학습 오디오 인코더를 프레임 분류로 미세조정한 구조다. Chengdu-FC는 Chengdu-MFA의 pseudo label을 학습 신호로 썼고, 학습은 AdamW, 가중치 감쇠 1×10^-4, 배치 크기 8, 단일 NVIDIA RTX 3090 GPU에서 10에폭 진행됐다. 처음 2에폭은 표준 손실, 이후에는 경계 근처 프레임에 가중치를 더 주는 손실을 적용했고, 학습률은 1×10^-5~3×10^-4, 경계 가중치 γ는 5~15, 반경 r은 0~2 범위에서 탐색했다.
평가는 전문가가 주석한 테스트셋에서 수행했다. 이 테스트셋은 마스터 데이터셋에서 10명의 화자로부터 50분을 뽑아 1인당 5분씩 구성한 것으로, 정답 경계와 모델 출력을 비교하는 기준이 됐다. 텍스트 의존 평가에서는 경계 위치의 절대 차이를, 텍스트 비의존 평가에서는 시간 허용치별 정밀도·재현율·F1·R-value를 보았다. 비교군은 표준만다린으로 학습된 MFA와 Charsiu-Mandarin-FC였다.
결과는 두 방식 모두에서 기준선을 앞섰다. Chengdu-MFA의 평균 음소 경계 차이는 22.3ms로 표준만다린 MFA보다 31.8% 줄었고, 평균 단어 경계 차이는 22.1ms로 26.6% 감소했다. Chengdu-FC-xlsr는 평균 단어 경계 차이 32.5ms, 평균 음소 경계 차이 30.2ms를 보여 Charsiu-Mandarin-FC보다 각각 62.3%, 61.2% 짧았다. 경계 차이 10/25/50/100ms 구간의 비율에서도 Chengdu-MFA는 음소 경계 기준으로 0.406/0.678/0.868/0.969를 기록했고, Chengdu-FC-xlsr는 0.429/0.669/0.822/0.942를 보였다. 텍스트 비의존 평가의 한 예로 τ=20ms에서 Chengdu-FC-large의 R-value는 0.500으로, 표준만다린 기준선보다 21.1% 높았다.
| 항목 | 값 | 근거 위치 |
|---|---|---|
| 마스터 데이터셋 | 15개 고품질 청두만다린 녹음, 15명 화자, 총 약 17.7시간, 24kHz | |
| 테스트셋 | 10명 화자에서 50분, 화자당 5분, 전문가 주석을 정답으로 사용 | |
| Chengdu-MFA | 평균 음소 경계 차이 22.3ms, 표준만다린 MFA 대비 31.8% 감소 | |
| Chengdu-FC-xlsr | 평균 음소 경계 차이 30.2ms, Charsiu-Mandarin-FC 대비 61.2% 감소 |
자료: STORIUM 정리
이 프리프린트가 제시하는 요지는 대규모 수작업 주석 없이도, G2P 사전→텍스트 의존 정렬기→pseudo label→텍스트 비의존 정렬기로 이어지는 부트스트래핑 절차를 통해 지역 변종용 정렬기를 실용적으로 구축할 수 있다는 점이다. 다만 실험은 청두만다린 하나의 사례와 17시간 규모의 자료, 그리고 전문가가 주석한 소규모 시험셋에 한정돼 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














