새로운 음성 생성기가 더 정교해질수록 딥페이크 음성 탐지기는 이전에 익힌 신호를 지키면서 새 데이터에 적응해야 한다. Enrico Gottardis, Mattia Tamiazzo, Simone Milani가 올린 arXiv 프리프린트는 이런 누적학습 상황에서 자주 나타나는 망각을 줄이기 위해, 판별기 본체를 고정한 채 입력 특징 공간만 되돌려 맞추는 ‘traceback translator’를 제안한다. 연구진은 먼저 ASVspoof 2019 학습 분할로 기준 모델을 학습했다. 입력은 128개 주파수 계수와 42프레임 시간창을 갖는 MFCC 스펙트로그램이며, 한 파일에서 여러 스펙트로그램을 추출한 뒤 다수결로 오디오 단위 판정을 냈다. 기준 구조는 맞춤형 ResNet18로, 첫 합성곱층을 고정하고 두 개의 완전연결층과 정규화, 드롭아웃으로 분류기를 구성했다.
핵심은 새 도메인에서만 학습하는 가벼운 번역 모듈이다. 이 모듈은 임베딩 뒤 128차원 잠재벡터를 입력받아 bottleneck 32를 거친 뒤 잔차 연결로 출력하며, CORAL 손실과 prototype consistency 손실을 함께 쓴다. 논문은 여기에 full retraining, BN층만 다시 학습하는 domain adaptation, 그리고 번역기 방식 domain translation을 비교했다.

평가에는 영어 ASVspoof 2019, FakeOrReal, In-The-Wild, 그리고 중국어 표본을 포함한 ADD 2022가 쓰였다. 표 2에 따르면 기준 모델은 ASV19에서 AUC 95.0%, EER 9.74%를 보였고, full retraining은 새 데이터에서 FoR AUC 99.7%, EER 3.27%, ITW AUC 100%, EER 0.28%, ADD22 AUC 100%, EER 0.78%를 냈지만 ASV19 성능은 괄호 안에서 각각 61.2%, 43.2%, 59.6%, 43.8%, 22.1%, 71.8%로 크게 떨어졌다.
번역기 방식은 새 데이터에서 FoR AUC 96.0%, EER 11.37%, ITW AUC 95.4%, EER 10.64%, ADD22 AUC 98.1%, EER 6.96%를 기록했다. 동시에 기존 ASV19 성능은 95.0% AUC, 9.74% EER로 유지됐다. 학습 파라미터 수는 표 3에서 full retraining 11095K, domain adaptation 10K, domain translation 21K로 제시됐다. 또 확산모델 기반 증강을 포함하면 ASVspoof 2019 학습 정확도는 81.9%에서 83.7%로, AUC는 91.5%에서 95.0%로 올랐다.
| 방법 | 새 데이터 성능 | 기존 데이터 성능 | 학습 파라미터 |
|---|---|---|---|
| Full retraining | FoR 99.7 AUC, 3.27 EER; ITW 100 AUC, 0.28 EER; ADD22 100 AUC, 0.78 EER | ASV19 61.2 AUC, 43.2 EER 등 괄호 값으로 제시 | 11095K |
| Domain adaptation | FoR 97.4 AUC, 8.26 EER; ITW 96.3 AUC, 9.15 EER; ADD22 99.3 AUC, 4.02 EER | ASV19 63.1 AUC, 40.7 EER 등 괄호 값으로 제시 | 10K |
| Domain translation | FoR 96.0 AUC, 11.37 EER; ITW 95.4 AUC, 10.64 EER; ADD22 98.1 AUC, 6.96 EER | ASV19 95.0 AUC, 9.74 EER 유지 | 21K |
| Baseline + diffusion augmentation | 정확도 81.9%→83.7%, AUC 91.5%→95.0% | ASVspoof 2019 학습 기준 내부 비교 | 해당 없음 |
자료: STORIUM 정리
이 논문은 심사 전 공개본이며, 결론에서는 더 많은 데이터셋으로 확장해 규모와 도메인 이동에 대한 견고성을 시험하겠다고 적었다. 현재로서는 고정 판별기에 작은 번역기를 더해 재학습 비용을 줄이면서 이전 지식을 보존하는 구성이, 음성 딥페이크의 연속 업데이트에 유효한지 실험적으로 보여준 사례로 읽힌다.
저작권자 © STORIUM 무단전재 및 재배포 금지














