텍스트를 오디오로 바꾸는 모델은 소리의 질은 높아졌지만, 여러 사건이 한 클립에 들어가거나 시간 순서를 지켜야 할 때는 자주 어긋난다. 이 논문은 이런 약점이 전반적 유사도나 지각 품질 위주의 평가·학습 신호에서 비롯된다고 보고, 사건 존재와 시간 관계를 더 세밀하게 확인하는 틀을 제안한다.
핵심은 오디오를 이해하는 대형언어모델(ALLM)을 판정자로 쓰는 방식이다. 생성된 오디오가 목표 사건을 포함하는지, 그리고 사건들의 순서가 맞는지를 ALLM이 검증하고, 그 판단이 벤치마크와 사람 검증을 통해 타당한지 먼저 확인한 뒤 선호쌍을 만들어 직접 선호 최적화(DPO)에 활용한다. 이는 동료검토 전 arXiv 프리프린트 상태의 결과다.

검증 범위도 분명히 넓혔다. 기존 벤치마크들에 더해, 서사형 다중 사건 평가를 위한 S3Bench(Sound Scene Story Benchmark)를 새로 제시해 다중 사건과 시간 제약을 함께 다룬다. 논문은 이 벤치마크에서 더 표현적이고 조합적인 장면의 지시 따르기를 평가하도록 설계했다고 설명한다.
표 2의 사람 검증에서는 ALLM 판정이 오디오 생성물의 사건 존재와 시간 순서를 얼마나 잘 맞추는지 확인했다. 예를 들어 AudioCaps-test에서 Qwen2.5-Omni-7B는 사건 존재 EM 81.7, Micro 91.9, 시간 순서 EM 75.4, Pairwise 83.3, τ 0.67, Joint 51.8을 보였고, Audio Flamingo 3는 각각 42.7, 66.0, 80.0, 83.9, 0.68, 25.9였다. MultiEvent-Temporal-4에서는 Qwen2.5-Omni-7B가 70.9, 92.0, 81.2, 96.6, 0.93, 57.6이었고 Audio Flamingo 3는 25.7, 71.5, 61.5, 88.1, 0.76, 15.8로 나타났다.
학습 결과는 표 3과 표 4에서 제시된다. AudioCaps-test에서는 Ours가 사건 존재 EM 87.4, Micro 94.7, 시간 순서 EM 89.1, Pairwise 92.8, τ 0.86, Joint 71.0을 기록해 비교군인 TangoFlux-CRPO의 87.4, 94.7, 85.7, 90.7, 0.81, 67.4보다 시간 순서와 종합 지표가 높았다. 또 FAD 3.31, FD 20.07, KL 1.16, IS 11.54, CLAP 0.375로 오디오 품질 관련 공통 지표도 함께 제시됐다.
| 구분 | 수치/결과 | 근거 위치 |
|---|---|---|
| AudioCaps-test 사람 검증: Qwen2.5-Omni-7B / Audio Flamingo 3 | Qwen2.5-Omni-7B: EM 81.7, Micro 91.9, EM 75.4, Pairwise 83.3, τ 0.67, Joint 51.8; Audio Flamingo 3: EM 42.7, Micro 66.0, EM 80.0, Pairwise 83.9, τ 0.68, Joint 25.9 | p.4 | Table 2 |
| AudioCaps-test 성능: Ours / TangoFlux-CRPO | Ours: EM 87.4, Micro 94.7, EM 89.1, Pairwise 92.8, τ 0.86, Joint 71.0, FAD 3.31, FD 20.07, KL 1.16, IS 11.54, CLAP 0.375; TangoFlux-CRPO: EM 87.4, Micro 94.7, EM 85.7, Pairwise 90.7, τ 0.81, Joint 67.4, FAD 2.34, FD 20.23, KL 1.16, IS 11.96, CLAP 0.397 | p.6 | Table 3 |
| MultiEvent-Temporal-3 성능: Ours / TangoFlux-CRPO | Ours: EM 69.1, Micro 88.7, EM 79.6, Pairwise 92.9, τ 0.86, Joint 55.0; TangoFlux-CRPO: EM 61.4, Micro 85.8, EM 65.2, Pairwise 88.0, τ 0.76, Joint 40.0 | p.6 | Table 4 |
| S3Bench 성능: Ours / TangoFlux-CRPO | Ours: EM 59.2, Micro 83.2, EM 85.1, Pairwise 94.4, τ 0.89, Joint 49.9; TangoFlux-CRPO: EM 57.0, Micro 82.2, EM 80.6, Pairwise 92.3, τ 0.85, Joint 45.4 | p.6 | Table 4 |
자료: STORIUM 정리
다중 사건·서사형 평가에서도 같은 경향이 보였다. MultiEvent-Temporal-3에서 Ours는 사건 존재 EM 69.1, Micro 88.7, 시간 순서 EM 79.6, Pairwise 92.9, τ 0.86, Joint 55.0으로 TangoFlux-CRPO의 61.4, 85.8, 65.2, 88.0, 0.76, 40.0을 앞섰다. S3Bench에서도 Ours가 59.2, 83.2, 85.1, 94.4, 0.89, 49.9를 기록해, 이 프리프린트는 사건 완결성·순서 정확도·종합 지시 따르기 정확도를 함께 끌어올렸다고 주장한다.
저작권자 © STORIUM 무단전재 및 재배포 금지














