
오디오 캡션이 한 문장 요약에서 벗어나 태그, 설명, 수치, 추론, 스펙트럼처럼 분리된 형식으로 확장되면서, 평가 방식의 공백도 함께 커졌다. arXiv v1 프리프린트로 공개된 이 논문은 그런 구조화 오디오 설명을 위해 다축 평가 프레임워크를 제안한다. 핵심은 서로 다른 데이터 형식을 하나의 점수 체계에 넣되, 각 축에는 별도의 평가 규칙을 두는 데 있다.
검증 범위는 AudioCards 데이터셋을 바탕으로 한 499개 클립, 57개 UCS 범주, 136개 하위범주다. 여기에 저자들은 클립별로 네 가지 음향 측정값을 계산해 보강했다. 통합 음량은 LUFS, 피치가 있는 343개 클립의 중간 기본주파수, 활성 사건 구간, 그리고 10개 대역의 주파수 프로필이다. 이렇게 만들어진 15개 필드를 태그셋, 설명, 추론, 수치, 스펙트럼의 다섯 유형으로 나눠 각각 다른 지표로 평가했다.
텍스트 성격의 필드에는 LLM-as-a-judge를 쓰고, 수치와 음향 측정에는 결정적 계산 지표를 적용했다. 문장형 캡션과 추론 필드는 전체 예측 목록과 참조 목록을 함께 넣어 정확성, 관련성, 완전성, 명료성의 네 기준을 각각 0~1로 채점한 뒤 평균을 낸다. 길이 제약이 있는 두 캡션에는 단어 수 보정 계수를 추가했다. 수치형 필드는 σ-정규화로 0~1 범위에 맞췄고, LUFS와 중간 기본주파수의 강건 분산은 전체 데이터셋의 median absolute deviation(MAD)으로 σ=6.86(lufs), σ=14.97(median f0).
프레임워크의 신뢰성은 통제 교란 실험으로 따졌다. 태그셋, 설명, 추론, 수치, 스펙트럼별로 오류 유형과 심각도를 단계적으로 주입해 점수가 단조롭게 악화하는지 본 것이다. 저자들은 텍스트 교란 생성에 Meta-Llama-3-70B-Instruct를 사용했고, 캡션·추론 평가에서는 BLEU-1, ROUGE-L, METEOR, FENSE 같은 전통적 지표와 비교했다. 결과적으로 LLM 판정은 의미를 보존하는 패러프레이즈와 실제 오염을 구분하는 데 더 적합한 경향을 보였고, 수치·스펙트럼 필드는 단순 정확도보다 세분된 오차 반영이 가능했다.
| 평가 가족 | 대상 필드/지표 | 원문 수치·범위 |
|---|---|---|
| Tag-set | nouns, verbs, noun_verb_pairs, adjectives, complementary_sounds | 평균 태그 개수: nouns 4.1, verbs 2.7, noun_verb_pairs 2.9, adjectives 4.3, complementary_sounds 4.4 |
| Description | caption_in_3_words, caption_in_7_words_or_less, descriptive_caption | 평균 단어 수: 3.2, 5.6, 19.0 |
| Numeric | lufs, median_f0, active_event | lufs -51.5 to -7.7 dBFS; median_f0 72.4–132.4 semitones; active_event=list of (onset, offset) spans |
| Spectral | frequency_profile | 10 bands, 4 ordinal levels; 125–10000 Hz |
자료: STORIUM 정리
추가로 이 평가는 한 모델에 묶이지 않는지 확인했다. Qwen2.5-0.5B-Instruct, Qwen3-4B-Instruct, Meta-Llama-3-8B를 포함한 다른 지시튜닝 모델에 동일한 평가 프롬프트를 적용하고, 100개 카드에 대해 단일 NVIDIA L40S GPU에서 추론 시간, 피크 메모리, 에너지 소비를 측정했다. 표 3에 따르면 Qwen2.5-0.5B는 0.86초/카드, 175J/카드, 1.55GB였고, Qwen2.5-7B는 1.31초/카드, 415J/카드, 17.35GB였다. 상위 모델들 사이에는 상관이 높았지만, 0.5B 모델은 상관이 낮아 신뢰성이 떨어졌다.
저작권자 © STORIUM 무단전재 및 재배포 금지










