복합 시각질의응답은 물체를 고르고, 위치 관계를 풀고, 속성을 확인하는 여러 추론을 이어 붙여야 한다. 이 연구는 GQA 계열 과제에서 VLM이 높은 전체 정확도를 보여도, 실패가 어떤 추론 연산에서 시작해 어떤 내부 경로로 퍼지는지는 별도로 봐야 한다고 문제를 제기한다. 이를 위해 연산 중심 기계적 분석 틀을 세우고, 시각적 근거의 강도와 정답 여부가 어떻게 엇갈리는지 살폈다.
분석은 네 가지 실패 양상을 구분한다. grounding failure, reasoning failure, attribute extraction failure, language prior dominance failure이다. 각 유형은 시각 정렬 강도와 정답성 사이의 관계가 다르게 나타났고, 그 차이를 통해 실패를 연산 단위로 분해할 수 있었다. 예를 들어 select는 grounding failure로 분류됐고, relate는 reasoning failure, verify와 query, exist는 attribute extraction failure, filter는 language prior dominance failure로 묶였다.

실험은 balanced training split에서 연산 유형별로 질문 500개씩, 총 3,500개 표본을 사용했다. 모델은 Qwen2.5-VL-3B-Instruct를 fp16 정밀도로 돌렸고, 모든 개입은 36개 transformer layer에 층별로 적용됐다. 각 샘플은 clean 1회와 개입 36회, 총 37회 forward pass를 거쳐 degradation curve를 만들었다. 이 결과를 바탕으로 grounding, attention knockout, MLP knockout의 효과를 비교했다.
정량 결과도 연산마다 달랐다. select의 평균 ablation 효과는 d=+0.75로, 시각적 grounding이 강할수록 정답 가능성이 높아졌다. 반대로 relate는 d=-0.17로 관계 추론에서 시각 정보 접근이 오히려 성능과 반대로 움직였다. verify는 d=+0.12로 뚜렷한 판별력이 없었고, language prior dominance 유형인 filter는 d=-0.01로 grounding과 정답의 연결이 거의 보이지 않았다. 논문은 이 차이를 내부 경로의 분기와 연결한다.
| 연산/실패 유형 | 정량 지표 | 개입·검증 단서 |
|---|---|---|
| select / grounding failure | acc=60.4%, mean ablation d=+0.75, MLP knockout d=-0.80 | p.7 | source_excerpt |
| relate / reasoning failure | acc=44.8%, mean ablation d=-0.17, attention knockout d=-0.32 | p.7 | source_excerpt |
| verify / attribute extraction failure | acc=86.4%, mean ablation d=+0.12, answer-position MLP knockout d=-0.71 | p.7 | source_excerpt |
| filter / language prior failure | acc=90.0%, mean ablation d=-0.01, MLP knockout d=-0.06 | p.7 | source_excerpt |
자료: STORIUM 정리
개입별로 보면 실패 경로가 더 선명해진다. grounding 실패는 feedforward network로만, reasoning 실패는 late-layer attention으로, attribute extraction 실패는 answer-position feedforward 계산으로만 주로 이어졌다. 예컨대 select의 MLP knockout은 d=-0.80, relate는 attention knockout에서 d=-0.32, verify는 answer-position MLP knockout에서 d=-0.71로 보고됐다. 저자들의 표현대로 이는 서로 다른 실패 유형에 서로 다른 교정 전략이 필요함을 시사한다. 이 결과는 arXiv 동료검토 전 프리프린트이며, cross-benchmark로는 VSR, cross-architecture로는 LLaVA-1.5-7B도 함께 살폈다.
저작권자 © STORIUM 무단전재 및 재배포 금지














