시각언어모델이 이미지를 읽은 뒤 답을 만드는 동안 시각 근거는 모든 층에서 같은 방식으로 유지되지 않는다. 동제대·홍콩이공대·상하이교통대 연구진은 답변 토큰이 질문을 돌아보는 주의와 이미지 토큰끼리 주고받는 주의를 층별로 추적해, 초기 질문 중심 정리·중간 시각 통합·후기 언어 답변 형성의 세 단계가 반복된다고 보고했다. 연구진은 가운데 구간을 시각 릴레이 창(VRW)으로 정의했다.
VRW는 답변→질문 주의와 이미지→이미지 주의를 샘플별로 0~1 정규화한 뒤 두 값의 차이가 중간층에서 정점에 가까운 연속 구간으로 추정한다. 기본 탐색 범위는 전체 깊이의 20~80%, 허용 오차는 0.1이다. 10개 공개 VLM과 시각 질의 2,000개를 조사하자 세 단계 순서는 유지됐지만, 세부 지각·계수처럼 근거 수집이 많은 과제는 창이 넓고 늦게 끝났고 고수준 추론은 더 일찍 언어 처리로 넘어갔다.

이 구간의 기능성은 Qwen3-VL-4B와 HaloQuest에서 확인했다. 이미지·질문 200쌍마다 온도 1.0으로 답변 5개를 샘플링해 근거 있는 답과 비근거 답을 짝지은 뒤, 두 답이 갈라진 시점부터 시각 토큰 잔차 활성값을 교체했다. 추정 VRW를 패치하면 비근거 답의 41.4%가 근거 있는 답으로 회복됐지만, VRW 이전 전체 구간은 8.7%, 이후는 11.2%, 같은 폭을 옮긴 창의 평균은 27.6±3.3%였다.
TRACE는 이 관찰을 추론 시점 제어로 옮긴다. 2층 MLP가 프리필 주의 통계로 층별 릴레이 점수를 예측하고, 스케줄러가 질문 관련성이 높은 상위 30% 시각 토큰의 이미지 간 주의를 과제에 맞춰 강화하거나 축소한다. 릴레이가 끝난 뒤에는 예측 엔트로피가 높을수록 선택한 시각 토큰을 더 강하게 참조하도록 감쇠형 편향을 준다. 기본 VLM은 동결하고 예측기 2,000쌍, 전체 모듈 FineVision 2만 샘플로 각각 학습했다.
평가는 Qwen3-VL 4B·8B와 InternVL3.5 4B·8B, 7개 벤치마크에서 탐욕 디코딩으로 진행했다. 네 모델의 HallusionBench·VlmsAreBlind·CountBench 평균은 기본 추론보다 4.33점 높았고, 최대 상승은 InternVL3.5-8B의 HallusionBench 54.5점에서 61.1점으로 오른 6.6점이었다. 28개 모델·벤치마크 조합 전체 평균 상승은 2.98점, MathVista 네 모델 평균은 3.05점이었다. 학습 가능한 제어기는 모델에 따라 19만9244개 또는 29만7548개 파라미터다.
| 항목 | 논문 결과·조건 | 원문 근거 |
|---|---|---|
| VRW 인과 패치 회복률 | 추정 VRW 41.4%; 이전 8.7%; 이후 11.2% | Sec. 3.5, Table 2, PDF p.6 |
| 평가 범위 | 공개 VLM 4종, 벤치마크 7종, greedy·temperature 0 | Sec. 4.1, PDF p.9 |
| 근거 민감 과제 평균 | 기본 추론 대비 +4.33점 | Sec. 4.2, Table 4, PDF pp.9–10 |
| 최대 단일 상승 | InternVL3.5-8B HallusionBench 54.5→61.1, +6.6점 | Table 4, PDF p.10 |
| 학습 규모·자원 | VRW 2,000쌍; FineVision 20,000개; RTX 5090 4장·약 8시간 | Sec. 4.1, PDF p.9 |
자료: STORIUM 정리
결과는 동료검토 전 arXiv v1 프리프린트의 단일 이미지 설정에 한정된다. VRW 자체가 주의 기반 대리 지표이며, 인과 패치는 한 모델과 제한된 샘플링 조건에서 수행됐다. 네 공개 백본과 지정된 벤치마크 밖의 폐쇄형 모델, 다중 이미지·영상, 긴 생성에서 같은 경계가 유지되는지는 확인되지 않았다. 제어 강도를 높일수록 항상 좋아지지도 않아, 시각 앵커 손실 가중치 0.20은 앵커 강도를 키웠지만 기본값 0.05보다 네 과제 평균이 낮았다.
1차 출처: https://arxiv.org/abs/2607.11436
저작권자 © STORIUM 무단전재 및 재배포 금지














