영상 요약은 핵심 장면을 골라내는 과정에서 전체 맥락을 잃기 쉽다. 2026년 7월 20일 공개된 프리프린트 ‘HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization’은 멀티모달 대규모 언어모델이 영상 전체를 연속적으로 보면서도 중요한 구간에 더 주의를 기울이도록 하는 HAS를 제안한다.
HAS는 먼저 영상 전반에서 연속적인 프레임 수준의 하이라이트 분포를 찾고, 이를 추론 단계의 어텐션 스티어링 벡터로 적용한다. 높은 점수의 프레임에는 더 큰 비중을 주되 낮은 점수의 프레임도 버리지 않는 방식이다. 모델 자체는 고정한 채 추론 시점에 개입한다는 점에서, 일부 키프레임만 남기는 하드 선택과 구별된다.

평가는 SumMe와 TVSum의 V2V 요약, VideoXum의 V2T·V2V·V2VT, VISTA의 장문 학술 영상 V2T 요약으로 진행됐다. SumMe에서 Kendall τ 0.304±0.02와 Spearman ρ 0.230±0.02, TVSum에서 τ 0.258±0.007과 ρ 0.196을 기록했다. VideoXum V2T에서는 BLEU-4 6.0±0.03, METEOR 12.7±0.3, ROUGE-L 26.7±0.3, CIDEr 28.0±0.8로 보고됐다.
VISTA 평균에서는 RLsum 23.94, BERTScore 82.05, VideoScore 2.03, FactVC 50.11을 기록했다. 같은 표의 완전 미세조정 모델인 mPLUG-Owl3와 Plan-mPLUG-Owl3는 여러 지표에서 더 높았으므로, HAS가 모든 조건의 절대 최고 성능을 달성했다는 뜻은 아니다. 이 연구의 핵심은 전체 영상을 유지하면서 하이라이트를 소프트한 주의도 안내로 사용한 데 있으며, 현재 결과는 동료평가 전 프리프린트에 근거한다.
논문 원문과 세부 실험 설정은 arXiv 논문 페이지에서 확인할 수 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














