위험운전 장면을 알아채고 그 상황에 맞는 감정적 응답까지 건네는 비전-언어 보조체계가 제안됐다. arXiv 프리프린트인 이 논문은 Keep Yelling Assistant(KYA)를 통해, 급끼어들기 같은 고위험 조작을 실시간으로 잡아내고 운전자 선호에 맞는 말투의 반응을 생성하는 흐름을 설계했다. 핵심은 감지와 반응을 분리하되 서로 연결하는 데 있다.
구조는 두 모듈로 나뉜다. 시각 모듈은 YOLOv8 계열을 써서 주변 차량과 위험 행동을 찾고, 상대 거리·속도·도달 예상 시간 같은 지표를 추출해 정규화한 뒤 구조화된 행동 로그를 만든다. 언어 모듈은 이 로그를 입력으로 받아 neutral, humorous, analytical 같은 감정 톤 설정에 따라 반응 문장을 생성하며, ChatGPT-4o, Claude 3, Gemini 2.5, Copilot이 여기에 쓰였다.

검증은 실제 대시캠 영상과 사용자 조사로 진행됐다. 연구진은 급끼어들기 관련 검색어로 고른 20개 영상을 사용했고, 총 5,019프레임과 그중 1,189개의 고위험 프레임을 확보했다고 적었다. 참가자 108명(남성 53명, 여성 55명)의 선호를 모아 언어 반응 스타일을 비교했으며, 모델 평가는 감정적 정합성을 기준으로 이뤄졌다.
시각 검출 성능에서는 YOLOv8l이 가장 높은 재현율 0.869, F1 0.921, mAP@0.5 0.998을 기록했고 ID switch는 1로 가장 낮았다. 평균 IoU도 0.988로 제시됐다. 반면 YOLOv8n과 YOLOv8s는 재현율 0.737과 0.762, MOTA 0.715와 0.745로 더 낮았지만, 정밀도는 각각 0.979와 0.9822로 높았고 ID switch도 3과 2에 그쳐 실시간 배치 가능성을 시사했다.
| 구성 요소 | 원문 수치/설정 | 근거 위치 |
|---|---|---|
| 데이터 규모 | 20개 영상, 5,019프레임, 1,189개 고위험 프레임 | p.7, p.10 |
| 시각 모듈 성능 최상 조합 | YOLOv8l: recall 0.869, F1 0.921, mAP@0.5 0.998, ID switches 1, Avg. IoU 0.988 | p.8~p.9, Table 1 |
| 경량 모델 성능 | YOLOv8n: precision 0.979, recall 0.737, F1 0.841, mAP@0.5 0.985, ID switches 3, MOTA 0.715 / YOLOv8s: precision 0.982, recall 0.762, F1 0.858, mAP@0.5 0.991, ID switches 1, MOTA 0.745 | p.9, Table 1 |
| 사용자 평가 | 108명(남성 53명, 여성 55명), 5점 리커트 포함 | p.7~p.8 |
| 최고 감정 정합성 점수 | YOLOv8s + ChatGPT-4o, 4.29/5.00 | p.2 |
자료: STORIUM 정리
감정 반응 평가에서는 네 개 언어모델이 모두 좋은 평을 받았고, 개인 성향에 따라 선호가 달라졌다. 그중 YOLOv8s와 ChatGPT-4o 조합이 5점 만점에 4.29로 가장 높은 점수를 얻었다. 본문은 또 차선 급변경, 추돌 유발, 과속 같은 위험운전이 인간 운전자에게 분노나 불안 같은 강한 정서를 일으킨다고 설명하며, 단순 경고를 넘어 감정까지 고려한 차량 내 AI를 목표로 삼고 있다.
저작권자 © STORIUM 무단전재 및 재배포 금지














