• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

버스 CCTV와 VLM을 결합해 승객 결제 행위를 분석하는 GHR-VLM의 제로샷 파이프라인

유지율 리포터 작성: 유지율 리포터
2026년 07월 17일 07시 00분
Reading Time: 1 min read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

대중교통 기관은 혼잡 관리, 서비스 계획, 수익 감사, 승객 경험 평가에 필요한 세밀한 운영 데이터를 요구하지만, 기존 승객 계수기나 요금 기록만으로는 정차와 개별 승객 행동을 함께 복원하기 어렵다. Rensselaer Polytechnic Institute 소속 연구진이 제시한 GHR-VLM은 이런 공백을 메우기 위해, 버스 내부 감시 영상을 먼저 정차 구간과 승객 단위 증거로 압축한 뒤 시각-언어 모델이 그 위에서만 추론하도록 설계했다. 이 논문은 2026년 7월 15일 공개된 arXiv 프리프린트로, 결제 전용 학습 데이터 없이 승객 수준의 결제 분석을 겨냥한다.

버스 영상 분석에서 모델 기반·VLM 기반·grounded hybrid 방법을 비교한 GHR-VLM 개요
버스 영상 분석에서 모델 기반·VLM 기반·grounded hybrid 방법을 비교한 GHR-VLM 개요. 출처: arXiv:2607.13569

핵심은 긴 영상을 한 번에 묻지 않고, 문이 열리고 닫히는 상태를 기준으로 정차 구간을 가려낸 다음 탑승객 후보만 잘라내는 계층적 구조다. 경량 엣지 모듈이 문 영역에서 정차 구간을 가려낸 뒤, 해당 구간에서 승객 추적과 시간 분할을 수행한다. 이후 백엔드 VLM은 먼저 승하차 방향을 판별하고, 탑승자로 남은 클립에 대해서만 결제 방식을 분류한다. 연구진은 이 과정을 visual grounding과 hybrid reasoning의 결합으로 설명하며, 긴 영상에서 VLM이 놓치기 쉬운 위치 단서를 먼저 압축해 주는 점을 강조한다.

방법은 세 단계로 구체화된다. 먼저 문 상태 변화를 10초 겹침 창에서 판단해 정차 구간을 만들고, 그 안에서 16프레임 단위로 승객을 추적한다. 다음으로 “front, side, back, inside” 같은 일반적인 시각 방향 판단을 VLM에 맡긴 뒤, 이를 탑승·하차·잔류로 매핑하는 Complex-to-Simple 방식으로 승객 방향을 정한다. 마지막으로 선택된 탑승 클립에서는 요금 상자 영역을 기준으로 두 단계의 coarse-to-fine 재검증을 수행한다. 1단계는 16프레임 접촉 시트로 전체 클립을 훑고, VLM이 근거로 삼은 프레임 집합을 함께 내놓게 하며, 2단계는 그 근거 구간을 다시 촘촘히 샘플링해 최종 결제 라벨을 정한다.

실험은 1280×720 해상도, 10 FPS의 실제 버스 감시 영상 436분으로 수행됐고, 정차 구간과 승객 클립에는 수작업으로 결제 라벨이 붙었다. 장비는 메모리 24GB의 NVIDIA RTX 4090 1대로, 행동 분류에는 GPT-4o, 결제 분류에는 GPT-5.4-mini를 사용했다. 평가용 영상은 C3_1이 주간 8시~14시, C3_3이 18시~21시 촬영본이며, C3_3은 밤 장면이 전체의 거의 절반을 차지한다. 엣지 모듈의 경우 1차 결과는 정차 수와 승객 클립 수를 과잉 예측했지만 재필터링과 병합을 거치며 실제 개수에 가까워졌다. 정차 F1은 C3_1에서 0.767에서 0.887로, C3_3에서 0.708에서 0.898로 올랐고, 승객 클립 F1은 각각 0.647에서 0.702, 0.753에서 0.847로 상승했다.

핵심 수치
데이터셋실제 버스 감시 영상 2개 기록(C3_1, C3_3) · 총 436분, 1280×720, 10 FPS
엣지 모듈 평가Round 1 → Round 2, temporal IoU ≥ 0.2 · C3_1 정차 F1 0.767→0.887, 승객 클립 F1 0.647→0.702; C3_3 정차 F1 0.708→0.898, 승객 클립 F1 0.753→0.847
결제 분류Stage 1 → Stage 2 · C3_1 5개 클래스 정확도 0.349→0.313, Evade/Non-Evade 정확도 0.813→0.783; C3_3 5개 클래스 정확도 0.485→0.536, Evade 재현율 0.559→0.647
자료: STORIUM 정리

결제 분류는 영상 품질에 따라 차이가 컸다. C3_1에서는 5개 클래스 정확도가 0.349에서 0.313으로 떨어졌고, 이진 Evade/Non-Evade 정확도도 0.813에서 0.783으로 감소했다. 반면 C3_3에서는 5개 클래스 정확도가 0.485에서 0.536으로 향상됐고, Evade 재현율은 0.559에서 0.647로 높아졌다. 다중 클래스 혼동행렬에서는 QR과 Tap의 구분이 특히 어렵게 나타났고, Swipe는 작은 동작 범위와 미세한 움직임 때문에 인식이 까다로웠다. 연구진은 단계 2가 더 집중된 근거를 제공하더라도, 흐림·역광·가림이 심한 장면에서는 성능이 제한된다고 정리한다.

이 결과만으로 실제 배치 가능성을 입증한 것은 아니다. 버스 영상에서 VLM을 곧장 쓰지 않고 엣지의 구조화된 지각과 결합했을 때 정차·승객 클립 탐지가 개선됐지만, 결제 분류 성능은 촬영 조건에 따라 엇갈렸다. GHR-VLM은 결제 전용 학습 데이터 없이도 승객 단위의 지불 행위를 추론하는 절차를 마련했지만, 논문 자체도 현재 결제 정확도는 실무 배치에 충분하지 않다고 밝힌다. 특히 동일한 파이프라인이라도 조명과 화질이 조금만 나빠져도 근거 선택과 최종 라벨이 흔들렸고, 이는 교통 영상의 현실적 난점을 그대로 드러낸다.

저작권자 © STORIUM 무단전재 및 재배포 금지

유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

엔비디아 미국 본사 건물
정책·윤리

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진
정책·윤리

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진
정책·윤리

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진
스타트업·투자

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
Next Post
Department of Computer Science, University of Engineering and Technology, Taxila, Pakistan 공식 로고

검사 의뢰 사유 모델, 두 장 흉부 X선보다 보고서 유래 표적 AUROC 높아

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.