Engineering & Technologyarticle2026-08-27

Evaluation of the Traffic Environment and Risk Factor Understanding Performance of Video-Language Models in Driving Situations : A Comparative Study Based on a Structured 3-Stage Evaluation

Open access0 citations

Abstract

본 연구는 비디오-언어 모델(Video-Language Models, VLMs)을 활용하여 주행 환경 및 위험 요인 이해 성능을 평가하기 위한 3단계 구조화 벤치마크를 제안하고 실증적으로 적용한다. 제안한 평가틀은 시공간 환경 인지(Q1), 에이전트 간 상호작용 이해(Q2), 핵심 위험 식별(Q3)로 이어지는 단계적 추론 과정으로 정의한다. 각 단계는 CoVLA(Comprehensive Vision-Language-Action) 데이터셋의 캡션에서 도출한 기준 라벨을 바탕으로 객관식 평가 문항으로 구현하였으며, 이를 통해 모델의 전체 성능뿐 아니라 위험 이해 과정에서 발생하는 단계별 취약성을 비교할 수 있도록 하였다. 본 연구는 주행 영상 약 500개와 1,500개 질문 항목을 활용하여 최근 7개 VLM을 단일/다중턴 대화 모드에서 평가하였다. 정량 평가는 전체 정확도, 문항별 정확도, 대화 모드 간 변화량 등을 중심으로 수행하였고, 정성 분석에서는 시각적 근거화, 맥락 활용, 출력 안정성을 검토하였다. 실험 결과, 대부분의 모델은 도로 구조와 주변 객체를 파악하는 환경 인지 단계에의 성능은 우수했으나, 이를 핵심 위험 요인 식별로 연결하는 Q3 단계에서는 한계를 보였다. 또한 다중 턴 조건은 일부 모델의 성능을 향상시켰지만, 동시에 초기 오류, 환각, 출력 형식 불안정성이 후속 응답으로 전파될 수 있음을 보였다. 이러한 결과는 제안한 벤치마크가 단순한 모델 순위 산출을 넘어, VLM의 주행 위험 이해가 어느 단계에서 취약해지는지를 진단하는 평가 도구로 활용될 수 있음을 보여 준다.

// Source

View paper (DOI)Open access versionOpenAlex대한교통학회지Published 2026-08-27

Authors: Yongsun LEE, Minjee KIM, Jiyoung Woo, Byeongjoon NOH