Engineering & Technologyarticle2026-08-27

Improving Detection Performance via R-VAE-Based Synthetic Data Augmentation for Indoor Fire Scenarios

0 citations

Abstract

본 논문은 실내 화재와 같은 사고 데이터의 극심한 불균형 및 희소성 문제를 해결하기 위한 효율적인 합성 데이터 생성 및 증강 방법론을 제안한다. 기존 VAE나 GAN, Diffusion 모델과 같이 이미지 전체를 생성하는 방식이 아닌, 실내 CCTV의 배경 불변성(Background Invariance)을 활용하여 배경을 분리하고 변화량(잔차)만을 학습하는 '잔차 학습 기반 VAE(Residual VAE)' 구조를 설계하였다. 먼저 상용 Text-to-Image(T2I) 모델을 활용하여 고정 배경과 화재 텍스트가 결합된 소수의 초기 화재 시드(Seed) 데이터를 생성하고, 이를 R-VAE의 입력으로 연계하여 대규모로 자가 증강하는 2단계(Two-stage) 파이프라인으로 구성된다. 이를 통해 불필요한 배경 노이즈 간섭을 배제하여 연산 효율을 극대화하였으며, 1x1, 3x3, 5x5 커널로 구성된 병렬 인코더/디코더를 도입하여 화재 특징의 다양성을 포착하였다. 생성된 데이터의 품질을 검증한 결과, 제안된 R-VAE 모델(Parallel 구조 기준)은 FID 163.38, KID 0.1136을 기록하며 기존 GAN 모델(FID 233.14, KID 0.2188) 대비 이미지 생성 품질을 입증하였다. 특히 훈련 시간 측면에서도 GAN 대비 약 4배 이상의 효율성을 보였다. 증강된 데이터의 실질적인 효용성을 확인하기 위해 ResNet-50, GoogLeNet 등 상위 판별 모델 학습에 적용한 결과, 단순 합성 데이터만을 사용했을 때보다 정확도(Accuracy)와 정밀도(Precision), F1-Score가 유의미하게 향상됨을 확인하였다. 마지막으로 시드 데이터 대비 증강 비율을 0.5배, 2배, 3배, 5배로 점진적으로 증가시키며 성능 변화를 분석한 결과, 증강 비율이 높아질수록 판별 모델의 성능이 안정적으로 향상되어 2배 이상의 증강 시 대부분 지표에서 0.99 이상의 높은 신뢰도에 도달하였다.

// Source

View paper (DOI)OpenAlexJournal of the Institute of Electronics and Information EngineersPublished 2026-08-27

Authors: Gyeongmin Kim, Jinhwan Koh