[20260805 특별세미나] Language-Based Video Anomaly Detection
페이지 정보

본문
[일시] 2026.08.05
[세미나 주제] Language-Based Video Anomaly Detection
[요약]
본 발표에서는 VLM과 LLM의 언어적 지식을 활용하여 영상의 의미와 문맥을 기반으로 이상행동을 탐지하는 Language-Based VAD에 대해 발표하였다. 기존 VAD는 특정 데이터셋과 환경에서 정상 및 이상 패턴을 학습하기 때문에 장소나 이상행동에 적용하기 위해 추가적인 데이터 수집과 재학습이 필요하다는 한계가 있다. 이에 두 연구는 언어 정보를 활용하여 기존 VAD의 일반화 한계를 보완하는 방향을 제시한다.
LAVAD는 별도의 VAD 데이터 수집이나 모델 학습 없이 새로운 환경에 적용할 수 있는 training-free VAD를 제안하였다. 각 프레임에 대한 caption을 생성한 뒤 image-text similarity를 이용해 noisy caption을 정제하고 주변 프레임의 caption을 LLM으로 통합하여 temporal summary를 생성한다. 이후 LLM을 통해 frame-level anomaly score를 추론하고 video-text similarity를 이용해 최종 score를 보정한다. 이를 통해 caption의 오류와 단일 프레임에서 부족한 시간적 문맥을 보완하였으며 UCF-Crime과 XD-Violence에서 별도 학습 없이 기존 training-free 방법보다 높은 성능을 보였다.
LaGoVAD는 anomaly definition이 고정되어 있다고 가정하는 기존 closed-set 및 open-set VAD의 한계를 확장하여, 사용자가 테스트 시 자연어로 anomaly definition을 입력할 수 있는 open-world VAD를 제안하였다. Video feature와 anomaly definition을 결합하여 정의에 조건화된 anomaly score와 category를 예측하며, PreVAD 데이터셋 구축과 Dynamic Video Synthesis를 통해 다양한 이상행동과 temporal localization을 학습한다. 또한 hard negative mining 기반 contrastive learning을 적용하여 정상 배경과 실제 이상구간 간의 vision-text alignment를 강화하였다.
종합적으로 LAVAD는 학습 없이 언어적 문맥을 활용하는 training-free VAD의 가능성을 제시하였고, LaGoVAD는 사용자가 정의한 이상 기준에 따라 판단을 변경할 수 있는 open-world VAD로 확장하였다. 다만 LAVAD는 caption 오류와 LLM의 추론 및 prompt 설정에 영향을 받을 수 있으며, LaGoVAD는 자연어 definition의 품질과 vision-text alignment 성능에 의존하고 자유로운 형태의 복잡한 사용자 정의에 대한 검증이 제한적이라는 한계가 있다.
[Q&A]
Q : LaGoVAD에서 Visual Encoder 뒤의 Temporal Encoder는 어떤 역할을 하나요?
A : CLIP 기반 Visual Encoder는 각 sampled frame에서 개별적으로 visual feature를 추출하기 때문에 프레임 간의 시간적 변화까지 직접 표현하기는 어렵습니다. 따라서 LaGoVAD는 Transformer 기반 Temporal Encoder를 추가하여 연속된 frame feature 사이의 시간적 관계를 모델링합니다. 이를 통해 단순히 한 프레임에 어떤 객체나 장면이 존재하는지만 보는 것이 아니라 행동의 진행 과정이나 변화와 같은 temporal context를 반영한 video feature를 생성하고, 이후 anomaly definition과 결합하여 이상 여부를 판단합니다.
Q : Synthesis Loss는 어떤 Loss인가요?
A : LaGoVAD의 Dynamic Video Synthesis에서는 정상 또는 anchor video와 유사한 video segment를 연결하여 새로운 학습 영상을 생성하고, 합성 과정에서 어떤 위치에 이상 segment가 포함되었는지를 알 수 있기 때문에 해당 위치를 temporal pseudo-label로 사용할 수 있습니다. Synthesis Loss는 이렇게 생성된 합성 영상과 pseudo-label을 이용하여 모델이 이상구간에는 높은 anomaly score를, 정상구간에는 낮은 score를 예측하도록 학습하는 역할을 합니다. 즉 기존 weakly-supervised VAD의 video-level label만 사용하는 것보다 합성 과정에서 얻은 시간적 위치 정보를 추가로 활용하여 anomaly localization 성능을 강화하기 위한 loss라고 볼 수 있습니다.
[관련 논문]
- Harnessing Large Language Models for Training-free Video Anomaly Detection
- Language-guided Open-world Video Anomaly Detection under Weak Supervision
[녹화영상]
https://us06web.zoom.us/rec/share/uTTlCGzCf9ZDLd3WQ-iipeFjC1l2odQVJMpSL5eFO0OEZ9xuVRtrKZ_v84ASnRn2.eeOnaDJuSIOVhAMf?startTime=1785905844000
[세미나 주제] Language-Based Video Anomaly Detection
[요약]
본 발표에서는 VLM과 LLM의 언어적 지식을 활용하여 영상의 의미와 문맥을 기반으로 이상행동을 탐지하는 Language-Based VAD에 대해 발표하였다. 기존 VAD는 특정 데이터셋과 환경에서 정상 및 이상 패턴을 학습하기 때문에 장소나 이상행동에 적용하기 위해 추가적인 데이터 수집과 재학습이 필요하다는 한계가 있다. 이에 두 연구는 언어 정보를 활용하여 기존 VAD의 일반화 한계를 보완하는 방향을 제시한다.
LAVAD는 별도의 VAD 데이터 수집이나 모델 학습 없이 새로운 환경에 적용할 수 있는 training-free VAD를 제안하였다. 각 프레임에 대한 caption을 생성한 뒤 image-text similarity를 이용해 noisy caption을 정제하고 주변 프레임의 caption을 LLM으로 통합하여 temporal summary를 생성한다. 이후 LLM을 통해 frame-level anomaly score를 추론하고 video-text similarity를 이용해 최종 score를 보정한다. 이를 통해 caption의 오류와 단일 프레임에서 부족한 시간적 문맥을 보완하였으며 UCF-Crime과 XD-Violence에서 별도 학습 없이 기존 training-free 방법보다 높은 성능을 보였다.
LaGoVAD는 anomaly definition이 고정되어 있다고 가정하는 기존 closed-set 및 open-set VAD의 한계를 확장하여, 사용자가 테스트 시 자연어로 anomaly definition을 입력할 수 있는 open-world VAD를 제안하였다. Video feature와 anomaly definition을 결합하여 정의에 조건화된 anomaly score와 category를 예측하며, PreVAD 데이터셋 구축과 Dynamic Video Synthesis를 통해 다양한 이상행동과 temporal localization을 학습한다. 또한 hard negative mining 기반 contrastive learning을 적용하여 정상 배경과 실제 이상구간 간의 vision-text alignment를 강화하였다.
종합적으로 LAVAD는 학습 없이 언어적 문맥을 활용하는 training-free VAD의 가능성을 제시하였고, LaGoVAD는 사용자가 정의한 이상 기준에 따라 판단을 변경할 수 있는 open-world VAD로 확장하였다. 다만 LAVAD는 caption 오류와 LLM의 추론 및 prompt 설정에 영향을 받을 수 있으며, LaGoVAD는 자연어 definition의 품질과 vision-text alignment 성능에 의존하고 자유로운 형태의 복잡한 사용자 정의에 대한 검증이 제한적이라는 한계가 있다.
[Q&A]
Q : LaGoVAD에서 Visual Encoder 뒤의 Temporal Encoder는 어떤 역할을 하나요?
A : CLIP 기반 Visual Encoder는 각 sampled frame에서 개별적으로 visual feature를 추출하기 때문에 프레임 간의 시간적 변화까지 직접 표현하기는 어렵습니다. 따라서 LaGoVAD는 Transformer 기반 Temporal Encoder를 추가하여 연속된 frame feature 사이의 시간적 관계를 모델링합니다. 이를 통해 단순히 한 프레임에 어떤 객체나 장면이 존재하는지만 보는 것이 아니라 행동의 진행 과정이나 변화와 같은 temporal context를 반영한 video feature를 생성하고, 이후 anomaly definition과 결합하여 이상 여부를 판단합니다.
Q : Synthesis Loss는 어떤 Loss인가요?
A : LaGoVAD의 Dynamic Video Synthesis에서는 정상 또는 anchor video와 유사한 video segment를 연결하여 새로운 학습 영상을 생성하고, 합성 과정에서 어떤 위치에 이상 segment가 포함되었는지를 알 수 있기 때문에 해당 위치를 temporal pseudo-label로 사용할 수 있습니다. Synthesis Loss는 이렇게 생성된 합성 영상과 pseudo-label을 이용하여 모델이 이상구간에는 높은 anomaly score를, 정상구간에는 낮은 score를 예측하도록 학습하는 역할을 합니다. 즉 기존 weakly-supervised VAD의 video-level label만 사용하는 것보다 합성 과정에서 얻은 시간적 위치 정보를 추가로 활용하여 anomaly localization 성능을 강화하기 위한 loss라고 볼 수 있습니다.
[관련 논문]
- Harnessing Large Language Models for Training-free Video Anomaly Detection
- Language-guided Open-world Video Anomaly Detection under Weak Supervision
[녹화영상]
https://us06web.zoom.us/rec/share/uTTlCGzCf9ZDLd3WQ-iipeFjC1l2odQVJMpSL5eFO0OEZ9xuVRtrKZ_v84ASnRn2.eeOnaDJuSIOVhAMf?startTime=1785905844000
첨부파일
-
260805_Language_based_VAD.pdf (2.8M)
DATE : 2026-08-14 14:50:57
댓글목록
등록된 댓글이 없습니다.