[20260805 특별세미나] CLIP-TSA: CLIP-Assisted Temporal Self-Attention for W…

페이지 정보

profile_image
작성자 김희지
댓글 0건 조회 17회 작성일 26-08-07 11:45

본문

[일시] 2026.08.05

[세미나 주제]
CLIP-TSA: CLIP-Assisted Temporal Self-Attention for Weakly-Supervised Video Anomaly Detection

[발표자]
김희지

[요약]
본 발표에서는 weakly-supervised VAD에서 이상 구간을 탐지하는 CLIP-TSA와, 이를 open-vocabulary setting으로 확장해 이상 구간과 사건 category를 함께 예측하는 OV-VAD를 소개하였다. 기존 weakly-supervised VAD는 영상 전체의 정상·이상 label만 제공되기 때문에, 비정상 영상 안에서 실제 anomaly가 발생한 구간을 모델이 직접 찾아야 한다.

CLIP-TSA는 영상을 여러 snippet으로 나누고, 각 snippet의 가운데 frame을 CLIP image encoder에 입력해 visual feature를 추출한다. 이후 TSA가 snippet별 중요도 score를 예측하고, score가 높은 구간에 attention을 부여한다. 후속 temporal network는 snippet 사이의 시간적 관계를 학습하며, classifier는 snippet별 anomaly score를 출력한다. 학습 시에는 normal·abnormal video의 top-α feature magnitude 차이를 크게 하는 Difference Maximization Trainer를 함께 사용한다. 다만 가운데 frame만 사용하므로 snippet 내부의 짧은 움직임을 놓칠 수 있고, anomaly category는 예측하지 못한다.
OV-VAD는 anomaly detection과 categorization을 두 branch로 분리한다. Detection branch는 CLIP frame feature에 Temporal Adapter와 LLM 기반 semantic prior를 결합해 frame별 anomaly confidence를 예측한다. Categorization branch는 anomaly confidence가 높은 frame을 중심으로 video feature를 만들고, 이를 category text embedding과 비교해 fighting, road accident, explosion 등의 label을 예측한다. 또한 LLM과 생성 모델로 pseudo novel anomaly를 만들어 unseen category 성능을 보완한다.

결론적으로 CLIP-TSA는 어느 구간이 이상한지 찾는 데 집중한 모델이고, OV-VAD는 여기에 vision-language alignment를 추가해 이상 구간과 사건 종류를 함께 예측하는 모델이다.

Q. 행동뿐 아니라 상황적 맥락도 고려하나요?
A. CLIP feature에는 사람, 물체, 장소와 배경 정보가 함께 포함되고, temporal module은 앞뒤 장면도 참고합니다. 따라서 도로 위 자동차와 인도 위 자동차를 어느 정도 다르게 볼 수 있습니다. 다만 맥락을 완전히 이해하는 것은 아니므로, UFC 영상이 정상 데이터에 포함되지 않았다면 영상 내에 모든 싸움 장면을 anomaly로 판단할 수도 있습니다.

Q. CLIP-TSA는 처음에 feature magnitude가 큰 snippet을 선택하나요?
A. 먼저 TSA의 scorer가 각 snippet의 중요도 score를 예측하고, score가 높은 Top-κ snippet을 강조합니다. 이후 temporal network를 지난 feature에 대해 DMT가 magnitude가 큰 Top-α snippet을 선택해 정상/이상 영상의 대표 feature를 만듭니다. 학습 초기에는 score와 magnitude 모두 정확하지 않지만, video-level label로 loss를 계산하고 역전파를 반복하면서 이상 영상에 더 특이적인 구간이 높은 score와 magnitude를 갖도록 학습됩니다. 다만 학습 과정에서 배경이나 조명 같은 잘못된 특징을 선택할 가능성은 있습니다.

Q. 한 영상에 여러 사건이 있으면 어떻게 처리하나요?
A. 두 모델 모두 frame/snippet별 anomaly score를 출력하므로 여러 anomaly 구간을 탐지할 수 있습니다. 다만 OV-VAD의 categorization은 video-level 단일 category 예측이므로, 서로 다른 사건이 여러 개 있으면 가장 강하게 반영된 한 category를 예측할 가능성이 높습니다.

Q. Top-K Score와 Top-K Magnitude의 차이는 무엇인가요?
A. Top-K Score는 학습된 scorer 또는 detector가 출력한 중요도로 anomaly score를 기준으로 선택하고 Top-K Magnitude는 feature vector의 norm이 큰 순서로 선택합니다. 이때 CLIP-TSA의 TSA는 Top-K score를 사용하고, DMT는 Top-K magnitude를 사용합니다.

[관련 논문]
- CLIP-TSA: CLIP-Assisted Temporal Self-Attention for Weakly-Supervised Video Anomaly Detection
- Open-Vocabulary Video Anomaly Detection

[녹화 영상]
https://us06web.zoom.us/rec/share/uTTlCGzCf9ZDLd3WQ-iipeFjC1l2odQVJMpSL5eFO0OEZ9xuVRtrKZ_v84ASnRn2.eeOnaDJuSIOVhAMf?startTime=1785902704000

첨부파일

댓글목록

등록된 댓글이 없습니다.