[20260709 특별 세미나] NoOVD: Novel Category Discovery and Embedding for Op…

페이지 정보

profile_image
작성자 장도영
댓글 0건 조회 97회 작성일 26-07-16 15:12

본문

[일시]
2026.07.09.

[세미나 주제]
NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

[발표자]
장도영

[요약]
본 발표에서는 F-VLM을 통해 frozen VLM 기반 2-stage Open-Vocabulary Object Detection의 기본 구조를 살펴보고, 이러한 구조에서 발생하는 novel category 탐지 문제를 개선한 NoOVD를 소개하였다.

Frozen VLM 기반 2-stage detector는 base-category annotation만으로 RPN과 RoI head를 학습하기 때문에, 학습 이미지에 존재하지만 annotation되지 않은 novel object를 background로 처리할 수 있다. 이로 인해 novel object proposal은 RPN에서 낮은 objectness score를 받거나, RoI head에서 background feature와 정렬될 수 있다. 추론 과정에서도 novel object proposal의 RPN score가 낮으면 post-processing 과정에서 제거되어 novel-category recall이 감소한다.

NoOVD는 이러한 문제를 해결하기 위해 K-FPN과 R-RPN을 제안한다. K-FPN은 frozen CLIP의 여러 중간 layer에서 추출한 feature와 frozen dimensionality-reduction head를 이용하여 구성하는 learnable-parameter-free feature pyramid이다. 일반 FPN과 달리 base-category supervision에 의해 학습되지 않으므로, CLIP이 사전학습을 통해 획득한 Open-Vocabulary knowledge를 최대한 유지한다.

Novel category discovery 단계에서는 먼저 RPN이 생성한 proposal을 K-FPN에 투영하고, RoI Align으로 proposal feature를 추출한다. 이후 proposal feature를 category-agnostic foreground 및 background text embedding과 비교한다. Foreground와의 유사도가 background와의 유사도보다 높으면서 base-category GT box에 해당하지 않는 proposal을 latent novel object proposal로 선정한다.

선정된 latent novel object proposal 영역은 원본 이미지에서 crop한 후 frozen CLIP Image Encoder에 입력하여 teacher feature를 추출한다. 이 teacher feature와 일반 FPN 및 RoI head를 통해 얻은 detector의 proposal feature가 유사해지도록 knowledge self-distillation을 수행한다. 이를 통해 RoI head가 annotation되지 않은 novel object를 background로 강제 정렬하지 않고, frozen CLIP이 보유한 novel-category knowledge를 학습하도록 유도한다.

R-RPN은 추론 단계에서 novel object proposal의 낮은 RPN score를 보완하는 방법이다. RPN의 NMS 이후 남은 proposal에 대해 K-FPN feature와 foreground/background text embedding의 유사도를 계산하여 foreground score를 구한다. 이후 기존 RPN objectness score와 K-FPN foreground score를 가중 결합하고, 결합된 score를 기준으로 proposal을 다시 정렬한다. 최종적으로 상위 proposal을 RoI head에 전달함으로써 novel-category proposal이 조기에 제거되는 것을 방지하고 novel-category recall을 향상한다.

[Q&A]
Q: K-FPN과 일반 FPN은 학습 및 추론 과정에서 어떻게 다르게 사용되나요?
A: 일반 FPN은 RPN 및 RoI head에 feature를 제공하는 detector의 주 feature pyramid이며, base-category annotation을 이용하여 학습됩니다. 반면 K-FPN은 frozen CLIP의 여러 layer feature와 frozen projection head로 구성되며, 별도의 learnable parameter를 갖지 않습니다. 학습 과정에서는 latent novel object proposal을 발견하고 self-distillation을 위한 teacher knowledge를 제공하며, 추론 과정에서는 R-RPN이 proposal의 foreground score를 계산하는 데 사용됩니다.

[관련 논문]
F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models
NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

첨부파일

댓글목록

등록된 댓글이 없습니다.