[20260709 특별 세미나] CAKE: Category Aware Knowledge Extraction for Open-V…
페이지 정보

본문
[일시] 2026.07.09
[세미나 주제] CAKE: Category Aware Knowledge Extraction for Open-Vocabulary Object Detection (AAAI 2025)
본 발표에서는 Open-Vocabulary Object Detection에서 base 카테고리만으로 학습하고도 novel 카테고리를 탐지해야 하는 문제를 다루었다. 기존 CLIP 지식 증류 기반 방법들은 카테고리 내부의 개체 간 차이까지 함께 학습하여 카테고리 고유의 특징이 흐려지는 한계가 있고, 또한 novel 객체가 RPN 단계에서 배경으로 걸러지는 문제도 있다는 점을 지적하며, 이를 CSKD와 CG-RPN 두 모듈로 해결하는 CAKE를 소개했다.
CSKD는 object-level과 cluster-level 증류를 함께 사용해 카테고리 내 개체별 편차를 걸러내고, 카테고리 단위의 순수한 지식만 학생 모델에 전달하도록 설계했다. CG-RPN은 고품질 카테고리 특징을 모은 Feature Set S를 SVD로 분해해 부분공간을 구성하고, 각 proposal 임베딩과 이 부분공간 간 유사도로 objectness를 보정하여 novel 객체를 포함한 영역이 배경으로 억제되지 않도록 했다.
두 모듈 모두 plug-and-play 구조로 설계되어 OC-OVD·OADP·BARON 세 baseline에 적용한 결과 AP novel이 각각 3~6점대로 개선되었으며, OV-COCO 기준 AP novel 41.8, OV-LVIS 기준 APr 25.0으로 기존 방법 대비 향상된 성능을 보였다.
[Q&A]
Q: inference 단계에서 text embedding은 어떻게 처리되는가?
A: 추론 시 매번 CLIP text encoder를 통과시키지 않고, 오프라인 환경에서 각 쿼리 텍스트에 대한 embedding을 미리 계산해 캐싱해두고 이를 그대로 불러와 사용한다.
[녹화영상]
https://us06web.zoom.us/rec/share/DNA-j13JDhFnR3eDMjxTejMgX7M07OANHWyB6jdYncnkqFrZ7vatgtuFw9FGTV9V.CILPnoBS9ofaPeTn
[세미나 주제] CAKE: Category Aware Knowledge Extraction for Open-Vocabulary Object Detection (AAAI 2025)
본 발표에서는 Open-Vocabulary Object Detection에서 base 카테고리만으로 학습하고도 novel 카테고리를 탐지해야 하는 문제를 다루었다. 기존 CLIP 지식 증류 기반 방법들은 카테고리 내부의 개체 간 차이까지 함께 학습하여 카테고리 고유의 특징이 흐려지는 한계가 있고, 또한 novel 객체가 RPN 단계에서 배경으로 걸러지는 문제도 있다는 점을 지적하며, 이를 CSKD와 CG-RPN 두 모듈로 해결하는 CAKE를 소개했다.
CSKD는 object-level과 cluster-level 증류를 함께 사용해 카테고리 내 개체별 편차를 걸러내고, 카테고리 단위의 순수한 지식만 학생 모델에 전달하도록 설계했다. CG-RPN은 고품질 카테고리 특징을 모은 Feature Set S를 SVD로 분해해 부분공간을 구성하고, 각 proposal 임베딩과 이 부분공간 간 유사도로 objectness를 보정하여 novel 객체를 포함한 영역이 배경으로 억제되지 않도록 했다.
두 모듈 모두 plug-and-play 구조로 설계되어 OC-OVD·OADP·BARON 세 baseline에 적용한 결과 AP novel이 각각 3~6점대로 개선되었으며, OV-COCO 기준 AP novel 41.8, OV-LVIS 기준 APr 25.0으로 기존 방법 대비 향상된 성능을 보였다.
[Q&A]
Q: inference 단계에서 text embedding은 어떻게 처리되는가?
A: 추론 시 매번 CLIP text encoder를 통과시키지 않고, 오프라인 환경에서 각 쿼리 텍스트에 대한 embedding을 미리 계산해 캐싱해두고 이를 그대로 불러와 사용한다.
[녹화영상]
https://us06web.zoom.us/rec/share/DNA-j13JDhFnR3eDMjxTejMgX7M07OANHWyB6jdYncnkqFrZ7vatgtuFw9FGTV9V.CILPnoBS9ofaPeTn
첨부파일
-
CAKE.pdf (1.6M)
DATE : 2026-07-13 11:01:19
- 이전글[20260702 특별 세미나] DINO and Grounding DINO: End-to-End and Open-Set Object Detection 26.07.13
- 다음글[20260702 특별 세미나] Lightweight Open-Vocabulary Recognition 26.07.11
댓글목록
등록된 댓글이 없습니다.