[20260716] Open-Domain Open-Vocabulary Object Detection
페이지 정보

본문
[일시] 2026.07.16
[세미나 주제] Open-Domain Open-Vocabulary Object Detection
[요약]
본 발표에는 category shift와 domain shift를 동시에 고려하는 open-domain open-vocabulary object detection(ODOVD)을 다룬 ODOV와 ExDet 논문을 리뷰하였다. 기존 객체 검출 연구는 주로 새로운 객체 클래스 또는 새로운 촬영 환경 중 하나에 초점을 두지만 실제 환경에서는 학습하지 않은 개게가 학습하지 않은 환경에서 등장할 수 있으므로 두 변화를 함께 처리할 필요가 있다.
ODOV는 이러한 문제를 정의하고 LVIS의 객체 클래스에 9개 이미지 스타일과 6개 촬영 및 열화 조건을 적용한 OD-LVIS 벤치마크를 구축하였다. 또한 baseline인 DVtor을 제안하여 DAPmt로 객체 고유의 category embedding을 생성하고 DP&G로 입력 이미지의 Domain feature를 추출한 뒤 두 정보를 결합하였다. 실험 결과 DVtor은 다양한 VLM backbone에서 기존 open vocabulary detector보다 높은 성능을 보였다.
ExDet는 기존 RPN이 Novel Object와 Domain shifted Object를 후보 단계에서 놓칠 수 있다는 문제를 해결하기 위해 TGE, DCR, ExRPN을 제안하였다. TGE는 실제 target domain 이미지 없이 proxy visual prototype을 생성하고 DCR은 이를 기존 detector에 적합한 feature로 보정하며 ExRPN은 semantic similarity를 활용해 Proposal score를 재조정한다. 그 결과 detector 전체를 재학습하지 않고도 AP와 Proposal recall을 함께 향상시켰다.
종합적으로 ODOV는 ODOVD문제와 평가 벤치마크를 제시하였고 ExDet는 classification과 proosal generation을 함께 개선하였다. 다만 합성 및 변환 domain 중심의 평가와 Text-visual space의 구조적 대응 관계에 대한 의존은 한계로 남는다.
[Q&A]
Q : 평균과 표준편차를 사용해서 domain statistics를 만든다고 하셨는데 이것만으로 도메인 정보만 추출할 수 있는 것이 맞나요?
A : 이미지 feature의 평균과 표준편차에는 객체의 형태나 배치와 같은 내용 정보가 일부 포함될 수 있기 때문에 평균과 표준편차가 도메인 정보만을 완전히 분리해서 추출한다고 보기는 어렵습니다. 하지만 기존 domain generalization 연구에서는 feature의 평균과 표준편차가 색상, 밝기, 대비, 화풍과 같은 전반적인 스타일 정보를 잘 반영하는 통계값으로 활용되어 DVtor도 이러한 특성을 이용하여 이미지의 domain 특서을 반영하는 Embedding을 학습하게 됩니다.
Q : 기존 RPN에서 novel object에 낮은 점수가 부여될때 ExRPN은 이를 어떻게 보완하나요?
A: ExRPN은 새로운 proposal 이미지를 생성하거나 이미 제거된 proposal을 복원하는 방식은 아닙니다. RPN이 생성한 proposal의 feature와 multi-domain text prompt간 유사돌르 계산하고 이를 기존 RPN confidence와 결합하여 proposal score를 재조정합니다. 이를 통해 novel object나 domain shifted object가 후속 분류 단계에 전달될 가능성을 높입니다.
Q : Domain shift도 해결할 수 있다고 했는데 실험결과가 LVIS의 category에 한정되어 있다면 domain shift를 해결했다고 볼 수 있나요?
A : category는 LVIS의 데이터셋으로 고정되어 있지만 학습은 자연 이미지에서 수행하고 테스트는 15개의 새로운 domain에서 진행하므로 domain generalization 성능을 평가한 것은 맞습니다. 또한 base와 novel category를 나누어 새로운 domain에서의 탐지 성능을 함께 확인하였습니다. 다만 평가 domain이 변환,합성 이미지 중심이므로 실제 환경의 모든 domain shift를 해결했다고 보기는 어렵습니다.
[관련 논문]
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
ExDet: Open-Domain Open-Vocabulary Detection with Cross-Modal Extrapolation and Rectification
[녹화영상]
https://us06web.zoom.us/rec/share/j-SGu6hL1xGFHAVXGZSBNdZvyUnSF0EuGTxmcjj6npWpL_CLy0tJccHRXOkDLtQ6.U0zMcWV3S8wUqdhK
[세미나 주제] Open-Domain Open-Vocabulary Object Detection
[요약]
본 발표에는 category shift와 domain shift를 동시에 고려하는 open-domain open-vocabulary object detection(ODOVD)을 다룬 ODOV와 ExDet 논문을 리뷰하였다. 기존 객체 검출 연구는 주로 새로운 객체 클래스 또는 새로운 촬영 환경 중 하나에 초점을 두지만 실제 환경에서는 학습하지 않은 개게가 학습하지 않은 환경에서 등장할 수 있으므로 두 변화를 함께 처리할 필요가 있다.
ODOV는 이러한 문제를 정의하고 LVIS의 객체 클래스에 9개 이미지 스타일과 6개 촬영 및 열화 조건을 적용한 OD-LVIS 벤치마크를 구축하였다. 또한 baseline인 DVtor을 제안하여 DAPmt로 객체 고유의 category embedding을 생성하고 DP&G로 입력 이미지의 Domain feature를 추출한 뒤 두 정보를 결합하였다. 실험 결과 DVtor은 다양한 VLM backbone에서 기존 open vocabulary detector보다 높은 성능을 보였다.
ExDet는 기존 RPN이 Novel Object와 Domain shifted Object를 후보 단계에서 놓칠 수 있다는 문제를 해결하기 위해 TGE, DCR, ExRPN을 제안하였다. TGE는 실제 target domain 이미지 없이 proxy visual prototype을 생성하고 DCR은 이를 기존 detector에 적합한 feature로 보정하며 ExRPN은 semantic similarity를 활용해 Proposal score를 재조정한다. 그 결과 detector 전체를 재학습하지 않고도 AP와 Proposal recall을 함께 향상시켰다.
종합적으로 ODOV는 ODOVD문제와 평가 벤치마크를 제시하였고 ExDet는 classification과 proosal generation을 함께 개선하였다. 다만 합성 및 변환 domain 중심의 평가와 Text-visual space의 구조적 대응 관계에 대한 의존은 한계로 남는다.
[Q&A]
Q : 평균과 표준편차를 사용해서 domain statistics를 만든다고 하셨는데 이것만으로 도메인 정보만 추출할 수 있는 것이 맞나요?
A : 이미지 feature의 평균과 표준편차에는 객체의 형태나 배치와 같은 내용 정보가 일부 포함될 수 있기 때문에 평균과 표준편차가 도메인 정보만을 완전히 분리해서 추출한다고 보기는 어렵습니다. 하지만 기존 domain generalization 연구에서는 feature의 평균과 표준편차가 색상, 밝기, 대비, 화풍과 같은 전반적인 스타일 정보를 잘 반영하는 통계값으로 활용되어 DVtor도 이러한 특성을 이용하여 이미지의 domain 특서을 반영하는 Embedding을 학습하게 됩니다.
Q : 기존 RPN에서 novel object에 낮은 점수가 부여될때 ExRPN은 이를 어떻게 보완하나요?
A: ExRPN은 새로운 proposal 이미지를 생성하거나 이미 제거된 proposal을 복원하는 방식은 아닙니다. RPN이 생성한 proposal의 feature와 multi-domain text prompt간 유사돌르 계산하고 이를 기존 RPN confidence와 결합하여 proposal score를 재조정합니다. 이를 통해 novel object나 domain shifted object가 후속 분류 단계에 전달될 가능성을 높입니다.
Q : Domain shift도 해결할 수 있다고 했는데 실험결과가 LVIS의 category에 한정되어 있다면 domain shift를 해결했다고 볼 수 있나요?
A : category는 LVIS의 데이터셋으로 고정되어 있지만 학습은 자연 이미지에서 수행하고 테스트는 15개의 새로운 domain에서 진행하므로 domain generalization 성능을 평가한 것은 맞습니다. 또한 base와 novel category를 나누어 새로운 domain에서의 탐지 성능을 함께 확인하였습니다. 다만 평가 domain이 변환,합성 이미지 중심이므로 실제 환경의 모든 domain shift를 해결했다고 보기는 어렵습니다.
[관련 논문]
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
ExDet: Open-Domain Open-Vocabulary Detection with Cross-Modal Extrapolation and Rectification
[녹화영상]
https://us06web.zoom.us/rec/share/j-SGu6hL1xGFHAVXGZSBNdZvyUnSF0EuGTxmcjj6npWpL_CLy0tJccHRXOkDLtQ6.U0zMcWV3S8wUqdhK
첨부파일
-
260722_Open_domain_open_vocabulary_object_detection.pptx (11.9M)
DATE : 2026-07-21 11:44:05
- 이전글[20260723 특별 세미나] Open World Open Vocabulary Detection 26.07.30
- 다음글[20260709 특별 세미나] NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection 26.07.16
댓글목록
등록된 댓글이 없습니다.