[20260702 특별 세미나] DINO and Grounding DINO: End-to-End and Open-Set Obj…

페이지 정보

profile_image
작성자 고예진
댓글 0건 조회 76회 작성일 26-07-13 14:29

본문

[일시] 2026.07.02.

[세미나 주제]
DINO and Grounding DINO: End-to-End and Open-Set Object Detection


[발표자]
고예진

[요약]
본 발표에서는 End-to-End Object Detection의 대표 모델인 DINO와 이를 Open-Set Object Detection으로 확장한 Grounding DINO 논문를 리뷰하였다. 기존 객체 검출기는 학습 시 정의된 클래스만 인식할 수 있는 closed-set 환경을 가정하기 때문에 실제 환경에서 등장하는 새로운 객체를 인식하지 못하는 한계가 있었다. 이를 해결하기 위해 DINO는 DETR의 느린 학습과 낮은 수렴 성능을 개선하는 데 초점을 맞추었으며, Grounding DINO는 Vision-Language 정보를 결합하여 텍스트 프롬프트만으로 학습되지 않은 객체까지 검출할 수 있는 Open-Vocabulary Object Detection을 제안하였다.

DINO는 이러한 문제를 해결하기 위해 세 가지 기법을 제안하였다. 첫째, Contrastive DeNoising Training(CDN)을 통해 positive anchor뿐 아니라 negative anchor도 함께 학습하여 중복 예측을 줄이고 학습 안정성을 향상시켰다. 둘째, Mixed Query Selection을 이용하여 Encoder에서 생성한 위치 정보와 학습 가능한 Content Query를 결합함으로써 정확한 객체 위치 초기화와 안정적인 의미 표현을 동시에 확보하였다. 셋째, Look Forward Twice를 통해 현재 Decoder Layer가 다음 Layer의 예측 정보까지 활용하도록 설계하여 Bounding Box 예측 성능과 수렴 속도를 동시에 향상시켰다. 이러한 개선을 통해 DINO는 기존 DETR 계열보다 빠른 학습과 높은 객체 검출 성능을 달성하였다.

Grounding DINO는 DINO 구조를 기반으로 이미지와 텍스트 정보를 효과적으로 융합하기 위해 세 가지 모듈을 도입하였다. 첫째, Feature Enhancer를 통해 이미지와 텍스트 특징을 상호 보완적으로 정제하였다. 둘째, Language-Guided Query Selection을 이용하여 텍스트와 가장 관련성이 높은 객체 Query를 선택함으로써 객체 탐색의 정확도를 향상시켰다. 셋째, Cross-Modality Decoder에서 이미지와 텍스트 특징을 반복적으로 상호작용시켜 객체 위치와 의미 정보를 함께 학습하였다. 이를 통해 사용자는 새로운 텍스트 프롬프트만 입력하면 재학습 없이도 다양한 객체를 검출할 수 있으며, Open-Set 환경에서도 높은 일반화 성능을 확보할 수 있다.


[Q&A]
Q : DINO의 Contrastive DeNoising Training에서 λ₁과 λ₂로 나눈 영역 중 negative는 λ₂ 전체를 의미하는 것인가요, 아니면 positive를 제외한 영역만 의미하는 것인가요?
A: Contrastive DeNoising Training은 Decoder에 입력될 Denoising Query를 생성하는 단계에서 수행됩니다. 이때 GT에 노이즈를 추가해 Query를 만들며, λ₁ 이하는 Positive Query, λ₁~λ₂ 사이는 Negative Query로 구분합니다. 이때 λ₂는 positive를 제외한 λ₁~λ₂의 ring 영역입니다. Positive는 GT를 복원하도록 학습하고, Negative는 no object로 학습하여 객체와 애매한 Anchor를 구분하는 능력을 향상시킵니다.


[관련 논문]
DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

첨부파일

댓글목록

등록된 댓글이 없습니다.