[20260616 통합세미나] Open-Vocabulary Object Discovery via Semantic Spectra…

페이지 정보

profile_image
작성자 고예진
댓글 0건 조회 58회 작성일 26-06-27 16:23

본문

[일시] 2026.06.16

[세미나 주제] Open-Vocabulary Object Discovery via Semantic Spectral Decomposition

[발표자] 고예진

[요약]
이번 발표에서는 Open-Vocabulary Object Detection에서 객체를 어떻게 찾을 것인가(Localize)라는 문제를 다루기 위해, CLIP의 공간적 한계를 개선하는 CLIP Surgery와 DINO feature를 활용한 Deep Spectral Methods를 소개하였다. 기존 CLIP은 이미지 전체와 텍스트를 정렬하도록 학습되었기 때문에 객체 위치를 정확히 찾지 못하고, 배경에 집중하거나 여러 클래스에서 공통적으로 나타나는 특징 때문에 noisy activation이 발생하는 문제가 있다. 또한 객체 위치 정보를 학습하지 않은 상황에서 semantic region을 어떻게 분리할 것인지도 중요한 문제이다.

첫 번째 논문인 CLIP Surgery는 추가 학습 없이 inference 단계에서 CLIP의 구조와 feature를 수정하여 patch-level semantic localization 성능을 향상시키는 방법이다. 저자는 CLIP의 opposite visualization과 noisy activation의 원인을 각각 inconsistent self-attention과 redundant feature로 분석하였다. 이를 해결하기 위해 기존의 QK 기반 self-attention 대신 동일한 feature space의 Value만을 사용하는 Consistent Self-Attention을 적용하고, FFN을 제거한 Dual Path 구조를 도입하여 객체 중심의 attention을 형성하였다. 또한 Feature Surgery를 통해 여러 클래스에 공통적으로 존재하는 redundant feature를 제거하여 image-text similarity map을 정제함으로써 보다 정확한 localization을 수행한다.

두 번째 논문인 Deep Spectral Methods는 DINO의 self-supervised feature를 이용하여 객체를 semantic region 단위로 분리하는 비지도 방법이다. 먼저 DINO에서 추출한 patch feature 간 유사도를 이용하여 그래프를 구성한 뒤, Graph Laplacian을 계산하고 Fiedler eigenvector를 통해 객체와 배경을 자연스럽게 분리한다. 이후 eigenvector 기반의 spectral decomposition을 수행하여 의미적으로 일관된 영역을 생성하며, 이를 object localization과 semantic segmentation에 활용한다. 별도의 annotation 없이도 객체 영역을 효과적으로 분리할 수 있으며, image editing이나 background removal과 같은 downstream task에도 적용 가능함을 보였다.

정리하면 CLIP Surgery는 Vision-Language Model의 공간적 표현을 개선하여 localization 성능을 높이는 접근이며, Deep Spectral Methods는 Self-Supervised Feature의 의미적 구조를 활용해 객체 영역을 발견하는 접근이다. 따라서 두 방법은 서로 다른 관점에서 Open-Vocabulary Object Discovery의 핵심 문제인 '어디에 객체가 있는가'를 해결하는 기반 기술로 활용될 수 있다.

Q. 두 논문 모두 Open-Vocabulary를 다루는 논문인가요?
A. 두 논문 모두 직접적으로 Open-Vocabulary Object Detection이나 Open-Vocabulary Object Discovery를 제안하는 논문는 아닙니다. 다만, CLIP Surgery는 Vision-Language Model의 patch-level localization 성능을 향상시키는 방법을 제안하고, Deep Spectral Methods는 Self-Supervised Feature를 이용해 객체 영역을 비지도적으로 발견하는 방법을 제안합니다. 이러한 두 기술은 각각 공간적 localization 개선과 비지도 객체 영역 생성이라는 측면에서 Open-Vocabulary Object Discovery에 적용 가능성이 높다고 판단하여 관련 연구 아이디어를 소개하기 위해 선정하였습니다.

Q. Deep Spectral Methods에서는 왜 굳이 이미지를 그래프로 표현하여 멀리 떨어진 노드까지 계산하나요?
A. 그래프를 사용하는 이유는 각 패치를 독립적으로 판단하는 것이 아니라, 패치 간의 모든 의미적 관계를 하나의 그래프로 표현하고 이를 동시에 고려하여 객체와 배경을 분리하기 위해서입니다. Spectral Graph Theory에서는 Minimum Cut 문제를 Graph Laplacian의 고유벡터 계산으로 완화할 수 있으며, 이를 통해 이미지 전체의 연결 구조를 고려한 전역적인 분할을 수행할 수 있습니다.


[관련논문]
- A closer look at the explainability of Contrastive language-image pre-training
- Deep Spectral Methods: A Surprisingly Strong Baseline for Unsupervised Semantic Segmentation and Localization

[녹화영상]
https://us06web.zoom.us/rec/share/zeIiqqo6uNdOFVKBi2kuIZOvN-LGOJBF9g5fTejEV1xWYgOa83Vf1CUnKzwCrgCz.grVoL_fXUuQoYMJb

첨부파일

댓글목록

등록된 댓글이 없습니다.