[20260702 특별 세미나] Lightweight Open-Vocabulary Recognition
페이지 정보

본문
[일시] 2026.07.02.
[세미나 주제]
Lightweight Open-Vocabulary Recognition
[발표자]
김민재
[요약]
본 발표에서는 CLIP 같은 vision-language model의 등장으로 가능해진 open-vocabulary 인식을 다루지만 이 능력을 제공하는 모델이 지나치게 무거워 엣지나 모바일 환경에 배포하기 어렵다는 공통 문제에 주목하여 이를 경량화하는 두 논문 YOLOE와 Data-Free Knowledge Distillation from CLIP을 비교 분석하였다. 첫번째 논문은 detection 관점에서 어디에 무엇이 있는지를 실시간으로 찾는 문제를, 다음 논문은 classification 관점에서 CLIP의 지식을 원본 데이터 없이 작은 전용 모델로 뽑아내는 문제를 다룬다. 기존 인식 모델이 학습 때 정의한 클래스 목록에만 갇히는 것과 달리 두 논문 모두 새로운 텍스트가 들어와도 재학습 없이 추론할 수 있는 open-vocabulary 능력을 유지하면서 모델을 어떻게 가볍게 만들 것인가를 서로 다른 축에서 풀어낸다.
YOLOE는 YOLO 기반 실시간 detector로 텍스트로 카테고리를 지정하는 방식, 박스나 마스크로 지정하는 방식, 아무 지정 없이 이미지 안의 객체를 모두 찾는 방식 세 가지를 하나의 모델로 통합한다. 핵심은 원래 YOLO가 미리 정해둔 클래스 개수만큼 점수를 내던 부분을 각 위치마다 의미 벡터를 만들도록 바꿔서 이미지에서 뽑은 벡터와 프롬프트에서 만든 벡터를 내적해 클래스를 판정하기 때문에 인식할 클래스가 모델 구조에 고정되지 않고 프롬프트에 따라 바뀐다. 텍스트 방식은 클래스 텍스트를 미리 벡터로 계산해두어 이미지와 텍스트를 무겁게 섞는 연산을 없앤다. 박스 방식은 지정한 영역 안에서 객체 위치에 큰 가중치를 주어 배경이 섞이는 것을 막고 지정이 없는 방식은 객체가 있을 법한 위치만 골라 미리 준비한 이름 목록에서 검색하는 식으로 무거운 언어 모델을 대신한다.
Data-Free KD from CLIP은 원본 학습 데이터 없이 CLIP에서 사용자가 원하는 소수 클래스만 분류하는 가벼운 전용 모델을 만든다. 데이터가 없으니 큰 모델을 거꾸로 이용해 학습용 이미지를 직접 만들어내는데, 기존 방법은 이때 모델 안에 저장된 데이터 통계를 기준으로 삼는다. 그런데 CLIP은 그 통계가 없거나 웹에서 모은 데이터 탓에 사람 얼굴 쪽으로 치우쳐 있어서 무슨 클래스를 만들려 해도 이미지가 얼굴처럼 뭉개지고 정확도가 한 자릿수까지 떨어진다. 이 논문은 그 통계 대신 CLIP이 이미지와 텍스트를 같은 공간에서 맞춰보는 능력을 이용해서 목표 클래스 텍스트와 가장 잘 맞는 이미지가 나오도록 잠재 벡터를 조금씩 고쳐가며 합성 이미지를 만든다. 이 과정에서 이미지가 다양하지 못하거나 클래스 의미가 흐려지거나 특정 스타일에만 맞춰지는 문제를 각각 보완하는 장치를 더한다. 이렇게 만든 합성 이미지로 작은 모델을 학습시키고 최종 모델은 텍스트를 다루는 부분을 완전히 떼어내고 이미지만 받아 지정한 클래스를 분류한다.
[Q&A]
Q : YOLOE가 세 prompt를 지원한다지만 RepRTA는 텍스트를 미리 캐싱하고 LRPC는 4585개 vocabulary에서 검색하는데, 임의 텍스트를 못 받는 닫힌 detector 아닌가요?
A : text prompt와 prompt-free를 나눠 봐야 합니다. text prompt는 추론 때 CLIP text encoder를 그대로 써서 임의 텍스트를 임베딩하므로 캐싱 안 된 문구도 처리되는 진짜 open입니다. 캐싱과 re-parameterization은 학습 가속과 배포 최적화로만 사용됩니다. 반면 prompt-free는 4585개 목록과 매칭하므로 그 안에 없는 개념은 이름을 못 붙이고 닫힌 목록이라는 지적은 이 경로에만 해당합니다.
Q : Prompt-free는 평가셋에 그 객체가 다 있지도 않은데 어떻게 측정하고 vocabulary는 어디서 가져오나요?
A : 평가는 LVIS에서 하지만 모델 예측을 text encoder로 LVIS 카테고리에 매핑한 뒤 AP를 계산합니다. vocabulary는 open-set image tagging의 tag list에서 가져온 4585개이고 이는 RepRTA의 학습용 캐시와는 다른 prompt-free 전용 목록입니다.
Q : Data-Free KD가 뭐고 일반 KD와 어떻게 다르며 왜 CLIP에서는 실패하나요?
A : 일반 KD는 데이터에 teacher와 student를 함께 통과시켜 학습하지만, DFKD는 원본 데이터가 없어 teacher를 거꾸로 이용해 합성 데이터를 만든 뒤 증류합니다. 이 과정을 model inversion이라 합니다. 기존 방식은 inversion에서 BatchNorm 통계에 의존하는데, CLIP은 ViT라 BN이 없거나 BN 통계가 얼굴로 편향되어 합성 이미지가 무너지고 정확도가 한 자릿수까지 떨어집니다. 이 논문은 BN 대신 image-text matching으로 inversion해서 이를 우회합니다.
Q : 최종 student는 지정한 소수 클래스만 분류하는데 왜 open-vocabulary라고 부르나요?
A : 여기서 open은 커스터마이징 대상을 임의 클래스 텍스트나 예시 이미지로 자유롭게 지정할 수 있다는 입력의 유연성을 뜻합니다. 그렇게 만든 student는 지정 클래스만 분류하는 closed-set이 맞습니다. 입력은 열려 있고 결과물은 닫혀 있는 구조라 closed-set 아니냐는 지적은 student 관점에서 맞습니다.
[관련 논문]
YOLOE: Real-Time Seeing Anything
Open-Vocabulary Customization from CLIP via Data-Free Knowledge Distillation
[녹화영상]
https://us06web.zoom.us/rec/share/zGRj_B1TTRh5HMrUFAndtU94R_Q_TVhigh7qHMQ0e9QaIdHXg14qcaJ93pZFG-Or._YVDDr8l2zoznhNh
[세미나 주제]
Lightweight Open-Vocabulary Recognition
[발표자]
김민재
[요약]
본 발표에서는 CLIP 같은 vision-language model의 등장으로 가능해진 open-vocabulary 인식을 다루지만 이 능력을 제공하는 모델이 지나치게 무거워 엣지나 모바일 환경에 배포하기 어렵다는 공통 문제에 주목하여 이를 경량화하는 두 논문 YOLOE와 Data-Free Knowledge Distillation from CLIP을 비교 분석하였다. 첫번째 논문은 detection 관점에서 어디에 무엇이 있는지를 실시간으로 찾는 문제를, 다음 논문은 classification 관점에서 CLIP의 지식을 원본 데이터 없이 작은 전용 모델로 뽑아내는 문제를 다룬다. 기존 인식 모델이 학습 때 정의한 클래스 목록에만 갇히는 것과 달리 두 논문 모두 새로운 텍스트가 들어와도 재학습 없이 추론할 수 있는 open-vocabulary 능력을 유지하면서 모델을 어떻게 가볍게 만들 것인가를 서로 다른 축에서 풀어낸다.
YOLOE는 YOLO 기반 실시간 detector로 텍스트로 카테고리를 지정하는 방식, 박스나 마스크로 지정하는 방식, 아무 지정 없이 이미지 안의 객체를 모두 찾는 방식 세 가지를 하나의 모델로 통합한다. 핵심은 원래 YOLO가 미리 정해둔 클래스 개수만큼 점수를 내던 부분을 각 위치마다 의미 벡터를 만들도록 바꿔서 이미지에서 뽑은 벡터와 프롬프트에서 만든 벡터를 내적해 클래스를 판정하기 때문에 인식할 클래스가 모델 구조에 고정되지 않고 프롬프트에 따라 바뀐다. 텍스트 방식은 클래스 텍스트를 미리 벡터로 계산해두어 이미지와 텍스트를 무겁게 섞는 연산을 없앤다. 박스 방식은 지정한 영역 안에서 객체 위치에 큰 가중치를 주어 배경이 섞이는 것을 막고 지정이 없는 방식은 객체가 있을 법한 위치만 골라 미리 준비한 이름 목록에서 검색하는 식으로 무거운 언어 모델을 대신한다.
Data-Free KD from CLIP은 원본 학습 데이터 없이 CLIP에서 사용자가 원하는 소수 클래스만 분류하는 가벼운 전용 모델을 만든다. 데이터가 없으니 큰 모델을 거꾸로 이용해 학습용 이미지를 직접 만들어내는데, 기존 방법은 이때 모델 안에 저장된 데이터 통계를 기준으로 삼는다. 그런데 CLIP은 그 통계가 없거나 웹에서 모은 데이터 탓에 사람 얼굴 쪽으로 치우쳐 있어서 무슨 클래스를 만들려 해도 이미지가 얼굴처럼 뭉개지고 정확도가 한 자릿수까지 떨어진다. 이 논문은 그 통계 대신 CLIP이 이미지와 텍스트를 같은 공간에서 맞춰보는 능력을 이용해서 목표 클래스 텍스트와 가장 잘 맞는 이미지가 나오도록 잠재 벡터를 조금씩 고쳐가며 합성 이미지를 만든다. 이 과정에서 이미지가 다양하지 못하거나 클래스 의미가 흐려지거나 특정 스타일에만 맞춰지는 문제를 각각 보완하는 장치를 더한다. 이렇게 만든 합성 이미지로 작은 모델을 학습시키고 최종 모델은 텍스트를 다루는 부분을 완전히 떼어내고 이미지만 받아 지정한 클래스를 분류한다.
[Q&A]
Q : YOLOE가 세 prompt를 지원한다지만 RepRTA는 텍스트를 미리 캐싱하고 LRPC는 4585개 vocabulary에서 검색하는데, 임의 텍스트를 못 받는 닫힌 detector 아닌가요?
A : text prompt와 prompt-free를 나눠 봐야 합니다. text prompt는 추론 때 CLIP text encoder를 그대로 써서 임의 텍스트를 임베딩하므로 캐싱 안 된 문구도 처리되는 진짜 open입니다. 캐싱과 re-parameterization은 학습 가속과 배포 최적화로만 사용됩니다. 반면 prompt-free는 4585개 목록과 매칭하므로 그 안에 없는 개념은 이름을 못 붙이고 닫힌 목록이라는 지적은 이 경로에만 해당합니다.
Q : Prompt-free는 평가셋에 그 객체가 다 있지도 않은데 어떻게 측정하고 vocabulary는 어디서 가져오나요?
A : 평가는 LVIS에서 하지만 모델 예측을 text encoder로 LVIS 카테고리에 매핑한 뒤 AP를 계산합니다. vocabulary는 open-set image tagging의 tag list에서 가져온 4585개이고 이는 RepRTA의 학습용 캐시와는 다른 prompt-free 전용 목록입니다.
Q : Data-Free KD가 뭐고 일반 KD와 어떻게 다르며 왜 CLIP에서는 실패하나요?
A : 일반 KD는 데이터에 teacher와 student를 함께 통과시켜 학습하지만, DFKD는 원본 데이터가 없어 teacher를 거꾸로 이용해 합성 데이터를 만든 뒤 증류합니다. 이 과정을 model inversion이라 합니다. 기존 방식은 inversion에서 BatchNorm 통계에 의존하는데, CLIP은 ViT라 BN이 없거나 BN 통계가 얼굴로 편향되어 합성 이미지가 무너지고 정확도가 한 자릿수까지 떨어집니다. 이 논문은 BN 대신 image-text matching으로 inversion해서 이를 우회합니다.
Q : 최종 student는 지정한 소수 클래스만 분류하는데 왜 open-vocabulary라고 부르나요?
A : 여기서 open은 커스터마이징 대상을 임의 클래스 텍스트나 예시 이미지로 자유롭게 지정할 수 있다는 입력의 유연성을 뜻합니다. 그렇게 만든 student는 지정 클래스만 분류하는 closed-set이 맞습니다. 입력은 열려 있고 결과물은 닫혀 있는 구조라 closed-set 아니냐는 지적은 student 관점에서 맞습니다.
[관련 논문]
YOLOE: Real-Time Seeing Anything
Open-Vocabulary Customization from CLIP via Data-Free Knowledge Distillation
[녹화영상]
https://us06web.zoom.us/rec/share/zGRj_B1TTRh5HMrUFAndtU94R_Q_TVhigh7qHMQ0e9QaIdHXg14qcaJ93pZFG-Or._YVDDr8l2zoznhNh
첨부파일
-
[260702]_김민재_Lightweight Open-Vocabulary Recognition.pdf (4.2M)
DATE : 2026-07-11 19:28:18
- 이전글[20260709 특별 세미나] CAKE: Category Aware Knowledge Extraction for Open-Vocabulary Object Detection 26.07.13
댓글목록
등록된 댓글이 없습니다.