[20260623 통합세미나] Language Supervision and Modular Adaptation: Frontier…

페이지 정보

profile_image
작성자 김지훈
댓글 0건 조회 43회 작성일 26-06-30 14:48

본문

[일시] 2026. 06. 23

[세미나 주제] Language Supervision and Modular Adaptation: Frontiers in Open-Vocabulary Object Detection

[발표자] 김지훈

[요약]
LLMDet는 짧은 단어 위주의 캡션에 의존하여 이미지의 전역적 문맥을 놓치는 기존 OVD 모델의 한계를 극복하고자 제안되었다. 이 모델은 LMM을 활용하여 고품질의 장문 캡션과 단문 캡션을 생성하고 이를 통합하여 detector를 학습시키는 방식을 도입한다. 대규모 데이터셋 구축과 더불어 탐지기와 LLM을 연결하여 병렬적으로 학습시킴으로써, 적은 데이터만으로도 대규모 데이터를 학습한 모델과 필적하는 탐지 성능을 확보했으며 특히 희귀 클래스 탐지 성능을 크게 향상시킨다.

두 번째로 DitHub는 모델이 새로운 지식을 학습할 때 기존 지식을 잊어버리는 catastrophic forgetting 문제와 단일 가중치 세트 갱신 방식의 한계를 해결하기 위한 방법론이다. 소프트웨어 버전 관리 시스템의 개념을 차용하여, 각 클래스에 특화된 지식을 담는 모듈은 독립적으로 생성 및 관리하고 특정 파라미터는 전역적으로 공유하여 메모리 효율을 극대화했다. 새로운 도메인의 클래스가 등장하면 기존 모듈을 가져와 효과적으로 병합함으로써 기존 지식 유지와 새 도메인 적응을 동시에 달성한다. 또한, 원치 않는 특정 클래스의 인식 능력을 별도의 재학습 없이 해당 모듈을 분리하는 것만으로 제거할 수 있는 개념을 객체 탐지 분야에 도입했다.

Q. LLMDet에서 Image-level 캡션과 Region-level 캡션을 함께 사용하는 이유는 무엇인가?
A. LLM에 전역 이미지 특징만 입력할 경우 특정 영역의 객체를 텍스트와 정확히 매핑하는 데 어려움이 발생하기 때문이다. 이를 보완하기 위해 이미지 전체 문맥을 묘사하는 작업뿐만 아니라, 특정 단일 영역을 묘사하는 작업을 동시에 적용했다. 연구 결과, 두 캡션을 통합했을 때 서로 강한 보완 효과를 내어 희귀 클래스 탐지 성능이 극대화되는 시너지를 확인했다.

첨부파일

댓글목록

등록된 댓글이 없습니다.