[20260710 특별 세미나] Parameter-Efficient Semantic Augmentation for Enhanc…

페이지 정보

profile_image
작성자 김지훈
댓글 0건 조회 57회 작성일 26-07-13 11:05

본문

[일시] 2026.07.10

[제목] Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection (HSA-DINO)

본 발표는 사전학습 OVOD 모델이 general domain에서는 강한 zero-shot 성능을 보이지만 의료·위성·수중 등 vertical domain으로 전이될 경우 성능이 급락하고, fine-tuning으로 이를 회복시키면 반대로 general domain 성능과 open-vocabulary 역량을 잃는 트레이드오프를 다루었다. 기존 텍스트 증강 방법은 이미지 내용을 반영하지 않는 고정 프롬프트를 사용하고, 기존 routing 방법은 도메인 간 분포가 겹쳐 오분류가 발생한다는 한계가 있었는데, HSA-DINO는 이 두 문제를 각각 MSPB와 SAR로 해결했다.

MSPB는 N개의 (key, prompt) 쌍으로 구성된 bank에서 스케일별로 이미지 특징과 가장 유사한 key를 선택해 프롬프트를 구성하며, matching loss와 orthogonal loss를 함께 사용해 key는 이미지에 정렬시키고 prompt들은 서로 다른 속성 방향을 커버하도록 학습시킨다. 이를 통해 색상·질감 같은 저수준 속성부터 공간적 맥락 같은 고수준 속성까지 계층적으로 텍스트 표현에 반영된다. SAR은 이상탐지의 anomaly score 계산 방식과 유사한 원리로 content와 domain 특징을 분리해 입력이 어느 도메인에 속하는지 판단하고, 이에 따라 augmented semantics 적용 여부를 동적으로 전환한다. V-LoRA는 image encoder에 저차원 어댑터를 삽입해 도메인 특화 시각 특징을 별도로 학습한다.

실험에서는 조화평균 H를 기준으로 HSA-DINO가 전 데이터셋에서 최고 성능을 달성했으며, ablation에서 SAR을 제거하면 augmented semantics가 모든 입력에 무차별 적용되어 general domain 성능이 붕괴에 가까운 수준으로 하락하는 결과가 특히 인상적이었다. V-LoRA·MSPB·SAR 세 모듈이 모두 갖춰질 때만 최고 성능에 도달한다는 점에서, 세 모듈이 독립적 기여가 아니라 서로를 보완하는 구조임을 확인할 수 있었다.

[Q&A]
Q: general domain 데이터셋은 대체로 샘플 수와 클래스 수가 매우 많은데, 이런 데이터셋이라면 vertical domain에 해당하는 샘플까지 포함하고 있을 수 있다. 그렇다면 general과 vertical을 구분하는 anomaly detection이 실제로 가능한가?
A: 이 논문이 다루는 vertical domain 데이터셋은 의료·위성 영상으로, 자연 이미지 위주의 일반적인 general domain 데이터셋과는 직관적으로도 차이가 크기 때문에 구분이 충분히 가능할 것으로 보인다.

[녹화영상]
https://us06web.zoom.us/rec/share/-XqoUwbRYpAF0B_9VIgNvvF7PAl_CkAy5tpRCProxyvo37kQ3ndhYuA67kXpkhs.4u4F8Dm-Iq27PScT

첨부파일

댓글목록

등록된 댓글이 없습니다.