2026 하계 데이터마이닝학회(KDMS2026) - 김지훈
페이지 정보

본문
<발표 후기>
8월 24일(월)
세션: 포스터 세션 #2
제목: category-invariant objectness calibration for open-vocabulary detection
본 연구에서는 open-vocabulary object detection에서 base category 중심의 학습으로 인해 novel object의 탐지 성능이 저하되는 문제를 다루었다. 분석 결과, 단순히 proposal 수를 늘리는 것만으로는 문제를 해결하기 어려웠으며, novel object가 후보로 생성되더라도 낮은 objectness로 인해 최종 탐지에서 제외될 수 있음을 확인하였다. 이를 바탕으로 객체성 판단에 category 정보가 과도하게 영향을 주는 현상을 완화하는 category-invariant objectness calibration(cioc)을 제안하였다. 제안 방법은 category 정보에 대한 의존을 줄이고 객체 자체의 특징에 집중하도록 하여 novel object의 탐지 성능을 개선하는 것을 목표로 한다.
<청취 후기>
[alienlm: alienization of language for api-boundary privacy in black-box llms]
본 연구는 llm api를 사용하는 과정에서 사용자의 prompt가 외부 서버에 평문으로 전달되면서 발생할 수 있는 개인정보 노출 문제를 다루고 있다. 이를 해결하기 위해 vocabulary의 token을 일대일로 변환하여 사람이 이해하기 어려운 alien language를 생성하고, 사용자의 입력을 변환된 형태로 api에 전달하는 alienlm을 제안하였다. 기존의 개인정보 보호 방법과 달리 모델 내부에 접근하지 않고 api 환경에서 적용할 수 있다는 점이 인상적이었으며, llm 활용이 증가하면서 중요해지고 있는 개인정보 보호 문제를 새로운 관점에서 해결한 흥미로운 연구라고 생각하였다.
[state-space hierarchical compression with gated attention and learnable sampling for hour-long video understanding in large multimodal models]
본 연구는 large multimodal model이 장시간 영상을 처리할 때 visual token이 과도하게 증가하는 문제를 다루고 있다. 이를 해결하기 위해 mambamia를 제안하여 영상의 공간·시간 정보를 단계적으로 압축하고, 중요한 정보만 선택적으로 활용하도록 한다. 이를 통해 token 수와 연산량을 줄이면서도 긴 영상에 대한 이해 성능을 유지하는 방식을 취한다. 장시간 영상 이해에서 모든 정보를 그대로 사용하는 대신 핵심 정보만 효율적으로 압축한다는 점이 인상적이었다.
8월 24일(월)
세션: 포스터 세션 #2
제목: category-invariant objectness calibration for open-vocabulary detection
본 연구에서는 open-vocabulary object detection에서 base category 중심의 학습으로 인해 novel object의 탐지 성능이 저하되는 문제를 다루었다. 분석 결과, 단순히 proposal 수를 늘리는 것만으로는 문제를 해결하기 어려웠으며, novel object가 후보로 생성되더라도 낮은 objectness로 인해 최종 탐지에서 제외될 수 있음을 확인하였다. 이를 바탕으로 객체성 판단에 category 정보가 과도하게 영향을 주는 현상을 완화하는 category-invariant objectness calibration(cioc)을 제안하였다. 제안 방법은 category 정보에 대한 의존을 줄이고 객체 자체의 특징에 집중하도록 하여 novel object의 탐지 성능을 개선하는 것을 목표로 한다.
<청취 후기>
[alienlm: alienization of language for api-boundary privacy in black-box llms]
본 연구는 llm api를 사용하는 과정에서 사용자의 prompt가 외부 서버에 평문으로 전달되면서 발생할 수 있는 개인정보 노출 문제를 다루고 있다. 이를 해결하기 위해 vocabulary의 token을 일대일로 변환하여 사람이 이해하기 어려운 alien language를 생성하고, 사용자의 입력을 변환된 형태로 api에 전달하는 alienlm을 제안하였다. 기존의 개인정보 보호 방법과 달리 모델 내부에 접근하지 않고 api 환경에서 적용할 수 있다는 점이 인상적이었으며, llm 활용이 증가하면서 중요해지고 있는 개인정보 보호 문제를 새로운 관점에서 해결한 흥미로운 연구라고 생각하였다.
[state-space hierarchical compression with gated attention and learnable sampling for hour-long video understanding in large multimodal models]
본 연구는 large multimodal model이 장시간 영상을 처리할 때 visual token이 과도하게 증가하는 문제를 다루고 있다. 이를 해결하기 위해 mambamia를 제안하여 영상의 공간·시간 정보를 단계적으로 압축하고, 중요한 정보만 선택적으로 활용하도록 한다. 이를 통해 token 수와 연산량을 줄이면서도 긴 영상에 대한 이해 성능을 유지하는 방식을 취한다. 장시간 영상 이해에서 모든 정보를 그대로 사용하는 대신 핵심 정보만 효율적으로 압축한다는 점이 인상적이었다.
- 다음글2026 하계 데이터마이닝학회(KDMS2026) - 장유나 26.08.31
댓글목록
등록된 댓글이 없습니다.