[20260707 통합세미나] Skeleton-based Human Action Recognition
페이지 정보

본문
[일시]
2026.07.07.
[세미나 주제]
Skeleton-based Human Action Recognition
[발표자]
김정년
[요약]
본 발표에서는 skeleton 기반 인간 행동 이해에서 사전학습 표현을 실제 연속 행동 분석에 적용하기 위한 두 가지 연구인 DuoCLR과 USDRL 기반 Foundation Model을 소개하였다. DuoCLR은 여러 단일 행동을 재배열하는 Shuffle and Warp 증강과 CPC, ROR의 이중 surrogate task를 통해 trimmed 영상에서 학습한 표현을 긴 untrimmed 영상의 frame-level action segmentation에 효과적으로 전이하였다. 실험 결과, 제한된 양의 정답 데이터만을 활용한 semi-supervised 환경에서도 높은 성능을 유지하였으며, 개별 행동의 특징뿐만 아니라 행동 간의 문맥과 상대적 순서를 함께 학습하는 것이 연속 행동을 구분하는 데 중요함을 확인하였다.
Foundation Model for Skeleton-Based Human Action Understanding에서는 DSTE 기반의 시공간 특징 추출과 Multi-Grained Feature Decorrelation, Multi-Perspective Consistency Training을 통해 시간 및 관절 단위의 dense representation을 학습하였다. 이를 바탕으로 행동 인식뿐만 아니라 detection, segmentation, early action prediction 및 cross-dataset transfer 등 다양한 downstream task에서 높은 성능과 일반화 능력을 보였다. 특히 decoder, memory bank, momentum encoder가 없는 비교적 단순한 구조로도 coarse-grained task와 dense prediction task를 함께 처리할 수 있다는 점에서 skeleton foundation model로서의 가능성을 확인하였다.
두 연구를 통해 실제 작업 절차 검증에서는 단순한 clip-level 행동 분류를 넘어 frame-level 특징과 장기적인 행동 문맥을 함께 고려하는 것이 중요함을 확인하였다. 향후에는 USDRL의 dense feature를 HA4M 조립 작업 데이터에 적용하고, MS-TCN 및 절차 검증 head와 결합하여 행동의 완료 여부, 누락, 수행 순서 및 수행 구간을 예측할 예정이다. 또한 DuoCLR의 step permutation 기반 사전학습 방법을 적용하여 제한된 학습 데이터 환경에서도 연속 조립 행동 간의 문맥과 순서 정보를 효과적으로 학습할 수 있는지 검증할 예정이다.
[질의응답]
Q: Foundation model 논문에서 입력이 spatial과 temporal 두가지 view로 들어가는데, 정확히 어떻게 작동하는 것인지
A: Temporal view와 spatial view는 같은 skeleton sequence를 서로 다른 기준으로 재구성해서 보는 방식입니다. 원래 skeleton input은 C×T×V×M 형태인데, 여기서 C는 좌표 채널, T는 frame 수, V는 joint 수, M은 사람 수를 의미합니다.
Temporal view에서는 각 frame을 하나의 token처럼 봅니다. 즉 한 frame 안에 있는 모든 사람과 모든 joint의 좌표를 펼쳐서 하나의 vector로 만들고, 이 vector들이 시간 순서대로 배열됩니다. 따라서 temporal stream은 “전체 자세가 시간에 따라 어떻게 변화하는가”를 학습합니다. 예를 들어 손을 올리거나, 걷거나, 물건을 집는 행동처럼 움직임의 순서와 변화 패턴을 파악하는 데 사용됩니다.
반대로 spatial view에서는 각 joint를 하나의 token처럼 봅니다. 하나의 joint가 전체 시간 동안 어떻게 움직였는지를 하나의 vector로 만들고, 이러한 joint token들 사이의 관계를 학습합니다. 따라서 spatial stream은 “관절들 사이의 구조적 관계가 어떤가”를 학습합니다. 예를 들어 손목, 팔꿈치, 어깨가 어떤 상대적 관계를 가지는지, 양손이 가까워지는지 같은 body structure 정보를 보는 역할을 합니다.
정리하면, temporal view는 frame 중심으로 시간적 변화와 action dynamics를 학습하고, spatial view는 joint 중심으로 skeleton structure와 관절 간 관계를 학습합니다. 이 두 stream을 함께 사용하기 때문에 모델은 행동의 움직임 패턴과 신체 구조 정보를 동시에 활용할 수 있습니다.
[관련 논문]
- DuoCLR: Dual-Surrogate Contrastive Learning for Skeleton-based Human Action Segmentation
- Foundation Model for Skeleton-Based Human Action Understanding
[녹화영상]
https://us06web.zoom.us/rec/share/bDVtaNKX3qA_vNmbb1_GK-bUt5J23tvt_RGMxXJvTR6XwBlXBB3RjOMr48bT21zM.0hTaAzHCrV4K8SLx
2026.07.07.
[세미나 주제]
Skeleton-based Human Action Recognition
[발표자]
김정년
[요약]
본 발표에서는 skeleton 기반 인간 행동 이해에서 사전학습 표현을 실제 연속 행동 분석에 적용하기 위한 두 가지 연구인 DuoCLR과 USDRL 기반 Foundation Model을 소개하였다. DuoCLR은 여러 단일 행동을 재배열하는 Shuffle and Warp 증강과 CPC, ROR의 이중 surrogate task를 통해 trimmed 영상에서 학습한 표현을 긴 untrimmed 영상의 frame-level action segmentation에 효과적으로 전이하였다. 실험 결과, 제한된 양의 정답 데이터만을 활용한 semi-supervised 환경에서도 높은 성능을 유지하였으며, 개별 행동의 특징뿐만 아니라 행동 간의 문맥과 상대적 순서를 함께 학습하는 것이 연속 행동을 구분하는 데 중요함을 확인하였다.
Foundation Model for Skeleton-Based Human Action Understanding에서는 DSTE 기반의 시공간 특징 추출과 Multi-Grained Feature Decorrelation, Multi-Perspective Consistency Training을 통해 시간 및 관절 단위의 dense representation을 학습하였다. 이를 바탕으로 행동 인식뿐만 아니라 detection, segmentation, early action prediction 및 cross-dataset transfer 등 다양한 downstream task에서 높은 성능과 일반화 능력을 보였다. 특히 decoder, memory bank, momentum encoder가 없는 비교적 단순한 구조로도 coarse-grained task와 dense prediction task를 함께 처리할 수 있다는 점에서 skeleton foundation model로서의 가능성을 확인하였다.
두 연구를 통해 실제 작업 절차 검증에서는 단순한 clip-level 행동 분류를 넘어 frame-level 특징과 장기적인 행동 문맥을 함께 고려하는 것이 중요함을 확인하였다. 향후에는 USDRL의 dense feature를 HA4M 조립 작업 데이터에 적용하고, MS-TCN 및 절차 검증 head와 결합하여 행동의 완료 여부, 누락, 수행 순서 및 수행 구간을 예측할 예정이다. 또한 DuoCLR의 step permutation 기반 사전학습 방법을 적용하여 제한된 학습 데이터 환경에서도 연속 조립 행동 간의 문맥과 순서 정보를 효과적으로 학습할 수 있는지 검증할 예정이다.
[질의응답]
Q: Foundation model 논문에서 입력이 spatial과 temporal 두가지 view로 들어가는데, 정확히 어떻게 작동하는 것인지
A: Temporal view와 spatial view는 같은 skeleton sequence를 서로 다른 기준으로 재구성해서 보는 방식입니다. 원래 skeleton input은 C×T×V×M 형태인데, 여기서 C는 좌표 채널, T는 frame 수, V는 joint 수, M은 사람 수를 의미합니다.
Temporal view에서는 각 frame을 하나의 token처럼 봅니다. 즉 한 frame 안에 있는 모든 사람과 모든 joint의 좌표를 펼쳐서 하나의 vector로 만들고, 이 vector들이 시간 순서대로 배열됩니다. 따라서 temporal stream은 “전체 자세가 시간에 따라 어떻게 변화하는가”를 학습합니다. 예를 들어 손을 올리거나, 걷거나, 물건을 집는 행동처럼 움직임의 순서와 변화 패턴을 파악하는 데 사용됩니다.
반대로 spatial view에서는 각 joint를 하나의 token처럼 봅니다. 하나의 joint가 전체 시간 동안 어떻게 움직였는지를 하나의 vector로 만들고, 이러한 joint token들 사이의 관계를 학습합니다. 따라서 spatial stream은 “관절들 사이의 구조적 관계가 어떤가”를 학습합니다. 예를 들어 손목, 팔꿈치, 어깨가 어떤 상대적 관계를 가지는지, 양손이 가까워지는지 같은 body structure 정보를 보는 역할을 합니다.
정리하면, temporal view는 frame 중심으로 시간적 변화와 action dynamics를 학습하고, spatial view는 joint 중심으로 skeleton structure와 관절 간 관계를 학습합니다. 이 두 stream을 함께 사용하기 때문에 모델은 행동의 움직임 패턴과 신체 구조 정보를 동시에 활용할 수 있습니다.
[관련 논문]
- DuoCLR: Dual-Surrogate Contrastive Learning for Skeleton-based Human Action Segmentation
- Foundation Model for Skeleton-Based Human Action Understanding
[녹화영상]
https://us06web.zoom.us/rec/share/bDVtaNKX3qA_vNmbb1_GK-bUt5J23tvt_RGMxXJvTR6XwBlXBB3RjOMr48bT21zM.0hTaAzHCrV4K8SLx
첨부파일
-
[260707]김정년_Skeleton_based_human_action_recognition.pdf (3.8M)
DATE : 2026-07-21 11:28:56
댓글목록
등록된 댓글이 없습니다.