LMS_373130771.png Minsoo Lee 2024.02.28

[WACV 2024] UNSPAT: Uncertainty-Guided SpatioTemporal Transformer for 3D Human Pose and Shape Estimation on Videos

3D Human Pose and Shape Estimation은 이미지와 비디오로부터 사람의 대한 Mesh를 재구성하는 작업입니다. 이러한 입력 영상 및 동영상으로부터 사람의 자세와 행동을 인식 및 추론하는 연구는 컴퓨터 그래픽, 헬스케어 등 다양한 산업군에 응용할 수 있어 큰 주목을 받고 있습니다.

본 연구에서는 비디오에서의 3D Human Pose and Shape Estimation을 위한 효율적인 프레임워크를 제안합니다[5]. 이전 비디오 기반 방법들이 Global Average Pooling을 사용하여 Spatial Information을 압축한 뒤 Temporal Relationship을 고려하는 것과 달리, ‘Spatial Alignment Module’과 ‘Space2Batch’라는 두 모듈을 통해 Spatio-temporal Attention의 과도한 복잡성을 해결하였습니다. 또한 Uncertainty-guided Attention Re-weighting 모듈을 활용하여, 배경이 혼잡하거나 사물에 가려져 인물 인식이 어려운 환경에서도 모델의 강건성을 향상시켰습니다. 이러한 기법들을 통하여 널리 사용되는 벤치마크 데이터셋들에 대해 SOTA 성능을 달성하였으며, 그 상세한 성과를 컴퓨터 비전 분야 대표 학회 WACV 2024에서 발표했습니다.


1. Introduction

3D Human의 Pose와 Shape를 매개변수 기반으로 나타내는 SMPL[1]의 도입 이래로, 3D Human Pose and Shape Estimation 분야는 SMPL Parameter를 예측하는 형태로 발전하여 상당한 성능 진전이 이루어졌습니다.


그림 1. 3D Human Pose and Estimation에 SMPL 도입 시각화[1]


그러나 단일 프레임 기반 3D Human Pose and Shape Estimation은 모션 블러와 가려짐과 같은 상황에 취약하며, 이로 인해 이미지 시퀀스에 대해 추정 시 시간 축에 대해 불안정한 예측 성능을 보입니다. 이를 해결하기 위해 비디오 기반 다양한 접근법[2, 3, 4]들이 제안되어 왔습니다. 근래의 비디오 기반 연구들은 시간 축으로의 직접적인 확장을 위하여 각 프레임에서 개별적으로 Feature를 추출한 후 이를 합쳐 Temporal-aware Feature를 구성합니다. 그러나 이러한 확장은 Temporal Error를 개선하는데 기여하였으나 Reconstruction Error를 크게 증가시켰습니다. 그 이유는 Spatio-temporal Attention의 과도한 복잡성을 해결하기 위해 Global Average Pooling을 사용하여 Spatial Information을 압축한 뒤 Temporal Relationship을 모델링했기 때문입니다.


그림 2. global average pooling을 적용한 경우와 적용하지 않은 경우에 대한 비교 이미지


이에 본 연구에서는 Complexity를 과도하게 증가시키지 않으며 Spatio-temporal Dimension을 모두 고려하는 3D Human Pose and Shape Estimation Framework 구축을 목표로 삼았습니다. 이를 위해 1) 인접한 프레임들을 공간적으로 재정렬 시키는 'Spatial Alignment Module (SAM)', 2) Spatial Relationship과 Temporal Relationship을 분해하여 Spatio-temporal Attention의 복잡성을 크게 줄이는 'Space2Batch'를 제안하였습니다. 또한 Motion Blur, Occlusion과 같이 어려운 환경에서 모델의 강건성을 향상시키기 위해 Uncertainty-guided Attention Re-weighting 모듈을 제안하였습니다.


2. Methods

본 연구에서는 연속된 이미지 시퀀스를 활용하여 중심 프레임의 3D Human Pose and Shape를 추측하는 것을 목표로 합니다. Pose와 Shape를 나타내기 위하여 Parametric Human Body Model인 SMPL을 이용하여 Shape Parameters, Pose Parameters를 예측합니다.


그림 3. 제안된 모델의 개요도[5]


Spatial Feature Extraction and Spatial Alignment Module

먼저 이미지에서 사람의 바운딩 박스를 추출한 후 박스 내에서 이미지 Feature를 추출합니다. 이전 비디오 기반 방법들이 Global Average Pooled 백터를 사용하는 것과는 대조적으로 공간 정보 손실을 막기 위하여 해당 Feature에서 Pooling을 하지 않고 Spatial Dimension을 유지합니다. 이러한 Feature는 Spatial Dimension을 포함하고 있기 때문에 추가적인 처리가 필요합니다.

구체적으로, 사람의 바운딩 박스들이 Spatially Align되어있지 않기 때문에 이러한 Feature들을 단순하게 합치게 될 경우 성능저하로 이어지며, 이러한 현상은 카메라나 장면 속 사람이 빠르게 움직일 때 빈번하게 발생합니다. 이러한 문제를 해결하기 위해 각 인접한 Feature를 중심이 되는 Feature에 공간적으로 정렬시키는 Spatial Alignment Module(SAM)을 제안하였습니다. SAM은 인접한 Feature와 중심 feature를 인풋으로 하여 Affine Transformation Matrix를 예측합니다. 이 행렬은 x축, y축으로의 Scale, Translation 파라미터로 이루어져 있습니다. 예측된 Affine Transformation Matrix를 이용하여, 인접 Feature는 중심 Feature와 공간적으로 정렬되도록 워핑(Warping) 됩니다.


Space2Batch

SAM에 의해 공간적으로 정렬된 Feature 시퀀스를 Transformer 아키텍처를 활용하여 프레임 간의 공간-시간적 관계를 모델링 하게 되면 Attention Complexity가 입력 차원의 제곱으로 증가하기 때문에 O(dw2h2T2)의 복잡성이 발생합니다. 여기서 공간-시간 축의 각 점에 대하여 Attention을 계산함으로써 발생하는 과도한 복잡성을 처리하기 위해, Space2Batch를 제안하였습니다. SAM에 의해 시간축 내의 특성들이 공간 위치가 정렬되었으므로, 공간 차원을 배치로 처리함으로써 공간 위치로부터 시간 상관관계를 분해할 수 있으며, 따라서 동일한 공간 위치 사이의 Attention만을 계산합니다. 이는 O(dw2h2T2)에서 O(dwhT2)로 복잡성을 상당히 줄이면서 전체 공간-시간적 Attention을 고려했을 때보다 더 나은 성능을 달성하는 결과를 보여줍니다.


Uncertainty-Guided Attention Re-Weighting

공간-시간적 상관관계를 모델링 할 경우 특정 프레임의 오류가 전체 시퀀스로 전파되는 것을 방지하는 것이 중요합니다. 이는 특히 비디오 일부 프레임에서 가려짐 혹은 블러로 인해 잘못된 예측이 발생할 수 있는 경우 더욱 고려되어야 합니다. 이전 연구에서는 Transformer를 이용하여 시간적 관계를 단순하게 모델링함으로써 Error Propagation 문제가 나타났으나, 이를 해결하기 위하여 Uncertainty-guided Attention Re-weighting 을 제안하였습니다. 이 모듈의 핵심은 모델이 공간-시간적 위치에 대해 Uncertainty를 예측하는 것입니다. 훈련 도중 의도적으로 배치 내 다른 비디오들의 공간-시간적 위치로 무작위 대치를 함으로써 인공적인 아티팩트(Artifact)를 생성합니다. 그 후 이러한 아티팩트를 구별하는 작은 네트워크를 훈련합니다. 인퍼런스 시, 예측된 불확실성 맵은 공간-시간적 Attention을 Re-weighting 하기 위하여 사용됩니다.



이러한 Uncertainty-guided Attention Re-weighting 은 현재 프레임을 예측할 때 주변 프레임들의 도움이 필요한 영역을 식별하는 역할을 하며 잘못된 정보가 인접한 프레임으로 전파되는 것을 방지합니다.


3. Experiment

Attention Visualization


그림 4. Attention weight, Uncertainty map, Re-weighted attention의 시각화[5]


위 그림 4는 노이즈 패치가 프레임들에 추가되었을 때 Attention Weight, Uncertainty Map 그리고 Uncertainty-guided Attention Re-weighting이 어떻게 동작하는지를 나타냅니다. 그림 4의 두번째 행에서 Uncertainty Estimator가 가려진 영역에 대해 높은 Uncertainty Value를 정확하게 예측하는 것을 확인할 수 있습니다. 또한 예측된 Uncertainty Map은 그림의 세 번째 행에서 네 번째 행으로 Attention Map을 Re-weighting하는데 사용됩니다.


Comparison with State-of-the-Art Methods

기존 비디오 기반 방법론들과 정량적 비교를 하기 위해 3DPW, MPI-INF-3DHP, Human3.6M 벤치마크 데이터셋에 대하여 Reconstruction Error (PA-MPJPE, MPJPE, MPVPE), Temporal Error (Acceleration)을 측정하였습니다.


그림 5. 기존 방법론들과의 정량적 비교 결과[5]


위 그림 5와 같이 LG AI연구원의 모델은 모든 벤치마크에 대해 이전 방법론들에 대해 더 좋은 성능을 보입니다. 특히 우리의 방법론이 공간적 정보를 압축시키지 않고 시간적 관계를 모델링 하기 때문에 Reconstruction Error 측면에서 큰 성능 차이를 보이고 있습니다.


그림 6. 기존 방법론들과의 정성적 비교 결과 (출처 : 3DPW Dataset)


또한 제안된 방법론은 위의 이미지 5와 같이 가려짐이 심한 상황에서 다른 방법론들과 비교하여 더욱 강건한 예측 성능을 보여주고 있습니다.


4. Conclusion

지금까지 LG AI연구원에서 제안한 비디오기반 3D Human Pose and Shape Estimation을 위한 효율적인 프레임워크에 대해 살펴보았습니다. 이번 발표된 논문은 WACV 2024에서 오럴 세션 발표에 선정되는 성과도 거두었습니다. 구체적으로, 입력 Feature를 공간적으로 정렬하여 공간-시간 관계를 효율적으로 연산하고, 불확실성을 기반으로 Attention을 Re-weighting 하여 모델의 강건성을 향상시켰습니다. 또한 해당 분야에서 널리 사용되는 벤치마크 데이터셋들에 대해 SOTA 성능을 달성하였습니다.

3D Human 기술은 AI agent, 물류, 제조 분야 등 점차 많은 산업 환경에 적용되고, 사용자들에게 직접적인 혜택을 제공하게 될 것으로 예상됩니다. LG AI연구원에서도 3D Human Pose and Shape 연구의 실제 어플리케이션을 위한 효율적인 접근 방식을 위한 연구를 지속해 나갈 예정입니다.


▶UNSPAT: Uncertainty-Guided SpatioTemporal Transformer for 3D Human Pose and Shape Estimation on Videos (Link)

참고
[1] Loper et al. SMPL: A Skinned Multi-Person Linear Model. SIGGRAPH 2015.

[2] Choi et al. Beyond Static Features for Temporally Consistent 3D Human Pose and Shape from a Video. ECCV 2020.

[3] Luo et al. 3D Human Motion Estimation via Motion Compression and Refinement. ACCV 2020.

[4] Wei et al. Capturing Human in Motion: Temporal-Attentive 3D Human Pose and Shape Estimation from Monocular Video. CVPR 2022.

[5] M Lee et al. Uncertainty-Guided SpatioTemporal Transformer for 3D Human Pose and Shape Estimation on Videos. WACV 2024.