이번 포스팅에서 소개할 내용은 NeurIPS 2022에 등록된 논문으로, 2022년 7월 LG AI연구원에 합류한 김건형 님이 KAIST 김기응 교수님 연구실에서 진행한 연구를 바탕으로 작성했습니다. KAIST 김기응 교수님의 연구실에서는 다양한 강화학습 및 모방학습 핵심 이론, 자연어와 강화학습을 결합한 연구 등 강화학습 전반에 걸친 다양한 연구를 수행하고 있습니다. 이번 연구는 상태만 있는 전문가 시연(state-only expert demonstration)을 활용하여 학습하는 사람의 모습에 착안하여, 상태만 있는 전문가 시연으로부터 오프라인 상황에서도 알고리즘이 학습할 수 있도록 하는 모방학습 방법론을 제시하고자 진행되었습니다.
Introduction
경험으로부터 학습하는 것은 지능형 에이전트의 핵심 요소 중 하나이며, 강화학습은 환경과 상호작용을 통해 보상함수를 받고, 이를 토대로 지능형 에이전트를 학습하는 프레임 워크입니다. 그러나 복잡한 문제에서 적절한 보상함수를 디자인하는 것은 매우 어렵기 때문에, 모방학습은 전문가 시연(expert demonstration)을 활용해 보상함수 없이 전문가의 행동을 따라 할 수 있게 합니다. 또한, 운전을 배우거나 영상을 보고 학습하는 과정에서 인간은 행동 정보 없이도 학습할 수 있지만 일반적인 모방학습 알고리즘은 전문가의 상태 정보 외에 별도의 행동 정보를 요구합니다.

그림 1. 운전을 배울 때 행동 라벨이 없이 상태만 있는 전문가의 시연
이처럼, learning from observation은 상태만 있는 전문가 시연에서 전문가를 모방하는 policy를 학습하는 것을 목표로 합니다. 하지만 기존 learning from observation의 문제 상황에는 환경과의 상호작용을 해야 할 뿐 아니라, 대체로 위험하거나 많은 비용이 발생합니다.

그림 2. 오프라인 learning from observation 문제 상황 개념도
따라서 본 논문에서는 위험부담이 큰 환경과의 상호작용 대신, 사전에 안전하게 수집된 불완전한 시연(imperfect demonstration)을 활용하는 오프라인 learning from observation 문제를 제안해 해결하고자 했습니다. 이 문제를 해결하기 위해 기존에는 off-policy learning from observation 알고리즘[1]이나, inverse dynamics model을 활용해 일반적인 오프라인 모방학습 알고리즘을 확장하는 방법[2]을 활용했습니다. 하지만 off-policy learning from observation 알고리즘의 경우, max-min의 최적화 형태를 가지고 out-of-distribution action value를 사용하기 때문에 오프라인에서 학습하기에는 불안정합니다. 또한, inverse dynamics model은 아래와 같은 수식으로 표현되며, stochastic한 전이 확률을 가질 때는 같은 환경에서도 policy마다 서로 다를 수 있어 문제 상황을 해결하기에 적합하지 않습니다.
이렇게 불완전한 시연으로 학습한 inverse dynamics model의 경우, stochastic한 환경에서 부정확한 전문가 행동 예측 결과를 냅니다. 그러므로 inverse dynamics model을 단순하게 활용해 기존 오프라인 모방학습 알고리즘을 확장하게 된다 해도 성능에 한계가 존재하게 됩니다. 본 논문에서는 이러한 오프라인 상황에서의 불안정성을 해결하면서도 최적의 성능을 달성할 수 있도록 수식에 기반한 새로운 알고리즘을 제시했습니다.
Method
대체로 오프라인 강화학습에서는 모델의 성능 저하를 막기 위해 데이터 support(지지집합)로부터 너무 멀어지지 않도록 하는 policy 제약이 쓰입니다. 동일한 이유로, 추가적인 KL regularization(정규화)과 함께 기존에 널리 쓰이던 모방학습 방법인 와 사이의 KL divergence 최소화를 사용합니다.
여기서 α>0는 상태-전이 분포 matching과 불완전한 시연 분포에서 멀어지는 것을 방지하는 것 사이의 균형을 맞추기 위해 사용되는 hyperparameter입니다. 해당 분포 matching 문제를 stationary distribution 최적화의 관점으로 다시 정리하면 다음과 같습니다:
여기서 첫 번째 제약조건은 종종 Bellman flow constraint라고 불리며, 어떤 policy π에 대해 이 유효한 상태-행동 stationary distribution이 되도록 하는 것입니다. 그리고 두 번째 제약조건은 marginalization constraint가 가 와 같은 policy에 대한 상태-전이 stationary distribution이 되도록 강제하는 것입니다. 해당 constraint optimization에 대한 Lagrangian은 다음과 같습니다:
이 때, 와 는 각각 Bellman flow constraint와 marginalization constraint에 대한 Lagrangian multiplier입니다. 위와 같은 최적화 문제를 다음과 같이 정리할 수 있습니다:
가 strict convex인 것을 활용하면, 에 대한 최대화의 closed-form solution을 구할 수 있습니다. 이후, closed-form solution인 을 에 대입하면 다음과 같은 결과를 얻습니다.
이렇게 얻은 objective는 convex minimization임과 동시에 out-of-distribution (OOD) action value를 사용하지 않는 형태가 됩니다. 마지막으로, 위 최적화 문제를 풀어 얻어낸 로부터 최적의 policy를 추출하는 문제가 남게 됩니다. 이를 위해서는 아래와 같은 weighted behavior cloning (WBC)를 사용합니다:
Experiments
본 논문은 LobsDICE를 검증하기 위해 tabular MDP와 continuous MDP에서 실험을 진행했습니다. Tablular MDP에서는 다음 네 가지의 비교 알고리즘을 사용하였습니다. 불완전한 시연에서의 BC, BCO[2], OPOLO[1]에 더해 저희가 디자인한 DemoDICEfO라는 알고리즘입니다. DemoDICEfO는 기존 오프라인 모방학습 알고리즘인 DemoDICE[3]를 확장한 것으로, inverse dynamics model을 학습하고 이를 이용해 전문가 시연에서 비어있는 행동들을 채워 넣은 뒤, 이렇게 구성한 전문가 시연을 사용해 DemoDICE 알고리즘을 적용한 것입니다. Continuous MDP에서는 IQ-Learn[4]과 RCE[5]라는 알고리즘을 추가해 실험했습니다.
우선 LobsDICE와 비교 알고리즘을 전문가, 불완전한 시연의 경로 숫자, 전이확률(transition probability)의 stochasticity 정도 등 다양한 내용을 조절해가며 randomly generated MDP에서 실험했습니다. 충분한 전문가 시연과 불완전한 시연이 있을 때, stochasticity의 정도가 증가하면(Figure 1에서 β=1) LobsDICE는 여전히 뛰어난 성능을 보이지만 비교 알고리즘들은 suboptimal한 성능을 보이는 것을 확인할 수 있었습니다.

Figure 1. LobsDICE와 비교 알고리즘들의 randomly generated MDP에서의 성능. 학습한 policy와 전문가의 상태-전이 stationary distribution 사이의 total variation을 측정한 것으로, 값이 작을수록 뛰어난 성능을 의미함[6]
다음으로 LobsDICE와 비교 알고리즘을 MuJoCo continuous control task에서 테스트했습니다. 이를 위해 D4RL 데이터 세트를 활용해 Hopper, Walker2d, HalfCheetah, Ant까지 총 네 가지 MuJoCo 환경에서 여러 task를 구성했습니다. LobsDICE는 다양한 task에서 유일하게 전문가의 성능에 가까운 성능을 가지는 policy를 항상 복원해냈고, 기존 비교 알고리즘의 성능을 능가하는 것을 확인했습니다.

Figure 2. LobsDICE와 비교 알고리즘의 MuJoCo control tasks에서의 성능. 높을수록 뛰어난 성능을 의미함[6]
Conclusion
본 논문은 오프라인 learning from observation에 적합한 새로운 알고리즘인 LobsDICE를 제시했습니다. LobsDICE는 out-of-distribution action value가 없는 convex optimization을 통해 학습하며, 이를 통해 오프라인 상황에서 안정적이고 뛰어난 성능을 보였습니다. LobsDICE는 다양한 tabular와 continuous task에서 성공적으로 state-of-the-art 성능을 달성하였습니다. 이 연구를 확장해 앞으로도 보다 다양한 형태의 데이터에 대해서도 학습 가능한 지능형 에이전트 알고리즘을 개발하고자 합니다.