Whiyoung_Jung_452bba881.png Whiyoung Jung 2026.03.05

[AAAI 2026] RL-Studio: A System for Multi-Phase Reinforcement Learning Experimentation

Introduction

AAAI(The Association for the Advancement of Artificial Intelligence)는 인공지능 분야에서 가장 권위 있는 국제 학회 중 하나로, 매년 전 세계 AI 연구자들이 모여 최신 연구 성과를 공유하고 미래 기술의 방향을 논의하는 자리입니다.

최근 AAAI 2026에서 가장 활발히 발표된 연구 주제는 ‘Physical AI’ 분야였습니다. 특히 Intelligent Robotics 카테고리에 "Embodied AI" 키워드가 새롭게 추가되는 등, 실제 물리 세계에서 동작하는 AI 시스템에 대한 관심이 크게 높아지고 있습니다. 이러한 흐름 속에서, 로봇 학습의 핵심 기술인 강화학습(Reinforcement Learning, RL) 연구 역시 중요한 위치를 차지하고 있습니다.

최근 Physical AI에 대한 관심이 높아지고 있는 가운데, 스마트 물류와 스마트 팩토리는 이제 비즈니스의 핵심적인 현실로 자리 잡고 있습니다. 글로벌 빅테크 기업 아마존(Amazon)은 전 세계 수백 개 물류센터에서 백만 대 이상의 자율 로봇을 운영하고 있으며, 이러한 대규모 로봇 군집(fleet)의 효율적인 협력은 현대 산업 자동화의 핵심 과제로 부상했습니다. 그런데 실제 시설을 구축하거나 변경하는 것은 큰 비용이 드는 일이기 때문에, 그 전에 다양한 레이아웃과 제어 전략을 테스트하는 시뮬레이션 기반 검증은 매우 중요한 역할을 합니다. 그러나 기존 시뮬레이션 플랫폼들은 강력한 기능을 제공하지만, 복잡한 설정과 긴 준비 시간으로 인해 빠른 의사결정이 필요한 현장에서는 활용이 어려웠습니다.

이러한 변화에 맞춰 AAAI 2026에서 LG AI연구원의 Physical Intelligence(PI) Lab은 Demonstration Program을 통해 강화학습 실험 플랫폼인 RL-Studio를 선보였습니다.


강화학습(Reinforcement Learning)이란?

강화학습(Reinforcement Learning, RL)은 AI 에이전트가 환경과의 시행착오를 통해 스스로 최적의 행동을 찾아가는 학습 방법입니다. 마치 아이가 자전거를 배울 때, 여러 번 넘어지고 일어서며 균형을 잡는 법을 배우듯, RL 에이전트도 환경과 직접 상호작용을 하며 보상 신호를 기반으로 점차 더 나은 전략(policy)을 학습합니다. 이러한 특성으로 강화학습은 게임 AI, 로봇 제어, 자율주행 등 다양한 분야에서 핵심적인 역할을 하고 있습니다.

전통적인 RL은 에이전트가 환경과 직접 상호작용하며 실시간으로 데이터를 수집하고 학습하는 방식입니다. 그러나 이 방식은 충분한 데이터를 모으기 위해 많은 환경 상호작용이 필요하고, 실제 로봇이나 산업 시스템처럼 시행착오의 비용이 큰 환경에서는 적용이 어렵다는 한계가 있습니다.

이러한 한계를 극복하기 위해 등장한 것이 오프라인 강화학습(Offline RL) 입니다. Offline RL은 미리 수집된 고정된 데이터셋(offline dataset)만을 활용하여, 환경과의 추가 상호작용 없이 학습하는 방식입니다. Offline RL의 등장과 함께, 기존의 환경 상호작용 기반 학습 방식은 이와 구분하기 위해 온라인 강화학습(Online RL)으로 불리게 되었습니다.

최근에는 이 두 방식의 장점을 결합한 오프라인 투 온라인(Offline-to-Online RL)으로 기술이 진화하고 있습니다. 먼저 Offline RL로 사전 학습하여 안정적인 초기 policy를 학습한 뒤, Online RL로 전환하여 실제 환경에서 추가 학습하는 하이브리드 방식입니다.

이미지 1. Online, Offline, Offline-to-Online RL의 학습 개요. Offline RL은 미리 수집된 데이터셋으로 학습하고, Online RL은 환경과의 상호작용을 통해 데이터를 수집하며 학습한다. Offline-to-Online RL은 Offline RL로 사전 학습한 policy를 Online RL로 전환(phase transition)하여 추가 학습하는 방식이다.


하지만 복잡한 변수가 존재하는 실제 산업 현장에서는 이 세 가지 방식만으로는 대응하기 어려운 더 정교하고 복잡한 프로세스가 요구되는 경우가 많습니다. 이번 블로그에서는 AAAI 2026 Demonstration Program에서 발표한 LG AI연구원 PI Lab의 Multi-Phase RL framework와 이를 지원하는 플랫폼 RL-Studio를 소개합니다.


1. 연구의 시작: 기존 RL 패러다임의 한계

실제 산업 현장에서 실험을 진행할 때 RL 연구자들은 여러 현실적인 어려움에 직면합니다. 특히 서로 다른 학습 방식을 연결하고, 복합적인 방식으로 조합해야 할 때 문제는 더욱 복잡해집니다.

지금까지의 RL 패러다임은 Online RL, Offline RL, 그리고 이 둘을 결합한 Offline-to-Online RL로 발전해 왔습니다. Offline-to-Online RL은 기존 데이터로 사전 학습 후 실제 환경에서 미세 조정한다는 점에서 실용적인 접근법이지만, 학습 과정이 "Offline → Online"이라는 고정된 두 단계에 한정됩니다.

이에 LG AI연구원은 기존의 틀을 깨는 근본적인 질문을 던졌습니다. 과연 "Offline-to-Online RL 이후에는 무엇이 있는가?"

● 왜 Multi-Phase RL인가?

Offline-to-Online RL은 사실 우리가 마주할 수 있는 광범위한 패러다임의 한 가지 사례에 불과합니다. Transfer learning이나 sim-to-real adaptation의 관점에서 본다면, 학습 과정에서의 전환(transition)은 훨씬 다양한 형태로 일어날 수 있습니다.

- 학습 방식의 전환: Offline ↔ Online 간의 유연한 전환
- 알고리즘의 전환: 예를 들어 TD3로 학습한 뒤 SAC로 전환하여 이어서 학습
- 학습 환경의 전환: 시뮬레이션에서 학습한 policy를 실제 환경에 적용하는 sim-to-real 시나리오

LG AI연구원은 이번 논문을 통해 이러한 단계별 전환이 실제 성능 향상에 얼마나 기여하는 지 두 가지 대표적인 실험을 통해 입증했습니다.

1. Fine-Tuning 시나리오 : Offline RL(TD3-BC[1])로 사전 학습한 Policy를 Online RL(TD3[2])로 미세 조정하는 경우입니다. 사전 학습된 Policy 덕분에 순수 Offline RL이나 처음부터 시작하는 Online RL보다 더 높은 sample efficiency를 달성할 수 있습니다(이미지2). 

2. Adaptation 시나리오 : 시뮬레이션 환경(1.0G 중력)에서 Online RL(TD3)로 학습한 뒤, 실제 환경(1.2G 중력)에서 다른 알고리즘(SAC[3])으로 전환하여 적응하는 경우입니다. 처음부터 학습하는 것보다 훨씬 빠르게 수렴하는 것을 확인할 수 있습니다(이미지3).

이미지 2. TD3-BC (미리 수집된 데이터로 Offline 학습) -> TD3 (환경과의 상호작용하여 Online 학습)

 

이미지 3. TD3 (시뮬레이션에서 Online 학습) -> SAC (실제 환경에서 Online 학습)


이처럼 여러 단계의 학습을 유연하게 조합해야 하는 환경에서, 기존 프레임워크들은 미리 정해진 학습 전환(예: Offline → Online)만 지원하거나 단일 알고리즘에 제한되는 한계가 있었습니다. 이러한 시나리오들은 중요한 연구 질문들을 제기합니다. 1)언제 phase를 전환해야 하는가? 2)어떤 phase 조합이 특정 태스크에 최적인가? 3)전환의 결과를 어떻게 예측할 수 있는가? 이 질문들에 체계적으로 접근하기 위해, LG AI연구원은 Multi-Phase RL framework와 이를 지원하는 플랫폼 RL-Studio를 개발하였습니다.

2. Multi-Phase RL과 RL-Studio 

Multi-Phase RL Framework

LG AI연구원이 발표한 Multi-Phase RL framework를 기존의 한계를 극복하는 방법을 제안합니다. Multi-Phase RL은 Offline-to-Online RL의 "두 단계" 구조를 넘어, 임의의 수의 학습 단계를 자유롭게 연결할 수 있도록 확장한 개념입니다. 단계마다 학습 방식(Online, Offline, Offline-to-Online), 알고리즘, 학습 환경을 독립적으로 설정할 수 있어, 앞서 언급한 산업 현장의 복잡한 학습 시나리오를 유연하게 구성할 수 있습니다.

RL-Studio: Multi-Phase RL을 위한 실험 플랫폼

RL-Studio는 Multi-Phase RL 실험을 쉽고 효율적으로 수행할 수 있도록 설계된 플랫폼입니다. 기존에는 새로운 단계의 실험을 구성할 때마다 알고리즘 설정, 이전 단계의 학습된 모델(checkpoint) 로딩, 데이터셋 연결 등 반복적인 설정 작업에 많은 시간을 소모해야 했습니다. RL-Studio는 이러한 실험 설정의 overhead를 줄여, 연구자들이 Multi-Phase RL의 핵심 연구 질문에 집중할 수 있도록 지원합니다.

RL-Studio에서 지원하는 주요 기능은 다음과 같습니다.

1. 다양한 환경 지원: MuJoCo[4], AntMaze[5], Adroit[6] 등 OpenAI Gym[7] 호환 환경
2. 폭넓은 알고리즘: Online RL, Offline RL, Offline-to-Online RL의 다양한 알고리즘
3. 유연한 데이터셋 활용: D4RL 데이터셋[8] 및 호환되는 커스텀 데이터셋
4. 손쉬운 확장: 필요에 따라 커스텀 알고리즘이나 환경 추가 가능

특히 이번 RL-Studio는 지난 ICML 2025에서 LG AI연구원이 발표한 Offline-to-Online RL 알고리즘인 PARS[9]OPT[10]도 RL-Studio에 탑재되어 있어, 최신 연구 성과를 바로 실험에 활용할 수 있습니다.

데모 영상 

아래의 영상들은 RL-Studio를 통해 Multi-Phase RL 실험을 구성하고 결과를 확인하는 과정을 보여줍니다.

 

 비디오 1. 첫 번째 phase 실험 구성. 환경과 데이터셋을 선택하고, Offline RL 알고리즘인 TD3-BC로 학습을 시작하는 과정을 보여줍니다.

비디오 2. 두 번째 phase 실험 구성. 첫 번째 phase에서 학습된 checkpoint를 불러온 뒤, Online RL 알고리즘인 TD3로 전환하여 이어서 학습하는 과정을 보여줍니다.

비디오 3. 여러 실험의 결과 그래프 비교. Online 학습은 환경과의 상호작용 횟수(interaction steps), Offline 학습은 학습 반복 횟수(gradient steps) 대비 return으로 성능을 측정하기 때문에, RL-Studio는 학습 패러다임별로 그래프를 자동 분리하여 공정한 비교를 지원합니다.

이처럼 RL-Studio를 사용하면 Multi-Phase RL 실험을 직관적으로 구성하고, phase 간 모델 전이와 성능 비교를 손쉽게 수행할 수 있습니다.

3. AAAI 2026에서의 관련 연구

Offline-to-Online RL에서 policy optimization은 크게 두 가지 목표로 구성됩니다. 하나는 state-action value function(Q-value)을 최대화하여 policy를 개선하는 policy improvement이고, 다른 하나는 policy가 기존 데이터 분포에서 크게 벗어나지 않도록 제약하는 policy constraint입니다. Online fine-tuning 초기에 policy improvement를 너무 공격적으로 수행하면 distribution shift가 증폭되어 성능이 불안정해지고, 반대로 policy constraint를 너무 강하게 적용하면 보수적인 학습으로 인해 성능 향상에 제약을 줄 수 있습니다. 기존 Offline-to-Online RL 알고리즘들은 이 두 목표 사이의 균형을 맞추는 데 집중해 왔지만, 대부분 모든 샘플에 동일한 균형을 적용하는 한계가 있었습니다.

이번 AAAI 2026에서 발표된 SPA(State Proficiency-Based Adaptive Fine-Tuning)[11]는 이 문제를 샘플 수준에서 해결합니다. SPA의 핵심 관찰은, 데이터셋의 한계와 policy의 일반화 능력 차이로 인해 offline 사전 학습의 효과가 상태마다 크게 다르다는 점에 주목합니다. 데이터셋에 잘 포함되고 높은 품질의 행동이 존재하는 상태에서는 policy가 효과적으로 학습되지만, 데이터 분포 밖의 상태나 suboptimal한 행동만 존재하는 상태에서는 학습이 부족합니다. SPA는 이러한 학습 효과의 차이를 state proficiency라는 개념으로 정의하고, 이를 기반으로 최적의 학습 전략을 제안합니다.

SPA의 state proficiency 평가 

SPA는 state proficiency를 평가하기 위해 action comparison 기반의 분류 방법을 사용합니다. 기본 아이디어는 현재 학습 중인 policy의 행동 품질을 reference policy와 비교하는 것입니다. 구체적으로, 각 상태 s에 대해 현재 policy π의 Q-value인 Q(s, π(s))를 reference policy의 Q-value인 Q(s, π_ref(s))와 비교합니다. 현재 policy의 Q-value가 reference policy보다 높으면 해당 상태를 높은 숙련도(high proficiency)로, 그렇지 않으면 낮은 숙련도(low proficiency)로 분류합니다.

여기서 offline 데이터와 online 데이터의 특성이 다르다는 점을 반영하여, SPA는 dual thresholds를 도입합니다. Offline에는 고정된 offline policy(π_off)를 reference policy로 사용하여 상대적으로 낮은 threshold를 설정하고, online 데이터에는 학습 과정에서의 optimal policy(π_opt)를 reference policy로 사용하여 상대적으로 높은 threshold를 설정합니다. 이를 통해 offline 데이터에서는 보수적으로, online 데이터에서는 적극적으로 학습하는 효과를 얻습니다.

또한 Q-value의 overestimation 문제로 인해 숙련도 분류가 잘못될 수 있으므로, SPA는 별도의 state value function(V-function)를 활용한 상태 숙련도의 classification correction 을 수행합니다. 높은 숙련도로 분류된 샘플 중에서 Q(s, π(s))가 V(s)보다 낮은 경우, 이를 overestimation에 의해 잘못 분류된 것으로 판단하고 낮은 숙련도로 재분류합니다.

SPA의 적응적 학습 전략

숙련도에 따른 평가가 완료되면, SPA는 분류 결과에 따라 샘플별로 다른 학습 전략을 적용합니다. 낮은 숙련도 샘플에는 policy improvement의 가중치를 높여 적극적으로 성능을 개선하고, 높은 숙련도 샘플에는 policy constraint의 가중치를 높여 이미 학습된 성능을 안정적으로 유지합니다. 이러한 동적 균형 메커니즘을 통해, 학습이 부족한 상태에서는 공격적으로 탐색하다가 숙련도가 높아지면 자동으로 보수적 학습으로 전환되며, 반대로 성능이 저하된 상태에서는 다시 적극적 학습으로 빠르게 복구됩니다.

그 결과, SPA는 D4RL 벤치마크의 Locomotion과 Maze2D 태스크에서 기존 방법 대비 각각 64.6%, 207.9%의 성능 향상률을 달성하며 SOTA(state-of-the-art)를 기록했습니다.

이처럼 Offline-to-Online RL 분야는 활발히 발전하고 있으며, RL-Studio는 이러한 최신 Online, Offline, Offline-to-Online RL 알고리즘들을 손쉽게 실험하고 비교할 수 있는 환경을 제공합니다.

4. LG AI연구원의 향후 계획 


LG AI연구원은 이번 AAAI 2026 Demonstration Program을 통해 RL-Studio를 공개하며, 전 세계 연구자들과 교류하고 귀중한 피드백을 수집했습니다. 이를 바탕으로 플랫폼의 완성도를 높이고, 강화학습 커뮤니티와의 협업을 통해 Multi-Phase RL 연구를 더 발전시켜 나갈 것입니다.

장기적으로 실제 로봇이나 산업 시스템에 RL-Studio를 적용하여, 시뮬레이션에서 학습하고 실제 환경에 배포한 뒤 운영 데이터를 다시 학습에 활용하는 폐쇄 루프(Closed-loop) 시스템으로 발전시키는 것을 목표로 하고 있습니다. LG AI연구원은 앞으로도 강화학습 분야의 혁신적인 연구를 지속하며, 실제 산업 현장에서 활용 가능한 AI 기술 개발에 앞장서겠습니다.
 

▶RL-Studio: A System for Multi-Phase Reinforcement Learning Experimentation Paper 보러가기

참고

[1] Fujimoto, S.; and Gu, S. S. 2021. A minimalist approach to offline reinforcement learning. In Advances in Neural Information Processing Systems, volume 34, 20132-20145.

[2] Fujimoto, S.; Hoof, H.; and Meger, D. 2018. Addressing function approximation error in actor-critic methods. In International Conference on Machine Learning, 1587-1596.

[3] Haarnoja, T.; Zhou, A.; Abbeel, P.; and Levine, S. 2018. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. In International Conference on Machine Learning, 1861-1870.

[4] Todorov, E.; Erez, T.; and Tassa, Y. 2012. MuJoCo: A physics engine for model-based control. In 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems, 5026-5033.

[5] Nachum, O.; Gu, S. S.; Lee, H.; and Levine, S. 2018. Data-efficient hierarchical reinforcement learning. In Advances in Neural Information Processing Systems, volume 31, 3303-3313.

[6] Kumar, V. 2016. Manipulators and manipulation in high dimensional spaces. Ph.D. thesis, University of Washington, Seattle.

[7] Brockman, G., et al. 2016. OpenAI Gym. arXiv preprint arXiv:1606.01540.

[8] Fu, J., et al. 2020. D4RL: Datasets for deep data-driven reinforcement learning. arXiv preprint arXiv:2004.07219.

[9] Kim, J., et al. 2025. Penalizing infeasible actions and reward scaling in reinforcement learning with offline data. In International Conference on Machine Learning, 30769-30790.

[10] Shin, Y., et al. 2025. Online pre-training for offline-to-online reinforcement learning. In International Conference on Machine Learning, 55122-55144.

[11] Li, S., et al. 2026. State proficiency-based adaptive fine-tuning for offline-to-online reinforcement learning. In AAAI Conference on Artificial Intelligence.