KGH_f89395341.png Geonhyeong Kim 2023.02.07

sungikchoi_da34c0c41.jpg Sungik Choi 2023.02.07

dasolhwang_57d8316f1.jpg Dasol Hwang 2023.02.07

[NeurIPS 2022] 학회 참석 후기 및 최신 연구 트렌드

세계 최고 인공지능 학회로 손꼽히는 NeurIPS 2022(Neural Information Processing Systems)가 2022년 11월 28일부터 12월 9일까지 미국 뉴올리언스에서 in-person 프로그램들과 virtual 프로그램들이 혼합된 hybrid 형태로 개최되었습니다. LG AI연구원에서도 많은 연구원이 참석해 게재 논문 발표 및 기술 시연을 진행하고, LG 계열사와 함께 기업 부스를 운영하는 등 다양한 활동을 펼쳤습니다. 동시에 NeurIPS에서 발표된 논문들을 통해 글로벌 최신 연구 트렌드를 살펴보고 인사이트를 얻을 수 있었습니다. 그중 가장 주목받고 있는 Generative Modeling, Large Language Models, Reinforcement Learning 분야 주요 논문들에 대해, Advanced ML Lab(AML)의 최성익님, 황다솔님, 김건형님이 소개해주셨습니다.


[AML 최성익 님] Score-based Generative Modeling

최근 generative model에서 가장 주목을 받고 있는 topic은 단연 score-based generative model (SGM)입니다. 2019년 NeurIPS에서 재조명된 이후로[1] SGM은 image synthesis[2], text-to-image modeling[3] 등에서 이미 표준으로 자리매김했습니다. 이번 NeurIPS 2022에서 발표된 SGM 연구의 경향을 정리해 보겠습니다.

SGM은 여러 번의 sampling step을 거친다는 특징으로 다른 generative model들에 비해서 sampling speed가 느리다는 단점을 가지고 있습니다. 따라서 SGM의 생성 속도를 향상시키는 연구들[4,5,6]이 NeurIPS에서 다양하게 소개되었습니다. 이 중 pre-train된 network를 바꾸지 않고 SGM의 sampling 속도를 높이는 성과를 보인 두 연구를 소개합니다. 

첫번째로 DPM-solver[5]는 SGM의 reverse process에 해당하는 probability flow ordinary differential equation이 semi-linear한 structure를 형성하는 것을 확인했습니다. 이에 따라 ODE 전체를 푸는 대신 non-linear 한 term만 approximation함으로써 조금 더 approximation error를 줄이는 sampling 기법을 고안했습니다. 

GENIE[6]는 truncated Taylor’s method 기반으로 probability flow ODE를 더 잘 반영하는 high order solver를 제안했습니다.


그림 1. Motivation of High-order Solver[6]


또한, gradient를 구하기 위한 추가적인 계산량은 기존 모델 위에 작은 neural network를 붙여서 approximation하는 식으로 줄였습니다. 


그림 2. Distillation network of GENIE[6]


위 제안된 method들은 다양한 image domain에서 성능 향상을 보였습니다. 특히 GENIE는 diffusion model의 sampling 속도를 평가할 때 자주 사용되는 CIFAR-10 dataset에서 기존 ddpm 대비 function evaluation의 개수를 대폭 감소시켰을 뿐만 아니라 function evaluation의 개수가 10개 정도일 때도 타 method 대비 안정적인 성능을 보였습니다.


그림 3.  GENIE[6]의 CIFAR-10 dataset에서의 function evaluation 대비 FID


SGM을 기존의 Image domain이 아닌 다양한 space에서 정의하는 연구들 또한 이번 NeurIPS에서 한 축을 차지했습니다. INDM[7]은 flow network에서 유도된 latent spaced에서의 diffusion을 정의하고 image generation 성능 향상을 보였습니다. Riemannian SDE[8]은 일반적인 Euclidean space가 아닌 Riemannian geometry에서의 SDE를 정의하여 manifold를 더 잘 반영하는 모델링을 보였습니다.


그림 4. Riemannian neural field over Riemannian Neural SDE[8]


마지막으로 이미지 도메인에서 다양한 downstream task에 SGM을 적용하는 연구 또한 많은 주목을 받고 있습니다. 특히, plug and play 형식으로 추가적인 training 없이 unconditional SGM을 downstream task에 사용하는 연구들 또한 등장했습니다. 예를 들어 super-resolution, inpainting등의 문제는 linear inverse problem으로 formulation될 수 있습니다. DDRM[9] 은 noisy linear inverse problem을 singular value decomposition을 통해 구해진 spectral space에서 sampling으로 formulation 시키고, 추가적인 training 없이 unconditional diffusion model만을 가지고 efficient한 sampling을 할 수 있음을 보였습니다. MCG[10]는 Tweedie’s formula를 통해 denoising한 output을 noise 된 data 대신 sampling path에서 사용함으로써 noise-less linear inverse problem에서 state-of-the-art 성능을 보였습니다.


그림 5. Manifold Constraint gradient for improved sampling under inverse constraint[10]


LG AI연구원의 AML랩에서는 SGM 기반 generative model에 대한 연구를 중점적으로 시행하고 있습니다. text-to-image modeling, image generation 뿐만 아니라 Neural SDE에 대한 근원적 연구 및 audio data에 대한 적용 등 광범위한 연구를 시행하고 초거대 모델로의 확장 또한 계획하고 있습니다.


[AML 황다솔 님] Large Language Models

방대한 양의 데이터로 훈련된 초거대 모델은 텍스트, 이미지, 오디오 등의 많은 영역에서 놀라운 성능을 보여주었습니다. 하지만 초거대 모델을 훈련하기 위해서는 컴퓨팅 리소스 등의 비용이 상당하게 요구되며, 모델 크기가 커질수록 비용도 함께 증가합니다. 일반적으로 가용 자원은 제한되어 있기 때문에, 주어진 자원 안에서 초거대 모델을 효과적으로 학습할 수 있는 방법에 대해 많은 연구가 수행되고 있습니다. 이번 NeurIPS 2022에서도 초거대 모델 관련 연구들이 다양하게 발표되었으며, 그중에서도 크게 주목받은 두 가지 연구를 소개해 드리겠습니다.


Training Compute-Optimal Large Language Models[11]

DeepMind에서 발표한 해당 논문은 한정된 자원 안에서 초거대 언어 모델의 최적의 성능을 낼 수 있는 모델의 크기와 데이터 양의 상관 관계에 대해 다양한 실험 및 분석을 수행합니다. 특히, 모델의 Floating point operations(FLOPs)이 주어졌을 때, 가장 좋은 성능을 낼 수 있는 Parameters와 Training Tokens를 찾는 방법을 제시합니다. 또한, 기존 초거대 언어 모델들이 모델 크기 증가에 비해 학습 토큰 수가 적다는 것을 발견하고, (그림 6 참조) 더 작은 모델에 더 많은 데이터로 학습한 모델이 기존 모델들의 성능을 뛰어 넘는 것을 보였습니다.


그림 6. 주어진 학습 FLOPs에서의 학습 토큰 수와 파라미터 수의 최적 값[11]


그림 7. FLOPs-Parameters plot [11]


해당 논문은 동일한 FLOPs 기준으로 기존 초거대 언어 모델인 Gopher(280B)에 비해 약 4배 작은 크기인 Chinchilla(70B)를 제시합니다. (그림 7 참조) 저자들은 기존 초거대 언어 모델들이 모델 크기 증가에 비해 학습 토큰 수가 적었다는 것을 발견했습니다. Gopher의 1/4배 모델 크기로 약 4배 이상의 학습토큰을 사용한 Chinchilla가 같은 FLOPs 기준에서 Gopher 모델의 성능을 뛰어넘는 것을 확인했습니다. 또한, 본 논문에 제시한 70B Chinchilla가 280B Gopher는 물론 175B GPT-3 그리고 530B Megatron-Turing NLG보다 더 좋은 성능을 보였습니다. 이는 Chinchilla의 크기가 기존 초거대 모델보다 작기 때문에 미세 조정 및 추론에서 훨씬 적은 자원을 사용할 수 있음을 의미합니다.


Flamingo: a Visual Language Model for Few-Shot Learning[12]

기존의 멀티모달(multi-modal) 연구에서는 먼저 방대한 양의 감독 데이터로 사전 훈련을 수행한 후, 주요 관심 태스크를 위한 미세 조정을 하는 것이 일반적인 패러다임이었습니다. 하지만, 미세 조정에서도 수천 수만개의 주석이 달린 방대한 데이터를 요구할 때가 있고, 종종 태스크 별 하이퍼파라미터 조정이 필요해 자원에 의존해야 하는 상황이 발생합니다. 이에 따라, 최근 멀티모달 분야에서는 미세 조정 없이 새로운 태스크에서 수행할 수 있는 zero-shot adaptation 관련 연구들이 소개되고 있습니다.


그림 8. Flamingo의 모델 구조[12]


Flamingo는 prompt 기반의 in-context zero/few-shot learning이 가능한 모델로, Pretrained vision-only, language-only model에서 시작해 Multi-modal Vision-Language Model을 학습합니다. Flamingo의 특징은 각각의 unimodal 모델을 freeze하고 두 모달리티를 잇는 다리 역할을 하는 레이어만 학습한다는 점입니다. 이를 통해 unimodal 모델들을 처음부터 훈련시키는 데 필요한 계산 리소스를 절약할 수 있고, 각 unimodal 모델이 갖고 있는 능력들을 활용할 수 있습니다. 또한, 임의의 교차 배열된 이미지와 텍스트 데이터를 입력으로 넣을 수 있기 때문에 대용량 웹 데이터로 학습 가능합니다. 각 모달리티만 이해하던 unimodal 모델들을 연결하여 적은 수의 예제를 통해 여러 벤치마크에서 미세 조정된 모델보다 더 좋은 성능을 보여줍니다.


[AML 김건형 님] Multi-modal Behavioral Cloning: Behavior Transformers[13]

최근 NLP 분야에서 transformer 기반 알고리즘들의 주목할 만한 성과들을 보인 이후로, decision transformer[14]나 trajectory transformer[15]와 같이 이를 강화학습에서 활용하고자 하는 연구들이 제안되기 시작했습니다. 이후 이 논문들을 기반으로, transformer 구조를 활용하는 강화학습 관련 연구들이 점차 늘어나고 있는 추세입니다[16,17]. 이번 NeurIPS 2022에서 다양하게 발표된 transformer 기반의 연구들[18-20] 중, 모방학습에서 transformer를 활용한 연구인 Behavior Transformer (BeT)[13]를 소개해 드리겠습니다.

Pre-collected data로부터 어떻게 policy를 학습하는 것이 좋은지에 대해서는 자율주행이나 로봇제어를 비롯해, 다양한 도메인에서 꾸준히 필요성이 제기되어 온 근본적인 문제입니다. Pre-collected data로부터 행동을 학습하는 방법은 크게 offline reinforcement learning을 사용하는 방법과 imitation learning, 그중에서도 behavioral cloning을 사용하는 방법으로 나뉩니다. 현실 세계에서는 많은 경우 구체적인 reward가 주어지지 않으며, 이처럼 직접적인 reward가 주어지지 않는 경우에는 behavioral cloning이 널리 쓰이고 있습니다. 일반적으로 behavioral cloning은 pre-collected data에서 주어진 state에 대해 action을 예측하도록 하는 supervised learning을 통해 학습되며, 충분한 데이터가 있다면 뛰어난 성능을 보여줍니다. 하지만 많은 최신 behavioral cloning 알고리즘들은 unimodal 전문가 policy로부터 데이터가 수집되었다고 가정하고 접근합니다. 하지만 특정 의미의 문장을 생성하거나 주어진 과제를 해결할 때, 사람들은 다양한 형태의 문장을 생성하거나 다양한 방법으로 주어진 과제를 해결하며, 이로 인해 실제 사람들로부터 수집하는 데이터는 multi-modal 형태를 띄는 것이 일반적입니다.


그림 9. 주어진 Multi-modal 데이터에 대해 기존의 behavioral cloning 알고리즘과 해당 논문에서 제안된 BeT로 학습한 policy의 비교[13]


이러한 multi-modal 데이터로부터 학습하는 새로운 방법론인 BeT는 다음 세 가지 주요 요소에 기반하여 구성되었습니다:

  1. Transformer 기반 모델들이 가진 context기반 multi-token 예측 능력을 활용해 multi-modal action을 예측하도록 합니다.

  2. Transformer 기반 모델들은 discrete classification에 적합하므로, k-means clustering을 활용해 연속 multi-modal 행동을 k개의 클러스터로 clustering합니다.

  3. Residual action corrector를 학습하여 BeT에서 continuous action을 생성할 수 있도록 합니다.


이를 위해 저자들은 k-means clustering과 MinGPT[21]라는 transformer decoder를 활용하여 BeT를 구성합니다. 구성한 BeT는 크게 다음과 같이 두 단계로 학습합니다:

  1. k-means 알고리즘을 사용해 주어진 연속 행동을 k개의 클러스터로 clustering하도록 학습합니다. 이 때 학습된 각 클러스터의 중심점을 ‘action center’라고 부릅니다. 이를 통해 연속 행동으로부터 action center와 offset을 생성하는 encoder, 그리고 action center와 offset으로부터 연속 행동을 생성하는 decoder를 얻습니다. (그림 10의 A 참조)

  2. 데이터셋의 경로로부터 하위 경로를 추출하고, observation들을 MinGPT에 넣어줍니다. 이 때 MinGPT에서 생성된 categorical distribution과 action offset는 각각 k-means encoder로 생성된 action center와 offset을 ground truth로 활용해 loss function을 구성합니다. (그림 10의 B 참조)


이후 실제 rollout에 활용할 때에는, observation들을 MinGPT에 넣고 생성된 이산 행동과 action offset을 k-means decoder에 넣어 실제로 사용할 연속 행동을 최종적으로 생성합니다. (그림 10의 C 참조)


그림 10. BeT 아키텍쳐 구조[13]


마지막으로, 저자들은 시각적 관찰 기반의 자율주행 CARLA[22]와 두 가지 로봇 제어 도메인인 Block Push[23], 그리고 주방 환경에서의 다양한 과제인 Franka Kitchen[24], 총 세 가지 도메인에서 실험을 진행했습니다. 그림 11에서와 같이 BeT는 대부분의 과제에서 기존 알고리즘 대비 뛰어난 성공률을 보였습니다.


그림 11. BeT와 기존 알고리즘들의 성능 비교.
CARLA에서는 목표지점에 도달한 비율, Block push는 각 블록에 성공적으로 도달한 비율과 밀어서 원하는 위치로 옮긴 비율,
Kitchen은 280 스텝 안에 n개의 작업을 완료한 비율[13]


해당 논문에서는 기존에 unimodal한 전문가 데이터만 다루는 기존 행동복제 알고리즘을 개선하기 위해 transformer 구조를 활용해 multi-modal한 데이터를 다룰 수 있는 BeT 알고리즘을 제안했습니다. 이를 발전시켜 나가면 보다 실제 사람에 가까운 multi-modal한 policy 학습이 가능할 것으로 기대됩니다.


Conclusion

특정 도메인에 한정되지 않는 ML학회인 만큼, 이번 NeurIPS 2022에도 굉장히 다양한 주제들로부터 많은 논문들이 발표되었습니다. 그중 LG AI연구원에서도 관심 깊게 보고 있는 Generative Modeling, Large Language Models, 그리고 Reinforcement Learning 분야의 주요 논문들에 대해 알아보았습니다.

이번 학회에 LG AI연구원은 메인 학회에 7건, 워크샵에 5건, 총 12개의 논문을 게재하는 훌륭한 연구 성과를 거두었습니다. 또한 전세계 학교에서 AI를 전공하고 있는 학생들을 초대하여 LG AI Day 저녁식사를 진행하는 등, 학계와의 적극적인 네트워킹을 위한 자리도 마련했습니다. 현장에서 많은 발표를 들으면서 머신러닝의 적용범위가 지금도 계속 넓어지고 있음을 느낄 수 있었으며, 이에 맞춰 저희 AML랩 또한 여러 분야를 아우를 수 있는 기초 연구분야 기술을 계속해서 개발해 나갈 계획입니다.

참고
[1] Y. Song and S. Ermon, “Generative modeling by estimating gradients of the data distribution”, NeurIPS, 2019.

[2] P. Dhariwal and A. Nichol, “DIfffusion models beat GANs on image synthesis”, NeurIPS, 2021.

[3] A. Nichol, P. Dhariwal, A. Ramesh, P. Shyam, P. Mishkin, B. McGrew, I. Sutskever, and M. Chen, “GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models”, ICML, 2021.

[4] T. Karras, M. Aittala, T. Aila, and S. Laine, “Elucidating the design space of diffusion-based generative models”, NeurIPS, 2022.

[5] C. Liu, Y. Zhou, F. Bao, J. Chen, C. Li, and J. Zhu, “DPM-Solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps”, NeurIPS, 2022.

[6] T. Dockhorn, A. Vahdat, and K. Kreis, “GENIE: High-order denoising diffusion solvers”, NeurIPS, 2022.

[7] D. Kim, B. Na, S. Kwon, D. Lee, W. Kang, and I-C. Moon, “Maximum likelihood training of implicit nonlinear diffusion models”, NeurIPS, 2022.

[8] S. W. Park, H. Kim, K. Lee, and J. Kwon, “Riemannian neural SDE: Learning stochastic representations on manifolds”, NeurIPS, 2022.

[9] B. Kawar, M. Elad, S. Ermon, and J. Song, “Denoising diffusion restoration models”, NeurIPS, 2022.

[10] H. Chung, B. Sim, D. Ryu and J. C. Ye, “Improving diffusion models for inverse problems using manifold constraints”, NeurIPS, 2022.

[11] Hoffmann, Jordan, et al. "Training Compute-Optimal Large Language Models." NeurIPS, 2022.

[12] Alayrac, Jean-Baptiste, et al. "Flamingo: a visual language model for few-shot learning." NeurIPS, 2022.

[13] Shafiullah, Nur Muhammad Mahi, et al. "Behavior Transformers: Cloning k modes with one stone." NeurIPS, 2022.

[14] Chen, Lili, et al. "Decision transformer: Reinforcement learning via sequence modeling." NeurIPS, 2021.

[15] Janner, Michael, Qiyang Li, and Sergey Levine. "Offline reinforcement learning as one big sequence modeling problem." NeurIPS, 2021.

[16] Zheng, Qinqing, Amy Zhang, and Aditya Grover. "Online decision transformer." ICML, 2022.

[17] Xu, Mengdi, et al. "Prompting decision transformer for few-shot policy generalization." ICML, 2022.

[18] Yang, Yaodong, et al. "Transformer-based Working Memory for Multiagent Reinforcement Learning with Action Parsing." NeurIPS, 2022.

[19] Takagi, Shiro. "On the Effect of Pre-training for Transformer in Different Modality on Offline Reinforcement Learning." NeurIPS, 2022.

[20] Wang, Kerong, et al. "Bootstrapped transformer for offline reinforcement learning." NeurIPS, 2022.

[21] Brown, Tom, et al. "Language models are few-shot learners." NeurIPS, 2020.

[22] Dosovitskiy, Alexey, et al. "CARLA: An open urban driving simulator." CoRL, 2017.

[23] Florence, Pete, et al. "Implicit behavioral cloning." CoRL, 2022.

[24] Gupta, Abhishek, et al. "Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning." CoRL, 2019.