최근 방대한 양의 데이터로 훈련된 Large Language Model (LLM)이 놀라운 성능 향상을 보여주고 있습니다. 하지만, 직접적인 전문가 데이터셋을 필요로 하는 Supervised Fine-tuning 방법들 만으로는 성능 개선에 한계가 있습니다. 이를 극복하기 위해 사람이나 AI의 피드백을 활용한 LLM 강화 학습 방법론에 대한 많은 연구들이 수행되고 있으며, ‘NeurIPS (Neural Information Processing Systems, 뉴립스) 2023’에서도 다양한 연구 성과가 공개되었습니다. 그중 Reinforcement Learning from Human Feedback (RLHF)과 Reinforcement Learning from AI Feedback (RLAIF) 기술 연구 동향에 대해 소개해 드리고자 합니다.
최근 LLM을 강화 학습으로 Fine-tuning 하는 대표적인 방법으로는 Reinforcement Learning from Human Feedback (RLHF)[1]이 많이 사용되고 있습니다. 기존 RLHF 방법론은 아래와 같이 정형화된 두 가지 과정을 거칩니다.
1. Reward Model Learning 과정
주어진 Pairwise Dataset (문제에 대한 두 가지 답변과 그에 대한 사람의 선호도를 매긴 Preference Data)을 이용하여 Reward Model 학습 진행
2. Policy Learning 과정
학습된 Reward Model을 이용하여 Proximal Policy Optimization (PPO)[2]와 같은 RL 알고리즘을 통해 LLM 학습 진행
하지만, 이러한 방식의 RLHF 방법론들은 두 가지의 분리된 학습 과정, 사람의 선호도를 표현하는 단일 Reward Model을 통해 학습하기 때문에 학습이 불안정하고 쉽게 성능 개선이 되지 않는 등의 문제점들이 있습니다. 이번 NeurIPS 2023에서도 앞서 언급 드린 문제점들을 해결하기 위한 RLHF 혹은 RLAIF 관련 연구들이 다양하게 발표되었으며, 그중에서도 다음의 두 가지 연구가 크게 주목 받았습니다.
1. Direct Preference Optimization: Your Language Model is Secretly a Reward Model[3]

그림 1. RLHF와 DPO를 통한 LLM 학습 과정
스탠퍼드대학교(Stanford University)에서 발표한 해당 논문은 주어진 사람이나 AI의 Preference Data 로부터 Reward Model을 학습하고, 이를 기반으로 Policy를 학습하는 기존의 RLHF 방식에서 벗어나, Preference Data로부터 직접적으로 Policy를 Learning 할 수 있는 방법론을 제안합니다. 해당 논문에서는 기존 RLHF의 두 단계 학습과정을 통해 얻은 Reward Model과 Optimal Policy를 수학적인 증명 하에 동등한 Optimal Policy를 얻을 수 있는 Single Optimization 문제로 변형하고 새로운 Objective Function을 제안하였습니다.

그림 2. DPO와 기존 방법론들을 이용한 LLM 학습 비교결과
(좌측: Sentiment Generation Task 결과, 우측: Summarization Task 결과)
해당 논문에서 제안된 Direct Perefence Optimization (DPO)가 기존 RLHF 방법론들에 비해 효과적이라는 것을 보여주기 위해, Controlled Sentiment Generation, Summarization, Dialogue 등의 다양한 NLP 도메인의 Benchmark들에서의 비교 실험을 수행하였습니다. 논문에서는 해당 Task에서 제안된 DPO가 기존 RLHF 방법론에 비하여 더 높은 성능과 함께 안정적인 학습 양상을 갖는 것을 보여주었습니다.
2. Fine-Grained Human Feedback Gives Better Rewards for Language Model Training[4]
워싱턴대학교(University of Washington)에서 발표한 해당 논문은 답변에 대한 사람의 선호도 정보만으로 학습되는 기존 Preference-based RLHF 방법론을 개선하기 위하여 보다 명확하게 기준들을 정의하고 LLM의 성능을 개선할 수 있는 방법론과 Benchmark를 제안하였습니다.

그림 3. 기존 Preference-based RLHF 방법론과 새롭게 제안된 Fine-Grained RLHF 방법론의 Human Feedback 수집 과정 및 LLM 학습 방법 비교
기존 Preference-based RLHF는 사람의 선호도에 대한 정보만을 피드백으로 받습니다. 사람들마다 서로 다른 기준의 선호도를 가지기 때문에, 여러 사람들의 피드백으로부터 유의미한 학습 시그널을 받기가 어렵습니다. 이러한 문제점을 해소하고 보다 효과적인 학습을 위해, 해당 논문에서는 성능 개선이 필요한 Metric들을 명확하게 정의하고 Fine-Grained Human Feedback을 학습에 활용하면, 다양한 Metric들에 대하여 보다 효과적인 학습이 가능하다는 것을 보여줍니다.

그림 4. Fine-Grained RLHF 방법론을 통해 개선된 LLM의 성능 결과 (좌측) 및 학습 그래프 (우측)

그림 5. Fine-Grained RLHF 방법론을 통해 개선된 LLM 성능의 Human evaluation 결과
해당 논문에서 제안된 Fine-Grained RLHF 방법론이 기존 Preference-based RLHF 방법론에 비해 효과적이라는 것을 보여주기 위해, Detoxification과 Long-Form Question Answering (QA) Task에서 비교 실험을 수행하였습니다. 논문에서는 해당 Task들에서 제안된 Fine-Grained RLHF가 기존 Preference-based RLHF에 비하여 보다 효과적으로 학습을 수행할 수 있음을 보여줍니다.
이번 글에서 다룬 논문 외에도 NeurIPS 2023에서 Human Feedback과 AI feedback을 활용한 RLHF, RLAIF 기술에 대한 다양한 연구들이 발표되었습니다. 특히 Fine-Grained Feeback을 이용한 학습 방법을 통해 앞으로는 보다 다양하고 구체적인 측면에서의 LLM 성능 개선이 가능할 것으로 보입니다. LG AI연구원에서도 RLHF 및 RLAIF를 통한 LLM Fine-tuning 연구를 진행하고 있으며, 특히 Feedback Signal을 이용하여 다양한 선호도를 갖는 사용자들에게 보다 적합한 답변을 생성할 수 있는 RLHF, RLAIF 방법론을 연구할 계획입니다.
▶ NeurIPS 2023 Research Blog 시리즈가 궁금하다면? (Link)
[1] Long Ouyang, et al. “Training language models to follow instructions with human feedback”, NeurIPS 2022
[2] John Schulman, et al. “Proximal Policy Optimization Algorithms”, Arxiv 2017
[3] Rafael Rafailov, et al. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023
[4] Zeqiu Wu et al. “Fine-Grained Human Feedback Gives Better Rewards for Language Model Training”, NeurIPS 2023