KSY_e8bd58921.png Soyeon Kim 2024.01.16

[NeurIPS 2023] Large Language Model (LLM) 분야 최신 연구 동향

NeurIPS 2023에서는 Large Language Model (LLM) 분야에서 많은 세션이 진행됐습니다. LLM 성능 향상과 관련된 연구 뿐만 아니라 신뢰할 수 있는 평가 방식, LLM과 인간 사이의 Alignment, 훈련 및 추론에서의 최적화, LLM을 활용한 다양한 Application, LLM에 의해 발생할 수 있는 Privacy/Bias 등 다양한 주제들이 다뤄졌습니다. 이번 글에서는 NeurIPS 2023에서 발표된 LLM 최신 연구 동향을 살펴보고, LLM 사전 학습 데이터와 관련해 인상적이었던 연구를 깊이 있게 소개해 드리고자 합니다.


섹션 1. NeurIPS 2023 Oral paper로 보는 LLM 연구 동향

NeurIPS 2023 기간 중 Oral과 포스터 발표는 3일 동안 진행됐습니다. 총 77개의 Oral Paper가 아래와 같은 스케줄(현지 시각 기준)로 발표됐습니다.


2023.12.12

  1. 오전 : Reinforcement Learning(1), Datasets & Benchmarks(1), Tractable Models

  2. 오후 : Efficient Learning Objects, Neuroscience, Vision Causality Privacy

2023.12.13

  1. 오전 : Neuro NLP/Tools, Diffusion Models

  2. 오후 : Optimization Datasets & Benchmarks(2), CoT/Reasoning

2023.12.14

  1. 오전 : Privacy/Fairness, Probability/Sampling, Vision(1)

  2. 오후 : LLMs, Reinforcement Learning(2), Vision(2), Theory(2)


흥미로운 것은 LLM에 대한 뜨거운 관심 덕분인지, 12월 14일에 진행된 ‘LLMs’ 외 다양한 주제에서도 LLM 관련 연구들이 많이 소개됐다는 점입니다. 본 섹션에서는 Oral로 발표된 논문들 중 눈여겨볼 만한 LLM 관련 연구들을 소개하도록 하겠습니다.


1. LLMs

  1. Are Emergent Abilities of Large Language Models a Mirage?[1]

저자는 LLM의 크기를 늘리면서 관찰된 Emergent Abilities가 실제로는 특정 모델 또는 태스크에 적용되는 어떤 특징으로 해석되기보다, 모델 성능 평가에 사용한 Metric 때문에 특정 태스크에서 급격히 뛰어난 질적 성장을 보이는 현상으로 이해해야 한다고 주장합니다. 평가 때 사용하는 Sample의 개수와 연구자들이 사용하는 Metric의 특성(Nonlinearity, Discontinuity)에 따라 특성이 달라질 수 있기 때문에 벤치마크와 Metric의 구성에 신중해야 할 것을 강조합니다.


  1. Jailbroken: How does LLM Safety Training Fail?[2]

최근 LLM은 도움이 되면서도 무해한(Helpful & Harmless) 방식으로 학습되고 있습니다. 그럼에도 불구하고, 실제 상황에서는 특정 악의적인 의도가 담긴 프롬프트의 입력에 따라 LLM의 생성 결과가 안전한 답변으로 이어지지 않는 경우들이 존재합니다. 논문 저자는 Safety를 고려한 학습에도 불구하고 이러한 양상이 관찰되는 이유를 두 가지 가설로 설명합니다. 1) Pretraining과 Instruction-following의 Objective가 상충하는 경우, 또는 2) 입력이 Safety Training 과정에서 Out-of-distribution 데이터이지만 Pretraining 단계에서는 포함됐을 법한 데이터인 경우입니다.
이를 통해 Safety Training은 여전히 취약한 부분이며, 단순히 데이터와 모델 사이즈를 늘리며 학습하는 것이 능사는 아니라는 점을 시사합니다.


2. NLP/Tools

  1. Toolformer: Language Models can Teach Themselves to Use Tools[3]

LLM은 다양한 분야에서 뛰어난 능력을 보여주지만, 수리적 부분이나 사실 기반의 정보 추론에는 낮은 성능을 보이기도 합니다. 따라서 본 논문의 저자는 모델이 외부 API Tool을 사용하면 훨씬 잘할 수 있는 태스크를 상정하고, 이러한 Tool을 잘 이용할 수 있도록 Self-supervised Learning으로 학습할 수 있는 Demonstration 데이터셋을 만들어 학습하는 방식을 제안합니다. Toolformer의 후속 연구 중 하나로는 아래의 ToolkenGPT가 있습니다.


  1. ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings[4]

LLM이 다양한 외부 Tool을 사용할 수 있도록 Fine-tuning 또는 In-context Learning을 활용하면 새로운 Tool의 Adaptation이나 Demonstration의 길이 한계와 같은 단점이 발생하게 됩니다. 논문 저자는 이러한 점을 보완하고자 Tool을 Token화 한 Toolken을 도입합니다. Toolken Embedding만을 학습하고 Language Model Head에 Append하고, Next Token Predeiction에서 Toolken이 나오면 대응되는 Tool을 실행해 답변을 생성하는 프레임워크를 제안합니다.


3. Efficient Learning

  1. QLoRA: Efficient Finetuning of Quantized LLMs[5]

본 연구는 LLM의 효율적인 Fine-tuning을 위해 모델의 일부 파라미터를 Fine-tuning하는 Parameter Efficient Fine-tuning(PEFT)의 방법론 중 하나입니다. 저자는 NormalFloat 4-bit 데이터 타입 사용, Double Quantization, Paged Optmizer를 사용해 기학습된 모델을 4-bit 까지 줄인 상태로 Fine-tuning할 수 있는 방법론을 제안합니다.


  1. Scaling Data-Constrained Language Models[6]

LLM 학습은 Multi-epoch를 사용하는 타 딥러닝 학습과 다르게 Single Epoch를 사용해왔습니다. 하지만, 학습에 사용할 수 있는 데이터가 Low-resource 언어와 같이 굉장히 한정적인 경우라면 부족한 학습량을 채우기 위해 데이터를 반복적으로 학습해야 하는 경우도 존재합니다. 본 논문은 이러한 Data-constrained 상황에서 Multi Epoch로 LLM을 학습할 경우 발생하는 영향을 분석하고 Scaling Law를 제안합니다.


4. Datasets & Benchmarks

  1. DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models[7]

LLM의 사용처가 다양해지면서 모델의 범용적 언어 능력 또는 높은 난이도의 태스크를 평가하는 벤치마크 외에도 모델의 Robustness나 Calibration 등 언어 및 지식적 역량 외의 측면을 평가하는 것이 중요해지고 있습니다. 본 논문은 모델의 Trustworthiness를 평가하기 위해 Toxicity, Stereotype Bias, Adversarial Robustness, Out-of-distribution Robustness, Robustness on Adversarial Demonstrations, Privacy, Machine Ethics, Fairness에 대한 종합적인 평가 벤치마크를 구성했습니다. 나아가 GPT-4와 GPT-3.5를 평가했을 때 GPT-4의 전반적 평가가 좋음에도 불구하고, Instruction Following을 잘하는 GPT-4의 능력 때문에 Jailbreaking 시 오히려 위험에 노출될 수 있는 가능성이 높음을 지적합니다.


5. Reinforcement Learning

  1. Direct Preference Optimization: Your Language Model is Secretly a Reward Model[8]

기존 딥러닝에서 모델의 성능을 측정할 때는 특정 Task의 벤치마크 성능만을 봤다면 2023년 LLM의 성능은 General 벤치마크 성능을 비롯해 Human Preference와 높은 일치도를 갖는 Instruction Following 능력도 중요하게 다뤄졌습니다. 이러한 Human Preference와의 Alignment를 높이기 위해 주로 사용된 방법은 Reward 모델을 학습하고 Policy 모델을 학습하는 방식입니다. 본 논문은 Binary Cross-entropy를 통해 바로 Policy를 최적화함으로써, 훨씬 안정되고 계산량이 상대적으로 가벼운 방법을 제안합니다.


섹션 2. LLM 사전 학습 데이터 관련 연구

앞서 살펴본 것처럼, LLM 학습에 대한 중요한 연구 방향이 많습니다. 그러나 아직 명확한 Rule of Thumb이 없고 많은 Technical Report에서도 숨기고 있는 영역이 바로 사전 학습 데이터와 관련된 부분인 것 같습니다.

‘고품질’ 데이터가 모델의 성능을 크게 좌우한다는 것은 LLM에서도 예외가 아닙니다. 따라서 LLM 학습에 도움이 되는 데이터를 구성하기 위해 일련의 과정들이 진행됩니다. 데이터 내 문서 필터링, 중복 제거, 비식별화 과정을 적용하고 학습 데이터 소스에 따라 가중치를 줌으로써 최종 사전 학습 데이터를 구성하게 됩니다.

본 섹션에서는 NeurIPS 2023에서 발표된 연구 중 LLM 사전 학습 데이터와 관련해 가장 인상 깊었던 연구를 소개하겠습니다.


  1. [DoReMi:Domain Reweighting with Minimax Optimization][9]


1. Motivation

이전 LG AI연구원 블로그에 작성된 “생성형 AI 시대: 거대 언어 모델(LLM)의 기술 방향성”에서도 기술되었듯이 학습 데이터로 사용할 수 있는 소스 데이터는 웹 데이터인 CommonCrawl, Wikipedia, Code 소스 데이터, 특허 및 학술적 내용이 담긴 데이터 등 다양합니다. 아래 그림 1에서 잘 알려진 ThePile 데이터셋 논문[10]에 있는 데이터 구성 테이블을 살펴보겠습니다.


그림 1. ThePile 데이터셋 논문[10]에 있는 데이터 구성 테이블


테이블을 이해하기 위해 각 명칭을 설명하자면, Component는 다양한 데이터 소스이며, Raw Size에서 Epochs 만큼을 곱한 양이 Effective Size가 되고 각 도메인 별 Effective Size를 전체 Effective Size 양으로 나눈 값이 Weight입니다. 이 데이터셋에서는 Domain Weight를 먼저 계산하기 보다, 고품질 데이터라고 볼 수 있는 데이터의 최종 학습 데이터에 중복으로 포함시킬 횟수(Epoch)를 설정하고 각 데이터셋의 크기를 계산한 다음 Domain Weight를 계산하는 방식입니다.

예를 들어, Wikipedia를 최종 사전 학습 데이터에 중복되게 3번 포함될 수 있도록 하는 것입니다. 하지만 그림 2에서 볼 수 있듯, 데이터마다 어떤 데이터가 어느 정도의 퀄리티를 갖는지 판단하는 것이 굉장히 Heuristics한 측면이 있습니다. ThePile 외에 PaLM[11], GLaM[12]과 같은 논문에서는 Downstream Task 성능에 따라 Weight를 튜닝하지만 컴퓨팅 자원이 많이 드는 실험을 여러 번 수행해야 하며, 선정한 Downstream Task에 Overfitting 될 수 있는 문제도 존재합니다.


2. Method

본 논문은 Downstream Task에 기대기보다, 모델이 학습에 사용하는 각각의 데이터 소스에서 모두 잘할 수 있도록 학습하는 방식으로 Domain Weight를 알고리즘으로 계산할 수 있는 방법인 DoReMi(Domain Reweighting with Minimax Optimization)를 제안합니다. 전체 방법론을 설명하기 전에 중요한 포인트를 짚고 넘어가겠습니다.


  1. Point 1: 작은 크기의 모델로 얻은 Domain Weight을 사용

DoReMi는 작은 크기의 Reference Model과 Proxy Model의 Loss로 최적화해 Domain Weight를 먼저 구하고, 이 Domain Weight를 사용한 데이터로 훨씬 큰 크기의 모델을 학습합니다.


  1. Point 2: 모든 데이터 소스에서 잘할 수 있도록 학습

다소 추상적일 수 있는 “모든 데이터 소스에서 잘할 수 있도록 학습하는 방식"은 각 도메인에서의 Worst-case Loss를 줄이는 방식으로 업데이트하는 Group Distributionally Robust Optimization(group DRO)으로 연결됩니다. Group DRO는 그룹으로 나눌 수 있는 데이터셋일 경우 학습에 사용한 데이터에 대해 평균을 취한 Loss로 업데이트하지 않고 각 그룹에 대한 Loss로 최적화 하는 아이디어입니다. 이는 평균 Loss 사용 시 특정 그룹의 Loss는 적을 수 있으나, 특정 그룹에서는 Loss가 클 수 있는 문제가 발생할 수 있기 때문입니다.

다시 돌아와 DoReMi 프레임워크는 Domain Weight를 얻는 것이 목표입니다. 이를 위해 총 3가지 단계를 거치게 됩니다.

  1. Step 1: Loss의 기준이 될 수 있는 작은 Reference Model을 학습합니다. 최초 Reference Model 학습에 사용하는 데이터는 Uniform Weight를 사용할 수 있습니다.
  2. Step 2: Domain Weight를 얻기 위해 Proxy Model을 Group DRO로 학습합니다.

 

그림 2. DoRemi Domain Reweighting

 

임의의 domain weight로 학습시킨 Reference Model의 Loss와 Step 별로 업데이트하는 Proxy Model의 Loss 차이를 이용해 Domain Weight와 Proxy Model을 순서대로 최적화하며 최종적으로 Domain Weight를 얻습니다. Loss의 차이가 큰 도메인일 경우 Domain Weight가 커지도록 업데이트되고, Proxy Model은 업데이트된 Domain Weight가 곱해진 Worst-case Loss 차이를 줄이도록 업데이트합니다. Worst-case loss는 아래 그림4와 같이 정의됩니다.

 

그림 3. 정의된 Worst-case Loss

 

  1. Step 3: 이렇게 얻게 된 Domain Weight로 데이터를 샘플링하여 실제 Target Model을 학습합니다.

 

3. Evaluation

실험에 주요하게 사용한 Reference Model과 Proxy Model의 사이즈는 280M이며 Target Model은 8B입니다. ThePile의 Baseline은 ThePile의 Domain Weight이며 GLaM의 Baseline은 Downstream task에 맞게 튜닝된 것을 감안하여 Uniform Weight으로 잡았습니다. 아래는 GPT-3에서 사용한 5개 벤치마크(TriviaQA, NaturalQuestions, WebQuestions, SQuADv2, LAMBADA)의 0-shot 평균 Accuracy(Exact Match)입니다. ThePile의 경우 1번의 DoReMi 수행 후 Baseline보다 높은 점수를 얻고, GLaM의 경우 2번 수행 후 Baseline보다 높고 Oracle이라고 볼 수 있는 GLaM의 Weight와 버금가는 성능을 보여줍니다.

 

그림 4. ThePile과 GLaM Dataset 성능 비교

 

DoReMi를 통해 얻게 된 Domain Weight는 최초 ThePile의 값과 다소 다른 값을 갖는 경향을 보입니다.

 

그림 5. DoReMi 진행 후 Domain Weight 변화 비교

 

4. Discussion

Reference Model의 크기에 따라 달라지는 Ablation을 간단히 보여주긴 하였지만 Reference Model의 학습 방법과 사이즈에 따른 심도 있는 분석은 주목할 만한 연구 주제가 될 것으로 보입니다. 또 데이터 소스 도메인의 세분화 정도에 따라 성능 차이가 날 수 있다는 시사점을 얻는 연구이기도 했습니다. 현업에서는 중요한 영역임에도 불구하고 많은 연구들에서 Heuristics한 숫자와 짧은 설명으로 넘어갔던 Domain Weight 영역에 대해 다시 생각해 볼 수 있는 인상 깊은 연구라고 할 수 있습니다.

이번 글의 섹션 1에서는 NeurIPS 2023의 Oral Paper를 통해 LLM의 최신 연구 동향을 알아보고, 섹션 2에서는 다소 잘 알려지지 않았던 사전학습 데이터의 Domain Weight를 알고리즘으로 구할 수 있는 방법론을 제안한 연구에 대해 깊이 있게 살펴보았습니다.

NeurIPS 2023 현장에서는 LLM과 관련한 튜토리얼, Pannel Talk, 연구 발표를 볼 수 있었고 이를 통해 LLM에 대한 세계 연구자들의 뜨거운 관심을 직접 느낄 수 있었습니다. 앞으로 LLM이 이뤄갈 엄청난 기술 확장 가능성을 기대해 보면서, LG AI연구원도 강력한 LLM의 Foundation Model을 만들기 위한 학습 및 데이터 구성 방법론, 효율적인 학습 및 추론 연구 개발과 Human Preference와 높은 Alignment를 보이는 선도적 연구를 진행해 나가겠습니다.

 

▶ NeurIPS 2023 Research Blog 시리즈가 궁금하다면? (Link)

참고

[1] Schaeffer, R., Miranda, B., & Koyejo, S. (2023). Are emergent abilities of Large Language Models a mirage?. arXiv preprint arXiv:2304.15004.

[2] Wei, A., Haghtalab, N., & Steinhardt, J. (2023). Jailbroken: How does llm safety training fail?. arXiv preprint arXiv:2307.02483.

[3] Schick, T., Dwivedi-Yu, J., Dessi, R., Raileanu, R., Lomeli, M., Zettlemoyer, L., ... & Scialom, T. (2023). Toolformer: Language models can teach themselves to use tools. arXiv preprint arXiv:2302.04761.

[4] Hao, S., Liu, T., Wang, Z., & Hu, Z. (2023). ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings. arXiv preprint arXiv:2305.11554.

[5] Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023). Qlora: Efficient finetuning of quantized llms. arXiv preprint arXiv:2305.14314.

[6] Muennighoff, N., Rush, A. M., Barak, B., Scao, T. L., Piktus, A., Tazi, N., ... & Raffel, C. (2023). Scaling Data-Constrained Language Models. arXiv preprint arXiv:2305.16264.

[7] Wang, B., Chen, W., Pei, H., Xie, C., Kang, M., Zhang, C., ... & Li, B. (2023). DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models. arXiv preprint arXiv:2306.11698.

[8] Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., & Finn, C. (2023). Direct preference optimization: Your language model is secretly a reward model. arXiv preprint arXiv:2305.18290.

[9] Xie, S. M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., ... & Yu, A. W. (2023). DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining. arXiv preprint arXiv:2305.10429.

[10] Gao, L., Biderman, S., Black, S., Golding, L., Hoppe, T., Foster, C., ... & Leahy, C. (2020). The pile: An 800gb dataset of diverse text for language modeling. arXiv preprint arXiv:2101.00027.

[11] Chowdhery, A., Narang, S., Devlin, J., Bosma, M., Mishra, G., Roberts, A., ... & Fiedel, N. (2023). Palm: Scaling language modeling with pathways. Journal of Machine Learning Research, 24(240), 1-113.

[12] Du, N., Huang, Y., Dai, A. M., Tong, S., Lepikhin, D., Xu, Y., ... & Cui, C. (2022, June). Glam: Efficient scaling of language models with mixture-of-experts. In International Conference on Machine Learning (pp. 5547-5569). PMLR.