71Hyunjik_Jo_47319b8c1.png Hyunjik Jo 2023.12.19

KSH_1f76ee171.png Seonghwan Kim 2023.12.19

SHP_0a03743b1.png Sangha Park 2023.12.19

KorQuAD2.0 1위: Generative Model for Long Context Question Answering

1. Introduction

LG AI연구원 EXAONE Lab에서는 LG그룹 계열사 난제를 해결하고 파트너사와의 협업에 활용하기 위한 초거대 언어 모델을 개발하고 있습니다. EXAONE의 기술 고도화와 높은 정확도 확보를 위해 언어 모델 학습 기법에 대해 집중적으로 연구하며 리더보드에 도전한 결과, 지난 6월 KorQuAD1.0[1] 1st rank에 이어 최근 KorQuAD2.0[2] 1st rank를 달성했습니다.

KorQuAD(The Korean Question Answering Dataset)는 한국어 인공지능(AI) 기계독해 평가로, KorQuAD 2.0은 총 100,000+쌍으로 구성된 한국어 Machine Reading Comprehension(MRC) 데이터셋입니다. 기존 질의응답 표준 데이터인 KorQuAD 1.0의 질문답변 20,000+쌍을 포함하며, 좀 더 길고 복잡한 양식과 추론 속도까지 리더보드에 반영합니다. 본 글에서는 KorQuAD2.0에 사용된 기법과 그 의의에 대해 살펴보고자 합니다.


2. KorQuAD2.0

KorQuad2.0은 다 문단 기계 독해 문제로서, KorQuAD 1.0과 같은 단일 문단 기계 독해에 비해 처리해야 할 문서의 길이가 길어짐에 따라 추론 속도와 정확도 측면에서 모두 도전적인 과제입니다. 자연어로 구성된 질문과 HTML 코드로 이루어진 위키백과 웹 문서를 입력으로 받아 짧은 답변뿐만 아니라 매우 긴 문단 단위의 답변, 표로 이루어진 답변, 리스트로 이루어진 답변 등 다양한 형태를 답변해야 합니다.


표1. KorQuAD 2.0 Dataset 문서 및 질문 개수 분포[2]

표 2. KorQuAD 2.0 답변 유형 분포[2]


KorQuAD2.0의 데이터는 크게 3가지 그룹으로 나누어집니다.

  1. Shot_text (1~20자): 첫 번째 그룹은 HTML Tag 없이 순수 텍스트로 된 Short 답변으로 이루어져 있습니다.

  2. Middle_text (20~120자): 두 번째 그룹은 Short 답변이긴 하지만 HTML Tag가 포함되어 있어 Shot_text그룹보다는 답변이 길어졌습니다.

  3. Long_text(120자~): 세 번째 그룹은 긴 답변으로 구성되어 있습니다. 다양한 길이의 지문과 답변이 있기 때문에 길이를 고려한 모델 설계가 필요합니다.


즉 KorQuAD2.0 문제를 원활하게 해결하기 위해서는 모델이 HTML 문서의 특성을 제대로 파악하고 Table, List와 같은 Tag를 고려하면서 긴 답변과 짧은 답변을 수월하게 할 수 있는 능력이 필요합니다.


3. Related Works

기존 연구에서는 KorQuAD와 같은 Context에서 정답을 추출하는 Extractive QA문제를 해결하기 위해서 Encoder모델 구조의 Span Prediction 방법론을 주로 사용해 왔습니다.


이미지 1. Bert[3]를 활용한 Encoder base Span Prediction


Span Prediction방법론은 주어진 Context로부터 Answer가 시작되는 위치와 끝나는 위치를 분류하여 해당 영역을 전체 정답으로 추론하는 방법론입니다. Start와 End만 추론하면 되기 때문에 속도가 빠르지만, 주어진 Context에 정답이 없다면 정답을 맞히지 못하는 한계가 있었습니다.

이후 Bart[4], T5[5]와 같은 강력한 Encoder-Decoder 구조의 모델이 등장하며 Question Answering 문제를 생성형 방식으로 해결하는 시도가 이어졌습니다. Span Prediction 방식과 다르게 입력 Context와 모델이 가진 parametric knowledge를 조합하여 새로운 답을 생성하기 때문에, 입력 context에 정답이 없더라도 pretrain과정 중에 학습된 정보를 이용하여 정답을 도출할 수 있었습니다.


이미지 2. T5 생성형 문제 풀이[5]


또한 그중 Google T5 모델은 현재까지 공개된 Bert 모델과 다르게 3B, 11B 등 큰 사이즈 모델 역시 공개가 되었고, instruction-tuned 모델인 FLAN-T5[6]까지 공개가 되는 등 지속해서 업데이트가 이뤄지고 있습니다. 또한 DPR[7], FID[8], RAG[9] 등 새로운 방법론 연구에도 지속적으로 모델이 활용되고 있습니다.


4. Contributions

  1. EXAONE LM 1.0

최근 초거대 언어모델이 강력한 성능으로 각광받고 있지만 초거대 모델을 구동하기 위해서는 대량의 컴퓨팅 자원 등 인프라 투자가 필요합니다. 연구자들이 다양한 영역(model compression, distillation, pruning등)에서 이를 해결해 나가고 있지만, 아직은 기술적 도전이 많이 요구됩니다. 이에 LG AI연구원에서는 다양한 실제 산업 현장 적용을 위해 적은 장비로 구동가능한 효과적인 모델을 만들고자 노력했고, Encoder-Decoder구조의 EXAONE LM 1.0모델을 자체 개발하게 되었습니다.

Encoder-Decoder 구조는 Encoding된 문서 또는 글의 representation을 기반으로 Decoder가 sequence를 생성하기 때문에, 문서를 이해하는 능력과 이를 바탕으로 생성하는 능력이 뛰어납니다. 또한 이미 학습된 Encoder-Decoder 구조의 모델에서 Encoder 부분만 따로 사용할 수 있는 장점도 있습니다[10].

EXAONE LM 1.0 모델은 LG AI연구원이 보유한 전문가 데이터를 이용해 학습했고 summarization, question answering, classification task와 같은 supervised fine-tuning task 등에서 적은 장비로 좋은 성능을 보여주고 있습니다. 또한 한국어, 영어 두 가지 언어로 학습했기 때문에 두 가지 언어에서 모두 강점을 지니고 있습니다.

LG AI연구원에서는 EXAONE LM1.0의 성능을 public 리더보드를 통해 검증하고자 했고, 해당 모델을 백본으로 korQuAD1.0에 이어 korQuAD2.0까지 전부 1st rank를 달성하며 성능을 입증했습니다. 앞으로도 LG AI연구원에서는 EXAONE LM 1.0 모델을 점점 발전시켜서 RAG와 같이 LLM에 external knowledge를 사용하는 application에서도 백본 모델로 활용할 예정입니다.


  1. Post-Training(QA, HTML-T5)

Post-training 방법은 Domain Adaptation[11] 등에 자주 사용되는 기법으로써, Pretrain 과정을 통해 학습하지 않은 코퍼스에 대해서 추가 pretrain Objective로 학습하여 좀 더 높은 성능을 얻어내는 기법입니다.

KorQuAD 2.0은 HTML 구조로 본문이 주어지기 때문에, 주로 전처리 과정을 통해 HTML TAG없이 plain text를 이용하여 pretrain을 수행하는 LM의 구조상 HTML의 중요한 맥락적 정보가 유실될 수 있습니다. 이에 착안하여 EXAONE Lab에서는 HTML Domain 영역과 Question Answering task 영역으로의 Shift를 위해 HTML Document와 Question Answering Dataset을 모아 Span Corruption Objective를 이용하여 post-training을 수행했습니다. 이때 Span Length는 일반적인 값이 아닌 HTML-T5[12]에서 제안된 Long Span Denoising 방식을 이용했습니다.


이미지 3. Long Span Denoising방식[12]


HTML-T5 논문에서는 HTML Document에 대해서 일반적인 Span Length 값인 3을 사용하게 되면, HTML Tag가 작게 나누어지기 때문에 의미 있는 정보가 유실될 수 있다고 주장했습니다. 이를 보완하기 위해서 length를 8로 증가시켜 모델이 의미 있는 HTML Tag를 맞출 수 있도록 개선했습니다.


  1. 데이터 전처리 및 증강

KorQuAD 2.0은 HTML 구조로 본문이 주어집니다. 이를 처리하지 않고 사용하게 되면 중요하지 않은 정보들까지 포함하기 때문에 토큰 수가 급격히 증가하며 리소스 효율이 낮아집니다. 그렇기 때문에 데이터 전처리 과정을 통해서 모델이 활용할 수 있는 형태로 가공이 필요합니다.

Table, List와 같은 중요한 Tag들의 경우 일반적인 문장 속 단어와 구분하기 위해 special token을 사용하여 대체했고, 불필요한 head 정보와 tail 정보를 사용하지 않도록 가공했습니다.

또한 <p> <a> 등과 같은 띄어쓰기와 단락 기호를 그대로 살려서 모델이 생성할 때 정답의 범위를 잘 유추할 수 있도록 보완했습니다. 전체적으로 정답의 길이가 짧은 문제가 많기 때문에 모델이 짧은 정답 문장을 생성하려는 경향이 있는데, 단락 기호 등을 잘 살려두자 문맥에 맞는 형태로 모델이 긴 문장을 잘 생성하는 모습을 확인할 수 있었습니다.

 

  1. MonoQA: Rerank & Reader

앞서 설명 드린 것처럼 KorQuAD2.0의 경우 단문 문서를 다루는 korQuAD1.0과는 다르게 긴 문서에서 정답을 유추해야 합니다. 입력을 길게 사용하는 것은 Attention의 모듈의 구조상 효율적이지 않기 때문에, EXAONE Lab에서는 ODQA(Open Domain Question Answering)Task에서 자주 사용되는 Retrieval & Reader 방식을 차용하게 되었습니다.

Retrieval & Reader 방법론은 사용자의 질의와 연관이 있는 web document를 검색하고 검색된 결과를 입력으로 하여 모델이 질의에 맞는 답변을 하는 방식입니다. 해당 방식을 변형하여 Long HTML 문서를 Web으로 보고 정답을 포함하는 단락을 유사도 기반으로 reranking하여 정답 단락을 얻어냈고, 이를 통해 reader 모델이 정답을 생성하도록 했습니다.

Baseline으로 Reranker에서 자주 사용되는 Encoder 구조의 cross Attention 방식을 사용하여 실험했을 때는 적당한 성능을 보여주었지만, Reranker와 Reader가 두 모델로 나뉘어 각각의 Task를 학습하므로 모델이 학습한 정보가 공유되지 않아 일정 성능 이상 향상되지 못했습니다.

EXAONE lab에서는 이러한 문제를 해결하고자 MonoQA[13]라는 단일 모델 구조를 차용하기로 했습니다.


이미지 4. The overall framework of ORConvQA system (consisting of ConvDR & monoQA)[13]


MonoQA 방식은 T5와 같은 generative reader를 활용하여 단락 단위로 유사한 단락인지 판단하고, 유사한 단락이라면 정답을 생성하는 형태로 Reranking과 Reader를 동시에 수행합니다. 해당 방식을 적용하면 Reader모델 역시 Reranking에 대한 정보를 동시에 습득하기 때문에 기존 방식보다 좀 더 높은 성능을 보여주게 됩니다.


5. Evaluation Results (Devset)

  EM F1
Baseline 77.84 89.83
++HTML T5 79.26 90.92
++MonoQA 80.04 91.49


6. Limitation

EXAONE LM을 활용한 KorQuAD모델은 문서에 존재하지 않는 정답 역시 Parametric Knowledge로 생성할 수 있는 장점이 있지만, 모든 정답을 Auto-Regressive하게 생성하기 때문에 Encoder Base 모델보다 속도가 느립니다. 하지만 최근 많은 최적화 라이브러리에서 Auto-Regressive 방식의 한계를 많이 개선하고 있기 때문에 연구를 통해 많은 부분이 개선될 것으로 기대하고 있습니다.


7. Conclusion

LG AI연구원에서는 이번 리더보드 도전에서 Encoder-Decoder 모델을 활용한 생성형 방식을 통해 KorQuAD2.0과 KorQuAD1.0 모두 1위를 달성했습니다. Encoder방식의 모델이 주로 사용되는 Question Answering분야에서 동일한 생성형 Pretrained Model을 활용하여 연속해서 1위를 차지한 점은 많은 의미가 있다고 생각합니다. 또한 직접 학습한 EXAONE의 성능을 여러 연구자분들에게 소개하는 좋은 기회였습니다. 앞으로도 EXAONE 연구에 매진하며 좋은 성능을 보여줄 수 있도록 노력을 이어 나갈 계획입니다.

참고
[1] Lim, S., Kim, M., & Lee, J. (2019, September 17). KorquAD1.0: Korean QA dataset for Machine Reading Comprehension. arXiv.org. https://arxiv.org/abs/1909.07005

[2]KorQuAD 2.0: Korean QA Dataset for Web Document Machine Comprehension, https://korquad.github.io/dataset/KorQuAD_2.0/KorQuAD_2.0_paper.pdf

[3] Kenton, Jacob Devlin Ming-Wei Chang, and Lee Kristina Toutanova. "Bert: Pre-training of deep bidirectional transformers for language understanding." Proceedings of naacL-HLT. Vol. 1. 2019.

[4] Lewis, Mike, et al. "Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension." arXiv preprint arXiv:1910.13461 (2019).

[5] Raffel, Colin, et al. "Exploring the limits of transfer learning with a unified text-to-text transformer." The Journal of Machine Learning Research 21.1 (2020): 5485-5551.

[6] Chung, Hyung Won, et al. "Scaling instruction-finetuned language models." arXiv preprint arXiv:2210.11416 (2022).

[7] Karpukhin, Vladimir, et al. "Dense passage retrieval for open-domain question answering." arXiv preprint arXiv:2004.04906 (2020).

[8] Izacard, Gautier, and Edouard Grave. "Leveraging passage retrieval with generative models for open domain question answering." arXiv preprint arXiv:2007.01282 (2020).

[9] Lewis, Patrick, et al. "Retrieval-augmented generation for knowledge-intensive nlp tasks." Advances in Neural Information Processing Systems 33 (2020): 9459-9474.

[10] Liu, Frederick, et al. "Enct5: Fine-tuning t5 encoder for non-autoregressive tasks." arXiv e-prints (2021): arXiv-2110.

[11] Gururangan, Suchin, et al. "Don't stop pretraining: Adapt language models to domains and tasks." arXiv preprint arXiv:2004.10964 (2020).

[12] Gur, Izzeddin, et al. "A real-world webagent with planning, long context understanding, and program synthesis." arXiv preprint arXiv:2307.12856 (2023).

[13] Kongyoung, Sarawoot, Craig Macdonald, and Iadh Ounis. "monoQA: Multi-Task Learning of Reranking and Answer Extraction for Open-Retrieval Conversational Question Answering." Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing. 2022.