
이번 ACL 2024에서는 차트 이해와 관련된 연구가 많은 주목을 받았습니다. 특히, 차트를 활용해 다양한 작업을 할 수 있도록 지원하는 범용 모델을 개발하는 것이 주요 관심사로 떠올랐습니다. 이번 글에서는 ACL 2024에서 발표된 차트 이해 관련 다양한 연구 중, 인상적이었던 ‘ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning[1]’ 에 대해 깊이 있게 살펴보고, LG AI연구원이 진행 중인 연구도 함께 소개하겠습니다.
1. 과제: Chart Comprehension and Reasoning
차트는 데이터 시각화의 중요한 요소로, 정보 분석, 질의 처리 및 인사이트 등을 시각적으로 명확하게 전달하는 데 활용됩니다. 하지만 AI 모델이 차트를 기반으로 사용자의 질문에 답하는 것은 여전히 어려운 과제입니다. 최근 몇 년간 이러한 문제를 해결하기 위해 차트 관련 연구가 다양하게 진행되어 왔으며, 특히 차트 질문 응답 및 요약, 추론 등의 작업에 집중하고 있습니다.

이미지 1. 다양한 차트 질의응답에 대한 예시.
차트 요약, Chart QA, Fact Checking 과 같이 기본적인 질문부터 복잡한 추론 및 data analysis 을 요구하는 데이터 특이치 감지, 상관관계 분석, 미래 예측 등[1].
이미지 1에서 볼 수 있듯이, 차트를 분석하고 해석하는 작업은 데이터 분석과 의사결정에 필수적입니다. 그러나 차트에서 정보를 추출하거나 의미를 파악하는 것이 결코 간단한 작업은 아닙니다. 기존의 방법론은 시각적 정보를 다루는 데 한계가 있으며, 차트 내의 복잡한 요소들 간의 관계를 명확히 이해하지 못해 실제 현장에서의 적용이 제한적이었습니다. 이러한 문제를 해결하기 위해 해당 연구는 차트 전용 비전-언어 모델을 개발하여, 차트 이해와 관련된 다양한 작업을 수행할 수 있는 범용적인 접근법을 제안합니다[1], [4]. 차트에 대한 질문 응답, 요약, 추론 등 여러 작업에서 새로운 성과를 보여주며, 실제 현장에서의 활용 가능성을 크게 확장하고 있습니다.
2. 데이터셋 확보

이미지 2. Instruction Tuning을 위한 차트 데이터 확보 과정.
차트 데이터는 Gemini Pro Vision 를 통해 추출되며, 질문은 GPT 3.5 와 GPT 4를 통해 생성됩니다[1].
오픈 소스로 사용할 수 있는 데이터는 제한적이기에, 저자는 웹 크롤링과 질문 생성을 통해 데이터를 확보했습니다. 전체적인 과정은 아래와 같습니다:
차트 데이터 수집 단계에서는 실제 환경에서 쉽게 볼 수 있는 다양한 차트를 수집합니다. 이 과정에서는 공공 데이터셋(예: UniChart)과 웹 크롤링 자료 등 다양한 출처에서 차트를 수집합니다[2]. 그 안에는 막대 그래프, 선 그래프, 원형 차트 등 여러 형태의 시각적 스타일이 포함되어 있습니다.
수집된 차트 이미지에서 필요한 정보를 얻기 위해 데이터 테이블 정보와 차트 제목을 자동으로 추출합니다. 이 과정에서는 Gemini Pro Vision[5]을 사용해 데이터 테이블을 추출하여 모델 학습에 필요한 입력 데이터를 생성합니다.
추출된 테이블 데이터를 활용하여 답할 수 있는 데이터를 생성합니다. 이 문제들은 GPT-3.5 또는 GPT-4와 같은 LLM을 통해 생성되며[3] 차트 요약, 질문 답변, 사실 확인, 체인 오브 소트(Chain of Thought) 추론[6], 코드 생성 등의 다양한 문제를 포함합니다.
마지막으로 모델 학습 및 튜닝을 위해 차트 데이터와 생성된 질문들이 모델 학습에 사용됩니다. 모델의 시각적 정보 이해와 언어 생성 능력을 개선하기 위해, 학습 과정에서는 다양한 모델 아키텍처(예: LLaVA[4]와 같은 End-to-end 시스템 또는 Pipeline 시스템)가 사용됩니다. 이에 대한 상세한 내용은 아래 ‘3. 접근 방법’에서 확인하실 수 있습니다.
최종적으로 총 191,000개의 Instruction 들이 만들어졌으며 70,882개의 차트에 대해 생성되었습니다. 이 차트들은 다양한 출처에서 수집되었으며, LLM 이 각 차트의 정보를 활용해 다양한 QA 데이터셋을 확보합니다.
3. 접근 방법: Vision Encoder + Adapter Module + LLM

이미지 3. End-to-end 시스템 모델의 구조.
Pretraining 단계에서 Weight 가 Freeze 되며 Instruction Tuning에서 다양한 차트 타입들에 대해 학습이 이루어집니다[1].
생성된 데이터들은 이후 모델 학습 단계에서 사용됩니다. 최종적으로 모델은 시각적 정보(차트 이미지)와 언어 모델을 결합하여 차트의 내용을 이해하고 자연어로 응답을 생성할 수 있게 됩니다. 모델의 주요 구성 요소는 다음과 같습니다:
시각 인코더(Vision Encoder): 기존에는 CLIP[7]이라는 모델을 기반으로 한 Vision Encoder가 사용되었으나, ChartInstruct 모델에는 UniChart라는 차트 전용으로 학습된 인코더로 대체되었습니다. UniChart는 차트 이미지를 효과적으로 이해하도록 최적화되어 있습니다.
어댑터 모듈(Adapter Module): Alignment Module이라고도 불리며, Vision Encoder에서 추출한 시각적 특징을 언어 모델이 이해할 수 있는 형태로 변환해 주는 모듈입니다. 이 모듈은 시각적 특징을 언어 모델의 입력 임베딩 공간으로 매핑(Mapping)하여 언어 모델이 차트 이미지를 올바르게 해석할 수 있도록 도와줍니다.
언어 모델 (LLM): 이 시스템에서는 Llama2[8], Flan-T5[9] 두 가지 언어 모델을 실험적으로 사용합니다. Llama2는 디코더(Decoder) 구조의 모델로, 시각적 특징을 직접 언어 디코더에 주입하여 텍스트를 생성합니다. Flan-T5는 인코더-디코더 구조를 가진 모델로, 시각적 특징과 명령을 먼저 언어 인코더에서 처리한 후 디코더를 통해 텍스트를 생성합니다.
모델 학습 단계: 첫 번째 단계에서는 어댑터 모듈만 학습하고, Vision Encoder와 언어 모델은 고정(Frozen) 상태로 유지합니다. 이 단계는 시각적 특징과 언어 모델 입력 임베딩 간의 정렬(Alignment)을 맞추는 데 중점을 둡니다. 두 번째 단계에서는 명령 데이터를 사용해 전체 모델(어댑터 모듈과 언어 모델)을 학습시킵니다. 이때 Vision Encoder는 여전히 고정 상태로 유지됩니다.
4. 결과

이미지 4. ChartQA, OpenCQA, Chart-to-Text, ChartFC (Fact Checking) 에서의 성능 지표[1].
ChartInstruct 모델의 결과는 다양한 차트 관련 작업에서 우수한 성능을 보여줍니다:
ChartQA: 차트에 대한 질문에 답하는 작업에서, ChartInstruct 모델은 이전의 최첨단(Open-source) 모델인 UniChart보다 높은 정확도를 기록했습니다. 특히 인간이 작성한 복잡한 질문에 대한 답변에서도 뛰어난 성능을 보였습니다.
OpenCQA: 이 작업은 차트에 대한 설명형 질문에 대한 답변을 생성하는 작업입니다. ChartInstruct 모델은 이 작업에서도 높은 BLEU 점수를 기록하여, 설명형 질문에 대해 더 적절한 답변을 생성할 수 있음을 입증했습니다.
Chart-to-Text: 차트를 요약하여 텍스트로 표현하는 작업에서, ChartInstruct 모델은 두 가지 데이터셋(Pew Research Center와 Statista)에서 모두 UniChart보다 높은 성능을 기록했습니다.
ChartFC (Fact Checking): 차트에 기반한 사실 확인 작업에서, ChartInstruct 모델은 사실 확인 정확도에서 이전 모델들을 크게 능가했습니다.
전반적으로 ChartInstruct 모델은 차트 이해와 추론 작업에서 새로운 최첨단 성능을 달성했으며, 다양한 실제 응용 작업에서 매우 유용한 도구로 사용될 수 있습니다.
5. LG AI연구원에서 진행 중인 연구

이미지 5. ChatEXAONE이 생성한 차트 막대 그래프.
(* 질문: 가격순으로 상위 10개의 모델을 알려줘.)

이미지 6. ChatEXAONE 이 생성한 라인 그래프.
(* 질문: Tell me consumption index of men over 30 years old.)
LG AI연구원에서는 데이터 분석을 위한 차트 생성 및 설명 모델 개발에 관심을 가지고 있습니다. 하나의 예로, Text-to-SQL 모듈에서 유저가 Database에 대한 질문을 했을 때, SQL 쿼리를 생성하고 실행된 결과값을 차트를 생성하는 모듈이 있습니다. 이미지 5, 6은 유저가 각각 DB 와 연동하여 “가격순으로 상위 10개의 모델을 알려줘”, “Tell me consumption index of men over 30 years old” 라는 질문을 던졌을 때 나오는 값을 차트로 생성한 결과를 보여줍니다. 이와 같이, 생성된 차트에 대해 추가적으로 차트 정보를 추출하고 관련하여 추론, COT, 요약, Forecasting 기능의 모델로 확장할 수 있다면 유저에게 차트에 대한 유용한 정보를 제공 할 수 있습니다.
이외에도, Csv나 Excel 파일과 같이 다양한 정보를 포함하고 있는 데이터의 경우 EDA (Exploratory Data Analysis) 또는 통계적 분석(Statistical Analysis)이 필요한 경우가 많습니다. 데이터 분석 중에 이해를 돕기 위해 LLM이 코드를 통해 다양한 차트들을 생성하는데, 이러한 경우에 Chart Vision 모델이 차트 분석에 큰 도움을 줄 수 있습니다. 특히, 차트를 위해 사용된 데이터가 너무 많을 경우, 모든 값들을 텍스트 형식으로 LLM 에게 분석을 요청할 수 없기에(i.e. Context Length Issue), 차트 이미지를 보고 정보를 추출하여 질문에 답하는 것이 시간상으로 크게 이득인 경우가 많습니다.
LG AI연구원에서는 이번 ACL 2024 논문에서 제안된 모델과 유사하게, 복잡한 차트에 대해 자동화된 설명을 생성할 수 있는 모델의 연구 개발을 이어가고 있습니다. 이 모델은 데이터 분석을 잘 모르는 사용자에게도 유용한 도구가 될 것이며, 향후 데이터 분석 작업에서 중요한 역할을 할 것으로 기대됩니다.
6. 요약
차트를 분석하고 해석하는 작업은 데이터 분석과 의사결정에 필수적이지만, AI 모델이 차트에서 정보를 추출하거나 의미를 파악하는 것은 결코 간단하지 않습니다. 기존의 방법론은 시각적 정보를 다루는 데 한계가 있으며, 차트 내의 복잡한 요소들 간의 관계를 명확히 이해하지 못해 실제 현장에서의 적용이 제한적이었습니다. 해당 연구는 이러한 문제를 해결하기 위해 차트 전용 비전-언어 모델을 개발하여, 차트 이해와 관련된 다양한 작업을 수행할 수 있는 범용적인 접근법을 제안합니다. 이 연구는 차트에 대한 질문 응답, 요약, 추론 등 여러 작업에서 새로운 성과를 보여주며, 실제 현장에서의 활용 가능성을 크게 확장하고 있습니다.
LG AI연구원은 이번 학회에서 발표된 최신 기술들을 바탕으로, 차트 이해 및 설명 모델의 성능을 더욱 개선해 나갈 계획입니다. 특히, 차트와 관련된 다양한 작업을 처리할 수 있는 범용 모델 개발에 집중할 것이며, 생성된 차트에 대한 자동화된 설명 기능을 강화해 데이터 분석과 의사결정을 지원하는 새로운 기능을 추가할 예정입니다. 또한, 이번 학회에서의 논의된 내용을 바탕으로 차트 데이터의 다양한 활용 가능성을 탐구하고, 이를 ChatEXAONE에 적용하는 방안을 모색해 나갈 예정입니다.
ACL Trends Review Series
#1. [ACL 2024] LLM 연구의 최신 트렌드와 주요 인사이트
#3. [ACL 2024] 효율적인 언어모델을 향하여
#4. [ACL 2024] AI-generated Text Detection 최신 연구 동향
#5. [ACL 2024] LLM 신뢰성에 대한 평가 방법론과 효율성 연구의 트렌드
#6. [ACL 2024] 문화 간 차이를 고려한 LLM 연구 트렌드
[1] Masry, Ahmed, et al. "ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning." arXiv preprint arXiv:2403.09028 (2024).
[2] Masry, Ahmed, et al. "Unichart: A universal vision-language pretrained model for chart comprehension and reasoning." arXiv preprint arXiv:2305.14761 (2023).[3] Ray, Partha Pratim. "ChatGPT: A comprehensive review on background, applications, key challenges, bias, ethics, limitations and future scope." Internet of Things and Cyber-Physical Systems 3 (2023): 121-154.
[4] Liu, Haotian, et al. "Visual instruction tuning." Advances in neural information processing systems 36 (2024).
[5] Reid, Machel, et al. "Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context." arXiv preprint arXiv:2403.05530 (2024).
[6] Wei, Jason, et al. "Chain-of-thought prompting elicits reasoning in large language models." Advances in neural information processing systems 35 (2022): 24824-24837.
[7] Radford, Alec, et al. "Learning transferable visual models from natural language supervision." International conference on machine learning. PMLR, 2021.
[8] Touvron, Hugo, et al. "Llama 2: Open foundation and fine-tuned chat models." arXiv preprint arXiv:2307.09288 (2023).
[9] Chung, Hyung Won, et al. "Scaling instruction-finetuned language models." Journal of Machine Learning Research 25.70 (2024): 1-53.