EXAONE 1.0에서 3.0까지, 인류의 더 나은 삶을 위한 전문가 AI를 만들고자 LG AI연구원이 걸어온 3년 간의 여정은 쉽지 않았습니다. 하지만 끊임없는 연구를 이어오며 매년 업그레이드된 모델을 발표했고, 대외 상용화 실적을 거두었습니다. 다양한 산업 분야에서 AI 기술의 발전 가능성을 하나씩 증명해 내는 과정부터, 성능과 비용이라는 두 가지 축 사이에서 사용자가 더 잘 활용할 수 있는 모델을 만들고, 실제 산업 현장에 적용 가능한 전문가 수준의 AI를 개발하는 성과를 이루었습니다.

EXAONE Milestone
EXAONE 3.0 7.8B Instruction Tuned 언어모델
2024년 8월. EXAONE 3.0을 선보입니다. 다양한 목적에 맞게 구성된 EXAONE 3.0 언어모델 라인업 중에서, 7.8B Instruction Tuned 모델을 연구용으로 활용할 수 있도록 오픈소스로 선공개합니다. 이번 모델 공개가 국내외 AI 연구자들이 보다 의미 있는 연구를 진행하고 AI 생태계가 한 걸음 나아가는 데 힘이 될 수 있기를 기대합니다.
EXAONE 언어모델은 최근 추세에 맞춰 Decoder-only Transformer Architecture에 기반하고 있습니다. 파라미터 수는 7.8B, 학습 데이터 양(토큰)은 8T입니다. 이번 포스팅에서는 EXAONE 3.0 7.8B Instruction Tuned 언어모델 성능 평가 결과와 주요 인사이트를 소개하겠습니다. 성능 평가에는 공개된 벤치마크 데이터셋과 자체 벤치마크 데이터셋을 함께 활용했고, 7.8B 모델과 비슷한 크기의 영어, 한국어를 지원하는 최신 AI 모델들을 함께 평가에 활용해 성능을 비교하고자 했습니다.
Key Takeaways
■ 영어 Global Top 수준 달성 : Real-world Use Cases 에서 평균 점수 1위, 단일 Benchmark 에서도 뛰어난 성능
7.8B 모델의 영어 성능은 다른 모델 대비 Global Top 수준입니다. EXAONE은 전문 산업 분야에서도 AI가 활용될 수 있도록, 높은 수준의 Expert AI를 지향하고 있습니다. 전문 산업 현장과 전문 분야에서 모델이 활용되기 위해서는 실제 Real-world use cases, 다시 말해 사람이 믿고 사용할 수 있도록 복합적으로 우수한 성능을 지녀야 합니다. 이 측면을 평가하기 위해 최근 Chatbot Arena 방식이 많이 활용되는데, 이는 사람이 자주 사용하는 기능 위주로 직접 모델을 사용하고 평가하는 방식입니다. 평가에 소요되는 시간은 길지만 모델의 실질적인 활용도를 정확하게 평가할 수 있다는 게 장점입니다. 우리는 7.8B 모델의 영어 성능을 확인하기 위해 Chatbot Arena의 평가 방식과 유사성이 높은 주요 벤치마크를 선정하고, 사람의 활용도가 높은 항목들에 대한 평가를 진행했습니다. 총 4개의 벤치마크에 대해 평가를 진행했고 모든 벤치마크에서 글로벌 Top 모델보다 우수한 성능을 확인할 수 있었습니다.
단일 Benchmark 에서도 우수한 성능을 입증했습니다. Math와 Coding의 경우 평균 점수 1위로 타 모델 대비 우위를 보였고, Reasoning 역시 높은 성능 결과를 얻을 수 있었습니다.

Evaluation Results of Real-world Use Cases (English)

Benchmark – Math, Coding, Reasoning (English)
■ 단연 월등한 한국어 성능 : Real-world use cases 와 단일 Benchmark 모두 평균 점수 1위
영어와 한국어 언어를 타겟으로 하는 Bi-lingual 모델인 EXAONE 7.8B 모델은 한국어에서도 뛰어난 성능을 보입니다. 한국어 성능 평가를 위해 Real-world use cases 측면의 성능을 확인할 수 있는 2개 Benchmark 를 사용했으며, 단일 Benchmark 는 KMMLU 등을 활용함으로써 영어 평가에 활용된 Benchmark 와 부합하도록 구성했습니다. 그 결과 Real-world use cases와 단일 Benchmark 에서 모두 평균 점수 1위의 결과를 확인할 수 있었습니다.

Evaluation Results of Real-world Use Cases (Korean)

Benchmark (Korean)
■ 경제성 확보 : 3년 간의 연구개발 통해 비용 6% 수준으로 절감
AI가 우리 삶에 적용되기 위해서는 성능 개선 외에 경제성 강화가 필수적입니다. 2021년 EXAONE 1.0을 공개한 이후 3년간 AI 모델 경량화 기술의 연구개발에 집중하고 비용 효율화를 달성하기 위해 집중했습니다. 그 결과로 이번에 공개한 7.8B 모델은 EXAONE 2.0 대비 추론 처리 시간은 56% 줄이고, 비용은 72% 감축하는 결과를 보였습니다. 이는 처음 공개한 EXAONE 1.0 비용 대비 6% 수준으로 크게 줄인 성과입니다.

EXAONE 3.0 Performance Improvement
■ 윤리적 투명성 : 우수 결과 외 보완 필요한 영역도 공개
LG AI연구원은 AI 모델 연구 개발 과정에서 AI 윤리를 반드시 고려합니다. EXAONE 3.0 7.8B Instruction Tuned 언어모델 역시 윤리성과 보안성을 평가하기 위해 Red Teaming 과정을 거쳤고 내부 데이터셋과 외부 제3자 데이터셋을 사용해 평가에 활용했습니다.
이번에 공개한 모델은 성적 차별이나 불법적인 답변을 하지 않는 데 우수하나 보완이 필요한 부분도 있습니다. 해당 평가 결과를 그대로 공개한 이유는 AI 윤리가 발전하기 위해서는 투명한 정보 공개가 반드시 선행되어야 한다고 생각하기 때문입니다. 이번 정보 공개를 바탕으로 연구자들이 AI 윤리 측면에서 더욱 활발한 연구를 진행하기를 바라며, LG AI연구원도 AI 윤리 연구를 이어가겠습니다.

Evaluation Results of Harmlessness (Korean Large Language Model Trustworthiness Benchmark Data)
이번 글에서는 LG AI연구원이 처음 오픈소스로 공개하는 EXAONE 3.0 7.8B Instruction Tuned 언어모델에 대해 다뤘습니다. 아래 링크를 통해 모델의 성능 평가 결과 등 자세한 내용을 확인하고 7.8B 모델을 직접 다운로드 받아 사용할 수 있습니다. 이번 모델 공개가 AI 연구자들의 다양한 연구와 발전을 돕고 기술 경쟁력을 한층 강화하는 데 기여할 수 있기를 바랍니다.