EXAONE 3.5 3개 모델 오픈소스로 공개 - Frontier AI급의 모델, Instruction Following 및 Long Context 최고 수준 성능 달성

EXAONE 3.5 기반 모델들을 오픈소스로 공개합니다. 지난 8월 EXAONE 3.0 기반 7.8B 모델을 공개한 이후 4달 만에 한층 강력해진 모델 라인업을 선보이게 되었습니다.

EXAONE 3.0을 공개한 직후 우리는 기업, 기관, 학계 등 많은 곳으로부터 다양한 피드백을 받았습니다. 그중 활용 목적에 맞춰 효율적으로 사용할 수 있는 다양한 사이즈의 모델을 공개해달라는 요청이 핵심을 이루었습니다.


이미지 1. EXAONE 3.5 3개 모델 오픈소스로 공개


피드백을 반영해 이번에 공개하는 EXAONE 3.5 기반 모델은 3가지 유형으로 구축되었습니다. 3개 모델 모두, 동일 사이즈의 글로벌 모델 대비 강력한 성능을 입증했습니다. 먼저 온 디바이스용 초경량 모델인 2.4B 모델입니다. 온 디바이스 환경이나 저사양 GPU에서도 학습과 추론이 가능한 경량화 모델로, 우수한 인프라 환경이 갖춰지지 않은 곳에서도 모델 구동이 가능합니다. 다음으로 사용자의 목적에 맞춰 범용적 활용이 가능한 경량 모델인 7.8B 모델입니다. 이전 버전의 오픈소스 모델과 크기는 동일하지만 성능은 더욱 향상되었습니다. 마지막으로 Frontier AI 급의 고성능 모델인 32B 모델입니다. 성능을 최우선으로 고려하는 고객을 위한 강력한 모델입니다.

우리의 오픈소스 모델 공개는 여기서 그치지 않습니다. EXAONE 3.5 모델에 대한 다양한 피드백에 귀 기울이고, 연구자들의 니즈에 맞춘 모델을 꾸준히 공개해 나갈 계획입니다. 이 과정을 통해 연구와 생태계 발전에 기여하고, AI 혁신의 기반을 이뤄가겠습니다. EXAONE 3.5 모델에 대한 여러분의 다양한 피드백을 기다리겠습니다.


Our Expertise in EXAONE 3.5

Training Efficiency

EXAONE 3.5의 3개 모델의 특징은 뛰어난 성능과 함께 경제성까지 확보했다는 점입니다. 그 배경에는 모델 학습의 효율성을 높인 LG AI연구원만의 연구개발 방식이 있습니다. 사전학습 단계에서는 중복된 데이터와 개인 식별 정보를 제거하는 등의 과정을 통해, 모델 답변의 성능을 높이고 인프라 비용을 줄이고자 했습니다. 또한 사후학습 단계에서는 모델의 사용성을 높이고, 새로운 과제 수행 능력을 높이는 방향에 초점을 맞췄습니다. 크게 SFT(Supervised Fine-tuning)와 DPO(Direct Preference Optimization) 방식을 통해 Instruction Following 능력을 강화하고 사용자의 선호도를 모델이 잘 반영할 수 있도록 했습니다.


Decontamination

EXAONE 3.5의 성능 평가 결과에 대한 신뢰도를 높이기 위해 치밀한 Decontamination 과정도 수행했습니다. 글로벌 모델에 사용된 Decontamination 방식을 차용하되, 평가에 활용된 데이터셋과 학습 데이터를 비교하는 과정을 10회 반복 수행함으로써 엄격하게 벤치마크 성능 평가를 진행했습니다.

이는 지금부터 소개할 EXAONE 3.5의 벤치마크 성능을 자신 있게 설명할 수 있는 이유입니다.


Key Takeaways 1. EXAONE 3.5 : A Global Model of Excellence

1. Long Context Understanding : The Top Performance in Four Benchmarks

EXAONE 3.5의 가장 강력한 특징은 바로 Long Context에 대한 이해도와 처리 능력이 향상됐다는 점입니다. 웹 검색 결과나 참조 문서 기반으로 답변을 생성하는 RAG(Retrieval-Augmented Generation) 기술이 활용되면서, 모델의 Long Context 이해도가 중요해졌습니다. 이번에 공개한 EXAONE 3.5 모든 모델들은 32K 토큰 Context를 처리할 수 있도록 모델링 되었고, 각각의 모델은 유사 사이즈의 글로벌 모델 대비 Long Context 처리 부분에서 가장 좋은 성능을 입증했습니다.

특히 일부 모델들의 경우 32K 토큰보다 더 긴 Context가 이해가 가능하다고 이야기하지만, 이는 모델 설계 시 확인한 이론적 수치에 불과한 경우가 많습니다. 반면 EXAONE 3.5는 모델이 실제로 이해하고 처리할 수 있는 최대 토큰 길이인 Effective Context Length가 32K로, 최근의 AI 연구와 활용 흐름에 맞춰 가장 효과적으로 활용할 수 있는 모델입니다. 특히 Bi-lingual 모델인 EXAONE은 영어뿐만 아니라 한국어에서도 Long Context Understanding 성능이 최고 수준임을 확인했습니다. 


이미지 2. Performance Comparison Results of EXAONE 3.5 - On Four Benchmarks Representing Long Context Scenarios
(Excluded from results if the model does not support context lengths longer than 16K)


2. Instruction Following Capabilities : The Highest Scores Across Seven Benchmarks

EXAONE 개발의 여정에서 가장 중요하게 생각하는 부분은 바로 모델의 실제 사용성 측면입니다. 실제 모델 연구와 개발 과정에서도 EXAONE이 실제 산업현장에서 사람의 생산성과 업무 효율성을 높여줄 수 있을 정도의 성능을 갖췄는지에 초점을 맞춰왔습니다. EXAONE 3.5의 테크니컬 리포트에서는 실제 사용성과 관련된 성능을 ‘Real-world use cases’로 기재했습니다. 총 7개의 벤치마크를 활용했고 EXAONE 3.5의 세 개 모델 모두 Instruction Following 능력 평균 점수 1위를 보이며, 동일 사이즈의 글로벌 모델들을 큰 차이로 앞서고 있음을 확인했습니다. Instruction Following 성능 역시 영어 뿐만 아니라 한국어에서도 우수한 성능을 확인할 수 있습니다.


이미지 3. Performance Comparison Results of EXAONE 3.5 - On Seven Benchmarks Representing Real-world Use Case Scenarios


3. Business Partnerships : Uncovering New Opportunities

이제 AI 서비스는 기술의 가능성을 보여주는 것을 넘어, 실제 활용성을 입증하고 비즈니스 모델을 만들어가야 할 때입니다. LG AI연구원 역시 국내 및 글로벌 기업들과의 파트너십을 체결해 비즈니스 성과를 가시화하고 있습니다. 국내에서는 폴라리스오피스, 한컴 등 자체 소프트웨어를 보유한 기업 서비스에 EXAONE 3.5 기반의 AI 솔루션 적용을 논의 중입니다. 특히 공공기관 활용도가 높은 한컴오피스에 EXAONE 3.5 기반의 AI 서비스를 구현하는 PoC 과제를 추진하고 있으며, 이를 통해 정부 및 공공기관의 업무 효율성 혁신을 이뤄갈 것으로 기대합니다.


Key Takeaways 2. EXAONE's Enhanced Features

1. General Domain : Competitive Results on Nine Benchmarks Compared to SOTA Open Models

EXAONE 3.5는 수학 능력, 프로그래밍 능력도 우수한 성능을 보입니다. 총 9개의 단일 벤치마크를 사용했고, 특히 2.4B 모델은 평균 점수 1위를 기록하며 동일 사이즈의 글로벌 모델 대비 뛰어난 성능을 보였습니다. 7.8B 모델과 32B 모델 역시 평균 점수 상위권을 기록했습니다.


이미지 4. Performance Comparison Results of EXAONE 3.5 - On Nine Benchmarks Representing General Scenarios. 
Bold
scores indicate the best performance, and underlined scores mean the second best


2. Responsible AI : Open and Transparent Disclosure of Information

EXAONE 3.5의 개발 과정에서 우리는 윤리적인 AI를 위한 기업의 책임을 다하고자 했습니다. 다양한 사이즈의 모델 라인업을 오픈소스로 공개할 경우 AI 연구와 생태계 발전에 기여할 수 있는 반면, 의도하지 않은 사회적 약자에 대한 불평등 문제나 유해 콘텐츠의 생성, 사용자에 의한 악의적 사용 등 잠재적 위험의 가능성도 존재하기 때문입니다. 우리는 잠재적 위험을 미리 식별하고 방지하기 위해 AI 라이프사이클의 전 주기에서 위험 여부를 검토하는 AI윤리영향평가 과정을 진행했고, LG AI 윤리원칙을 준수하며 연구 개발을 이어왔습니다.

EXAONE 3.5의 윤리성 평가 결과, 우수한 점과 함께 보완이 필요한 부분도 확인할 수 있었습니다. 세 개 모델 모두 혐오 표현이나 불법적인 요소를 필터링 하는 부분에서 우수한 결과를 보였습니다. 반면 상대적으로 2.4B 모델의 경우 지역이나 직업과 관련한 편향을 개선해야 하는 점도 확인했습니다. 평가 결과를 그대로 공개한 이유는 AI 윤리가 발전하기 위해서는 투명한 정보 공개가 반드시 선행되어야 한다고 판단하고 있기 때문입니다. 이번 정보 공개를 바탕으로 연구자들이 AI 윤리 측면에서 더욱 활발한 연구를 진행하기를 바라며, LG AI연구원도 AI 윤리 연구를 이어가겠습니다.