AI 기술이 처음 등장했을 때 사람들의 관심사는 ‘AI로 어디까지 가능할까?’였습니다. AI 연구자는 더 강력한 성능의 AI 모델을 개발하는 데 집중했고, AI 기술은 폭발적인 성장을 이루며 다양한 가능성을 현실로 구현할 수 있음을 증명했습니다.
하지만 그 과정에서 여러 가지 부작용도 따랐습니다. 무분별한 데이터 학습으로 인해 신뢰도가 떨어지거나, 비윤리적이거나, 타인의 권리를 침해하는 결과를 도출하는 문제가 발생했습니다. 그에 따라 이제 AI 기술의 핵심 논점은 ‘AI 모델의 성능’뿐만 아니라 ‘AI가 도출한 결과와 그 근거가 얼마나 신뢰할 수 있고 안전한가’로 확장되었습니다.
이러한 문제를 해결하기 위해 LG AI연구원은 AI 모델에 사용된 학습 데이터셋의 Life-Cycle를 추적해 법적 리스크를 종합적으로 분석하고, 데이터셋 활용에 대한 위험 요소를 평가하는 Agent AI 시스템을 연구했습니다. 본 연구 성과[1]와 함께, 해당 Agent AI 시스템이 제시하는 결과를 직접 살펴볼 수 있는 ‘NEXUS(넥서스)’도 함께 선보입니다.
NEXUS에 담긴 LG AI연구원의 Agent AI 기술과 Data Compliance 프레임워크를 지금부터 자세히 소개합니다.
데이터 컴플라이언스에 집중한 LG의 Agent AI

이미지 1. LG AI연구원이 공개한 NEXUS (nexus.lgresearch.ai)
AI 기술의 발전은 산업과 일상의 모든 영역으로 AI를 확장하며 우리 삶에 근본적인 변화를 불러왔습니다. 동시에 전례 없는 도전 과제도 마주하게 했습니다. 법적으로 안전하며, 윤리적으로 책임감 있게 기술을 발전시켜야 한다는 과제입니다.
이를 위해 우리는 AI 모델의 근간인 학습 데이터에 주목했습니다. 데이터셋의 법적 투명성과 안정성 확보가 중요하다고 판단하고, 데이터셋을 중심으로 개선 방안을 고민했습니다.
최근 AI 데이터셋의 특징 중 하나는 독특하고 복잡한 계층 구조를 지닌다는 점입니다. 하나의 데이터셋은 그 데이터의 출처가 된 수많은 Dependencies(하위/종속 데이터)와 복잡한 관계를 맺고 있습니다.
LG의 Agent AI 기술로 분석한 결과, 주요 AI 학습 데이터셋은 수없이 재배포되어 사람이 일일이 출처를 추적하는 것이 불가능한 수준이었습니다. 또한 재배포되는 각 단계마다 수십 개 혹은 수백 개의 데이터셋들과 연결되어 있기도 했습니다. 이는 하나의 데이터셋이 많게는 수천, 수만 개의 개별 데이터 소스와 연결된 상태일 수 있음을 의미합니다. 이처럼 복잡하게 연결된 수많은 데이터셋의 안전성을 파악하기 매우 어렵기 때문에, 데이터셋의 복잡성은 결국 심각한 불투명성과 법적 리스크로 연결될 수 있습니다.
그래서 우리는 Agent AI를 활용해 데이터셋의 Life-Cycle을 추적하여 리스크를 분석하고 평가하는 기술을 연구했습니다. 이 기술을 직접 구현한 프로젝트가 바로 NEXUS입니다.
복잡한 데이터셋의 계층 구조까지 자동 분석

이미지 2. 데이터셋의 계층 구조를 분석하는 NEXUS
이번에 공개한 Agent AI 기술의 주요 특징은 데이터셋의 복잡한 계층 구조까지 찾아 자동으로 분석할 수 있다는 점입니다. LG의 Agent AI는 데이터셋이 재배포되고 결합되는 과정에서 발생하는 권리관계의 변화를 광범위한 Scalability(확장성)을 기반으로 추적합니다. 시스템은 각 단계에서 발생할 수 있는 라이선스 충돌, 권리관계 불일치, 개인정보 포함 여부 등을 자동으로 감지하고, 이에 대한 구체적인 리스크 평가 결과를 제공합니다.
LG의 Agent AI는 데이터셋을 단순한 정보의 집합이 아닌, Dataset과 Dependencies로 이어지는 복잡한 트리 구조로 인식합니다. 각 노드에서 발생할 수 있는 법적 리스크를 개별적으로 평가하고, 이러한 리스크가 상위 노드에 미치는 영향을 자동으로 분석합니다.
시간, 비용, 정확도에서 압도적인 경쟁력
NEXUS에 적용된 Agent AI 기술은 LG AI연구원의 EXAONE 3.5 모델을 기반으로 개발된 종합 Data Compliance 솔루션입니다. 크게 내비게이션(Navigation), QA(Question-answer), 스코어링(Scoring) 세 가지 핵심 모듈로 구성되어 있으며, 각 모듈은 서로 다른 방식으로 파인 튜닝 되었습니다.
내비게이션 모듈 : 인공적으로 생성된 합성 데이터를 활용하여, 웹 문서 탐색 및 텍스트 분석 과정을 집중적으로 학습했습니다. 데이터셋, 소프트웨어, 콘텐츠 등의 개체(Entity) 이름과 유형을 분석해 관련된 웹 페이지나 라이선스 문서를 탐색합니다.
QA 모듈 : 수집된 문서를 분석해 Dependencies 및 라이선스 정보를 효율적으로 추출합니다.
스코어링 모듈 : 변호사가 직접 라벨링한, 정제된 데이터셋을 기반으로 라이선스 조항의 세부 내용을 정확히 이해하고, Entity의 유형 및 메타데이터와 결합하여, Entity가 지닐 수 있는 법적 위험도를 점수화하여 평가하는 복잡한 과정을 수행합니다.
이러한 구성 요소들의 유기적인 작용을 통해, Agent AI 기술은 뛰어난 정확성과 속도를 달성했습니다. 사람 전문가 대비 45배 이상 빠른 속도로 작업을 완료하면서 비용은 700분의 1 수준으로 절감할 수 있습니다. 또한 사람 전문가 대비 Dependencies 식별 정확도는 약 16.85%p, 라이선스 문서 식별 정확도는 약 8.1%p 더 높아, 시간·비용·정확도 모든 면에서 우수한 성능을 보여줍니다.

이미지 3. Accuracy of finding the sources and license terms of 216 datasets
실제로 상위 1,000번 이상 다운로드 된 Hugging Face 데이터셋 중 무작위로 선정된 216개를 평가한 결과, Dependencies 식별 정확도는 약 81.04%, 라이선스 문서(주로 URL 형태) 식별 정확도에서는 95.83%를 기록했습니다. 이는 유사한 환경에서 웹 검색이 가능한 다른 대형 언어 모델 서비스와 비교했을 때 큰 우위를 보이는 수치일 뿐 아니라, 사전에 유사 Task로 훈련받은 변호사의 평균 점수도 넘어서는 결과입니다. 이러한 성능 차이는 Agent AI 기술력이 웹으로부터 특정 정보를 탐색해 내는 능력뿐 아니라, 라이선스 조항을 분석하여 정량적인 점수로 환산해 내는 스코어링 모듈의 정교한 알고리즘에 기인합니다.

이미지 4. Efficiency Comparison between AutoCompliance Agent and Human expert
처리 속도와 비용 절감 측면에서도 뛰어난 결과를 보였습니다. 하나의 데이터셋에 대해 Dependencies와 라이선스 정보를 찾고, 이를 종합해 법적 위험을 평가하는 전체 프로세스의 수행 시간이 평균 약 53.1초 정도밖에 걸리지 않습니다. 같은 작업을 사람이 직접 수행할 경우 평균 2,400초 이상 소요되는 것과 비교했을 때 월등히 빠른 시간입니다. 비용도 0.29달러(약 300원 내외)에 불과하여 전문가 검토 대비 큰 폭의 비용 절감 효과가 있습니다. 이처럼 우리가 공개한 Agent AI 기술과 NEXUS는 대규모로 라이선스 검토가 이뤄져야 하는 산업 현장, 연구 기관, 법무 부서 등에서 신속성과 정확성은 물론 경제성까지 모두 충족시키는 혁신적인 솔루션입니다.
LG의 Data Compliance 프레임워크
데이터셋에 대한 법적 리스크 평가는 LG AI연구원이 개발한 Data Compliance 프레임워크를 기반으로 이루어집니다. 이 프레임워크는 18개의 주요 평가 항목을 통해 데이터셋의 법적 안전성을 종합적으로 평가합니다. 대표적으로 라이선스 부여 여부, 데이터 수정 권한, 2차 저작물 작성 권한, 산출물의 원저작권 침해 가능성, 개인정보 보호 관련 사항 등이 포함됩니다. 각 항목은 실제 법적 분쟁 사례와 판례 분석을 바탕으로 설계된 가중치를 적용해, 현실적이고 신뢰할 수 있는 리스크 평가가 가능합니다.
Data Compliance 평가 결과는 7단계 위험등급 체계로 분류되며, 다음과 같은 세부적인 기준으로 운영됩니다.

이미지 5. LG AI연구원 Data Compliance 프레임워크
A-1 등급은 가장 안전한 최상위 등급으로, 두 가지 조건을 모두 만족해야 합니다. 첫째, 명시적인 상업적 이용 허가가 있거나 퍼블릭 도메인에 해당해야 합니다. 둘째, 모든 하위 데이터셋 역시 동일한 수준의 권리 허가를 가지고 있어야 합니다.
A-2에서 B-2 등급은 제한된 범위 내에서 안전한 사용이 가능한 데이터셋을 의미합니다. 예를 들어, 연구 목적으로는 자유롭게 사용할 수 있지만 상업적 이용에는 일부 제한이 있는 경우가 여기에 해당합니다.
C-1에서 C-2 등급은 '그레이존'에 해당하는 데이터셋으로, 사용하기에 다소 리스크가 있다고 판단된 데이터셋입니다. 예를 들어 라이선스 조건을 명백히 위반했거나, 라이선스 상태가 불명확하거나, 하위 데이터셋과의 권리관계가 모호한 데이터셋을 들 수 있습니다. 또한 저작권 침해 가능성이 높은 콘텐츠, 민감한 개인정보가 포함된 데이터, 웹 크롤링, 분쟁 가능성이 있는 데이터셋 등도 포함됩니다.
Agent AI, 그리고 NEXUS가 그리는 미래
LG가 공개한 Agent AI 기술과 NEXUS는 AI 데이터셋의 법적 안정성을 위한 새로운 표준을 제시했지만, 여전히 해결해야 할 과제가 많습니다. 실제로 LG AI연구원이 NEXUS를 통해 3,612개의 주요 데이터셋을 심층 분석한 결과, 데이터셋과 Dependencies 간의 권리관계 불일치 문제가 예상을 훨씬 상회하는 수준으로 나타났습니다.
특히 우려스러운 점은 이러한 불일치가 발견된 데이터셋 상당수가 현재 널리 사용되는 주요 AI 모델들의 학습 데이터라는 사실입니다. 한 예로, 상업적으로 이용 가능하다고 판단된 2,852개의 AI 학습 데이터셋 중 종속 데이터의 리스크를 모두 고려해 본 결과, 21.21%인 605개의 데이터셋만 상업적으로 이용 가능했습니다. 이처럼 현실에서 나타나는 AI 데이터셋의 법적 안정성 관련 문제를 인식하고, 변화하는 AI 기술과 법적 환경에 발맞춰 이를 개선하기 위한 노력을 이어갈 것입니다.
우리의 첫 번째 도전은 Agent AI 기술이 분석하는 데이터셋 범위와 깊이를 획기적으로 확장하는 것입니다. 현재 3,612개의 데이터셋을 넘어, 향후 세상에 존재하는 모든 데이터의 Life Cycle을 파악할 수 있는 규모로 확대할 계획입니다. 이는 단순한 양적 확장이 아닌, 질적 심화에 초점을 맞춘 진화가 될 것입니다.
더불어, Data Compliance 프레임워크 역시 글로벌 스탠다드로 발전시켜 나갈 것입니다. 현재의 18개 평가 항목은 AI 모델과 데이터 사용 패턴의 변화를 반영해 지속적으로 고도화될 예정이며, 글로벌 AI 커뮤니티 및 법률 전문가와 협력해 국제 표준으로 발전시킬 계획입니다. 이를 통해 AI 데이터셋의 법적 안정성을 보장하고, 개발자가 프로젝트에 적합한 데이터셋을 쉽게 탐색하며 신뢰할 수 있는 리스크 평가와 해결 방안을 제공받을 수 있도록 지원할 것입니다. 궁극적으로 NEXUS를 AI 개발자를 위한 종합적인 법적 리스크 관리 시스템으로 발전시키며, 안전하고 책임 있는 AI 생태계 구축에 기여할 것입니다.