
이미지 1. LG AI연구원 Vision Lab 조아라 님
AI는 다양한 산업 현장에 적용되며 우리 삶에 혁신적인 변화를 만들어내고 있습니다. AI가 전문적인 문서의 내용을 이해하고 분석하여 직무별 특화된 활용법을 제안하고, 산업 현장에서 발생하는 다양한 형태의 데이터를 빠르게 분석해 최적의 공정 스케줄링을 제시하기도 합니다.
LG AI연구원은 AI가 문서 내 그림, 그래프, 테이블 등 다양한 형태의 정보를 이해하는 ‘문서 심층 분석(Deep Document Understanding, 이하 DDU)’ 기술을 공개했습니다. 앞으로 이 기술을 대화형 AI 서비스나 AI 예측 서비스에 적용하여 활용 범위를 확장하고, 독자적인 솔루션을 개발하는 것을 목표로 하고 있습니다.
DDU 기술 개발을 이끌어 온 Vision Lab 조아라 님을 만나 그간의 연구 과정 및 성과, 그리고 LG AI연구원에서의 일상에 대한 이야기를 나눠보았습니다.
나의 첫 커리어의 시작

이미지 2. 나의 첫 커리어의 시작
학부 3학년 때 우연히 HCI(Human-Computer Interaction)에 관심을 가지게 된 것을 계기로 Vision 분야의 공부를 시작했습니다. 우리 눈에 보이는 것을 RGB 신호로 변환할 수 있고, 그 정보를 컴퓨터가 인식하며 다양하게 활용할 수 있다는 것에 매력을 느꼈어요.
연구를 하면서 Vision AI로 사회에 긍정적인 영향을 주고 싶다는 목표가 생겼고, 방법을 고민한 결과 ‘수화 인식’을 떠올렸어요. ‘수화를 인식하여 텍스트 또는 음성으로 출력할 수 있다면, 수화를 모르는 시각장애인 분들과 대화가 가능하지 않을까?’라는 물음으로 시작해, 학부 졸업작품으로 세상에 내놓겠다는 도전 정신으로 이어졌죠.
수화 인식 연구를 꼭 해보겠다는 마음으로 대학원까지 진학했지만, 막상 대학원에서는 수화 인식 연구는 마음속에 간직한 채 다른 프로젝트를 진행하며 바쁜 시간을 보냈습니다. 대신 다양한 분야의 Vision 연구를 접하며 AI 기술의 확장 가능성을 배웠던 과정이었습니다.

이미지 3. 연구에 몰두 중인 조아라 님
2016년 박사학위를 받은 직후에는 바로 스타트업에 입사해서 1년 반 정도 탈세 혐의 예측 프로젝트를 진행했어요. 당시 대표님께서 제게 하신 말씀 중 “기술은 세상에 환원할 수 있는 방향으로 발전해야 하며, 탈세 혐의 예측을 통해 찾아낸 검은 돈을 나라에 환원함으로써 세상을 더 이롭게 할 수 있다”는 말씀이 아직도 기억에 남네요.
이때는 제가 이미지가 아닌 데이터를 활용한 AI 모델을 연구했던 유일한 시기였을 거예요. 1년 반의 시간 동안 프로젝트에 집중하면서 좋은 성과도 있었지만, Vision 분야 연구에 대한 갈증도 어마어마하게 커졌죠. 이 때 좋은 기회로 LG CNS로 입사하면서 LG에서의 커리어를 시작하게 됐습니다.

이미지 4. LG AI연구원 로고 조형물 앞에 앉아 있는 조아라 님
LG에 합류하고 나서는 Smart Store 프로젝트를 진행했습니다. 무인 계산대 위에 구매하려는 제품을 올려두고 계산하기 버튼을 클릭하면, 카메라가 1초 이내로 선반 위의 제품을 스캔하여 계산해 주는 프로젝트였어요. 데이터 수집부터 모델 개발까지 직접 도맡았고, 모델은 99% 이상의 인식률을 보여주며 성공적인 결과를 거두었습니다.
이후 좋은 기회로 2019년에 AI연구원(당시 LG사이언스파크 AI추진단)에 합류하게 됐습니다. AI연구원에서라면 내가 개발한 AI 모델을 세상에 선보일 수 있겠다는 확신이 들었어요. 입사 초기에는 Vision 검사 프로젝트를 맡아 진행하다가 육아휴직 이후인 2021년 본격적으로 DDU 프로젝트와 함께하게 되었습니다.
DDU 기술의 무한한 확장 가능성

이미지 5. DDU 기술의 무한한 확장 가능성
현재 DDU 기술은 LG AI연구원 Vision Lab의 DDU Squad(스쿼드) 조직이 담당하고 있어요. 2021년 분자구조식 변환 모델의 기본 구조, Super Atom, Stereo Chemistry 연구로부터 시작해 2023년 Polymer, 2024년 Vision Markush, Reaction으로 점차 범위를 넓혀가며 연구를 진행해 왔습니다.
2024년부터는 일반 문서영역으로 커버리지를 확장해, 레이아웃 검출, Table to HTML, Chart to Table, OCR 등 Vision 기반 모델을 연구하고 있습니다. 주요 성과로는 LG화학에 레이아웃 검출, Table to HTML, 분자구조식 변환 모델을 전달하고, 글로벌 출판사에 레이아웃 검출, 분자구조식 변환 모델, Reaction 모델을 제공했던 것을 꼽을 수 있습니다.
LG AI연구원에서 진행하는 타 프로젝트에도 DDU 모델을 함께 탑재하고 있습니다. 예를 들어, 현재 LG AI연구원이 공개한 기업 전문가용 AI 비서 ChatEXAONE에서는 사용자의 문서를 이해하는 과정에 DDU기술이 일부 적용되었고, 점차 확대해갈 예정입니다. Financial AI에서는 Financial Report 문서에서 차트와 테이블의 수치를 추출하고 정리해 새로운 금융 리포트를 작성하는 과정에 활용되고 있죠.
또한 신소재와 신물질, 신약 개발 플랫폼인 EXAONE Discovery에서는 분자 구조식을 검출하고 변환하는 데 DDU 기술이 활용되고 있습니다. 다양한 프로젝트에 효율적으로 적용하기 위해 저희가 개발한 모든 DDU 모델들을 API화 했습니다.
LG의 DDU, 차별화된 경쟁력은?

이미지 6. LG의 DDU 기술 설명에 대한 이미지
LG AI연구원의 DDU 기술은 세상의 모든 문서를 이해하는 것이 목표예요. 이를 위해서 문서의 모든 내용을 분석하고, 이를 Extraction 할 수 있는 기술을 확보하는 데 집중했습니다. 이러한 기술력을 바탕으로 차별화 경쟁력을 꼽자면 두 가지로 정리할 수 있습니다.
첫 번째로는 Anti-hallucination을 위한 정확한 정보 추출과 이를 기반으로 한 Understanding 기술이라고 할 수 있습니다. 최근 LLM 생성형 모델이 급속도로 발전하며 일상 곳곳에서 활용되지만, 여전히 Hallucination 문제가 지속적으로 제기되고 있죠. 저희 DDU스쿼드에서는 이러한 Hallucination 문제를 최소화하기 위해 Vision Only 모델을 활용해 정확한 데이터를 추출 하는 것을 목표로 하고 있습니다.
두 번째로는 문서 형식에 구애받지 않는다는 점입니다. 모든 문서를 이미지화하여 처리하기 때문에 PDF, PPT, DoC, HWP, PNG, JPG 등 여러 형태의 문서를 동일한 모델로 처리할 수 있어요. 이미지로 처리하지 않는 일반 LLM 모델의 경우에는 사전에 각 확장자에 맞는 Parser를 사용해서 전처리를 해야 하지만, LG AI연구원의 DDU는 이러한 과정이 모두 생략될 수 있다는 점이 차별점입니다.
우리의 삶을 바꿀 DDU
Document AI 기술은 이미 우리의 삶 속 다양한 분야에서 활용되고 있습니다. 금융, 의료, 법률, 물류 등 여러 산업에서 효율성을 높이는 데 기여하고 있죠. 예를 들어, 금융이나 보험업계에서는 대출 서류나 보험 청구서와 같은 문서를 자동으로 처리하고, 의료 분야에서는 환자의 의료 기록을 디지털화하여 관리 효율성을 높이고 있어요. 또한, 법률 & 계약 관리에서는 계약서 검토 및 법적 문서 분석을 자동화하여 업무 속도를 향상시키고, 물류 & 유통에서는 송장과 영수증을 자동으로 처리하여 물류 운영을 최적화하고 있습니다.
앞으로 LG AI연구원의 DDU는 DLA, Table to HTML, Chart to Table, OCR 등의 Vision Model과, 현재 개발 중인 Document Foundation Model(DocFM)을 활용하여 문서를 심도있게 이해할 수 있는 모델로 발전시킬 계획이에요. 나아가 이미지 형태의 문서를 편집 가능한 형태로 변환하여 자유롭게 수정할 수 있도록 하는 Application 개발과, 문서를 원하는 형식(PPT Style, Blog Style 등)으로의 변환하는 Application 등으로 발전시켜 Document 업무의 새로운 혁신을 이끌어 가고자 합니다. 궁극적으로 문서 처리의 효율성을 극대화하고, 업무 환경을 한 단계 진화시키는 데 기여하고 싶습니다.
Vision Lab의 일하는 방식

이미지 7. Vision Lab의 일하는 방식
Vision Lab에서는 Vision 분야 연구뿐만 아니라, 다양한 Modality로 확장하는 연구도 함께 진행하고 있습니다. 향후 세계적인 수준의 파운데이션 모델 기반의 Embodied AI까지 연구를 확장하는 것이 목표입니다.
Vision Lab에서 가장 중요한 가치는 자유롭게 아이디어를 공유하고, 긴밀하게 협력하는 것입니다. 또한, 동료의 일이 곧 팀의 일이라는 인식을 가지고 있어요. 도움이 필요할 때는 주저 없이 요청하고, 함께 논의하며 해결하려 노력하는 것이 문화로 자리 잡혀 있죠. 이를 통해 서로의 강점을 극대화하고, 어려운 과제도 효과적으로 해결해 나갑니다.
무엇보다 Vision Lab 구성원이 서로 신뢰한다는 점이 가장 큰 장점이라고 생각해요. 각자의 전문성과 의견을 존중하고, 신뢰를 바탕으로 적극적으로 피드백을 주고받으며 성장해 나가고 있어요. 이러한 문화 덕분에, 유연하고 협력적인 연구 환경을 유지하며 지속적으로 발전하고 있다고 생각합니다.
Work-Life Balance at LG AI Research

이미지 8. 직장 어린이집을 다니며 지내는 조아라 님 아이의 모습
현재 저는 육아휴직 후 복직해 워킹맘의 삶을 살고 있어요. 개인적으로 LG AI연구원에서의 삶에 굉장히 만족하고 있습니다. 아이가 지금 50개월인데, 20개월 때부터 약 30개월 동안 함께 출퇴근하며 직장 어린이집을 이용해 왔죠. 아이를 돌봐주는 곳이 가까이 있는 덕분에 갑자기 문제가 생겨도 신속하게 데리러 갈 수 있고, 바깥놀이 시간에는 창문 너머에서 아이가 뛰어노는 모습을 보며 안심할 수 있었습니다. 특히 서울 식물원은 서울이라는 대도시 안에서도 아이들이 사계절의 변화를 몸으로 느끼며 자연을 배워가기에 너무나 좋은 환경이었습니다. LG AI연구원에서 지원해주는 디앤오 어린이집이 바로 서울 식물원에 위치해 있기에 봄이면 형형색색의 다양한 꽃들을 만나고, 여름이 되면 시골 아이처럼 새까맣게 탄답니다. 가을이 되면 도토리며 다양한 낙엽들도 모아오고요. 겨울이면 하얗게 눈내린 아무도 밟지 않은 잔디밭을 신나게 뛰어 놀 수 있었답니다.
LG AI연구원은 다양한 사내복지를 제공하지만, 개인적으로는 그 중에서 어린이집 복지가 가장 훌륭하다고 생각해요. 이제 유치원으로 옮길 나이가 되어 새로운 곳에서 시작을 하게 되었는데, 입학 하루만에 어린이집의 깨끗한 환경과 서울 식물원 바깥놀이를 그리워하는 아이를 보니 좋은 환경임을 다시 생각하게 되었습니다. 또한, 유연근무제도 워킹맘에게는 큰 장점입니다. 아이가 아프거나 갑자기 다치는 사고가 있을 때 출퇴근 시간을 조정할 수 있어 육아와 회사일을 순조롭게 해낼 수 있었어요. 모든 워킹맘들이 마찬가지겠지만, 시간이 지나 아이가 엄마의 모습을 자랑스럽게 여길 수 있도록 하루하루 최선을 다하며 열심히 살아가고 있습니다.
나의 이름 앞 수식어

이미지 9. 나의 이름 앞 수식어
Document AI 분야에서 LG AI연구원을 가장 먼저 떠올리도록 하는, 임팩트 있는 연구 성과를 거두는 데 기여하고 싶어요. 임팩트가 크려면 기술적으로 혁신적일 뿐만 아니라, 실제 고객들에게 실용적인 가치를 제공할 수 있어야 한다는 생각입니다. 그런 연구 성과에 당당히 제 이름이 올라가는 날을 목표로 하며 연구를 이어가고 있습니다.
2025년, DDU의 목표는
연구적인 측면에서는 Document Foundation Model을 구축하고, Vision Model과의 융합을 통해 Hallucination 없이 뛰어난 성능을 갖춘 모델을 개발하기 위해 힘쓰고 있어요. 이를 통해 Document AI 기술의 정밀도를 한층 더 높이고, 신뢰할 수 있는 AI 모델을 만들고자 합니다.
사업적으로는, 현재 저희가 개발한 모델들이 API 형태로 제공되고 있는 만큼, 이를 기반으로 한 API 사업을 확장하는 데 집중할 계획입니다. 더 나아가, 모든 API를 ChatEXAONE에 통합하여 더욱 강력한 AI 서비스를 제공하고, 최종적으로는 우리만의 Document AI 솔루션을 구축하는 것을 목표로 하고 있습니다.
이러한 연구 및 사업적 성과를 통해 Document AI 분야에서 독보적인 입지를 다지며, 고객들에게 혁신적인 가치를 제공하는 한 해를 만들어 나가고자 합니다.