|
LG AI연구원은 KAIST와 함께 NAACL 2024에서 열린 ‘제6회 임상 자연어 처리 워크숍(ClinicalNLP 2024)’의 EHRSQL 과제에서 1위를 달성했습니다. 이번에 발표한 모델은 전자 건강 기록(EHR)에 대한 자연어 질문을 SQL 쿼리로 정확하게 변환하고, 답변할 수 없는 질문을 식별하여 회피합니다. LG AI연구원과 KAIST는 이번 성과를 통해 정확하고 실용적인 Text-to-SQL 시스템이 의료 의사 결정을 개선할 수 있다는 잠재력을 보여주고자 합니다. |
AI 기술은 환자 치료, 임상 연구 및 행정 효율을 향상시키는 솔루션을 제공하며 의료 산업을 변화시키고 있습니다. 대량의 데이터를 분석하고 해석하는 AI의 능력은 조기 질병 탐지부터 맞춤형 치료 추천까지 의료 서비스 전반을 혁신하고 있습니다. 그중에서도 전자 건강 기록(Electronic Health Records, EHR) 접근성 향상은 AI의 핵심적인 응용 분야입니다. AI 모델은 의료 전문가들이 복잡한 데이터에서 유용한 통찰력을 신속하게 추출할 수 있도록 도와줌으로써 임상 의사 결정을 개선하고 궁극적으로 환자의 치료결과를 개선할 수 있습니다.

그림 1. 전자 건강 기록(EHR)을 위한 신뢰할 수 있는 Text-to-SQL 모델의 워크플로우[2].
의료 전문가들의 자연어 질문은 SQL 쿼리로 번역되어 EHR 데이터베이스에서 실행되며,
쿼리 결과에 기반하여 답변이 제공됩니다.
Text-to-SQL 모델을 사용하여 자연어 쿼리를 SQL 쿼리로 변환하는 능력은 의료 전문가들이 전자 건강 기록(EHR)에 접근하고 상호 작용하는 방식을 혁신적으로 변화시켰습니다. 특히 거대 언어 모델(LLM, Large Language Model)과 같은 AI 기술을 활용함으로써, 이 시스템들은 복잡한 의료 문의를 정확한 SQL 쿼리로 번역하는 데 점점 더 능숙해지고 있습니다. Text-to-SQL 모델을 활용하면 SQL 전문 지식이 없는 임상의들도 관련 정보를 효율적으로 검색할 수 있습니다.
이러한 의미 있는 발전에도 불구하고, 의료 분야에서 Text-to-SQL 모델의 신뢰성 보장은 여전히 중요한 도전 과제입니다. 복잡하거나 모호한 쿼리를 잘못 해석하면 잘못된 정보가 전파될 수 있으며, 이는 임상 환경에서 치명적인 문제를 일으킬 수 있기 때문입니다. 따라서 Text-to-SQL 시스템이 실용적으로 활용되기 위해서는 답변할 수 없는 질문이나 불확실한 예측을 정확하게 탐지할 수 있는 메커니즘을 갖추는 것이 필수적이며, 이를 통해서만 의료 의사 결정에서 발생할 수 있는 잠재적인 오류를 방지할 수 있습니다.
이러한 문제 의식에 따라, 제6회 임상 자연어 처리 워크숍(ClinicalNLP 2024)에서는 'EHRSQL: 전자 건강 기록에서의 신뢰할 수 있는 Text-to-SQL 모델링'이라는 공동 과제(Shared Task)가 개최됐습니다. 이 과제의 목표는 EHR 데이터베이스에 대해 신뢰할 수 있는 Text-to-SQL 모델을 개발하여 자연어 질문을 정확한 SQL 쿼리로 변환하면서도 잘못된 응답을 피하는 것입니다. 과제에서 다루는 자연어 질문은 환자 인구 통계, 생명 징후, 질병 생존율 등 다양한 주제를 포괄합니다.
LG AI연구원은 KAIST와 함께 해당 과제에 참여하여 전자 건강 기록을 위한 실용적인 Text-to-SQL 시스템으로 1위을 달성했습니다. 이번에 발표한 모델은 자가 학습(Self-training) 전략과 종합적인 필터링 메커니즘을 활용하여 자연어 질문을 SQL 쿼리로 정확하게 번역하고 답변 불가 질문을 신뢰성 있게 식별해 회피합니다. 이번 연구로 구축한 시스템이 해당 과제에서 최고 수준의 성과를 얻음으로써, 정확하고 신뢰할 수 있는 Text-to-SQL 번역을 통해 의료 의사 결정을 혁신할 잠재력을 확인할 수 있었습니다. 시스템의 신뢰성 강화에 집중한 이번 연구는 의료 전문가들에게 접근하기 쉽고 신뢰할 수 있는 도구를 제공하여 기술과 임상 실무 사이의 간극을 더욱 좁힌다는 의의가 있습니다.
1. 과제: EHRSQL
전자 건강 기록(Electronic Health Records, EHRs)
전자 건강 기록(EHR)은 의료 시설 내 환자의 전체 의료 이력을 기록하는 포괄적인 관계형 데이터베이스입니다. 입원 및 진단부터 치료 및 퇴원에 이르기까지 환자 치료의 다양한 측면을 포착하며, 중요한 임상 데이터의 원천으로서 기능합니다. 그러나 이러한 풍부한 정보에 접근하기 위해서는 SQL과 같은 쿼리 언어에 능숙해야 하며, 이러한 기술적 전문성이 부족한 의료 전문가들에게는 진입 장벽이 존재한다는 문제점이 있습니다.
EHRSQL
EHRSQL은 자연어 질문을 SQL 쿼리로 변환하여 전자 건강 기록(EHR)에 대한 접근성을 향상시키기 위해 설계된 전문적인 Text-to-SQL 데이터셋입니다[1]. 의사, 간호사, 보험 심사 팀을 포함한 222명의 병원 직원의 입력으로 구성된 이 데이터셋은 병원 환경에서의 다양한 정보 요구를 반영합니다. 질문은 환자 인구 통계, 생명 징후, 질병 생존율과 같은 주제를 다룹니다. 이 데이터셋은 구조화된 EHR 데이터에 대한 질문-응답 모델을 개발하는 실용적인 벤치마크로서, Text-to-SQL 연구와 의료 현장에서의 실제 배치 사이의 간극을 메우는 역할을 하고 있습니다.

그림 2. 질문 샘플[1]

그림 3. EHRSQL에 포함된 응답자 222명의 병원 부서와 경력 연수 비율 통계[1]
평가 지표
의료 분야에서 잘못된 정보는 치명적인 결과를 초래할 수 있기 때문에, 의료 분야 Text-to-SQL 모델 개발 시 신뢰성은 중요한 목표입니다. EHRSQL은 정확한 SQL 생성과 신뢰할 수 있는 답변을 보장하고자 구축되었습니다. 이를 위해 평가 지표는 모델이 답변할 수 없는 질문이나 불확실한 예측을 식별함으로써 잘못된 답변을 제공하는 것을 자제하도록 설계되었습니다. 예를 들어, 관련 데이터가 부족하거나 외부 지식이 필요한 질문은 답변할 수 없는 질문으로 식별되어야 신뢰성 있는 임상 의사 결정을 보장할 수 있습니다.
Text-to-SQL 모델의 정확성과 신뢰성을 평가하기 위해 '신뢰성 점수(Reliability Score, RS)'라는 평가 지표가 도입되었습니다[3]. RS는 모델이 정확한 SQL 쿼리를 생성하면서 답변할 수 없는 질문($Q_{una}$)에 대한 응답을 자제하는 능력을 측정합니다. 이는 다음 요소로 구성됩니다
1. 답변 가능한 질문($Q_{ans}$)에 대해 정확한 SQL 쿼리을 생성하거나 $Q_{una}$에 대해 응답을 거부하면 점수를 얻습니다.
2. Qans에 대해 잘못된 SQL 쿼리를 생성하거나 $Q_{una}$에 대해 SQL 쿼리 생성을 시도하면 점수를 잃습니다.
RS는 모델이 SQL 쿼리를 생성하거나 자제하는지의 여부와 실행 정확도($Acc$)에 기반하여 계산됩니다. 상수 'c'는 부과되는 패널티의 가중치를 결정합니다. 이를 통해 신뢰성 점수(RS)는 의료 분야에서 신뢰할 수 있는 Text-to-SQL 모델을 개발하고 평가하는 데 필수적인 도구로 쓰일 수 있습니다.

그림 4. 데이터 인스턴스에 대한 RS의 정의[3].
g(x)는 모델이 주어진 질문에 SQL을 생성할지(g(x)=1) 생성하지 않을지(g(x)=0)를 나타냅니다.
Acc(x)는 답이 실제 값과 일치하는지를 뜻합니다. 'c'는 패널티 가중치를 의미합니다.
2. 접근 방법: 자가 학습(Self-Training)
전자 건강 기록(EHR)을 위한 신뢰할 수 있는 Text-to-SQL 모델을 구축하기 위해, 이번 연구에서는 두 단계 자가 학습을 활용하는 접근 방법을 개발했습니다. 첫 번째 단계로 초기 시드 모델을 학습시키고 이를 사용하여 답변할 수 없는 질문을 식별합니다. 그 다음 두번째 단계에서는 확장된 데이터셋으로 모델을 재학습하여 모델을 개선하였습니다. 마지막으로, 생성된 SQL 쿼리의 품질을 보장하기 위해 필터링 기술을 적용했습니다.
그림 5를 통해 자세히 살펴보겠습니다. 첫 번째 단계에서 모델은 학습 데이터셋을 사용하여 학습됩니다. 이후 학습된 모델을 사용하여 테스트 데이터셋의 각 샘플에 대해 SQL 쿼리(또는 null)를 생성합니다. 이어서, K개의 null 샘플을 선택하여 학습 데이터셋에 추가함으로써 null이 증강된 학습 데이터셋을 만듭니다. 이 증강된 데이터셋은 최종 모델을 학습시키는 데 사용됩니다.

그림 5. 제시된 접근 방법의 학습 과정 및 SQL 쿼리 생성 방식
자가 학습(Self-Training)
자가 학습이란 모델이 레이블이 없는 데이터에 대한 자체 예측을 사용하여 스스로를 재학습하는 준지도 학습(Semi-supervised Learning) 기술입니다. 일반적으로 레이블이 없는 데이터는 풍부하지만, 레이블이 있는 데이터는 부족하고 비용이 높다는 문제가 있습니다. 자가 학습은 가상 레이블(Pseudo-label)을 생성하고 이를 학습 과정에 활용함으로써, 풍부한 레이블이 없는 데이터를 활용하여 모델의 정확성과 신뢰성을 향상시킵니다.
예를 들어, 병원에서 전자 건강 기록(EHR)을 위한 Text-to-SQL 시스템을 실제로 배치하는 상황을 생각해 봅시다. 의사나 의료 제공자와 같은 사용자가 시스템에 입력하는 자연어 쿼리를 수집하는 것은 상대적으로 쉽지만, 모든 쿼리마다 정확한 정답 SQL 쿼리를 작성하는 것은 어렵습니다. 이런 경우 유일하게 사용할 수 있는 자원은 모델이 자체적으로 생성한 예측뿐인 경우가 많습니다. 모델이 답변 불가능하다고 식별한 질문에 가상으로 레이블을 붙이고, 이 추가 데이터로 재학습하는 자가 학습 기법을 통해, 모델이 답변 가능 질문과 답변 불가 질문을 구분하는 능력을 향상시킬 수 있습니다. 이는 결과적으로 더욱 신뢰할 수 있는 SQL 쿼리 생성으로 이어집니다.
시드 모델 학습(Seed Model Training)
이번 연구에서는 우선 답변 가능한 질문과 답변 불가능한 질문이 포함된 원본 학습 데이터셋에서 시드 모델을 파인 튜닝하였습니다. 이 초기 학습은 모델이 EHRSQL 데이터셋의 질문 유형에 대한 기본적인 이해를 갖게 했습니다.
가상 레이블(Pseudo-Labeled) 답변 불가 질문을 이용한 자가 학습
시드 모델은 테스트 데이터에서 답변할 수 없는 질문을 식별하는 데 사용되었으며, 효과적으로 답변 불가능한 질문을 레이블링했습니다. 이 가상 레이블(Pseudo-label)을 붙인 질문들을 원본 학습 데이터에 통합하여 확장된 데이터셋을 만들었습니다. 이 데이터로 모델을 재학습하여, 답변 가능한 질문과 답변할 수 없는 질문을 구별하는 능력이 향상되었습니다.
필터링 전략
모델의 예측을 정제하기 위해 두 단계 필터링 과정을 적용했습니다.
1. 최대 엔트로피(Entropy) 필터링
생성된 SQL 쿼리의 각 토큰의 엔트로피(Entropy)를 계산했습니다. 쿼리에 포함된 어떤 토큰이 높은 엔트로피를 보여 불확실성을 나타내면, 그 쿼리는 답변할 수 없는 것으로 분류되었습니다.
2. 실행 기반 필터링
SQL 쿼리를 데이터베이스에 테스트했습니다. 오류를 발생시키거나 유효한 값을 검색하지 못하는 쿼리는 필터링되었습니다.
자가 학습과 이 필터링 전략을 결합함으로써, 모델은 답변 가능한 질문과 답변할 수 없는 질문을 구별하는 신뢰성이 향상되었고, 이는 더 정확한 SQL 쿼리 생성으로 이어졌습니다.
3. 결과
이번 연구에서 발표한 모델인 PLUQ (Pseudo-Labeled Unanswerable Questions)는 자가 학습 패러다임을 활용하여 EHR을 위한 Text-to-SQL 모델의 신뢰성을 향상시킵니다. 이 모델은 주요 지표인 RS(10)에서 가장 높은 성능을 달성하여 EHRSQL 2024의 공식 리더보드에서 최상위 순위를 달성했습니다. 특히 RS(0)와 RS(10) 점수 간의 차이가 가장 작다는 점은 모델이 답변 가능한 질문과 답변할 수 없는 질문 모두에서 불확실한 결과를 "답변할 수 없음"으로 정확하게 분류함으로써 패널티 점수를 최소화하는 능력을 보여주었습니다. 개발 데이터셋에 비하여 테스트 데이터셋에서 점수가 약간 감소했음에도 불구하고, PLUQ는 모든 RS 지표에서 다른 모델들을 일관되게 능가하여 결국 해당 과제에서 1위를 차지했습니다.

그림 6. 공식 리더보드의 개발 단계 및 테스트 단계 결과.
굵은 글씨는 최고 점수를 나타내며, 순위 결정 지표는 RS(10)입니다.
4. 요약
이번 연구에서 제시한 모델은 두 단계 자가 학습 전략과 종합적인 필터링 메커니즘을 활용하여 답변 가능한 질문과 답변할 수 없는 질문을 구별함으로써, 전자 건강 기록을 위한 더 신뢰할 수 있는 SQL 쿼리 생성을 이끌었습니다. 이 접근법을 통해 신뢰성 점수에서 가장 높은 성능을 달성하고 EHRSQL 2024 공동 과제에서 최상위 순위를 달성하는 결과를 얻었습니다. LG AI연구원과 KAIST는 정확성과 신뢰성을 결합한 Text-to-SQL 시스템을 통해 의료 의사 결정을 혁신할 잠재력이 있음을 보여주었습니다.
LG AI연구원은 Text-to-SQL 시스템 및 LLM의 성능과 신뢰성을 더욱 향상시키기 위해 지속적인 연구를 이어갈 계획입니다. 복잡한 의료 데이터셋을 처리하는 능력을 향상시키고, 실제 의료 환경에서 검증 실험을 수행하며, 다른 사전 훈련된 모델을 통합하는 연구를 이어갈 예정입니다. 궁극적으로는 의료 분야에서 AI의 역량을 강화하고, 환자 치료 결과와 의료 실무의 효율성을 개선할 수 있을 것으로 기대하고 있습니다.
[2] Choi, Edward, et al. “Reliable Text-to-SQL Modeling on Electronic Health Records - NAACL Clinical NLP 2024 Shared Task” https://sites.google.com/view/ehrsql-2024
[3] “Evaluation Tab of Reliable Text-to-SQL Modeling on Electronic Health Records” https://www.codabench.org/competitions/1889/
[4] “The 6th Clinical Natural Language Processing Workshop” https://clinical-nlp.github.io/2024/
[5] Jo, Yongrae, et al. "LG AI Research & KAIST at EHRSQL 2024: Self-Training Large Language Models with Pseudo-Labeled Unanswerable Questions for a Reliable Text-to-SQL System on EHRs" arXiv preprint arXiv:2405.11162 (2024)