기계 학습 분야의 글로벌 대표 학술 대회인 NeurIPS에서는 2022년부터 매년 Table Representation Learning (TRL) Workshop이 개최되고 있습니다. 본 워크샵에서는 Tabular Data를 위한 효과적인 학습 방식 연구를 중심으로 다룹니다. Tabular Data에 대한 연구자들의 관심이 지속 증가하는 추세에 맞춰 TRL 워크샵의 규모 또한 매년 확대되고 있습니다.
LG AI연구원의 Data Intelligence (DI) Lab은 NeurIPS TRL 워크샵에서 새로운 정규화(Normalization) 기술을 다루는 "Learnable Numerical Input Normalization for Tabular Representation Learning based on B-splines[1]"를 발표했습니다. Tabular Data의 학습 성능을 극대화할 수 있는 수치형 입력(Numerical Input)을 다루며, 복잡하고 이질적인 Tabular Data의 특성을 학습하고 이에 맞춰 대응할 수 있는 B-splines 기반의 정규화 기법을 제안합니다.
Tabular Data는 이질적이고 다양한 분포를 보여주는 특성이 있습니다. 각 열은 서로 다른 변수(Feature)로 구성되며, 각각의 분포와 특성에 적합한 정규화 기법이 필요하기에 입력값을 정규화 하는 과정이 특히 중요합니다. 기존에 사용되던 정규화 방법인 Min-Max, 표준화, Quantile 변환 등은 간단히 적용할 수 있지만, Neural Networks 학습 과정에서 최적화되지 못하고 특정 분포에만 효과적인 경우가 많습니다. 따라서 Tabular Data에서 Neural Networks의 성능은 어떤 정규화 방법을 선택하는가에 따라 크게 좌우되며, 모든 변수의 분포에 적합한 정규화 방식을 각각 찾아 적용하는 과정에서 상당한 시간과 자원이 소요됩니다. 따라서 본 연구에서는 이러한 한계를 극복하고, 데이터 샘플의 학습 난이도에 따라 동적으로 변환을 조정할 수 있는 정규화 기법을 제안합니다.
LG AI연구원의 Learnable Numerical Input Normalization for Tabular Representation Learning based on B-splines[1]
정규화 기법은 정규화 되지 않은 원시 입력(Raw Input)을 특정한 연속 함수(Continuous Function)를 통해 정규화 된 입력(Normalized Input)으로 변환하는 과정입니다. 하나의 변수에 대한 정규화 기법은 그와 대응하는 곡선으로 표현 가능하며, 본 연구에서는 데이터의 특성에 맞춰 변화할 수 있는 정규화 기법을 구현하기 위해 매개변수화 된 곡선(Parametrized Curve) 중 하나인 B-spline을 이용해 정규화 기법을 구현했습니다. 이후 해당 곡선의 매개변수는 Neural Networks의 학습과 동시에 최적화됩니다.

이미지 1. B-spline 기반 입력 정규화[1]
위 그림은 이번 연구에서 제안한 방식으로 찾은 정규화 곡선 중 하나입니다. 이와 같이 원시 입력을 정규화된 입력으로 변환하는 정규화 기법은 하나의 곡선으로 표현 가능합니다. 곡선의 기울기에 따라 특정 원시 입력의 범위가 정규화된 입력에서 차지하는 영역이 결정됩니다. 또한 곡선의 기울기를 조절해 Neural Networks가 높은 중요도로 학습해야 하는 원시 입력의 영역을 지정할 수 있습니다.
본 연구에서 B-spline을 선택한 이유는 다음과 같습니다. B-spline는 특정 차수(Order)를 설정하면 모든 입력 범위에서 기울기를 손쉽게 계산할 수 있어 곡선의 기울기 조절이 자유롭고, 매듭 벡터(Knot Vector)와 제어점을 조정하여 매끄럽고 연속적인 곡선을 생성할 수 있습니다. 또한, 매듭 벡터를 비감소(Non-decreasing) 형태로 유지함으로써 정규화된 입력이 원시 입력 데이터의 순서를 보존하도록 하여, 정규화의 안정성을 보장할 수 있습니다.
본 연구에서는 다음 두 가지를 가정하여 각 변수에 적합한 B-spline 기반 정규화 기법을 찾습니다.
어떤 정규화 기법이 넓은 범위의 원시 입력을 정규화 된 입력의 좁은 영역으로 대응시킨다면, 해당 정규화 기법을 사용해 학습된 Neural Networks는 해당 원시 입력의 범위를 상대적으로 낮은 중요도로 학습한다.
어떤 데이터 샘플의 학습 손실도(Training Loss)가 낮다면 해당 데이터 샘플은 사소하고 구분하기 쉬운 샘플로 중요도가 낮다.
위 두 가지 가정을 고려하여 B-spline 곡선의 매개변수는 다음과 같은 손실 함수(Loss Function)을 통해 학습됩니다.
제안하는 손실 함수를 이용해 도출된 곡선의 매개변수는 학습 손실도가 낮은 데이터 샘플에서 낮은 기울기를 갖게 되고, 따라서 해당 데이터 샘플 주변의 원시 입력을 좁은 영역의 정규화 된 입력으로 대응시키게 됩니다.

이미지 2. Neural Networks의 학습에 따라 변화하는 B-spline[1]
이미지 2는 이번 연구에서 제안한 방식이 각 변수에 해당하는 정규화 곡선을 학습해 가는 과정을 보여줍니다. 학습 시작 단계에서는 해당 변수에 대한 정보가 부족하여 간단한 선형 변환 형태를 보이지만, 학습이 진행될수록 데이터 샘플들의 중요도를 파악하여 중요한 원시 입력 영역에 많은 가중치를 주는 정규화 기법이 진행되는 것을 확인할 수 있습니다.
본 연구에서 제안하는 방식은 최근 제안된 Tabular Data에서의 효율적인 Neural Networks 학습을 위한 방법들과 함께 적용 가능한 방법입니다. 예를 들어 수치형 변수(Numerical Feature)를 표현하는 데 주로 사용되는 Periodic Embedding, Piecewise-Linear Embedding 등의 임베딩 방식이나 FT-Transformer, T2G-Former 등의 Transformer 기반 효과적인 Neural Networks 구조와 같이 적용하여 더욱 효율적인 Tabular Data를 위한 Neural Networks 구현이 가능합니다.

이미지 3. OpenML 데이터셋에서의 성능 결과, 26개 데이터셋의 평균치[1]
(Bold 처리된 수치는 1위 성능 평균치, underline 처리된 수치는 차순위를 의미)
Tabular data는 실제 산업 전반에서 중요한 역할을 담당하고 있으며, 이를 효과적으로 처리할 수 있는 AI 기술들은 공정 자동화, 스마트 팩토리, 그리고 데이터 기반 의사결정과 같은 첨단 산업 분야에서 많은 부가가치를 창출할 것으로 기대됩니다.
이러한 데이터를 효과적으로 처리하기 위해 LG AI연구원 DI Lab은 Tabular Data에 특화된 다양한 연구를 지속적으로 수행하고 있습니다. 본 연구에서 제안한 데이터 전처리 방식뿐 아니라 부족한 샘플 수를 보완할 수 있는 데이터 증강 기법과 효율적인 학습 방식을 개발하여 Tabular Data에서 Neural Networks의 효율성 향상을 위해 노력하고 있습니다. 또한, 이상 데이터 감지와 같은 샘플 데이터가 극히 적거나 없는 상황을 고려하여 방대한 양의 표를 미리 학습하여 새로운 임무가 주어져도 빠르게 해결할 수 있는 기반 모델(Foundation Model)과 최근 주목받고 있는 거대언어모델(LLM, Large Language Model)을 이용해 유사 데이터를 생성하는 연구도 진행 중입니다. LG AI연구원은 글로벌 학회 등에서 다양한 연구 성과를 공개할 계획입니다. 앞으로의 이야기도 기대해주세요!
NeurIPS 2024 Series
EP. 1 [NeuriPS 2024] Mutual Information Estimation Benchmark 연구 소개
EP. 3 [NeurIPS 2024 Series] Tabular Data 예측 성능 강화를 위한 Attention 기반 데이터 증강기법 연구 소개
EP. 4 [NeurIPS 2024 Series] Multimodal 시계열 예측을 위한 Adaptive Information Routing 기술 연구
[1] Suh, Min-Kook, et al. “Learnable Numerical Input Normalization for Tabular Representation Learning based on B-splines.” Table Representation Learning Workshop @ NeurIPS 2024 (2024).
[2] Gorishniy, Yury, et al. "On embeddings for numerical features in tabular deep learning." Advances in Neural Information Processing Systems 35 (2022).[3] Gorishniy, Yury, et al. "Revisiting deep learning models for tabular data." Advances in Neural Information Processing Systems 34 (2021).
[4] Yan, Jiahuan, et al. "T2g-former: organizing tabular features into relation graphs promotes heterogeneous feature interaction." Proceedings of the AAAI Conference on Artificial Intelligence. Vol. 37. No. 9. (2023).
[5] Hollmann, Noah, et al. "TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second." The Eleventh International Conference on Learning Representations (2023).
[6] McElfresh, Duncan, et al. "When do neural nets outperform boosted trees on tabular data?." Advances in Neural Information Processing Systems 36 (2024).