LKU_8c80d4241.png Kyungeun Lee 2024.01.17

[NeurIPS 2023] Tabular Learning 연구 동향

LG AI연구원의 Data Intelligence(DI) Lab은 NeurIPS 2023의 ‘Table Representation Learning Workshop’에서 ‘Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular Domains’ 논문을 발표하였습니다.

정형 데이터를 의미하는 Tabular Data는 우리가 데이터베이스에서 쉽게 볼 수 있는 Table 형태의 행과 열로 표현되는 데이터입니다. 이미지, 텍스트, 음성 등 비정형 데이터와는 달리, Table 형태의 Tabular Data에 대해서는 아직까지 딥러닝이 좋은 성능을 보이지 못하고 있습니다. 이에 따라, 기존 기술과는 차별화되는 Tabular Domain에 특화된 다양한 기술들이 제안되고 있습니다. Tabular Data Problem의 경우, 불연속 함수와 같이 Irregular Function을 학습하는 것이 매우 중요하다고 알려져 있습니다. 반면, 딥 네트워크의 경우 매우 복잡하고 Smooth한 함수에 쉽게 수렴하는 것으로 알려져 있어, Tabular Domain에서는 딥 네트워크가 좋은 성능을 보이지 못하고 있습니다.


그림 1. Binning as a Pretext Task for Self-supervised Learning 개요도[7]


본 논문에서는 이러한 딥 네트워크의 한계점을 효율적으로 극복하기 위하여, 연속(Continuous) 변수를 불연속(Discrete) 변수로 변환할 수 있는 Binning Algorithm을 활용합니다. 특히, Label 정보가 제공되지 않는 Unsupervised Setting을 고려합니다. 그림 1에서 설명하는 것과 같이, 본 방식은 Autoencoder 구조를 사용합니다. 그러나 Input 값이 아닌 Input 값의 Binning Class 값을 예측합니다. 이때, Binning은 Training Data에 대해 수행되며, Bin 개수는 Hyperparameter로 사용자가 설정합니다. 본 방식의 장점은 다음과 같습니다. (1) Target을 연속(Continuous) 변수에서 불연속(Discrete) 변수로 변경함에 따라 Irregular Function을 학습할 수 있도록 Inductive Bias를 부여합니다. (2) Tabular Data의 특성상, 수치형(Numerical) 변수와 이산형(Categorical) 변수가 혼재할 수 있는데, 모든 변수에 대해 Target을 불연속 변수인 Bin으로 설정하여, 해당 문제를 효과적으로 해결할 수 있습니다. (3) Training Data 내의 분포 상 유사한 값을 가지는 경우, 동일한 Bin으로 취급하여 유사한 값을 그룹화할 수 있습니다. (4) 불필요한 패턴을 포함하는 Minor Error를 무시할 수 있습니다. (5) 모든 변수(Feature)를 동일한 Elements를 포함하는 Equal Sets로 만들어, 불필요한 변수가 학습을 저해하는 것을 방지합니다. (6) Target 정보와 Loss Function만을 변화시키는 것으로, 모든 추가적인 변형이 가능합니다. 예를 들어, 고도화된 임의의 Encoder 네트워크를 쓸 수도 있고, 추가적인 Augmentation을 적용할 수도 있으며, 다른 Loss Function과도 Weighted Sum으로 함께 적용할 수 있습니다. 

결과적으로, Binary Classification, Multiclass Classification, Regression의 다양한 Downstream Task에 대하여 총 25개의 Dataset에서 좋은 성능을 보이는 것을 확인하였습니다. 특히, Supervised Setup에서 학습한 Tree-based 알고리즘과 최신의 가장 좋은 딥 네트워크 기반 알고리즘과 비교하더라도, 비슷하거나 더 나은 성능을 찾을 수 있는 것을 확인하였습니다.

NeurIPS 2023에서는 본 논문과 같이 Tabular Domain에 특화된 연구 성과들이 발표되었습니다.  Main Conference에서 총 10편의 논문이 발표되었고, Distribution Shift 또는 Synthetic Data 등 특정 문제 세팅에서 벤치마크 데이터셋 및 알고리즘을 정리한 연구가 4편으로 가장 많으며, Graph Representation Learning의 아이디어를 Tabular Representation Learning에 응용한 연구가 3편으로 뒤를 이었습니다.

그 외에도, Gradient Boosted Decision Tree (e.g. XGBoost, CatBoost) 대비 딥러닝의 성능을 분석한 연구가 2편, Transformer 모델을 사용하여 Tabular Learning 성능을 향상시킨 연구가 1편 발표되었습니다. 이번 글에서는 Tabular Domain 관련 연구 논문 중, 다양한 방법론을 제안하는 3편의 논문을 중점적으로 살펴보겠습니다.


1. When Do Neural Nets Outperform Boosted Trees on Tabular Data?

본 논문은 Tabular Domain에서 Neural Nets(NNs)와 Gradient-boosted Decision Trees(GBDTs) 간의 성능 차이를 실험적으로 분석하기 위해, 대규모 실험을 진행하고 그 결과를 정리했습니다. 176개의 데이터셋, 19개의 알고리즘, 30개의 Hyperparameter Setting에 대해 10-fold Cross-validation 결과를 분석했고, 가장 어려운 36개의 데이터셋에 대한 TabZilla Benchmark를 공개하였습니다.

본 논문의 주요 Research Question은 다음 두 가지로 요약될 수 있습니다.


(1) 다양한 데이터셋에 대하여 모두 좋은 성능을 내는 하나의 알고리즘이 존재하는가?

(2) 특정 알고리즘의 성능이 데이터셋의 어떤 성질과 관련하여 설명할 수 있는가?


두 질문에 답을 찾기 위해 본 논문에서는 대규모 실험을 진행했습니다. 먼저 알고리즘으로는 GBDTs 중 3가지(CatBoost, LightGBM, XGBoost), NNs 중 11가지(DANet, FT-Transformer, MLPs, NODE, ResNet, SAINT, STG, TabNet, TabPFN, VIME), 그리고 Simple Baselines으로 5가지(Decision Tree, KNN, Logistic Regression, Random Forest, SVM) 모델을 사용했습니다. 데이터셋으로는 Python OpenML[4] Library에서 접근할 수 있는 데이터로 총 176개의 Classification 데이터셋을 사용했습니다. Downstream Task 성능과 관련된 데이터의 통계적 속성을 분석하기 위하여, Python PyMFE[5] Library에서 제공되는 총 965개의 Meta-features 를 활용하였습니다. General에 해당하는 샘플 수, 클래스 수, Feature 구성 등뿐만 아니라 Statistical에 해당하는 최솟값, 최댓값 등을 포함합니다.


그림 2. 논문의 분석 방법 개요[1]


실험 결과를 요약하면 다음과 같습니다. 먼저, 모든 것을 잘하는 하나의 알고리즘은 존재하지 않습니다. 모든 알고리즘이 최소 1개의 데이터에서 1등 또는 꼴등을 하는 것으로 나타났습니다. 그중, CatBoost가 총 21개 알고리즘 중 평균 6.12등으로 가장 잘하는 것으로 나타났습니다.

NNs 중에서는 TabPFN[6] 이 가장 좋은 성능을 보였고, 특히 TabPFN의 학습 속도가 매우 빠르게 나타났습니다. Large Data에서는 메모리 문제로 3,000장만 학습에 사용했음에도 불구하고 CatBoost와 유사한 성능을 나타내는 것을 볼 수 있습니다. 그러나 GBDTs와 NNs를 비교하는 경우, GBDTs가 보다 많은 경우에서 우수한 성능을 보였습니다. 

따라서 현재까지의 알고리즘 중에서는 GBDTs 중 좋은 Hyperparameter를 찾는 것이 최고 성능을 얻는 데 큰 도움을 줄 것이라 예상할 수 있습니다. 특히, Meta-feature 에 대한 분석 결과, GBDTs가 보다 불규칙적인(Irregular) 데이터, 또는 Large Datasets, 또는 Feature 개수 대비 데이터 크기의 비율이 높은 경우, NNs 대비 좋은 성능을 나타내는 것을 알 수 있었습니다. 마지막으로, 위와 같은 대규모 실험 결과 NNs에서 가장 어려운 것으로 분석되는 36개의 데이터셋을 TabZilla Benchmark로 공개하였습니다.

본 논문은 현재까지 Tabular Domain에서 가장 큰 규모의 실험을 진행한 연구이며, 다양한 Meta-feature에 대해 연구 결과를 정리해놓았습니다. 그 결과, 현재까지 제안된 NNs보다 GBDTs가 나은 성능을 보인다는 것을 확인했습니다. Tabular Dataset의 불규칙성과 대규모 데이터가 사용되는 경우에 대응할 수 있는 좋은 딥러닝 구조 및 학습 방식에 대한 연구 필요성을 시사하고 있습니다.


2. A Performance-Driven Benchmark for Feature Selection in Tabular Deep Learning

다른 데이터와 달리, Tabular Dataset은 수많은 Feature를 포함합니다. 심지어 Feature Engineering을 통해 새로운 Feature를 만들어 내기도 합니다. 이때 Neural Networks는 Noisy Feature에 쉽게 Overfitting 하는 것으로 알려져 있으며, 이러한 문제점을 분석하고 해결하기 위해 본 논문에서는 Feature Selection Benchmark를 제공하고 Deep Lasso라는 방법론을 제안합니다. 

Benchmark는 12개의 데이터셋(8 Classification, 4 Regression), 3가지의 Additional Features, 9개의 Feature Selection Methods를 포함합니다. 먼저 Additional Features로는, Gaussian Noise에 해당하는 Random Features, 몇 개의 Features를 뽑아 Gaussian Noise로 Corrupted한 Corrupted Features, 그리고 몇 개의 Features를 뽑아 그들의 곱으로 정의한 Second-order Features가 있습니다. 

Feature Selection Methods로는 Univariate Statistical Test, Lasso, First-layer Lasso, Adaptive Group Lasso, LassoNet, Random Forest, XGBoost, Attention Map Importance, Deep Lasso가 있습니다. 이 중 Deep Lasso는 본 연구에서 처음 제안한 방식으로, 학습 중 샘플 별 Gradient에 대한 Group Lasso Penalty에 해당합니다.


그림 3. Uninformative Feature가 추가됨에 따른 성능 하락.
각 Plot은 개별 데이터에 대한 결과에 해당하며, X축은 Uninformative Feature의 비율, Y축은 성능, Color는 예측 모델을 의미[2].


실험 결과 특히 Second-order Features에 대해 Deep Lasso가 좋은 성능을 보이는 것을 확인할 수 있습니다. 불필요한 Feature가 많이 포함되는 경우에 Feature Selection Methods를 함께 사용하면, Raw Data로부터 학습한 방식 대비 큰 성능 향상을 확인할 수 있습니다.

본 논문은 이전까지 지적된 적 없는 Feature Selection 문제를 새롭게 지적하고, Benchmark 및 새로운 해결 방법을 함께 제안한 연구라는 점에서 의의가 있습니다. Neural Networks가 불필요한 Feature에 쉽게 과적합하는 문제에 대해 실험적인 증거를 제시하고 가능한 해결책을 제안함으로써, 후속 연구에 대한 좋은 가이드라인을 제공할 수 있을 것으로 기대됩니다.


3. HyTrel: Hypergraph-enhanced Tabular Data Representation Learning

Tabular Dataset을 Sequence of Tokens로 변환하여 Language Model을 학습하는 경우, Table의 구조적 특성을 반영할 수 없습니다. 예를 들어, Table은 Row와 Column을 임의로 변경하는 경우에도 그 의미가 동일합니다. 본 연구에서는, Table Structure를 고려하는 Representation을 학습할 수 있는 Tabular Language Model로 HyTrel (Hypergraph-enhanced Tabular Data Representation Learning)을 제안합니다. HyTrel은 Hypergraph를 통해 Permutation Invariance 및 세 가지 구조적 특성을 고려합니다. 세 가지 구조적 특성은 아래와 같습니다. 

(1) 동일한 Column의 값은 Semantically 유사하고

(2) Pairwise 이상의 고차원의 복잡한 관계를 가질 수 있으며 

(3) Hierarchy를 가지는 방식으로 정보가 구성된다


그림 4. Hypergraph 정의 예시[3]

 

Table은 위의 그림 3과 같이 Hypergraph로 변환됩니다. 이때 Hypergraph의 각 Node는 Cell 값에 해당하며 Hyperedge는 Column, Row, Table로 세 가지 값을 가집니다. 본 연구에서는 Hypergraph를 Node와 Hyperedge 간의 연결 여부로 결정합니다. 

예를 들어, 위 그림에서 Barcelona는 Column에 대해 (Barcelona, Club)=1, (Barcelona, Country)=0, (Barcelona, Founded)=0을 가지고, Row에 대해 (Barcelona, 1)=1, (Barcelona, 2)=0, (Barcelona, 3)=0을 가지고, Table에 대해 (Barcelona, Soccer Clubs)=1을 가집니다. 

Hypergraph로 변환된 다음, Embedding Layer를 거쳐 각 Node와 Hyperedge의 Embedding이 계산되고, Structure-aware Transformer Module로 구성된 Hypergraph Encoder를 통해 Representation이 학습됩니다. Pretraining Heads로는 ELETRA Head와 Contrastive Head의 두 가지를 활용하였습니다. 

해당 방법론의 실험 성능을 확인하기 위하여 총 네 가지 Task를 대상으로 실험을 진행하였습니다. 먼저 Column Type Annotation(CTA)은 Column의 Semantic Type을 맞추는 문제로 Entity Recognition 및 Entity Linking 등의 분야에서 매우 중요합니다. Column Property Annotation (CPA)은 Table로부터 Knowledge Graph에서의 관계성을 찾아내는 문제입니다. Table Type Detection (TTD)은 Table의 Semantic type을 맞추는 문제이며, Table Similarity Prediction(TSP)은 Table 간의 Similarity를 예측하여 두 Table의 관계 여부를 판단하는 문제입니다. 

결과적으로, 네 가지 Task에서 모두 HyTrel이 좋은 성능을 거두었습니다. 특히 CTA와 CPA 문제에서는 ELECTRA Head를 사용한 경우가, TTD와 TSP 문제에서는 Contrastive Head를 사용한 경우가 높은 성능을 거두었습니다. 특히 Pretraining 없이 학습한 경우에도 높은 성능을 보인다는 점에서, Hypergraph를 사용하면 성능 향상에 유용한 것을 확인할 수 있었습니다.

매년 Tabular Learning에 관한 연구 논문의 발표 수가 증가하고 있습니다. LG AI연구원도 NeurIPS 2023에서 Tabular Learning에 관한 Workshop에서 발표를 진행하고, TechTalk 세션에서 다양한 현업 종사자들과 Unsupervised Setup 외에 Supervised 또는 Semi-supervised Setup에서 Binning 방식을 어떻게 적용할 수 있을지, 실제 산업에 어떤 식으로 해당 모델을 활용하고 있는지 등 실제 애플리케이션 활용 방안에 대해 열정적으로 논의하기도 했습니다. 이를 통해 Tabular Learning의 필요성과 중요성을 체감할 수 있었습니다.


그림 5. NeurIPS 2023 TechTalk 세션 발표 모습

 

LG AI연구원 DI Lab에서는 NeurIPS 2023에서 논의된 다양한 연구 방법론과 결과, 그리고 여러 경험과 배움을 토대로 더욱 발전된 Tabular Learning 연구를 진행할 계획입니다. 또 다양한 벤치마크와 데이터에 대한 학습 방안과 비즈니스적 활용 방안을 함께 고민하며 새로운 모델 연구도 이어 나갈 것입니다. 특히, 현재 LG AI연구원 DI Lab에서는 Tabular Data의 특성으로 인해 발견되는 문제점에 초점을 맞춰 연구를 진행하고 있습니다. (1) 의미가 유사한 샘플 정의의 어려움, (2) 데이터의 구성 또는 차원이 매우 상이함, (3) Tree-based Machine Learning 알고리즘의 장점을 사용한 딥 네트워크 개발 필요 등입니다. 동시에, TabPFN과 같이 다양한 Task에서 좋은 성능을 보이는 Foundation Model을 만드는 연구도 진행 중에 있으며, Classification 문제 뿐 아니라 Regression 문제도 고려할 수 있는 모델을 만들고자 노력하고 있습니다. 연구 뿐만 아니라 다양한 산업 분야에서도 자주 사용되는 Tabular Data와 관련해 좋은 성능을 내는 모델을 개발한다면, 산업적으로도 큰 가치를 창출할 수 있을 것으로 기대하고 있습니다.


▶ NeurIPS 2023 Research Blog 시리즈가 궁금하다면? (Link)
참고

[1] D McElfresh et al., When Do Neural Nets Outperform Boosted Trees on Tabular Data?, NeurIPS, 2023.

[2] V Cherepanova et al., A Performance-Driven Benchmark for Feature Selection in Tabular Deep Learning, NeurIPS, 2023.

[3] P Chen et al., HyTrel: Hypergraph-enhanced Tabular Data Representation Learning, NeurIPS, 2023.

[4] P Gijsbers et al., An open source automl benchmark, arXiv, 2019.

[5] E Alcobaca et al., Mfe: Towards reproducible meta-feature extraction, Journal of Machine Learning Research, 2020.

[6] Noah Hollmann et al., Tabpfn: A transformer that solves small tabular classification problems in a second, International Conference on Learning, 2023.

[7] Kyungeun Lee, Ye Seul Sim, Hyeseung Cho, Suhee Yoon, Sanghyu Yoon, Woohyung Lim., Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular Domains, NeurIPS Workshop, 2023