본 논문은 Tabular Data에서 Neural Networks(NNs)와 Gradient-Boosted Decision Trees(GBDTs)의 성능 차이를 비교하는 연구임. 기존 연구에서는 NNs가 더 우수하다는 주장과 GBDTs가 더 우수하다는 주장이 혼재되어 있으며, 이 논문은 이 논쟁이 과도하게 강조되었음을 입증하고자 함.
연구진은 176개의 데이터셋에서 19개의 알고리즘을 비교하고, 데이터셋의 메타특징 분석을 통해 어떤 데이터셋에서 NNs 또는 GBDTs가 더 잘 작동하는지를 가이드로 제공함.
또한 연구 결과로 TabZilla Benchmark Suite를 공개하여 Tabular Data 연구 가속화를 목표로 함.
Tabular Data는 기계 학습에서 가장 널리 사용되는 데이터 형태 중 하나이며, 의료, 금융, 온라인 광고 등 다양한 산업에서 활용됨.
기존 연구에서는 Tabular Data에서 GBDTs가 NNs보다 더 성능이 뛰어나다는 주장과 그 반대 주장이 지속적으로 논의되어 왔음.
기존의 NN vs. GBDT 논쟁은 대부분 소수의 데이터셋에서 제한된 알고리즘을 비교한 결과에 기반하며, 이러한 결과가 일반화되기 어렵다는 한계가 있음. 따라서 대규모 실험을 통해 더 포괄적인 통찰을 제공하고자 하며, 데이터셋 메타특징 분석을 통해 어떤 유형의 데이터셋이 특정 알고리즘에 더 적합한지를 밝히고자 함.
1) 176개 데이터셋에서 19개 알고리즘을 비교하는 대규모 Tabular Data 분석을 수행함.
2) 데이터셋 메타특징 분석을 통해 NNs와 GBDTs 중 어떤 알고리즘이 적합한지를 파악함.
3) TabZilla Benchmark Suite를 공개하여 연구 커뮤니티에 기여함
연구진은 Tabular Data에 대해 Neural Networks(NNs)와 Gradient-Boosted Decision Trees(GBDTs)의 성능 차이에 관한 기존 논쟁이 과도하게 강조되었음을 인지하고, 이 논쟁을 재검토하고자 함.
Tabular Data 분야에서 NNs와 GBDTs 중 어떤 알고리즘이 더 우수한지에 대한 논쟁이 지속되고 있음.
기존 연구들은 소수의 데이터셋과 제한된 알고리즘으로 실험을 진행했기 때문에 결과의 일반화 가능성이 낮음.
또한, 데이터셋의 메타특징을 고려한 연구가 부족하여, 어떤 유형의 데이터셋에서 특정 알고리즘이 더 잘 작동하는지에 대한 가이드가 부족함.
단순히 알고리즘 간의 평균 성능을 비교하는 것을 넘어, 데이터셋의 메타특징과 알고리즘 성능의 관계를 분석하고자 함.
이를 통해 어떤 데이터셋에서 NNs가 더 적합한지, 어떤 데이터셋에서 GBDTs가 더 적합한지를 파악할 수 있는 실질적인 가이드를 제공하는 것이 목표임.
기존 연구와의 차별성을 위해, 176개 데이터셋과 19개 알고리즘을 사용하여 대규모 실험을 설계함.
각 알고리즘에 대해 최대 30개의 하이퍼파라미터 설정을 실험하고, 10-Fold Cross Validation을 사용하여 성능을 평가함.
데이터셋의 다양한 메타특징을 추출하여 알고리즘 성능과의 상관관계를 분석함.
실험 결과가 통계적으로 유의미한지를 확인하기 위해 Friedman Test와 Wilcoxon Signed-Rank Test를 수행함.
데이터를 바탕으로 메타학습 모델을 구축하여, 새로운 데이터셋에 대해 최적의 알고리즘을 예측할 수 있도록 함.
연구 결과를 바탕으로 가장 어려운 데이터셋 36개를 선별하여 TabZilla Benchmark Suite를 공개함.
이 데이터셋은 향후 연구자들이 새로운 알고리즘을 테스트하고 비교할 때 공정한 기준점으로 활용될 수 있음.
기존 연구는 주로 소규모 데이터셋과 제한된 알고리즘을 사용하여 Tabular Data에서의 알고리즘 성능을 비교함. 대표적인 연구와 본 연구와의 차이점을 아래와 같이 정리함.
Grinsztajn et al.은 45개 데이터셋에서 7개의 알고리즘을 비교하며 GBDTs가 NNs보다 더 나은 성능을 보인다고 주장함.
대부분의 기존 연구는 데이터셋 수가 50개 이하이며, 다양한 하이퍼파라미터 튜닝을 고려하지 않음.
기존 연구는 데이터셋의 메타특징을 충분히 분석하지 않았기 때문에, 데이터셋 유형에 따른 알고리즘의 성능 차이에 대한 이해가 부족함.
Tabular Data에 대한 NNs 연구는 주로 세 가지 접근 방식으로 나뉨:
- Data Transformation Methods: 데이터를 전처리하거나 변환하여 NNs에 더 적합하게 만드는 방식.
- Architecture-based Methods: 새로운 NN 아키텍처를 설계하여 Tabular Data에 더 잘 맞도록 하는 방식.
- Regularization-based Methods: 과적합을 방지하기 위해 정규화 기법을 활용하는 방식.
기존 연구와 달리, 본 연구는 176개 데이터셋과 19개 알고리즘을 사용하여 대규모 실험을 진행함.
데이터셋의 다양한 메타특징을 분석하여, 어떤 데이터셋에서 NNs 또는 GBDTs가 더 나은 성능을 보이는지에 대한 실질적인 가이드를 제공함.
TabZilla Benchmark Suite를 공개하여, 연구자들이 새로운 알고리즘을 테스트할 수 있는 공정한 기준점을 제공함.
본 연구에서는 Tabular Data에서 NNs와 GBDTs의 성능을 비교하고, 메타특징 분석을 통해 어떤 데이터셋에서 특정 알고리즘이 더 적합한지 파악하고자 함. 이를 위해 아래와 같은 방법론을 사용함.

19개 알고리즘을 선정하여 비교함.
GBDT 계열: CatBoost, LightGBM, XGBoost
NN 계열: ResNet, TabNet, SAINT 등
베이스라인 알고리즘: Decision Tree, KNN, Random Forest 등
각 알고리즘에 대해 최대 30개의 하이퍼파라미터 설정을 실험하고, 성능 지표로 Accuracy와 Log Loss를 사용함.


OpenML-CC18, OpenML Benchmarking Suite 등에서 176개 데이터셋을 수집함.
PyMFE 라이브러리를 사용하여 총 965개의 메타특징을 추출함.
일반적인 데이터셋 특징, 통계적 특징, 정보 이론적 특징 등을 포함함.
메타특징과 알고리즘 성능 간의 상관관계를 분석하여, 어떤 데이터셋에서 특정 알고리즘이 더 적합한지를 파악함.
실험 결과의 신뢰성을 높이기 위해 Friedman Test와 Wilcoxon Signed-Rank Test를 사용하여 알고리즘 간 성능 차이가 통계적으로 유의미한지를 검증함.
메타특징을 활용하여, 각 데이터셋에 대해 최적의 알고리즘을 예측할 수 있는 메타학습 모델을 구축함.
메타학습 모델은 Leave-One-Out 방식으로 평가하여, 새로운 데이터셋에 대해 높은 예측 정확도를 보임.
연구 결과를 바탕으로 가장 어려운 데이터셋 36개를 선별하여 TabZilla Benchmark Suite를 공개함.
이 데이터셋은 기존 알고리즘으로 쉽게 해결되지 않으며, 연구자들이 새로운 알고리즘을 비교할 때 공정한 기준점으로 활용될 수 있음.
TabZilla는 GitHub에서 오픈소스로 제공됨 (https://github.com/naszilla/tabzilla).

NN vs. GBDT 논쟁
GBDT는 불규칙한 데이터셋과 대규모 데이터셋에서 더 나은 성능을 보임.
NN은 정규화된 데이터셋과 소규모 데이터셋에서 더 나은 성능을 보임.

하이퍼파라미터 튜닝의 중요성
CatBoost와 ResNet 같은 알고리즘의 가벼운 하이퍼파라미터 튜닝이 알고리즘 선택보다 더 중요한 경우가 많음.

본 연구는 Tabular Data에서 NN과 GBDT의 성능 차이 논쟁이 과도하게 강조되었음을 입증함. GBDT는 불규칙한 데이터셋에서 더 나은 성능을 보이며, 간단한 베이스라인이나 GBDT의 가벼운 튜닝이 많은 경우 충분함. 연구 결과로 공개된 TabZilla Benchmark Suite는 향후 연구에 있어 중요한 기준점이 될 것임.
논문 출처 : https://arxiv.org/pdf/2305.02997
McElfresh, D., Khandagale, S., Valverde, J., Prasad, V., Feuer, B., Hegde, C., Ramakrishnan, G., Goldblum, M., & White, C. (2024). When do neural nets outperform boosted trees on tabular data? Proceedings of the 37th Conference on Neural Information Processing Systems (NeurIPS).