
부스팅(Boosting)은 앙상블 학습 기법으로, 하나의 복잡한 모델을 만드는 대신 여러 개의 단순한 모델(약한 학습기, weak learner)을 결합하여 강력한 하나의 모델을 만드는 방식입니다. 모델을 순차적으로(sequential) 학습하며, 각 새로운 모델이 이전 모델의 오류를 교정하도록 훈련된다는 점이 핵심입니다.
AdaBoost 이후 등장한 현대적인 부스팅 모델들은 대부분 경사 하강법(Gradient Descent)을 결합한 GBM(Gradient Boosting Machine) 계열입니다.
① GBM (Gradient Boosting Machine)
가중치 업데이트 대신, 이전 모델의 잔차(Residual, 실제값-예측값)를 직접 학습하여 오차를 줄여나갑니다.
② XGBoost (eXtreme Gradient Boosting)
GBM의 느린 속도와 과적합 문제를 해결하기 위해 등장했습니다. 병렬 처리와 규제(Regularization) 기능을 포함합니다.
③ LightGBM (LGBM)
트리를 옆으로 늘리는 대신 위로 쌓는 리프 중심(Leaf-wise) 분할 방식을 사용합니다.
④ CatBoost (Category Boosting)
이름에서 알 수 있듯 범주형 변수(Categorical Feature) 처리에 특화된 모델입니다.
| 모델 | 주요 특징 | 학습 속도 | 데이터 크기 | 주요 장점 |
|---|---|---|---|---|
| GBM | 기본 부스팅 알고리즘 | 느림 | 중소형 | 높은 정확성의 표준 |
| XGBoost | 병렬 처리, 규제 포함 | 보통 | 대형 | 안정성, 범용성 |
| LightGBM | 리프 중심 분할 | 매우 빠름 | 대형/초대형 | 속도 및 메모리 효율 |
| CatBoost | 범주형 변수 최적화 | 보통/빠름 | 중대형 | 튜닝 불필요, 범주형 데이터 강점 |