위클리 페이퍼 #3-2 부스팅 (Boosting)

문학소년·2026년 3월 7일

위클리 페이퍼

목록 보기
9/24

🇶 부스팅은 어떤 특징을 가진 앙상블 기법인가요? 토픽에서 배운 AdaBoost 이외의 부스팅 모델에는 무엇이 있는지에 대해 구글 등을 활용하여 직접 리서치해보고, 각 부스팅 모델의 특징, 장단점에 대해 말해주세요.

부스팅(Boosting)은 앙상블 학습 기법으로, 하나의 복잡한 모델을 만드는 대신 여러 개의 단순한 모델(약한 학습기, weak learner)을 결합하여 강력한 하나의 모델을 만드는 방식입니다. 모델을 순차적으로(sequential) 학습하며, 각 새로운 모델이 이전 모델의 오류를 교정하도록 훈련된다는 점이 핵심입니다.

1. 부스팅 기법의 주요 특징

  • 순차적 학습 (Sequential): 병렬로 학습하는 배깅(Bagging)과 달리, 이전 모델의 오차를 다음 모델이 보완하는 방식으로 진행됩니다.
  • 가중치 업데이트: 예측이 틀린 데이터에 더 높은 가중치를 부여하여 다음 모델이 그 데이터를 더 잘 맞추도록 유도합니다.
  • 높은 정확도: 편향(Bias)을 효과적으로 줄여주기 때문에 단일 모델이나 배깅보다 일반적으로 성능이 뛰어납니다.
  • 과적합 위험: 오답에 지나치게 집착할 경우 노이즈까지 학습하여 과적합(Overfitting)이 발생할 수 있습니다.

2. 주요 부스팅 모델

AdaBoost 이후 등장한 현대적인 부스팅 모델들은 대부분 경사 하강법(Gradient Descent)을 결합한 GBM(Gradient Boosting Machine) 계열입니다.
① GBM (Gradient Boosting Machine)
가중치 업데이트 대신, 이전 모델의 잔차(Residual, 실제값-예측값)를 직접 학습하여 오차를 줄여나갑니다.

  • 장점: 매우 높은 예측 성능을 자랑합니다.
  • 단점: 순차적 계산으로 인해 학습 속도가 매우 느리며, 과적합 방지 기능이 부족합니다.

② XGBoost (eXtreme Gradient Boosting)
GBM의 느린 속도와 과적합 문제를 해결하기 위해 등장했습니다. 병렬 처리와 규제(Regularization) 기능을 포함합니다.

  • 장점: 성능이 뛰어나고 안정적이며, 조기 종료(Early Stopping) 기능을 제공합니다.
  • 단점: 여전히 데이터가 커지면 학습 시간이 길고, 하이퍼파라미터 튜닝이 까다롭습니다.

③ LightGBM (LGBM)
트리를 옆으로 늘리는 대신 위로 쌓는 리프 중심(Leaf-wise) 분할 방식을 사용합니다.

  • 장점: 이름처럼 매우 가볍고 빠릅니다. 메모리 사용량이 적어 대용량 데이터 처리에 최적화되어 있습니다.
  • 단점: 데이터 양이 적을 때(약 10,000건 이하) 과적합이 발생하기 쉽습니다.

④ CatBoost (Category Boosting)
이름에서 알 수 있듯 범주형 변수(Categorical Feature) 처리에 특화된 모델입니다.

  • 장점: 별도의 인코딩 없이 데이터를 그대로 넣어도 성능이 잘 나오며, 기본 설정값으로도 훌륭한 결과를 보여줍니다.
  • 단점: 수치형 데이터만 있는 경우에는 LightGBM보다 속도가 느릴 수 있습니다.

📊 주요 부스팅 모델 비교

모델주요 특징학습 속도데이터 크기주요 장점
GBM기본 부스팅 알고리즘느림중소형높은 정확성의 표준
XGBoost병렬 처리, 규제 포함보통대형안정성, 범용성
LightGBM리프 중심 분할매우 빠름대형/초대형속도 및 메모리 효율
CatBoost범주형 변수 최적화보통/빠름중대형튜닝 불필요, 범주형 데이터 강점

0개의 댓글