위클리 페이퍼 #3-1 결정 트리 (Decision Tree)

문학소년·2026년 3월 6일

위클리 페이퍼

목록 보기
8/24

🇶 결정 트리의 장점과 단점은 무엇인가요?

결정 트리(Decision Tree)는 스무고개 게임처럼 데이터를 분류하거나 예측하는 모델로, 머신러닝 모델 중에서도 직관성이 가장 뛰어난 도구 중 하나입니다.


이미지 출처: https://medium.com/@jainvidip/understanding-decision-trees-1ba0ef5f6bb4

1. 결정 트리의 장점

  • 해석이 쉽고 직관적임 (White Box): 모델이 어떤 기준으로 의사결정을 내렸는지 시각적으로 바로 확인할 수 있어서 비전문가도 "왜 이런 결과가 나왔는지" 쉽게 이해할 수 있습니다.
  • 데이터 전처리의 최소화: 데이터의 스케일(단위)에 영향을 받지 않기 때문에, 정규화(Normalization)나 표준화(Standardization) 같은 복잡한 전처리 과정이 거의 필요 없습니다.
  • 수치형과 범주형 데이터 모두 처리 가능: 숫자 데이터뿐만 아니라 '성별', '지역' 같은 범주형 데이터도 함께 다룰 수 있습니다.
  • 비선형 관계 학습 가능: 데이터 간의 관계가 직선 형태가 아니더라도 복잡한 패턴을 잘 찾아냅니다.
  • 중요 변수 선택: 어떤 변수가 분류나 회귀에 가장 큰 영향을 미쳤는지(Feature Importance)를 파악하기 쉽습니다.

2. 결정 트리의 단점

  • 과적합(Overfitting) 위험성: 트리가 너무 깊어지면 훈련 데이터의 아주 사소한 노이즈까지 학습하여, 새로운 데이터에 대한 예측력이 떨어지는 높은 분산 문제를 겪기 쉽습니다. 이를 방지하기 위해 가지치기(Pruning)가 필수적입니다.
  • 데이터 변화에 민감함: 데이터가 조금만 바뀌어도 트리의 구조가 완전히 뒤바뀔 수 있어 모델의 안정성이 낮습니다. 이러한 취약성을 극복하기 위해 랜덤 포레스트(Random Forest) 같은 앙상블 기법이 주로 사용된다.
  • 최적해 보장이 어려움: 탐욕 알고리즘(Greedy Algorithm)을 기반으로 매 순간 최적의 분기를 선택하기 때문에, 전체적인 관점에서의 전역 최적해(Global Optimum)를 찾는다는 보장이 없습니다.
  • 연속형 변수 처리의 한계: 연속적인 값의 변화를 예측할 때 계단식으로 결과가 나타나므로, 부드러운 예측 곡선을 만들기 어렵습니다.

0개의 댓글