
🇶 결정 트리의 장점과 단점은 무엇인가요?
결정 트리(Decision Tree)는 스무고개 게임처럼 데이터를 분류하거나 예측하는 모델로, 머신러닝 모델 중에서도 직관성이 가장 뛰어난 도구 중 하나입니다.

이미지 출처: https://medium.com/@jainvidip/understanding-decision-trees-1ba0ef5f6bb4
1. 결정 트리의 장점
- 해석이 쉽고 직관적임 (White Box): 모델이 어떤 기준으로 의사결정을 내렸는지 시각적으로 바로 확인할 수 있어서 비전문가도 "왜 이런 결과가 나왔는지" 쉽게 이해할 수 있습니다.
- 데이터 전처리의 최소화: 데이터의 스케일(단위)에 영향을 받지 않기 때문에, 정규화(Normalization)나 표준화(Standardization) 같은 복잡한 전처리 과정이 거의 필요 없습니다.
- 수치형과 범주형 데이터 모두 처리 가능: 숫자 데이터뿐만 아니라 '성별', '지역' 같은 범주형 데이터도 함께 다룰 수 있습니다.
- 비선형 관계 학습 가능: 데이터 간의 관계가 직선 형태가 아니더라도 복잡한 패턴을 잘 찾아냅니다.
- 중요 변수 선택: 어떤 변수가 분류나 회귀에 가장 큰 영향을 미쳤는지(Feature Importance)를 파악하기 쉽습니다.
2. 결정 트리의 단점
- 과적합(Overfitting) 위험성: 트리가 너무 깊어지면 훈련 데이터의 아주 사소한 노이즈까지 학습하여, 새로운 데이터에 대한 예측력이 떨어지는 높은 분산 문제를 겪기 쉽습니다. 이를 방지하기 위해
가지치기(Pruning)가 필수적입니다.
- 데이터 변화에 민감함: 데이터가 조금만 바뀌어도 트리의 구조가 완전히 뒤바뀔 수 있어 모델의 안정성이 낮습니다. 이러한 취약성을 극복하기 위해
랜덤 포레스트(Random Forest) 같은 앙상블 기법이 주로 사용된다.
- 최적해 보장이 어려움: 탐욕 알고리즘(Greedy Algorithm)을 기반으로 매 순간 최적의 분기를 선택하기 때문에, 전체적인 관점에서의 전역 최적해(Global Optimum)를 찾는다는 보장이 없습니다.
- 연속형 변수 처리의 한계: 연속적인 값의 변화를 예측할 때 계단식으로 결과가 나타나므로, 부드러운 예측 곡선을 만들기 어렵습니다.