ex. 고객 이탈 예측이라면,
최근 로그인 횟수 > 10회?
|- 예 -> 유지
ㄴ 아니오
|- 결제 이력 있음 -> 유지
ㄴ 결제 이력 없음 -> 이탈
-> 나무(Tree) 구조로 결과를 예측
2. 장점
1) 해석이 쉽다
결정 트리의 가장 큰 장점
트리 구조를 보면:
어떤 조건으로 분기되었는지
왜 특정 결과가 나왔는지
직관적으로 이해 가능
2) 데이터 전처리가 비교적 적다
다른 알고리즘과 달리:
정규화(Standardization)
스케일링(Normalization)
필수 아님!!!
3) 수치형·범주형 데이터를 모두 처리 가능
ex:
나이(수치형)
성별(범주형)
지역(범주형)
함께 사용 가능
4) 비선형 관계를 잘 학습한다
선형회귀처럼 직선 관계만 가정하지 않는다
복잡한 규칙도 표현 가능
ex:
특정 연령대에서만 구매율 증가
특정 조건 조합에서만 이탈 증가
5) 변수 중요도 확인 가능
어떤 변수가 예측에 가장 큰 영향을 주는지 확인 가능
ex:
최근 로그인 횟수
결제 횟수
가입 기간
3. 단점
1) 과적합(Overfitting)에 취약
가장 큰 단점
트리가 너무 깊어지면:
학습 데이터를 거의 암기
새로운 데이터에서 성능 저하
2) 데이터 변화에 민감하다
데이터가 조금만 바뀌어도 트리 구조 자체가 크게 달라질 수 있음
즉, 모델 안정성이 상대적으로 낮음
3) 예측 성능이 최고 수준은 아닐 수 있다
단일 결정 트리는:
랜덤포레스트
XGBoost
LightGBM
같은 앙상블 모델보다 성능이 낮은 경우가 많음
그래서 실무에서는 단독 사용보다 앙상블 기법으로 발전시켜 사용하는 경우가 많음
4) 복잡해지면 해석이 어려워진다
얕은 트리는 이해하기 쉽지만,
깊이가 10-20 이상으로 커지면:
분기 수가 매우 많아짐
해석성이 급격히 떨어짐
🎯 정리
결정 트리는 해석이 쉽고 전처리가 적으며 수치형·범주형 데이터를 모두 처리할 수 있다는 장점이 있다. 반면, 트리가 깊어질 경우 과적합이 발생하기 쉽고 데이터 변화에 민감하다는 단점이 있다.
따라서, 실무에서는 단일 결정 트리보다 랜덤포레스트나 XGBoost와 같은 앙상블 기법으로 성능과 안정성을 보완하여 사용하는 경우가 많다