결정 트리(Decision Tree)모델은 예/아니오로 답할 수 있는 질문노드들과 그에 대한 답인 분류 노드들로 이루어져 질문에 답을 하면서 분류해나가는 알고리즘이다. 결정 트리의 첫 질문을 루트(Root)노드, 중간의 질문 노드들을 결정(Decision)노드, 최종 결과를 리프(leaf)노드라고 한다. 결정 트리 모델은 어떤 질문을 하는 것이 데이터를 가장 잘 나누는지가 핵심이다.

어떤 질문을 하는 것이 좋은지/안 좋은지에 대한 기준을 지니 불순도(Gini Impurity)라고 한다. 지니 불순도(GI)란 데이터셋 안에 서로 다른 데이터가 얼마나 섞여 있는지를 나타낸다. 데이터셋 안에 한 가지의 데이터가 많을수록 데이터가 순수하다고 하며, Split된 데이터셋의 GI가 낮을수록, 즉 데이터셋이 순수할수록 좋은 질문이라고 할 수 있다.
결정 트리 모델의 장점은 모델의 분류 과정을 시각화할 수 있고, 어떤 속성이 영향을 미쳤는지 쉽게 파악할 수 있다는 점이다. 또한, 트리 구조는 단순하여 학습과 예측속도가 빠르다. 수치형 데이터와 범주형 데이터 모두 처리할 수 있어 데이터 전처리에 대한 부담도 적다.
그러나 결정 트리 모델은 과적합에 매우 취약하다. 트리의 깊이(depth)가 깊어질수록 훈련 성능은 높아지지만 테스트 성능은 낮아지며, 데이터가 조금만 바뀌어도 트리 구조가 완전히 달라질 수 있어 재현성과 안정성이 낮다는 단점이 있다. 이처럼 단일 트리의 성능은 제한적이고, 일반화 성능에도 한계가 있기 때문에 결정 트리 알고리즘을 활용한 앙상블 기법들이 많이 쓰인다.