아래 를 식을 최대화시킬 수 있는 컬럼과 기준값을 선택 (impurity가 크다 → entropy, gini, mse가 높다 -> 분류가 잘안돼있다)
(Impurity)를 계산하는 방식은 종속 변수에 따라 달라짐
Entropy based IG 예제



| 속성명 | 타입 | 설명 |
|---|---|---|
impurity | ndarray | 각 노드의 불순도 값(Gini, Entropy, MSE 등)을 나타냄 |
n_node_samples | ndarray | 해당 노드에 도달한 학습 데이터 샘플의 총 개수 |
weighted_n_node_samples | ndarray | 샘플에 가중치(weight)가 적용된 경우의 가중치 합 (기본값은 n_node_samples와 동일) |
value | ndarray | 노드의 예측값 (분류: 클래스별 샘플 수, 회귀: 노드 내 샘플들의 평균 타겟 값). |
| 속성명 | 타입 | 설명 |
|---|---|---|
feature | ndarray | 분할에 사용된 피처의 인덱스. 리프 노드(Leaf Node)인 경우 -2(sklearn.tree._tree.TREE_UNDEFINED) 값 |
threshold | ndarray | 분할을 결정하는 임계값(기준값) 데이터 피처 값이 이 임계값 이하이면 왼쪽, 초과면 오른쪽으로 분할 (리프 노드는 -2) |