Confusion Matrix / Precision / Recall / F1-Score / Fβ-Score / TPR / FPR / AUC_ROC / AUC_PR

✍ 예측 기준으로 Positive와 Negative가 결정된다고 생각하자
① TP (True Positive)
▪ Positive로 예측 (실제 Positive) → True
② FP (False Positive)
▪ Positive으로 예측 (실제 Negative) → False
③ TN (True Negative)
▪ Negative로 예측 (실제 Negative) → True
④ FN (False Negative)
▪ Negative로 예측 (실제 Positive) → False

▪ Positive로 예측한 샘플(TP+FP) 중 실제 Positive 샘플(TP)의 비율
→ 모델이 Positive로 얼마나 정확히 예측했나?
→ 정밀도가 높다는 것은 FP가 낮다는 것

▪ 실제 Positive 샘플(TP+FN) 중 Positive로 올바르게 예측한 샘플(TP)의 비율
→ 실제 Positive한 샘플들이 모델에 의해 얼마나 정확히 탐지되었나?
→ 재현율이 높다는 것은 FN이 낮다는 것

▪ Precision과 Recall의 조화평균
→ 0.0~ 1.0 사이의 값을 가지고, 1에 가까울수록 좋은 모델
→ 정밀도와 재현율을 균형 있게 반영하기 위해 산술평균이 아닌 조화평균을 사용

▪ β를 매개변수로 사용해 Precision과 Recall 사이의 균형에 가중치를 부여하는 방법
→ β > 1.0 : Recall에 비중을 두고 계산
→ β < 1.0 : Precision에 비중을 두고 계산
→ β = 1 : F1-Score

▪ Recall(재현율)과 동일

▪ 실제 Negative 샘플(FP+TN) 중 Positive로 잘못 예측한 샘플(FP)의 비율
→ 정상 샘플을 이상 샘플로 잘못 예측한 모델의 오차를 의미
▪ X축 : FPR / Y축 : TPR
▪ 곡선 : 모델의 성능을 나타내며, 좌측 상단에 가까울수록(TPR이 높고 FPR이 낮을수록) 모델이 성능이 우수
▪ X축 : recall / Y축 : precision
▪ 곡선 : 우측 상단에 가까울수록(Precision과 Recall이 모두 높을수록) 모델이 성능이 우수

▪ ROC Curve의 아래 면적
→ 값은 0~1사이 이며, 1에 가까울수록 모델의 성능이 우수
→ 0.5라면 모델은 random prediction으로 간주
→ 모델의 모든 임계값에서의 성능을 평가하므로, 전체적인 분류 성능을 평가하는데 유용
→ 그러나, False Positive Rate가 상대적으로 중요시되는 AUC_ROC에서 TN(True Negative)이 큰 비중을 차지하는 불균형 데이터에서는 이 값이 모델의 성능을 제대로 평가하지 못할 수 있음
▪ PR Curve의 아래 면적
→ 값은 0~1사이 이며, 1에 가까울수록 모델의 성능이 우수
→ 값이 높을수록 모델이 Positive class를 잘 예측하고 있다는 의미