모델 평가는 단순히 하나의 수치를 계산하는 과정이 아니다.
문제의 성격, 데이터의 분포, 그리고 잘못된 예측이 초래하는 비용(cost)에 따라
적절한 평가 지표는 완전히 달라진다.
이 장에서는 회귀와 분류 문제를 중심으로,
대표적인 평가 지표들의 정의, 해석, 사용 시점과 주의점을 체계적으로 정리한다.
회귀 문제에서의 핵심 질문은 다음과 같다.
예측값은 실제값과 얼마나 가까운가?
즉, 오차(error)의 크기를 어떻게 정의하고, 어떻게 평균낼 것인가?
회귀 모델은 연속적인 실수값(real-valued output)을 예측한다.
따라서 분류 문제처럼 “맞다 / 틀리다”로 평가할 수 없으며,
를 명확히 정의해야 한다.
MAE는 가장 직관적인 회귀 오차 지표다.
각 데이터 포인트에서 발생한 오차의 절대값을 취한 뒤, 이를 평균낸다.
절대값을 사용하는 이유는 평가 과정에서
과대 예측과 과소 예측의 방향보다는 오차의 크기 자체가 중요하기 때문이다.
예를 들어, 집값 예측에서 MAE가 100이라면
모델은 평균적으로 약 100만 원 정도의 오차를 가진다고 해석할 수 있다.
이러한 상황에서는 MAE가 큰 오차의 위험성을 충분히 반영하지 못할 수 있다.
MSE는 오차를 제곱한 뒤 평균낸 값이며,
RMSE는 MSE에 제곱근을 취해 원래 데이터 단위로 복원한 지표다.
오차를 제곱함으로써, 큰 오차는 작은 오차보다 훨씬 큰 패널티를 받는다.
오차 제곱은 다음과 같은 효과를 만든다.
즉, MSE/RMSE는
“큰 실수는 반드시 강하게 벌주겠다”는 명확한 의도를 가진 지표다.
| 관점 | MAE | RMSE |
|---|---|---|
| 오차 처리 | 선형 | 제곱 |
| 큰 오차 | 비교적 관대 | 매우 민감 |
| 이상치 영향 | 작음 | 큼 |
실무에서는 해석의 편의성 때문에 RMSE가 MSE보다 더 자주 사용된다.
MAPE는 오차를 실제값 대비 비율로 표현하는 지표다.
절대 오차는 데이터의 스케일에 크게 의존한다.
MAPE는 이를 보완하기 위해 비율 기반 평가를 사용한다.
이 경우 MAPE는 정의되지 않거나 비현실적으로 큰 값을 가질 수 있다.
(R^2)는 오차 기반 지표가 아니라,
모델이 종속 변수의 전체 분산을 얼마나 설명하는지를 측정한다.
독립변수(X)를 추가하면,
그 변수가 의미가 없더라도 SSE는 감소할 가능성이 크다.
따라서 (R^2)는 거의 항상 증가한다.
즉, 모델의 복잡도를 전혀 고려하지 않는다.
이를 보완하기 위해 변수 개수와 샘플 수를 고려한 지표가 Adjusted (R^2)다.
불필요한 변수가 추가되면 패널티가 부여된다.
분류 문제에서는 다음 두 질문이 중요하다.
특히 클래스 불균형이 존재하는 경우,
Accuracy 하나만으로는 모델 성능을 평가할 수 없다.
모든 분류 지표는 혼동 행렬에서 출발한다.
| 실제 \ 예측 | Positive | Negative |
|---|---|---|
| Positive | TP | FN |
| Negative | FP | TN |
양성이라고 예측한 것 중, 실제로 맞은 비율이다.
FP를 줄이는 것이 핵심이다.
적합한 사례:
실제 양성 중에서 모델이 찾아낸 비율이다.
FN을 줄이는 것이 핵심이다.
적합한 사례:
Precision과 Recall의 조화 평균이다.
두 지표 중 하나라도 낮으면 F1-score도 낮아진다.
불균형 데이터에서 Accuracy를 대체하는 대표적인 지표다.
Log Loss는 정답 여부가 아니라,
모델이 예측한 확률의 품질을 평가한다.
틀렸을 뿐 아니라,
틀린 예측에 강한 확신을 가질수록 큰 패널티를 받는다.
확률 기반 의사결정 시스템에서 핵심적인 지표다.
ROC-AUC는 임계값에 독립적인 성능 지표다.
순위 기반으로 모델의 분류 능력을 평가한다.
“임의의 양성 샘플이 음성 샘플보다 높은 점수를 받을 확률”로 해석할 수 있다.
| 구분 | 지표 | 특징 및 사용 시점 |
|---|---|---|
| 회귀 | MAE | 이상치에 덜 민감, 직관적 해석 |
| MSE / RMSE | 큰 오차를 강하게 줄이고 싶을 때 | |
| MAPE | 비율(%) 기반 비교, 비즈니스 보고 | |
| Adjusted (R^2) | 변수가 많은 회귀 모델 평가 | |
| 분류 | Accuracy | 클래스 균형일 때만 사용 |
| Precision | FP를 줄이는 것이 중요한 경우 | |
| Recall | FN을 줄이는 것이 중요한 경우 | |
| F1-score | 불균형 데이터에서 종합 평가 | |
| Log Loss | 확률 예측의 품질까지 평가 |
어떤 모델이 집값(단위: 만 원)을 예측하고 있다.
데이터에는 고가 주택이 일부 섞여 있어 아주 큰 오차가 간혹 발생한다.
비즈니스 담당자는
“평균적으로 얼마나 틀리는지만 알면 된다”
고 말한다.
Q. 이 상황에서 가장 적절한 평가 지표는 무엇인가?
전력 사용량을 예측하는 모델을 만들었다.
갑작스러운 폭염·한파 시 예측이 크게 빗나가는 경우가 있으며,
운영팀은 다음과 같이 요구한다.
“큰 예측 실패는 절대 용납할 수 없다.”
Q. 이 요구사항을 가장 잘 반영하는 회귀 평가 지표는 무엇인가?
A 국가의 매출은 수백만 원 단위,
B 국가는 수천억 원 단위다.
두 나라의 예측 모델 성능을 같은 기준으로 비교해야 한다.
Q. 이 경우 가장 적절한 회귀 평가 지표는 무엇인가?
스팸 메일 분류 모델을 운영 중이다.
스팸 메일 몇 개를 놓치는 것보다
정상 메일을 스팸으로 분류하는 것이 훨씬 치명적이다.
Q. 이 상황에서 가장 우선적으로 봐야 할 분류 평가 지표는 무엇인가?
암 진단 보조 모델을 개발 중이다.
의사는 다음과 같이 말한다.
“암 환자를 정상으로 분류하는 일만은 절대 없어야 한다.”
데이터는 정상 환자가 훨씬 많은 불균형 데이터다.
Q. 이 상황에서 가장 중요한 평가 지표는 무엇인가?
(정확도는 적절한 지표일까?)
모델 평가 지표 퀴즈 – 해설
🧠 퀴즈 1 해설 — 집값 예측 모델
정답: MAE (Mean Absolute Error)
이유
집값 데이터에는 고가 주택이라는 이상치(outlier)가 존재
비즈니스 요구사항은
MAE는 오차를 절대값으로만 계산하므로
극단적인 오차에 과도한 패널티를 주지 않는다.
왜 MSE / RMSE는 부적절한가?
일부 고가 주택 예측 실패가 전체 성능을 왜곡할 수 있다.
🧠 퀴즈 2 해설 — 전력 수요 예측
정답: RMSE (또는 MSE)
이유
→ 정전, 과부하, 운영 사고로 직결
왜 MAE는 부족한가?
🧠 퀴즈 3 해설 — 글로벌 매출 예측 비교
정답: MAPE (Mean Absolute Percentage Error)
이유
예시
→ 절대 금액은 다르지만 예측 품질은 동일
🧠 퀴즈 4 해설 — 스팸 메일 필터링
정답: Precision (정밀도)
이유
가장 치명적인 오류:
정상 메일을 스팸으로 분류 (False Positive)
Precision은
FP를 직접적으로 억제하는 지표다.
왜 Recall은 덜 중요한가?
🧠 퀴즈 5 해설 — 암 진단 모델
정답: Recall (재현율)
(+ 보조 지표로 F1-score)
이유
가장 치명적인 오류:
암 환자를 정상으로 분류 (False Negative)
Recall은
FN을 최소화하는 데 직접적인 지표
Accuracy가 부적절한 이유
데이터가 심각하게 불균형
예: 정상 99%, 암 1%
왜 F1-score를 함께 보나?
🎯 핵심 정리 한 줄 요약