[기초] 머신러닝 모델 평가 지표

엘리자베스22호·2026년 1월 11일

회사 멘토링 - AI part

목록 보기
11/11

모델 평가는 단순히 하나의 수치를 계산하는 과정이 아니다.
문제의 성격, 데이터의 분포, 그리고 잘못된 예측이 초래하는 비용(cost)에 따라
적절한 평가 지표는 완전히 달라진다.

이 장에서는 회귀와 분류 문제를 중심으로,
대표적인 평가 지표들의 정의, 해석, 사용 시점과 주의점을 체계적으로 정리한다.


1. 회귀(Regression) 모델 평가

핵심 질문

회귀 문제에서의 핵심 질문은 다음과 같다.

예측값은 실제값과 얼마나 가까운가?
즉, 오차(error)의 크기를 어떻게 정의하고, 어떻게 평균낼 것인가?

회귀 모델은 연속적인 실수값(real-valued output)을 예측한다.
따라서 분류 문제처럼 “맞다 / 틀리다”로 평가할 수 없으며,

  • 오차의 크기
  • 오차의 분포
  • 큰 오차를 얼마나 강하게 벌줄 것인지

를 명확히 정의해야 한다.


1.1 MAE (Mean Absolute Error, 평균 절대 오차)

MAE는 가장 직관적인 회귀 오차 지표다.
각 데이터 포인트에서 발생한 오차의 절대값을 취한 뒤, 이를 평균낸다.

MAE=1n∑i=1n∣yi−y^i∣MAE = \frac{1}{n} \sum_{i=1}^{n} |y_i - \hat{y}_i|

절대값을 사용하는 이유는 평가 과정에서
과대 예측과 과소 예측의 방향보다는 오차의 크기 자체가 중요하기 때문이다.

특성 및 해석

  • 모든 오차를 선형적으로 취급한다.
  • 오차 10은 오차 5의 정확히 두 배로 반영된다.
  • 일부 이상치(outlier)가 존재하더라도 지표가 급격히 커지지 않는다.
  • 데이터 단위와 동일하므로 해석이 용이하다.

예를 들어, 집값 예측에서 MAE가 100이라면
모델은 평균적으로 약 100만 원 정도의 오차를 가진다고 해석할 수 있다.

사용이 적합한 경우

  • “평균적으로 얼마나 틀리는지”를 파악하고자 할 때
  • 예측 오차의 단위 자체가 해석의 대상이 되는 경우
  • 일부 이상치는 존재하지만, 이를 과도하게 강조할 필요가 없는 문제

사용이 부적절한 경우

  • 큰 오차가 발생했을 때의 비용이 매우 큰 문제
  • 극단적인 예측 실패를 반드시 억제해야 하는 경우

이러한 상황에서는 MAE가 큰 오차의 위험성을 충분히 반영하지 못할 수 있다.


1.2 MSE / RMSE (Mean Squared Error)

MSE는 오차를 제곱한 뒤 평균낸 값이며,
RMSE는 MSE에 제곱근을 취해 원래 데이터 단위로 복원한 지표다.

MSE=1n∑i=1n(yi−y^i)2MSE = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2
RMSE=MSERMSE = \sqrt{MSE}

오차를 제곱함으로써, 큰 오차는 작은 오차보다 훨씬 큰 패널티를 받는다.

왜 제곱을 사용하는가?

오차 제곱은 다음과 같은 효과를 만든다.

  • 작은 오차는 상대적으로 영향이 작다.
  • 큰 오차는 제곱으로 인해 급격히 커진다.

즉, MSE/RMSE는
“큰 실수는 반드시 강하게 벌주겠다”는 명확한 의도를 가진 지표다.

MAE와의 근본적인 차이

관점MAERMSE
오차 처리선형제곱
큰 오차비교적 관대매우 민감
이상치 영향작음큼

실무에서는 해석의 편의성 때문에 RMSE가 MSE보다 더 자주 사용된다.

사용이 적합한 경우

  • 큰 예측 오차가 실제 비용 또는 위험으로 직결되는 경우
  • 일부 시점의 실패가 시스템 전체에 영향을 미치는 문제
    (전력 수요 예측, 트래픽 예측, 설비 부하 예측 등)

사용이 부적절한 경우

  • 데이터에 노이즈나 이상치가 많이 포함된 경우
  • 소수의 비정상 샘플이 전체 성능 평가를 왜곡해서는 안 되는 경우

1.3 MAPE (Mean Absolute Percentage Error)

MAPE는 오차를 실제값 대비 비율로 표현하는 지표다.

MAPE=100%n∑i=1n∣yi−y^iyi∣MAPE = \frac{100\%}{n} \sum_{i=1}^{n} \left| \frac{y_i - \hat{y}_i}{y_i} \right|

절대 오차는 데이터의 스케일에 크게 의존한다.
MAPE는 이를 보완하기 위해 비율 기반 평가를 사용한다.

특성 및 장점

  • 서로 다른 스케일의 데이터 간 성능 비교가 가능하다.
  • 비즈니스 보고에 직관적이다.
  • “평균적으로 8% 정도의 오차가 발생한다”와 같은 설명이 가능하다.

사용이 적합한 경우

  • 국가·지점·제품군 등 규모가 다른 대상 간 성능 비교
  • 실제값이 0이 되지 않는 매출, 수요, 트래픽 데이터
  • 비즈니스 의사결정 보고용 지표가 필요한 경우

사용이 부적절한 경우

  • 실제값이 0이 될 수 있는 데이터
  • 실제값이 매우 작은 구간이 자주 등장하는 경우

이 경우 MAPE는 정의되지 않거나 비현실적으로 큰 값을 가질 수 있다.


1.4 (R^2) Score 및 Adjusted (R^2)

(R^2)는 오차 기반 지표가 아니라,
모델이 종속 변수의 전체 분산을 얼마나 설명하는지를 측정한다.

R2=1−SSESSTR^2 = 1 - \frac{SSE}{SST}

  • SSE: 잔차 제곱합
  • SST: 전체 제곱합

해석

  • (R^2 = 1): 완벽한 예측
  • (R^2 = 0): 평균 예측과 동일
  • 음수 가능: 평균보다 못한 모델

치명적인 한계

독립변수(X)를 추가하면,
그 변수가 의미가 없더라도 SSE는 감소할 가능성이 크다.
따라서 (R^2)는 거의 항상 증가한다.

즉, 모델의 복잡도를 전혀 고려하지 않는다.

Adjusted (R^2)

이를 보완하기 위해 변수 개수와 샘플 수를 고려한 지표가 Adjusted (R^2)다.

Radj2=1−(1−R2)n−1n−k−1R^2_{adj} = 1 - (1 - R^2)\frac{n-1}{n-k-1}

  • (n): 샘플 수
  • (k): 독립변수 개수

불필요한 변수가 추가되면 패널티가 부여된다.

사용이 적합한 경우

  • 선형 회귀 및 다중 회귀 모델 비교
  • 설명력과 해석 가능성이 중요한 분석 과제

사용이 부적절한 경우

  • 비선형 머신러닝 모델의 단독 성능 평가
  • 예측 정확도가 핵심 목표인 문제

2. 분류(Classification) 모델 평가

핵심 질문

분류 문제에서는 다음 두 질문이 중요하다.

  • 얼마나 정확히 구분하는가?
  • 어떤 종류의 실수를 하는가?

특히 클래스 불균형이 존재하는 경우,
Accuracy 하나만으로는 모델 성능을 평가할 수 없다.


2.1 혼동 행렬 (Confusion Matrix)

모든 분류 지표는 혼동 행렬에서 출발한다.

실제 \ 예측PositiveNegative
PositiveTPFN
NegativeFPTN
  • FP: 1종 오류 (오진)
  • FN: 2종 오류 (놓침)

2.2 Precision과 Recall

Precision (정밀도)

Precision=TPTP+FPPrecision = \frac{TP}{TP + FP}

양성이라고 예측한 것 중, 실제로 맞은 비율이다.
FP를 줄이는 것이 핵심이다.

적합한 사례:

  • 스팸 필터링
  • 추천 시스템
  • 자동 차단 시스템

Recall (재현율)

Recall=TPTP+FNRecall = \frac{TP}{TP + FN}

실제 양성 중에서 모델이 찾아낸 비율이다.
FN을 줄이는 것이 핵심이다.

적합한 사례:

  • 암 진단
  • 사기 탐지
  • 결함 검출

2.3 F1-score

Precision과 Recall의 조화 평균이다.

F1=2⋅Precision⋅RecallPrecision+RecallF1 = 2 \cdot \frac{Precision \cdot Recall}{Precision + Recall}

두 지표 중 하나라도 낮으면 F1-score도 낮아진다.
불균형 데이터에서 Accuracy를 대체하는 대표적인 지표다.


2.4 Log Loss (Cross-Entropy Loss)

Log Loss는 정답 여부가 아니라,
모델이 예측한 확률의 품질을 평가한다.

−1N∑(ylog⁡(p)+(1−y)log⁡(1−p))-\frac{1}{N} \sum (y \log(p) + (1-y)\log(1-p))

틀렸을 뿐 아니라,
틀린 예측에 강한 확신을 가질수록 큰 패널티를 받는다.

확률 기반 의사결정 시스템에서 핵심적인 지표다.


2.5 ROC-AUC

ROC-AUC는 임계값에 독립적인 성능 지표다.
순위 기반으로 모델의 분류 능력을 평가한다.

“임의의 양성 샘플이 음성 샘플보다 높은 점수를 받을 확률”로 해석할 수 있다.

한눈에 보는 요약 (Cheat Sheet)

구분지표특징 및 사용 시점
회귀MAE이상치에 덜 민감, 직관적 해석
MSE / RMSE큰 오차를 강하게 줄이고 싶을 때
MAPE비율(%) 기반 비교, 비즈니스 보고
Adjusted (R^2)변수가 많은 회귀 모델 평가
분류Accuracy클래스 균형일 때만 사용
PrecisionFP를 줄이는 것이 중요한 경우
RecallFN을 줄이는 것이 중요한 경우
F1-score불균형 데이터에서 종합 평가
Log Loss확률 예측의 품질까지 평가

Quiz

📌 퀴즈 1. 집값 예측 모델

어떤 모델이 집값(단위: 만 원)을 예측하고 있다.
데이터에는 고가 주택이 일부 섞여 있어 아주 큰 오차가 간혹 발생한다.
비즈니스 담당자는

“평균적으로 얼마나 틀리는지만 알면 된다”
고 말한다.

Q. 이 상황에서 가장 적절한 평가 지표는 무엇인가?


📌 퀴즈 2. 전력 수요 예측

전력 사용량을 예측하는 모델을 만들었다.
갑작스러운 폭염·한파 시 예측이 크게 빗나가는 경우가 있으며,
운영팀은 다음과 같이 요구한다.

“큰 예측 실패는 절대 용납할 수 없다.”

Q. 이 요구사항을 가장 잘 반영하는 회귀 평가 지표는 무엇인가?


📌 퀴즈 3. 글로벌 매출 예측 비교

A 국가의 매출은 수백만 원 단위,
B 국가는 수천억 원 단위다.
두 나라의 예측 모델 성능을 같은 기준으로 비교해야 한다.

Q. 이 경우 가장 적절한 회귀 평가 지표는 무엇인가?


📌 퀴즈 4. 스팸 메일 필터링

스팸 메일 분류 모델을 운영 중이다.
스팸 메일 몇 개를 놓치는 것보다
정상 메일을 스팸으로 분류하는 것이 훨씬 치명적이다.

Q. 이 상황에서 가장 우선적으로 봐야 할 분류 평가 지표는 무엇인가?


📌 퀴즈 5. 암 진단 모델

암 진단 보조 모델을 개발 중이다.
의사는 다음과 같이 말한다.

“암 환자를 정상으로 분류하는 일만은 절대 없어야 한다.”

데이터는 정상 환자가 훨씬 많은 불균형 데이터다.

Q. 이 상황에서 가장 중요한 평가 지표는 무엇인가?
(정확도는 적절한 지표일까?)

profile
2026년 화이팅!!!

1개의 댓글

comment-user-thumbnail
2026년 1월 11일

모델 평가 지표 퀴즈 – 해설


🧠 퀴즈 1 해설 — 집값 예측 모델

정답: MAE (Mean Absolute Error)

이유

  • 집값 데이터에는 고가 주택이라는 이상치(outlier)가 존재

  • 비즈니스 요구사항은

    “평균적으로 얼마나 틀리는지”

  • MAE는 오차를 절대값으로만 계산하므로
    극단적인 오차에 과도한 패널티를 주지 않는다.

왜 MSE / RMSE는 부적절한가?

  • 제곱 오차 특성상
    일부 고가 주택 예측 실패가 전체 성능을 왜곡할 수 있다.
  • “평균적인 오차 규모”를 보고 싶을 때는 과도함.

🧠 퀴즈 2 해설 — 전력 수요 예측

정답: RMSE (또는 MSE)

이유

  • 전력 수요 예측에서 큰 오차는
    → 정전, 과부하, 운영 사고로 직결
  • MSE / RMSE는 큰 오차에 훨씬 큰 패널티를 부여한다.
  • 모델이 극단적인 예측 실패를 피하도록 학습된다.

왜 MAE는 부족한가?

  • MAE는 큰 오차와 작은 오차를 선형적으로 취급
  • “큰 실수는 절대 안 된다”는 요구사항을 반영하지 못함

🧠 퀴즈 3 해설 — 글로벌 매출 예측 비교

정답: MAPE (Mean Absolute Percentage Error)

이유

  • 국가별 매출 규모 차이가 매우 큼
  • 절대 오차(MAE, RMSE)는 스케일이 큰 국가에 종속
  • MAPE는 오차를 비율(%)로 정규화해 비교 가능

예시

  • A 국가: 1억 중 1천만 오차 → 10%
  • B 국가: 1천억 중 100억 오차 → 10%

→ 절대 금액은 다르지만 예측 품질은 동일


🧠 퀴즈 4 해설 — 스팸 메일 필터링

정답: Precision (정밀도)

이유

  • 가장 치명적인 오류:
    정상 메일을 스팸으로 분류 (False Positive)

  • Precision은

    “스팸이라고 판단한 것 중 진짜 스팸 비율”

  • FP를 직접적으로 억제하는 지표다.

왜 Recall은 덜 중요한가?

  • 스팸 메일을 일부 놓치는 것(FN)은 상대적으로 허용 가능
  • 사용자 신뢰 관점에서 FP가 훨씬 큰 문제

🧠 퀴즈 5 해설 — 암 진단 모델

정답: Recall (재현율)
(+ 보조 지표로 F1-score)

이유

  • 가장 치명적인 오류:
    암 환자를 정상으로 분류 (False Negative)

  • Recall은

    실제 암 환자 중 모델이 찾아낸 비율

  • FN을 최소화하는 데 직접적인 지표

Accuracy가 부적절한 이유

  • 데이터가 심각하게 불균형

  • 예: 정상 99%, 암 1%

    • 전부 정상이라고 예측 → Accuracy 99%
    • 하지만 모델은 의미 없음

왜 F1-score를 함께 보나?

  • Recall만 극단적으로 높이면 FP가 폭증 가능
  • F1은 Precision–Recall 균형을 확인하는 안전장치

🎯 핵심 정리 한 줄 요약

  • 평균적인 오차 크기 → MAE
  • 큰 실수 절대 금지 → RMSE
  • 스케일 다른 데이터 비교 → MAPE
  • 오진이 치명적 → Precision
  • 놓침이 치명적 → Recall
  • 불균형 데이터 → F1-score / ROC-AUC
답글 달기