#10 Weekly Paper _편향, 분산

Heidi J.·2026년 5월 27일

Weekly_Paper

목록 보기
25/37
post-thumbnail

모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요.

1. 편향(Bias)

모델이 실제 데이터의 패턴을 제대로 학습하지 못하는 오류
즉, 모델이 너무 단순해서 발생

예를 들면:
학생 성적을 예측한다고 가정한다

실제 관계:

  • 공부시간이 늘수록 성적 증가
  • 하지만 어느 순간 증가폭 감소
    그런데 모델이 단순 직선만 사용하면:

    복잡한 패턴을 표한하지 못함
    👉 항상 비슷하게 틀림
    👉 이것이 높은 편향(high bias)

1) 특징

  • 모델이 너무 단순함
  • 학습 데이터도 잘 못 맞춤
  • 테스트 데이터도 못 맞춤
  • 과소적합(Underfitting) 발생

2) 높은 편향의 예

  • 변수가 너무 적음
  • 모델이 지나치게 단순
  • 학습 부족

2. 분산(Variance)

학습 데이터에 지나치게 민감하게 반응하는 문제
즉, 모델이 너무 복잡해서 발생

예를 들면:
학생 10명의 데이터를 학습했는데
모델이 모든 데이터를 완벽하게 외워버렸다고 가정한다

학습 데이터 성능:

  • 거의 100점

새로운 데이터:

  • 성능 급락
    👉 이것이 높은 분산

1) 특징

  • 모델이 지나치게 복잡함
  • 학습 데이터는 매우 잘 맞춤
  • 새로운 데이터는 못 맞춤
  • 과적합(Overfitting) 발생

🎯 편향 vs. 분산 비교

구분편향(Bias)분산(Variance)
원인모델이 너무 단순모델이 너무 복잡
문제패턴 학습 실패데이터 암기
학습 데이터 성능낮음매우 높음
테스트 성능낮음낮음
대표 현상과소적합과적합

3. 편향-분산 트레이드오프(Bias-Variance Tradeoff) ⭐⭐⭐

편향과 분산은 서로 반대 관계에 있음

▶️ 모델이 단순할수록

  • 편향 ⬆️
  • 분산 ⬇️
    즉,
  • 일반화는 안정적
  • 하지만 패턴을 잘 못 배움

▶️ 모델이 복잡할수록

  • 편향 ⬇️
  • 분산 ⬆️
    즉,
  • 학습 데이터는 잘 맞춤
  • 하지만 새로운 데이터에 약함

🎯 핵심 목표
머신러닝의 목표는:

편향과 분산의 균형점을 찾는 것

▶️ 너무 단순한 모델

  • 직선 하나로 모든 데이터 설명
  • 과소적합
  • Bias 높음

▶️ 너무 복잡한 모델

  • 데이터 하나하나 굴곡 따라감
  • 과적합
  • Variance 높음

▶️ 적절한 모델

  • 핵심 패턴만 학습
  • 일반화 성능 좋음

👩‍💻 실무에서 해결 방법
▶️ 편향이 높을 때(과소적합)
해결:

  • 모델 복잡도 증가
  • 변수 추가
  • 학습 충분히 수행
    예:
  • 선형회귀 -> 랜덤포레스트/XGBoost

▶️ 분산이 높을 때(과적합)
해결:

  • 데이터 증가
  • 정규화(Regularization)
  • Dropout
  • 가지치기(Pruning)
  • 모델 단순화

편향은 모델이 너무 단순해서 발생하는 오차이고, 분산은 모델이 학습 데이터에 과도하게 적합되어 발생하는 오차이다.
머신러닝에서는 두 요소 사이의 균형(Bias-Variance Tradeoff)을 맞추는 것이 핵심이다.

😎

profile
꼬꼬마 데분가😎

0개의 댓글