편향과 분산

Youngho LEE·2025년 5월 25일

편향(Bias)

  • 학습 알고리즘에서 잘못된 가정을 했을 때 발생하는 오차이다.
  • 높은 편향값은 알고리즘이 데이터의 특징과 결과물과의 적절한 관계를 놓치게 만드는 과소적합(underfitting) 문제를 발생시킨다.
  • 추정한 결과가 한쪽으로 치우치는 경향을 보임으로써 발생하는 오차이다.
  • 지나치게 단순한 모델로 인한 error이다.
  • 편향이 크다는 것은 모델이 뭔가 중요한 요소를 놓치고 있다는 뜻이다.

분산(Variance)

  • 트레이닝 셋에 내재된 작은 변동(fluctuation)때문에 발생하는 오차이다.
  • 높은 분산값은 큰 노이즈까지 모델링에 포함시키는 과적합(overfitting) 문제를 발생시킨다.
  • 변량(데이터)들이 퍼져있는 정도를 의미한다.
  • 지나치게 복잡한 모델로 인한 error이다.
  • 분산이 크다는 것은 훈련 데이터에 지나치게 적합 시켜 일반화가 되지 않은 모델이다.

편향과 분산의 관계❗️

  • trade-off 관계이다.
  • 모델이 복잡해질수록 편향은 작아지고, 분산은 커진다. (overfitting)
  • 모델이 단순해질수록 편향은 커지고, 분산은 작아진다. (underfitting)
  • 오류를 최소화하려면 편향과 분산의 합이 최소가 되는 적당한 지점을 찾아야한다.


출처
wikipedia
blog
blog

profile
개발자

0개의 댓글