
편향(Bias)
- 학습 알고리즘에서 잘못된 가정을 했을 때 발생하는 오차이다.
- 높은 편향값은 알고리즘이 데이터의 특징과 결과물과의 적절한 관계를 놓치게 만드는 과소적합(underfitting) 문제를 발생시킨다.
- 추정한 결과가 한쪽으로 치우치는 경향을 보임으로써 발생하는 오차이다.
- 지나치게 단순한 모델로 인한 error이다.
- 편향이 크다는 것은 모델이 뭔가 중요한 요소를 놓치고 있다는 뜻이다.
분산(Variance)
- 트레이닝 셋에 내재된 작은 변동(fluctuation)때문에 발생하는 오차이다.
- 높은 분산값은 큰 노이즈까지 모델링에 포함시키는 과적합(overfitting) 문제를 발생시킨다.
- 변량(데이터)들이 퍼져있는 정도를 의미한다.
- 지나치게 복잡한 모델로 인한 error이다.
- 분산이 크다는 것은 훈련 데이터에 지나치게 적합 시켜 일반화가 되지 않은 모델이다.
편향과 분산의 관계❗️
- trade-off 관계이다.
- 모델이 복잡해질수록 편향은 작아지고, 분산은 커진다. (overfitting)
- 모델이 단순해질수록 편향은 커지고, 분산은 작아진다. (underfitting)
- 오류를 최소화하려면 편향과 분산의 합이 최소가 되는 적당한 지점을 찾아야한다.

출처
wikipedia
blog
blog