
모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요.
모델이 실제 데이터의 패턴을 제대로 학습하지 못하는 오류
즉, 모델이 너무 단순해서 발생
예를 들면:
학생 성적을 예측한다고 가정한다
실제 관계:

학습 데이터에 지나치게 민감하게 반응하는 문제
즉, 모델이 너무 복잡해서 발생
예를 들면:
학생 10명의 데이터를 학습했는데
모델이 모든 데이터를 완벽하게 외워버렸다고 가정한다
학습 데이터 성능:
새로운 데이터:
🎯 편향 vs. 분산 비교
| 구분 | 편향(Bias) | 분산(Variance) |
|---|---|---|
| 원인 | 모델이 너무 단순 | 모델이 너무 복잡 |
| 문제 | 패턴 학습 실패 | 데이터 암기 |
| 학습 데이터 성능 | 낮음 | 매우 높음 |
| 테스트 성능 | 낮음 | 낮음 |
| 대표 현상 | 과소적합 | 과적합 |
편향과 분산은 서로 반대 관계에 있음
▶️ 모델이 단순할수록
▶️ 모델이 복잡할수록
🎯 핵심 목표
머신러닝의 목표는:
편향과 분산의 균형점을 찾는 것
▶️ 너무 단순한 모델
▶️ 너무 복잡한 모델
▶️ 적절한 모델
👩💻 실무에서 해결 방법
▶️ 편향이 높을 때(과소적합)
해결:
▶️ 분산이 높을 때(과적합)
해결:
편향은 모델이 너무 단순해서 발생하는 오차이고, 분산은 모델이 학습 데이터에 과도하게 적합되어 발생하는 오차이다.
머신러닝에서는 두 요소 사이의 균형(Bias-Variance Tradeoff)을 맞추는 것이 핵심이다.
😎