gradient 값이 자주 크게 나타나는 파라미터 → 가 커짐
→ 는 작아짐
→ 학습률 자동 감소
gradient가 작게 나타나는 파라미터 → 가 작아짐
→ 는 커짐
→ 학습률 자동 증가
경사가 가파른 곳은 조심스럽게, 경사가 완만한 곳은 과감하게 움직임.
Momentum: gradient 자체의 평균
RMSProp: gradient 제곱의 평균
둘 다 EWA 기반이지만:
출처 및 참고 자료
- Andrew Ng, Improving Deep Neural Network, DeepLearningAI