[Andrew Ng] 4-6. Adam Optimization Algorithm
Adam Optimization Algorithm
- Adam은 Momentum + RMSProp을 결합한 적응적 최적화 알고리즘입니다.
- Momentum: gradient 방향의 누적 (first moment)
- RMSProp: gradient 크기(분산)에 따른 learning rate 조정 (second moment)
- gt : 현재 시점 gradient
gt=∇θJ(θt−1)
mt=β1mt−1+(1−β1)gt
- mt : gradient의 지수 가중 평균 (first moment)
- β1 : momentum decay rate (보통 0.9)
- 2차 모멘트 (RMSProp) 계산
vt=β2vt−1+(1−β2)gt2
- vt : gradient 제곱의 지수 평균 (second moment)
- β2 : RMS decay rate (보통 0.999)
- Bias Correction (초기 단계 보정)
mt^=1−β1tmt,vt^=1−β2tvt
- 초기값 m0=v0=0 때문에 편향이 발생함으로 보정해야함.
- 파라미터 업데이트
θt=θt−1−ηvt^+ϵmt^
- η : base learning rate
- ϵ : 작은 상수 (1e-8) — 분모 안정화
- Momentum으로 방향성 강화 → 빠른 수렴, 진동 완화
- RMSProp으로 gradient 크기 조절 → 학습 안정화
- Bias Correction으로 초반 편향 제거 → 안정적 학습 시작
출처 및 참고 자료
- Andrew Ng, Improving Deep Neural Network, DeepLearningAI
- 혁펜하임, Easy! 딥러닝