[Andrew Ng] 4-6. Adam Optimization Algorithm

Prettypotato·2026년 2월 17일

Adam Optimization Algorithm

  • Adam은 Momentum + RMSProp을 결합한 적응적 최적화 알고리즘입니다.
  • Momentum: gradient 방향의 누적 (first moment)
  • RMSProp: gradient 크기(분산)에 따른 learning rate 조정 (second moment)

  • gtg_t : 현재 시점 gradient
    gt=θJ(θt1)g_t = \nabla_{\theta} J(\theta_{t-1})

  • 1차 모멘트 (Momentum) 계산
mt=β1mt1+(1β1)gtm_t = \beta_1 m_{t-1} + (1-\beta_1) g_t
  • mtm_t : gradient의 지수 가중 평균 (first moment)
  • β1\beta_1 : momentum decay rate (보통 0.9)

  • 2차 모멘트 (RMSProp) 계산
    vt=β2vt1+(1β2)gt2v_t = \beta_2 v_{t-1} + (1-\beta_2) g_t^2
    • vtv_t : gradient 제곱의 지수 평균 (second moment)
    • β2\beta_2 : RMS decay rate (보통 0.999)

  • Bias Correction (초기 단계 보정)
    mt^=mt1β1t,vt^=vt1β2t\hat{m_t} = \frac{m_t}{1-\beta_1^t}, \quad \hat{v_t} = \frac{v_t}{1-\beta_2^t}
    • 초기값 m0=v0=0m_0 = v_0 = 0 때문에 편향이 발생함으로 보정해야함.

  • 파라미터 업데이트
    θt=θt1ηmt^vt^+ϵ\theta_t = \theta_{t-1} - \eta \frac{\hat{m_t}}{\sqrt{\hat{v_t}} + \epsilon}
    • η\eta : base learning rate
    • ϵ\epsilon : 작은 상수 (1e-8) — 분모 안정화

  • 핵심 직관
  1. Momentum으로 방향성 강화 → 빠른 수렴, 진동 완화
  2. RMSProp으로 gradient 크기 조절 → 학습 안정화
  3. Bias Correction으로 초반 편향 제거 → 안정적 학습 시작

출처 및 참고 자료

  • Andrew Ng, Improving Deep Neural Network, DeepLearningAI
  • 혁펜하임, Easy! 딥러닝

0개의 댓글