[Andrew Ng] 4-5. RMSProp - Root Mean Sqruare Prop

Prettypotato·2026년 2월 17일

RMSProp 이란?

  • RMSProp은 학습률(learning rate)을 각 파라미터마다 적응적으로 조정하는 최적화 알고리즘이다.
  • Momentum, EWA 같은 개념을 gradient의 제곱(제곱 gradient)에 적용하여 학습률을 자동으로 조정합니다.
    • gradient가 크면 learning rate를 작게
    • gradient가 작으면 learning rate를 크게

RMSProp 수식 정의

  • gradient의 제곱에 대한 EWA
    st=βst1+(1β)gt2s_t = \beta s_{t-1} + (1 - \beta) \, g_t^2
    • sts_t: gradient 제곱의 EWA
    • gt=J(θt1)g_t = \nabla J(\theta_{t-1}): 현재 gradient
    • β\beta: decay rate (보통 0.9)
  • 파라미터 업데이트
    θt=θt1ηst+ϵgt\theta_t = \theta_{t-1} - \frac{\eta}{\sqrt{s_t} + \epsilon} g_t
    • η\eta: base learning rate
    • sts_t: RMSProp의 적응 스케일
    • ϵ\epsilon: 작은 상수 (0.0…1e-8) – 분모 안정화

RMSProp 이해

  • gradient 값이 자주 크게 나타나는 파라미터st\sqrt{s_t}가 커짐
    η/st\eta / \sqrt{s_t}는 작아짐
    학습률 자동 감소

  • gradient가 작게 나타나는 파라미터st\sqrt{s_t}가 작아짐
    η/st\eta / \sqrt{s_t}는 커짐
    학습률 자동 증가

  • 경사가 가파른 곳은 조심스럽게, 경사가 완만한 곳은 과감하게 움직임.

RMSProp과 Momentum 비교

  • Momentum: gradient 자체의 평균

    vt=βvt1+(1β)gtv_t = \beta v_{t-1} + (1-\beta)g_t
  • RMSProp: gradient 제곱의 평균

    st=βst1+(1β)gt2s_t = \beta s_{t-1} + (1-\beta) g_t^2
  • 둘 다 EWA 기반이지만:

    • Momentum은 방향성 누적 → 관성을 만듦
    • RMSProp은 scale에 따른 Lr 조정

출처 및 참고 자료

  • Andrew Ng, Improving Deep Neural Network, DeepLearningAI

0개의 댓글