[ML] Calculus Backgrounds

이정연·3일 전

ML

목록 보기
3/7

공부 기록

이변수 함수의 그래프

  • 변수 값에 따라 값이 바뀌는 함수
  • 등치선: 함수값이 같은 x, y의 조합을 연결한 것
  • 외곽으로 갈수록 함수 값 증가함 → 안쪽으로 가야지 함수값 줄어듦 ⇒ 등치선: 이 방향으로 가야하구나 알 수 있음 == ‘방향’을 알 수 있음 ⇒ 등치선이 중요한 이유

손실 함수

  • 지도 학습: 데이터와 정답을 제공하여 컴퓨터를 학습시키는 알고리즘
    • 목표: 예측 값과 실제 값의 차이를 줄이는 것 → 손실함수의 값을 줄이는 것 ⇒ 파라미터 값을 조정하여 손실 함수를 줄어들게 만들자.
  • 평균제곱오차(MSE)
    L=1n∑i=1n(yi−y^i)2L=\frac 1n\sum\limits_{i=1}^n(\mathbf {y_i-\hat y_i})^2

미분의 정의

  • 일변수 함수(변수가 하나인)의 미분: 극한으로 정의됨
  • 미분은 함숫값이 가장 빠르게 증가하는 x\mathbf x의 방향을 의미한다.
  • 다변수 함수(변수가 여러 개)의 미분

경사하강법

  • 아이디어:
    1. 기울기는 함숫값이 가장 빠르게 증가하는 x의 방향 → 기울기의 반대 방향으로 가면 함숫값이 감소함 ⇒ 기울기의 반대 방향으로 돈다.
    2. 기울기의 반대 방향으로 ‘얼마나’ 내려갈지 결정
    3. 내려간다.
    4. 1~3 반복 → 최저점을 찾을 수 있음
  • 방법
    1. 초기점에서의 기울기 구함
    2. 기울기의 반대방향으로 얼마나 갈지 결정 η\eta (학습계수, learning rate)
      1. η\eta에 따른 학습

편미분

  • 편미분은 순서 상관 없음

벡터 함수에 대한 미분: Jacobian Matrix

볼록 함수 & 볼록 최적화

  • 볼록함수에 대해서는 local minimum = global minimum

  • 볼록 함수 판별법: Hessian matirx가 positive semidefinite인지 파악

    • 위의 방법 안쓰는 이유: 행렬이 0보다 크다 작다 뭐 이런 표현 없기 때문

    • Hessian matrix: gradient ∇f\nabla_{f}를 다시 x\mathbf x에 대해 미분

      *벡터 인수 스칼라 함수에만 한정: 도함수: 행벡터, 이계도함수:

      • 편미분은 순서 상관 없음 에 의해 H(f)\bf \mathit H(f)는 대칭행렬임
    • xTAx≥0\mathbf {x^TAx \ge 0} 을 만족하는 행렬 A를 positive semidefinite라고 한다.

      *스칼라 값 나옴

profile
아 몰라몰라 안해안해

0개의 댓글