머신러닝 3일차 회귀분석

ilysm·2023년 3월 15일

피쳐가 많은 경우 mse 대신 비용함수를 줄이는 경사하강법 사용

10000개이고 배치크기가 300일때 33번 + 1번(100)

배치크기가 크면 그래디언트를 계산하는데 많은 시간과 메모리

n=0.02로 학습률이 적으면 시간도 오래 걸리고

n=0.02 일 때 위와 같은 경우 찾기 힘듬

즉 최적의 학습률을 찾는 것이 중요함


학습량이 적어 큰 데이터 좋음
전체 데이터를 보는 것(배치 경사하강법)이 아니라 매번 다른 데이터 셋을 하나 씩 보는 것이므로 하나씩 튀어감. 지역 최솟값에 도달한 가능성이 적어짐

학습 스케줄? (Learning Schedule)

  • 큰 학습률에서 시작하고 학습속도가 느려질때 학습률을 낮추면 최적의 고정 학습률보다 더 좋은 솔루션을 빨리 발견할 수 있다.
    처음에는 파라미터가 크게 업데이트 되다가 기울기가 0이 되는 지점에 가까워질수록 파라미터 적게

다항 회귀

x^2을 그대로 사용하는 것이 아닌 x2 값으로 바꾸어 선형 만들어 사용.

학습곡선

과대 적합과 과소 적합
300차원의 곡선- 과대 적합을 만들 수 있다
차수가 높아 질 수록 일반화 성능이 떨어지고 있다.

과대 적합

학습데이터 셋에 대해 성능이 매우 좋게 나옴(RMSE 낮게 나옴)
그러나 valid는 잘 안 맞음.

학습과 비용함수


실제 0인 데이터에 대해 1에 가깝게 나오면 비용함수가 상승 1에 가까울 수록 더 낮은 성능
참에 대해 참이라고만 끝나는 것이 아닌 확률의 크기도 중요, 확률의 크기를 보기 위해 로그 함수 사용

비용함수

log loss 함수 (모델에서 손실 함수)
정답을 더 높은 확률로 예측할 수록 좋은 모델이라고 평가 하는 것

소프트맥스

0.15로 클래스 1인지 아닌지
0.75로 클래스 2인지 아닌지
0.25로 클래스 3인지 아닌지

그 후 시그모이드 함수를 통해 함수의 합이 1이되도록 바꿔줌.
여기선 확률이 가장 높은 2번째 클라스를 보고 이 데이터는 세토사라는 품종일 것이다.

profile
한걸음씩 배워나갑니다

0개의 댓글