3가지 최적화 기법
gradient descent : new 세타 = 세타-(cost function 기울기 x 학습률)
- Weight Initialization
- Weight regularization
Weight Initialization seta 초기화 방법
- seta0, seta1은 동시에 값이 바뀜

- 초기에 설정된 seta 값에 따라 최종 seta 값이 결정됨

- seta에 조합에 의한 cost function 위의 면 : Loss-surface
- Xavier Initialization 자비에 초기화
- He Initialization 헤 초기화
Xavier Initialization

- n : 앞선 layer의 퍼셉트론(node)의 개수
layer가 많아질수록 다음 layer 로 넘어가는 수가 점점 커지는데, 이를 방지하기 위하여
- sigmoid를 잘 사용하지 않기에, 자비에는 default이기는 하나, 잘 사용하지 않음
He Initialization

Weight regularization
- seta 규제 (억누름)
- gradient descent는 학습 과정 중에 진행되는 것임 : train data 기반으로 error를 줄이는 seta => over fitting이 될 수도!
- 그렇기에, 적당한 수준에서 멈추게 하려함

- 원래 0이 아니었던 것들이 값이 생기면서 식이 늘어남

MSE or Cross Entropy
- lambda : hyper parameter
- Regulization Term = R(seta) : 2가지 버전
- L1 : 모든 seta들의 절댓값의 총합
- L2 : 모든 seta들을 제곱 후 합함
=> Moel이 복잡해지면 MSE는 작아지고, R(seta)는 커짐 : trade off
- 모델의 오버피팅, 복잡도를 동시에 고려하는 최적의 seta를 구할 수 있게 된다.
L1 & L2 Regulirization = Weight Decay

=> L1 : 관련성이 없는 feature는 0으로 유도하여, 없어지게 함 -> feature selection 효과

- Ridge & Lasso 회귀 : 전통적 머신러닝
- Elastic net : 둘 다 적용
lambda : regularzation rate =>