
- 행렬곱
- Batch Normalization
- Relu 계열 활성화 함수 (text model : tanh) : 대부분의 은닉층에 적용
- Drop out : 마지막 은닉층에 적용
최적화 Weigt Upgrade : SGD , AdaGrad, Momentum, Adam 등
- 딥러닝의 대표적인 Hyper Parameter 사람이 결정해주는 수 : layer size, epoch, learning rate ...
- layer의 개수, 노드의 개수 : 정해져 있지 않음
- 노드의 개수 : 2의 배수가 좋음