loss function을 최소로 하는 가중치를 구하는 것
문제 : local minimun, zigzag 문제 발생, 학습시간이 오래걸림
momentum - 점점 빠르게 경사하강
adaGrad - 학습률을 점차 줄여나감
rmsprop- 기울기를 서서히 잉ㄴ조 새로운 기울기 정보를 반영
adam - 모멘텀과 adagrad를 합친 최적화 기법
fc layer = dense layer
합성곱을 하게 된다면 인풋 shape가 점점 줄게됨
4x4 -> 2x2 가 됨 이걸 방지하기 위해 패딩
필터의 크기, 패딩, 스트라이드 크기는 초 매개변수임
풀링 - 세로 가로 방향의 공간을 줄이는 연산
이미지 인식에서는 주로 최대 풀링을 사용
합성곱 계층과 달리 학습해야할 매개변수가 없음
입력 데이터의 채널 수 그대로 출력 데이터로 보냄 (이미지가 겹쳐있는 애들 그대로 내보냄)
입력의 변화에 영향을 적게 받음. 데이터의 차이 발생시 풀링이
흡수해 사라지게 만듦
cross entropy를 loss function으로 쓰는 이유 - 벡터 형태로 들어가기 때문
affine, dense, fc layer - 인접하는 계층의 모든 뉴런과 결합되어 있는 신경망
입력 데이터와 가중치가 1대 1로 대응하는 것을 뜻함
affine layer를 합성곱으로 바꾼 애들이 cnn
네트워크와
이미지가 입력되고 확률이 아웃풋으로 나오는 것
합성곱 필터(가중치)를 학습시키며 갱신