
이미지 데이터와 라벨(타겟) 다운로드
다운로드된 객체의 data, targets 속성에 이미지와 라벨 데이터 저장
훈련 데이터: train_data
이미지: 60000 X 28 X 28 3차원 배열, 라벨: 60000개의 원소의 1차원 배열
테스트 데이터: test_data
이미지 10000 X 28 X 28 3차원 배열, 라벨: 10000개의 원소의 1차원 배열
subplot(5, 5, i+1)
5 X 5 그리드에 i+1 순서대로 여러 개의 그림을 표시
imshow (train_data.data[i], cmap='gray')
i 번째 학습용 데이터 28 X 28 픽셀을 화면에 표시
cmap(color map)은 흑백 이미지 (그레이 스케일 적용)
입력 계층: 784(28 X 28)개 픽셀
학습 시 28 X 28 2차원 입력을 784개의 1차원 구조로 변환하여 입력
은닉 계층: 128개의 뉴런(노드)을 갖는 은닉 계층 1개
relu 활성화 홤수
출력 계층: 10개의 숫자 분류
다중 분류를 위해 softmax 활성화 함수




정보 이론에서 모든 사건 정보량의 기대값으로 전체 사건의 확률 분포의 불확실성 정도를 측정
물리 시스템에서는 혼돈의 정도를 측정하는 척도
사건을 관측할 정보량은 확률에 반비례
잘 일어나지 않는 사건은 자주 발생하는 사건보다 정보량이 많음
실제 확률값(라벨 데이터의 원핫 벡터)와 클래스의 예측 활륙 밧의 곱
모델이 예측한 값이 실제 값을 설명하는데 얼마나 비효율적인지를 나타냄
값이 적을수록 정확한 예측을 나타낸다는 특징이 있음
확률론적 경사하강법 (Stocastic Gradient Decent, SDG)
미분의 기울기를 구하여 감소 방향으로 가중치를 갱신
모멘텀 (Momentum)
경사하강법에 관성을 도입
AdaGrad (Adaptive Gradient)
학습을 진행하면서 학습 속도를 적응적으로 조정
RmSProp
AdaGrad에서 갱신량이 0이되는 문제를 개선
Adam (Adaptive Moment Estimation)
RMSProp와 AdaGrad의 하이브리드 기법
대용량 데이터로 학습하는 경우 데이터 세트의 각 레코드마다 학습(가중치 / 파라미터 업데이트)하면 많은 계산을 수행하여 실행 시간이 오래 걸림
전체 데이터를 몇 개의 데이터 세트로 분할한 미니 배치(mini batch) 크기 단위로 학습하여 계산량을 줄임