머신러닝
컴퓨터가 데이터를 학습하는 알고리즘과 기술을 통칭
지도학습 (Supervised Learning)
- 입력 데이터X 와 타겟값y 를 알고 있는 데이터를 학습하여 이들의 관계를 모델링하는 학습 방법
- 새로운 데이터에 대한 타겟값을 예측하는 데에 사용
- EX> 컴퓨터에게 개와 고양이를 분류하는 법을 가르치기 위해 필요한 것
- 개,고양이 사진을 표현한 데이터 X
- 개, 고양이 사진의 클래스 Y
- 지도학습은 Y 의 형태에 따라 두 가지로 나뉜다
- 분류 Classification
- 회귀 Regression
분류 Classification
- 타겟변수 Y가 이산형 변수인 경우
- 이산형 변수: 특정한 값만 가질 수 있는 변수
- 예제
- 개와 고양이 분류
- 얼굴 인식
- 제품의 정상/불량 조기 판단


회귀 Regression
- 타겟변수 Y가 연속형 변수인 경우
- 연속형 변수: 연속 범위 내에서 임의의 값을 가질 수 있는 변수
- 예제
- 소매점의 이번 달 수요 예측
- 이미지에서 물체의 위치(상대적 좌표) 파악

비지도학습(Unsupervised Learning)

- 주성분 분석
- 특이값 분해
- 비음수 행렬 분해
- 밀도 추정 Density Estimation : 관측된 데이터를 이용하여 데이터 생성에 대한 확률밀도함수를 추정
- 가우시안 혼합 모델
- 커널 밀도 추정
- 이상치 탐지 : 다른 포인트들과 비교하여 많이 벗어나 있는 포인트를 찾아내기
- 인공신경망 기반 비지도학습
강화학습(Reinforcement Learning)
- 자신이 한 행동에 대한 보상을 바탕으로 목적을 달성하는 학습
파라미터와 하이퍼파라미터
머신러닝 모델의 파라미터
- 모델의 구성 요소이자 데이터로부터 학습되는 것
EX> 선형 회귀 모델

EX> 신경망

머신러닝 모델의 하이퍼파라미터
- 모델 학습 과정에 반영되며, 학습을 시작하기 전에 미리 값을 결정하는 것
EX> 여러 오븐에 각각 다른 세팅을 주어 빵을 굽는 경우 그 온도와 시간

EX> 신경망: Feed-forward Network 네트워크 구조

손실함수 Loss Function
- 학습 알고리즘이 작동하게끔 만드는 원동력
- 손실함수의 값을 줄여나가는 과정이 곧 모델을 학습하는 과정이다
손실
- 실제 데이터에서 관측된 결과 vs 모델에 의해 생성된 결과
- 둘의 차이에 의해 손실이 발생한다
- 손실이 작다면 모델 성능이 좋은 것
- 손실을 수리적으로 계산하기 위하여 함수로 정의한다
- 손실함수 종류
학습, 검증/개발, 테스트 셋
학습 셋 Training set
- 모델 생성을 위해 학습 과정에 사용
- 모델 파라미터 추정을 위해 소모됨
검증/개발 셋 Validation/Development set
- 학습 과정에서 하이퍼파라미터를 튜닝하는 데에 사용
- 여러 하이퍼파라미터로 생성된 모델 중 어떤 것이 성능이 좋은 지 평가하는 데에 소모됨
테스트 셋 Test set
- 생성된 모델의 예측 성능 평가
- 미래에 타겟값이 관측되지 않은 데이터라고 가정하고, 예측이 잘 되는지 평가하는 데에 소모됨
3-way holdout 방법
- 갖고 있는 데이터를 3개로 분할
- 학습,개발,테스트 셋
- 여러 hyperparameter sets으로 후보 모델들 학습
- Validation set 을 이용하여 모델들을 평가 → 최적의 hyperparameter set 선정
- Training set과 validation set을 합쳐서 앞서 도출된 best hyperparameterset 으로 모델 재학습
- Test set 으로 모델 평가
- 모든 데이터로 최종 모델 학습