[AI][Data Analysis and Machine Learning]머신러닝 기초 개념

·2025년 3월 7일
post-thumbnail

머신러닝

컴퓨터가 데이터를 학습하는 알고리즘과 기술을 통칭

지도학습 (Supervised Learning)

  • 입력 데이터X 와 타겟값y 를 알고 있는 데이터를 학습하여 이들의 관계를 모델링하는 학습 방법
  • 새로운 데이터에 대한 타겟값을 예측하는 데에 사용
  • EX> 컴퓨터에게 개와 고양이를 분류하는 법을 가르치기 위해 필요한 것
    • 개,고양이 사진을 표현한 데이터 X
    • 개, 고양이 사진의 클래스 Y

  • 지도학습은 Y 의 형태에 따라 두 가지로 나뉜다
    • 분류 Classification
    • 회귀 Regression

분류 Classification

  • 타겟변수 Y가 이산형 변수인 경우
    • 이산형 변수: 특정한 값만 가질 수 있는 변수
  • 예제
    • 개와 고양이 분류
    • 얼굴 인식
    • 제품의 정상/불량 조기 판단


회귀 Regression

  • 타겟변수 Y가 연속형 변수인 경우
    • 연속형 변수: 연속 범위 내에서 임의의 값을 가질 수 있는 변수
  • 예제
    • 소매점의 이번 달 수요 예측
    • 이미지에서 물체의 위치(상대적 좌표) 파악

비지도학습(Unsupervised Learning)

  • 타겟값 Y 이 없는 입력 데이터X만을 학습하는 방법

  • 입력 데이터에 내재되어 있는 특성을 찾아내는 용도

  • 종류

    • 군집화 Clustering : 유사한 포인트들끼리 그룹을 만드는 방법

    • 잠재 변수 모델 Latent Variable Model : 표현된 데이터 속에 내재되어 있는 요인을 찾는 것

- 주성분 분석
- 특이값 분해
- 비음수 행렬 분해
- 밀도 추정 Density Estimation : 관측된 데이터를 이용하여 데이터 생성에 대한 확률밀도함수를 추정
    - 가우시안 혼합 모델
    - 커널 밀도 추정
- 이상치 탐지 : 다른 포인트들과 비교하여 많이 벗어나 있는 포인트를 찾아내기
- 인공신경망 기반 비지도학습

강화학습(Reinforcement Learning)

  • 자신이 한 행동에 대한 보상을 바탕으로 목적을 달성하는 학습

파라미터와 하이퍼파라미터

머신러닝 모델의 파라미터

  • 모델의 구성 요소이자 데이터로부터 학습되는 것

EX> 선형 회귀 모델

EX> 신경망

머신러닝 모델의 하이퍼파라미터

  • 모델 학습 과정에 반영되며, 학습을 시작하기 전에 미리 값을 결정하는 것

EX> 여러 오븐에 각각 다른 세팅을 주어 빵을 굽는 경우 그 온도와 시간

EX> 신경망: Feed-forward Network 네트워크 구조

손실함수 Loss Function

  • 학습 알고리즘이 작동하게끔 만드는 원동력
    • 손실함수의 값을 줄여나가는 과정이 곧 모델을 학습하는 과정이다

손실

  • 실제 데이터에서 관측된 결과 vs 모델에 의해 생성된 결과
    • 둘의 차이에 의해 손실이 발생한다
    • 손실이 작다면 모델 성능이 좋은 것
  • 손실을 수리적으로 계산하기 위하여 함수로 정의한다
  • 손실함수 종류
    • 교차 엔트로피
    • 평균 제곱 오차

학습, 검증/개발, 테스트 셋

학습 셋 Training set

  • 모델 생성을 위해 학습 과정에 사용
  • 모델 파라미터 추정을 위해 소모됨

검증/개발 셋 Validation/Development set

  • 학습 과정에서 하이퍼파라미터를 튜닝하는 데에 사용
  • 여러 하이퍼파라미터로 생성된 모델 중 어떤 것이 성능이 좋은 지 평가하는 데에 소모됨

테스트 셋 Test set

  • 생성된 모델의 예측 성능 평가
  • 미래에 타겟값이 관측되지 않은 데이터라고 가정하고, 예측이 잘 되는지 평가하는 데에 소모됨

3-way holdout 방법

  1. 갖고 있는 데이터를 3개로 분할
    1. 학습,개발,테스트 셋
  2. 여러 hyperparameter sets으로 후보 모델들 학습
  3. Validation set 을 이용하여 모델들을 평가 → 최적의 hyperparameter set 선정
  4. Training set과 validation set을 합쳐서 앞서 도출된 best hyperparameterset 으로 모델 재학습
  5. Test set 으로 모델 평가
  6. 모든 데이터로 최종 모델 학습
profile
어리둥절 빙글빙글 돌아가는 코딩세상~

0개의 댓글