[DS] 머신러닝의 정의, 분류

llunaB·2022년 2월 22일

dataScience

목록 보기
1/7

머신러닝이란?

학습이란?

"
만약 컴퓨터 프로그램이 특정한 태스크 T를 수행할 때 성능 P 만큼 개선되는 경험 E를 보이면, 그 컴퓨터 프로그램은 태스크 T와 성능 P에 대해 경험 E를 학습했다.
"
즉, 컴퓨터에게 필기체를 인식하는 학습을 시킨다고 했을 때
새롭게 입력된 필기체를 분류할 때 (T), 미리 만들어진 데이터세트로 학습한 경험을 통해(E) 정의된 확률 수준으로 필기체를 인식하면(P) 컴퓨터는 학습을 했다 라고 말할 수 있다.

학습 = 표현 + 평가 + 최적화

1. 표현

  • 어떤 task를 수행하는 agent가 입력값을 처리해 어떻게 결괏값을 만들지를 결정하는 방법
    ex. 필기체 아라비아 숫자가 실제로 어떤 숫자를 의미하는지를 예측하는 논리 모형
  • 표현을 위한 방법
    - 서포트 벡터 머신
    - 의사결정 트리
    - k-means 모델

2. 평가

  • 에이전트가 얼마만큼 태스크를 잘 수행했는지 판정하는 방법
    ex. 최소제곱법과 같은 동일한 기준으로 정량화된 결괏값과 실제값의 차이를 제곱해서 모두 더한 값을 가지고 태스크의 수행 정도를 판단하는 방법

3. 최적화

  • 평가에서 설정한 기준을 최적으로 만족하는 조건을 찾는 것
    ex. 최소제곱법 기준으로 평가한다면 경사감소법과 같은 방법으로 최적 조건을 찾는다.
  • 최적화 과정이 끝나면 학습 모델에 사용된 가중치가 결정되며, 이를 두고 학습이 완료됐다고 한다.

일반화(generalization)

  • 여러가지 방법에 의해 학습이 완료된 후, 새로운 데이터에 대한 예측을 하는 것

머신러닝의 분류

지도학습(supervised)

  • 학습 데이터에 레이블이 있는 경우(레이블이 있는 입력 데이터로 학습한다.)

모델

  • 분류 classification
    - kNN : k nearest neighbor
    - Support Vector Machine
    - Decision Tree
  • 예측 prediction
    - Regression(회귀)

분류와 회귀의 차이점?

  • 분류는 결괏값이 학습 데이터세트에 포함한 레이블 중 하나여야 한다.
  • 회귀는 데이터세트 범위 내 어떤 값도 가능하다.(학습데이터셋으로 결정된 함수식으로 계산한 임의의 값)

분류 모델?

  • 목적 : 그룹명(레이블)이 적힌 학습 데이터로 학습 후 새로 입력된 데이터가 속한 그룹을 찾아내는 것
  • 분류되는 그룹 수가 2개인 경우 이진분류, 이항분류, 3개 이상인 경우 다항 분류라 한다.

회귀 모델?

  • 목적 : 레이블된 학습 데이터를 가지고 특성과 레이블의 관계를 함수식으로 표현하는 것
  • 분석하고자 하는 문제의 결과가 몇 가지로 고정된 것이 아니라 어떤 결과값도 가능한 경우 사용(ex.주가분석)

비지도학습(unsupervised)

  • 학습 데이터에 레이블이 없는 경우

모델

- 군집 clustering
	- k-means
    - k-me-doids
    - DBSCAN

군집 모델

  • 학습 데이터에 레이블이 없으므로, 입력된 데이터를 특정 형태의 그룹으로 형성해야 한다.
  • 목표 : 레이블 없이 확보된 데이터 특성을 분석해 서로 유사한 특성을 가진 데이터끼리 그룹화하는 것.
  • 즉, 레이블 없는 데이터를 분류하는 것.

예시

  • 전화 통화음질 개선을 위한 사람 목소리와 노이즈 구별

군집 모델의 분류

  • 평할 기반 군집 모델 partition-based clustering
  • 계층적 군집 모델 hierarchical clustering

레이블이란?

  • 학습 데이터의 속성을 우리가 분석하고자 하는 관점에서 정의하는 것.
    ex. 사물을 찍은 사진이 있을 때, 사진들 = 학습데이터, 사진 속 사물들 = 레이블

출처
인공지능, 머신러닝, 딥러닝 입문(김의중, 위키북스)

profile
안녕하세요. 성장하는 주니어 개발자입니다. :-)

0개의 댓글