제로베이스_Machine Learning (12)

KulangK·2023년 9월 12일

Machine Learning

목록 보기
12/13
post-thumbnail

📄 목차

  1. Clustering
    • Iris data
    • make_blobs
    • 실루엣 분석
    • 이미지 분할

1. Clustering

  • 비지도 학습
    • 군집 (clustering): 비슷한 샘플을 끼리끼리 모으는 것
    • 이상치 탐지 (Outlier detection): 정상 데이터가 어떻게 보이는지 학습하여 비정상 샘플을 감지
    • 밀도 추정 (Probability Density Function): 데이터셋의 확률 밀도 함수 추정, 이상치 탐지 등에 사용됨
  • K-Means
    • 군집화에서 가장 일반적인 알고리즘
      1. 군집 중심 (centroid)라는 임의의 지점들을 선택
      2. 임의의 지점들 사이에 직선을 그어 그룹화함
      3. 해당 그룹들의 중간 지점 생성
      4. 2, 3의 과정 반복 until 중심 지점 변경 없을 때 까지
    • 거리 기반 알고리즘이기 때문에 속성이 많을 수록 정확도 떨어지는 단점 존재


Iris data


make_blobs


실루엣 분석

  • Clustering (군집) 은 비지도학습이기 때문에 강의에서 다룬 정답이 정해져 있는 데이터와 달리 실제 데이터에서 얼마나 잘 나뉘었는지, 군집을 시켰는지 알기가 어려움
    • 지도학습에서는 다양한 방법으로 평가 가능함
      • 회귀: RMSE 등을 통해 평가
      • 분류: precision, recall 등 다양한 지표를 이용해 평가
    • 이때 군집을 평가하기 위해 사용되는 것이 실루엣 분석

  • 각 군집 간의 거리가 얼마나 효율적으로 분리되어 있는지 나타냄
    • 군집 간의 거리가 가까울 수록 잘못 분류된 데이터가 있을 가능성 多
    • 다른 군집과는 떨어져 있고, 동일 군집간의 데이터는 서로 가깝게 잘 뭉쳐 있는지 확인
    • 군집화가 잘 되어 있으면 개별 군집은 비슷한 정도의 여유 공간을 가짐
  • 실루엣 계수: 개별 데이터가 가지는 군집화 지표

  • 실루엣 plot

    • 군집이 겹치는지, 적정 거리를 두고 있는지, 군집의 데이터가 얼마나 분산 되어있는지를 볼 수 있음

    Iris Data 실습

kNN과 K-Means의 차이


이미지 분할

이외에 MNIST (손글씨)에서도 픽셀을 군집화 후 logistic regression을 사용하는 파이프라인을 생성하면 정확도가 1% 오르는 등 개선이 가능함.

profile
새싹 데이터 분석가 https://github.com/KulangK

0개의 댓글