[ML] 지도학습 vs 비지도학습

HanSol Choi·2024년 6월 18일

기계학습 알고리즘

지도학습 (Supervised learning)

-학습데이터에 힌트 정보와 정답 정보 포함
-알고리즘을 이용하여 정답과 힌트 간의 관계를 파악

  • 회귀 (Regression)
    -회귀는 연속적인 값을 예측하는 문제이다. 주어진 입력 데이터로부터 연속적인 수치 데이터를 예측할 때 사용된다.
    -예를 들어, 주택의 크기, 위치, 방 개수 등의 정보를 입력 데이터로 사용하여 주택 가격을 예측하는 경우가 회귀 문제이다.

    • 회귀 알고리즘
      선형 회귀 (Linear Regression)
      다항 회귀 (Polynomial Regression)
      릿지 회귀 (Ridge Regression)
      라쏘 회귀 (Lasso Regression)
  • 분류 (Classification)
    -분류는 주어진 입력 데이터로부터 이산적인 클래스 레이블을 예측하는 문제이다. 즉, 데이터가 어떤 카테고리에 속하는지를 예측한다.
    -예를 들어, 이메일이 스팸인지 아닌지를 예측하는 경우가 분류 문제이다.

    • 분류 알고리즘
      로지스틱 회귀 (Logistic Regression)
      →회귀라는 단어 때문에 회귀 분석에만 사용될 것 같지만 범주형 자료를 분류하는데 매우 강력한 알고리즘
      서포트 벡터 머신 (Support Vector Machine, SVM)
      결정 트리 (Decision Tree)
      랜덤 포레스트 (Random Forest)
      k-최근접 이웃 (k-Nearest Neighbors, k-NN)
      나이브 베이즈 (Naive Bayes)
  • 회귀와 분류의 차이점

    • 결과의 유형
      • 회귀: 연속적인 수치 값 (예: 주택 가격, 온도)
      • 분류: 이산적인 클래스 레이블 (예: 스팸/비스팸, 질병 있음/없음)
    • 평가 지표
      • 회귀: 평균 제곱 오차 (MSE), 평균 절대 오차 (MAE), R^2 등
      • 분류: 정확도 (Accuracy), 정밀도 (Precision), 재현율 (Recall), F1 점수 등

비지도학습 (Unsupervised learning)

-관측치들의 특성 정보를 담고 있는 데이터를 사용
-관측치들의 특성을 파악 또는 데이터에 존재하는 패턴을 찾을 때

  • 군집 (Clustering)
    -데이터 포인트들을 유사한 특성을 가진 그룹으로 묶는 것
    -군집화 알고리즘은 데이터를 여러 군집으로 나누어 각 군집이 내부적으로 유사하고 다른 군집과는 다르도록 함

    • K-평균 군집화 (K-means Clustering)
    • 계층적 군집화 (Hierarchical Clustering)
  • 연관 (Association)
    -데이터 항목 간의 흥미로운 관계를 발견하는 것
    -주로 장바구니 분석에서 사용

    • 아프리오리 알고리즘 (Apriori Algorithm)
    • FP-Growth (Frequent Pattern Growth)
  • 차원 축소 (Dimensionality Reduction)
    고차원의 데이터를 더 낮은 차원으로 변환하여 데이터의 주요 특성을 유지하면서 시각화하거나 계산 효율성을 높이는 것

    • 주성분 분석 (Principal Component Analysis, PCA)
    • t-SNE (t-Distributed Stochastic Neighbor Embedding)
profile
ML/DL Study,기록📝

0개의 댓글