
기계학습 알고리즘
지도학습 (Supervised learning)
-학습데이터에 힌트 정보와 정답 정보 포함
-알고리즘을 이용하여 정답과 힌트 간의 관계를 파악
-
회귀 (Regression)
-회귀는 연속적인 값을 예측하는 문제이다. 주어진 입력 데이터로부터 연속적인 수치 데이터를 예측할 때 사용된다.
-예를 들어, 주택의 크기, 위치, 방 개수 등의 정보를 입력 데이터로 사용하여 주택 가격을 예측하는 경우가 회귀 문제이다.
- 회귀 알고리즘
선형 회귀 (Linear Regression)
다항 회귀 (Polynomial Regression)
릿지 회귀 (Ridge Regression)
라쏘 회귀 (Lasso Regression)
-
분류 (Classification)
-분류는 주어진 입력 데이터로부터 이산적인 클래스 레이블을 예측하는 문제이다. 즉, 데이터가 어떤 카테고리에 속하는지를 예측한다.
-예를 들어, 이메일이 스팸인지 아닌지를 예측하는 경우가 분류 문제이다.
- 분류 알고리즘
로지스틱 회귀 (Logistic Regression)
→회귀라는 단어 때문에 회귀 분석에만 사용될 것 같지만 범주형 자료를 분류하는데 매우 강력한 알고리즘
서포트 벡터 머신 (Support Vector Machine, SVM)
결정 트리 (Decision Tree)
랜덤 포레스트 (Random Forest)
k-최근접 이웃 (k-Nearest Neighbors, k-NN)
나이브 베이즈 (Naive Bayes)
-
회귀와 분류의 차이점
- 결과의 유형
- 회귀: 연속적인 수치 값 (예: 주택 가격, 온도)
- 분류: 이산적인 클래스 레이블 (예: 스팸/비스팸, 질병 있음/없음)
- 평가 지표
- 회귀: 평균 제곱 오차 (MSE), 평균 절대 오차 (MAE), R^2 등
- 분류: 정확도 (Accuracy), 정밀도 (Precision), 재현율 (Recall), F1 점수 등
비지도학습 (Unsupervised learning)
-관측치들의 특성 정보를 담고 있는 데이터를 사용
-관측치들의 특성을 파악 또는 데이터에 존재하는 패턴을 찾을 때
-
군집 (Clustering)
-데이터 포인트들을 유사한 특성을 가진 그룹으로 묶는 것
-군집화 알고리즘은 데이터를 여러 군집으로 나누어 각 군집이 내부적으로 유사하고 다른 군집과는 다르도록 함
- K-평균 군집화 (K-means Clustering)
- 계층적 군집화 (Hierarchical Clustering)
-
연관 (Association)
-데이터 항목 간의 흥미로운 관계를 발견하는 것
-주로 장바구니 분석에서 사용
- 아프리오리 알고리즘 (Apriori Algorithm)
- FP-Growth (Frequent Pattern Growth)
-
차원 축소 (Dimensionality Reduction)
고차원의 데이터를 더 낮은 차원으로 변환하여 데이터의 주요 특성을 유지하면서 시각화하거나 계산 효율성을 높이는 것
- 주성분 분석 (Principal Component Analysis, PCA)
- t-SNE (t-Distributed Stochastic Neighbor Embedding)