
머신러닝 시스템의 종류는 매우 많으므로 크게 나눠서 본다면 아래와 같다.
훈련지도 방식
(지도, 준지도, 비지도, 자기지도, 강화 학습)
실시간으로 점진적인 학습을 하는지
(온라인 학습(새로운 데이터가 올때마다 학습)과 배치 학습(한꺼번에 학습))
(1)단순히 알고잇는 데이터 포인트와 새 데이터 포인트를 비교하는 것인지 아니면
(2)과학자들 처럼 훈련 데이터 셋에서 패턴을 발견하여 예측 모델을 만드는지
세번째는 어렵게 느껴질 수 있는데 쉽게 이야기 하자면,
(1) -> 이전에 알고 있던 데이터를 새로운 문제와 비교해서 그때 썼던 가장 비슷했던 문제의 풀이 방식을 새로운 문제에 적용시켜서 푸는 것이고 (사례 기반 학습)
(2) -> 는 이전에 알고 있던 데이터들에서 나만의 풀이방법을 만들어서 새로운 문제가 왔을 때 과거의 데이터를 참고할 필요 없이 바로 푸는 것이다. (모델 기반 학습)
이 범주들은 동시에 만족 할 수 있다. -> 예) 훈련지도 방식이면서 배치 학습일 수도 있다.
머신러닝 시스템은 학습하는 동안의 지도 형태나 정보량에 따라 분류 할 수 있는데
그 중 대표적인 사례에 대해 알아보자
지도 학습은 정답이 있는 데이터로 훈련을 시켜서 학습한 패턴을 바탕으로
새로운 데이터의 값을 예측하는 학습 방식이다.
대표적인 문제로 분류와 회귀가 있다.
분류는 새로운 데이터가 이미 정의된 클래스 중 어디에 속하는지 판별하는 작업이다.
회귀는 데이터의 여러 특성(Feature)들을 종합적으로 판단해 타겟을 예측하는 것입니다.
일부 회귀 알고리즘 또는 분류 알고리즘은 분류 문제 또는 회귀 문제를 해결하기 위해 사용될 수 있다.
분류 알고리즘 중 로지스틱 회귀(Logistic Regression)라는 것이 있다. 이름에는 회귀가 붙지만 이는 모델의 본질적인 구조가 회귀식에 기반하기 때문에 그런거고 라는 선형식에
시그모이드 함수(입력 값 크기에 상관없이 0~1 값 출력)를 붙인 분류 알고리즘이다.
예) 임계값을 기준으로 선형식을 통해 수치를 계산하고 시그모이드 0~1사이의 값으로 어느 클래스에 속하는지 분류한다. -> 로지스틱 회귀
이때, 선형 회귀와 선형식은 다르다.
선형 회귀는 선형식을 통해 특정 문제를 해결하기 위한 모델이고,
선형식은 우리가 아는 이 식 자체를 의미하는 것이다.
어쨌든, "회귀 알고리즘"과 "회귀 문제"는 완전히 같은 개념이 아니다. 이는 분류도 똑같다.
비지도 학습은 정답이 없는 데이터로 훈련을 시켜서 모델이 스스로 구조나 패턴을 찾아내는 학습 방식이다.
대표적인 문제로 군집화, 차원축소, 이상치 탐지, 시각화 등등이 있다.
군집화는 유사한 특성이나 기준으로 각각의 데이터를 그룹으로 묶는 방법이다.
차원축소는 데이터가 가지고 있는 정보를 최대한 유지하면서 특성(Feature)의 수를 줄이는 방법이다.
그리고 여러 특성을 합치는 과정을 특성 추출이라고 한다.
이상치 탐지(특이치 탐지)는 정상 데이터들 사이에서 튀어 있는 데이터를 찾는 방법이다.
시각화는 대규모의 고차원 데이터를 도식화 가능한 2D 혹은 3D로 표현하여 데이터가 어떻게 조직되어 있는지 확인하거나 예상치 못한 패턴을 발견할 수 있는 방법이다.
연관 규칙 학습은 여러 특징들 사이에서 함께 나타나는 규칙이나 관계를 찾는 방법이다.