4차 산업 혁명의 기반 구성요소 : AI + 빅데이터
머신러닝에는 여러 가지 데이터 분석기술이 포함되는데 특시, 데이터를 분석하는데 특화된 분석 기법과 방법론을 총칭해'데이터 애널리틱스(Data Analytics)'라고 한다.
분류 : 감독학습 과업, 감독의 역할을 하는 요인이 이산형
ex) 신용 상태의 정상/불량 판별
회귀 : 감독학습 과업, 감독의 역할을 하는 요인이 연속형 수치값
회귀를 통해 만들어진 모형을 회귀모형이라 함
ex) 내년도 전기 수요양 예측
군집화 : 무감독학습
ex) 마케팅에서 유사한 고객을 그룹으로 분리해, 그룹 특성의 따른 차별화된 마케팅 전략 사용
차원축소 : 데이터의 특성을 단순화하기위해 주성분 분석
정보의 유실은 최소화 하면서도 정대적인 양이나 차원을 축소하는 것을 목표로 한다.
동시출현분석 : 동시에 발생할 가능성이 높은 이벤트를 찾는 과업
ex) 장바구니 분석
프로파일링 : 현상에 대한 기술 또는 설명을 위해 데이터의 공통된 속성 값을 도출하는 과정
데이터 분석 시
표본추출->데이터 탐색-> 데이터 변환->데이터 모델링->모형 평가 과정
을 거침
모집단(Population)으로 부터 표본(Sample)을 반드는 과정
샘플의 최소치 : Delmaster and Hancock의 연구의 따르면 최소 6 x 클래수 수 x 속성수
ex)클래스 수 2, 속성 10개일 경우 최소 120개의 샘플 데이터 필요
통계의 Sampling이 모집단의 분포와 유사한 것을 추구하는 것과 달리, 머신러닝은 모델 수립에 최적화된 Sampling 수행 필요(분류 문제에서 불균형 데이터 셋일 경우 샘플링 주의)
ex)
높은 빈도의 클래스는 낮은 비중으로 샘플링(Under-sampling)
낮은 빈도의 클래스는 높은 비중으로 샘플링(Over-sampling/Up-Sampling)

ExampleSet에서 Visualizations 에서 시각화 선택 할 수 있음
너무 많은 변수는 시각화 의미가 없을 수 있음.
종속변수, 독립변수의 NULL 이있으면 Filter Examples 오퍼레이터를 사용해 NULL이 포함된 튜플을 없애거나 평균값으로 대체 할 수있음.
One-Hot Encoding Operator, Numerical to Binomial 오퍼레이터 사용.
감독학습, 연속형데이터의 종속 변수를 예측 하는 기법

잔차 제곱의 합이 최소인 추세선을 회귀선을 선택한다.
y = a + bx
y는 종속변수의 예측 값, a는 절편, b는 회귀계수, x는 설명요인
회귀변수의 성능 평가는 R^2값 이용(1에 가까울 수록 성능 굿)

분류분석 기법, 동질적인 개체를 찾아가는 것을 목표로 함

분류 기준을 너무 많이 만들어 매우 작은 집단이 만ㄴ들어지는 "과적합"하면 안댐!

오퍼레이터, 어떻게 연결되는지 숙지 할 것!
연관규칙분석
연관성 판단기준 : 지지도(Support), 신뢰도(Confidence), 향상도(Lift)

군집분석, K평균군집분석알고리즘을 이용


Normalize : 속성의 단위는 다양하기에 정규화 수행
Clustering : 군집화하는 거임



ClusterModelVisualizerOObject : 클러스터 결과 시각화

특정 클러스터의 결과 보기

각 클러스터의 결과값 한번에 보기
작성중........
한달이 넘게 작성중인 것으로 보아 아주 엄청난 것을 작성중이신 거 같은데 아주 기대가 됩니다!🫥