데이터마이닝은 방대한 양의 데이터로부터 유용한 정보를 추출하는 프로세스를 뜻한다. 기업은 경영 활동에 필요한 다양한 의사결정을 진행할 때, 데이터마이닝 과정을 사용한다.
데이터 마이닝 표준 처리 과정(CRISP-DM, Cross Industry Standard Process for Data Mining)은 비즈니스 이해(Business Understanding), 데이터 이해(Data Understanding), 데이터 준비(Data Preparation), 모형(Modeling), 평가(Evaluation), 적용(Deployment)의 6단계로 구성되어 있다.


기계학습(Machine Learning)은 일반적으로 지도학습(Supervised Learning)과 비지도학습(Unsupervised Learning) 방법으로 나뉜다. 이 둘은, 데이터의 출력
: 입력 데이터(X data)와 그에 대한 출력 데이터(Y data)가 함께 제공되고 모델은 이를 기반으로 입력 데이터를 데이터로 반환하는 것. 즉, 정답이 있는 데이터를 활용해 데이터를 학습시키는 것을 의미한다.
모델에 입력 값(X data)이 주어지면 입력값에 대한 Label(Y data)를 제공해 학습시키며, 모델은 입력 데이터와 출력 사이 데이터의 관계를 이해하고, 새로운 입력 데이터에 대해 적절한 예측을 할 수 있도록 학습이 진행된다
ex) 스팸 필터링, 의료진단, 언어번역
: 주어진 데이터를 정해진 카테고리(라벨)에 따라 분류하는 문제
EX. 이진 분류 문제 : 맞다, 아니다 의 이진분류
다중 분류 문제 : 사과다 바나나다 포도다 등의 2가지 이상의 다중분류
: 어떤 데이터들의 Feature를 기준으로, 연속된 값(그래프)을 예측하는 문제
Ex. 패턴 트렌드, 경향 예측
*타겟변수
타켓변수(Target Variable)는 지도학습(Supervised Learning)인 분류, 회귀 문제에서 데이터 출력(정답)을 의미한다. 모델은 입력된 데이터와 근거리 활용 관계를 학습하여 새로운 입력 데이터에 대한 타켓변수 값을 예측한다.
* Feature

머신러닝은 어떤 데이터를 분류하거나, 값을 예측(회귀)하는 것이다. 데이터의 값을 잘 예측하기 위한 데이터의 특징들을 머신러닝/딥러닝에서는 "Feature"라고 부르며, 지도, 비지도, 강화학습 모두 적절한 feature를 잘 정의하는 것이 핵심이다. 엑셀에서 attribute(column)라고 불려지던 것을 머신러닝에서는 통계학의 영향으로 feature라고 부른다.
: 지도 학습과는 달리 정답 라벨이 없는 데이터를 비슷한 특징끼리 군집화 하여 새로운 데이터에 대한 결과를 예측하는 방법을 뜻한다. 라벨링 되어있지 않은 데이터로부터 패턴이나 형태를 찾아야 한다. 지도 학습에서 적절한 Feature를 찾아내기 위한 전처리 방법으로 비지도 학습을 이용하기도 한다.
비지도학습이라는 용어는 정답이 없는 데이터를 이용한 학습 전체를 포괄하는 용어이기 때문에 클러스터링 외에도 차원 축소(dimensionality reduction) 및 이를 이용한 데이터 시각화, 생성 모델(generative model) 등 다양한 task를 포괄하는 개념이다.
Ex. 이미지 분류, 제조 공정 품질 관리, 소비자 행동 분석
: 주어진 데이터의 속성값들을 고려해 유사한 개체끼리 그룹화
: 다차원의 데이터셋을 차원 축소하여 새로원 차원의 데이터셋을 생성
: 어떤 항목이 어떤 항목을 동반하여 등장하는지 연관성에 대한 규칙
2-2) Dimentionality Reduction
2-3) Hidden Markov Model
2-4) GAN(generative Adversarial Network)
: 주어진 입력에 대응하는 행동을 취하는 시스템에 대해 보상이 주어지게되며,
이러한 보상을 이용하여 학습시키는 것을 의미한다.
과적합 over-fitting : 모형이 trainind data를 과하게 학습하여, 학습 데이터에 대해서는 높은 정확도를 나타내지만 test data 혹은 다른 데이터에 적용할 때는 성능이 떨어지는 현상
과소적합(Underfitting) : 모형이 너무 단순하여 데이터 속에 내제되어 있는 패턴이나 규칙을 제대로 학습하지 못 하는 경우

범주형 데이터 (Categorical Variable):
수치형 데이터 (Numerical Variables):
탐색적 데이터 분석(Exploratory Data Analysis, EDA)는 데이터를 이해하고 탐색하기 위해 시각화 기법을 사용하는 과정으로, 데이터를 다각도에서 직관적으로 해석함으로써 사용할 데이터와 그 인과관계를 정리한다.
EDA를 진행하는 이유는 데이터의 분포(distribution) 및 값(value)을 여러 각도에서 관찰해보면서 데이터의 전체적인 양상과 보이지 않던 현상을 더 잘 이해할 수 있도록 해주기 때문이다. 또한, 데이터 준비 단계에서 미쳐 파악하지 못한 잠재적인 문제들을 발견하거나, 다양한 패턴을 발견하도록 도와줄 수 있다. 데이터에 대한 이러한 관찰과 지식들은 이후에 통계적 추론이나 예측 모델을 구축할 때에도 그대로 사용되기 때문에 굉장히 중요하고, 필수불가결한 과정이라고 봐야한다.
EDA는 한번에 완벽하게 특정한 결론을 도출하는 것이 아니라 반복적이고, 으로 데이터를 시각화 및 변환하는 체계적인 방법이다. 차트 혹은 그림 등을 이용하여 데이터를 확인하는 시각화(Graphic), 그래픽적인 요소를 사용하지 않고 Summary Statistics을 통해 확인하는 비시각화(Non-Graphic)로 나눌 수 있다.
graphic한 EDA는 그래프를 통해 데이터를 한눈에 파악해야 할 때, non-graphic한 EDA는 정확한 값을 구할 때 사용한다.
변수변환(variable transformation) : 데이터 모델링에서 함수에 의한 변수 치환을 나타낸다. 변수변환은 일반적으로 변수의 스케일을 변화시키거나 더 나은 이해를 위해 변수의 값을 표준화(standardize)하거나 복잡한 비선형 관계를 선형 관계로 변환할 때 사용된다.
변수는 로그(Logarithm), 제공/세제곱 루트, Binning(범주화)로 변환된다.
계급 불균형 자료(Imbalanced data) : 정상 범주의 관측치 수와 이상 범주의 관측치 수가 현저히 차이나는 데이터
문제점 : 불균형한 데이터 세트는 이상 데이터를 정확히 찾아내지 못할 수 있다는 문제점이 존재
해결방안 : undersampling & oversampling
framingham data set을 이용하여 데이터 탐색을 진행
Referance
https://kharshit.github.io/blog/2019/09/20/evaluation-metrics-for-object-detection-and-segmentation
https://ebbnflow.tistory.com/165
https://velog.io/@jhlee508/머신러닝-K-평균K-Means-알고리즘