[머신러닝] 데이터마이닝

SEUNGHYEON·2023년 9월 12일

Machine Learning

목록 보기
1/9

데이터마이닝 프로세스란?

데이터마이닝은 방대한 양의 데이터로부터 유용한 정보를 추출하는 프로세스를 뜻한다. 기업은 경영 활동에 필요한 다양한 의사결정을 진행할 때, 데이터마이닝 과정을 사용한다.

데이터 마이닝 표준 처리 과정(CRISP-DM, Cross Industry Standard Process for Data Mining)은 비즈니스 이해(Business Understanding), 데이터 이해(Data Understanding), 데이터 준비(Data Preparation), 모형(Modeling), 평가(Evaluation), 적용(Deployment)의 6단계로 구성되어 있다.

머신러닝 Machine Learning : ML

  • 경험을 통해 데이터를 기반으로 학습하고 예측하는 시스템으로,이를 구현하기 위해 알고리즘을 연구하고 구축하는 기술
  • 프로그래머가 명시적으로 코딩하지 않고 자기 개선과 예제를 통해 학습할 수 있는 시스템
  • 입력과 출력 데이터의 상관관계를 학습하여 규칙을 생성

기계학습(Machine Learning)은 일반적으로 지도학습(Supervised Learning)비지도학습(Unsupervised Learning) 방법으로 나뉜다. 이 둘은, 데이터의 출력

지도학습

: 입력 데이터(X data)와 그에 대한 출력 데이터(Y data)가 함께 제공되고 모델은 이를 기반으로 입력 데이터를 데이터로 반환하는 것. 즉, 정답이 있는 데이터를 활용해 데이터를 학습시키는 것을 의미한다.

모델에 입력 값(X data)이 주어지면 입력값에 대한 Label(Y data)를 제공해 학습시키며, 모델은 입력 데이터와 출력 사이 데이터의 관계를 이해하고, 새로운 입력 데이터에 대해 적절한 예측을 할 수 있도록 학습이 진행된다

  • 분류, 회귀

ex) 스팸 필터링, 의료진단, 언어번역

1-1) 분류(Classification)

: 주어진 데이터를 정해진 카테고리(라벨)에 따라 분류하는 문제

EX. 이진 분류 문제 : 맞다, 아니다 의 이진분류

다중 분류 문제 : 사과다 바나나다 포도다 등의 2가지 이상의 다중분류

2-2) 회귀(Regression)

: 어떤 데이터들의 Feature를 기준으로, 연속된 값(그래프)을 예측하는 문제

Ex. 패턴 트렌드, 경향 예측

*타겟변수

타켓변수(Target Variable)는 지도학습(Supervised Learning)인 분류, 회귀 문제에서 데이터 출력(정답)을 의미한다. 모델은 입력된 데이터와 근거리 활용 관계를 학습하여 새로운 입력 데이터에 대한 타켓변수 값을 예측한다.

* Feature

머신러닝은 어떤 데이터를 분류하거나, 값을 예측(회귀)하는 것이다. 데이터의 값을 잘 예측하기 위한 데이터의 특징들을 머신러닝/딥러닝에서는 "Feature"라고 부르며, 지도, 비지도, 강화학습 모두 적절한 feature를 잘 정의하는 것이 핵심이다. 엑셀에서 attribute(column)라고 불려지던 것을 머신러닝에서는 통계학의 영향으로 feature라고 부른다.

비지도학습(Unsupervised Learning)

: 지도 학습과는 달리 정답 라벨이 없는 데이터를 비슷한 특징끼리 군집화 하여 새로운 데이터에 대한 결과를 예측하는 방법을 뜻한다. 라벨링 되어있지 않은 데이터로부터 패턴이나 형태를 찾아야 한다. 지도 학습에서 적절한 Feature를 찾아내기 위한 전처리 방법으로 비지도 학습을 이용하기도 한다.

비지도학습이라는 용어는 정답이 없는 데이터를 이용한 학습 전체를 포괄하는 용어이기 때문에 클러스터링 외에도 차원 축소(dimensionality reduction) 및 이를 이용한 데이터 시각화, 생성 모델(generative model) 등 다양한 task를 포괄하는 개념이다.

Ex. 이미지 분류, 제조 공정 품질 관리, 소비자 행동 분석

비지도 학습

2-1) 군집화(Clustering)

: 주어진 데이터의 속성값들을 고려해 유사한 개체끼리 그룹화

  • K-means K-means 알고리즘은 k 값이 주어져 있을 때, 주어진 데이터들을 k 개의 클러스터로 묶는 알고리즘으로 대표적인 클러스터링 기법 K-means
  • 군집(cluster)의 타당성 평가 비지도 학습에 사용되는 데이터에는 레이블(label)이 없으므로, 지도 학습처럼 단순정확도(accuracy)를 지표로 그 정확도를 평가할 수는 없다. 군집을 만든 결과가 얼마만큼 타당한지는 군집간의 거리, 군집의 지름, 군집의 분산도 등을 종합적으로 고려하여 확인한다.. 따라서 일반적으로 군집 간 분산(inter-cluster variance)이 최대가 되고 군집 내 분산(inner-cluster variance)이 최소가 될 때 최적의 군집 모양과 개수라고 판단한다.
  • 추천 시스템 ( Recommender System )

2-2) 변환 / 차원축소(Dimentionality Reduction)

: 다차원의 데이터셋을 차원 축소하여 새로원 차원의 데이터셋을 생성

2-3) 연관규칙

: 어떤 항목이 어떤 항목을 동반하여 등장하는지 연관성에 대한 규칙

2-2) Dimentionality Reduction

2-3) Hidden Markov Model

2-4) GAN(generative Adversarial Network)

  • Semi-Supervised Learning : 지도 학습과 비지도 학습을 함께 사용할 수도 있다.

강화학습(Reinforcement learning)

: 주어진 입력에 대응하는 행동을 취하는 시스템에 대해 보상이 주어지게되며,

이러한 보상을 이용하여 학습시키는 것을 의미한다.

베이즈의 정리

과적합(과대적합)에 대하여 조사하기

과적합 over-fitting : 모형이 trainind data를 과하게 학습하여, 학습 데이터에 대해서는 높은 정확도를 나타내지만 test data 혹은 다른 데이터에 적용할 때는 성능이 떨어지는 현상

과소적합(Underfitting) : 모형이 너무 단순하여 데이터 속에 내제되어 있는 패턴이나 규칙을 제대로 학습하지 못 하는 경우

변수 TYPE

범주형 데이터 (Categorical Variable):

  • 명목형 데이터 : 범주 또는 범주로 분류되는 데이터
  • 순서형 데이터 : 순서(상대적인 순위)를 지정할 수 있는 데이터

수치형 데이터 (Numerical Variables):

  • 이산형 데이터 : 불연속적 데이터 (신입생 수, 주차장 잔여수)
  • 연속형 데이터 : 연속적 데이터 (길이, 무게, 부피, 온도 등)

EDA(데이터 시각화)

탐색적 데이터 분석(Exploratory Data Analysis, EDA)는 데이터를 이해하고 탐색하기 위해 시각화 기법을 사용하는 과정으로, 데이터를 다각도에서 직관적으로 해석함으로써 사용할 데이터와 그 인과관계를 정리한다.

EDA를 진행하는 이유는 데이터의 분포(distribution) 및 값(value)을 여러 각도에서 관찰해보면서 데이터의 전체적인 양상과 보이지 않던 현상을 더 잘 이해할 수 있도록 해주기 때문이다. 또한, 데이터 준비 단계에서 미쳐 파악하지 못한 잠재적인 문제들을 발견하거나, 다양한 패턴을 발견하도록 도와줄 수 있다. 데이터에 대한 이러한 관찰과 지식들은 이후에 통계적 추론이나 예측 모델을 구축할 때에도 그대로 사용되기 때문에 굉장히 중요하고, 필수불가결한 과정이라고 봐야한다.

EDA는 한번에 완벽하게 특정한 결론을 도출하는 것이 아니라 반복적이고, 으로 데이터를 시각화 및 변환하는 체계적인 방법이다. 차트 혹은 그림 등을 이용하여 데이터를 확인하는 시각화(Graphic), 그래픽적인 요소를 사용하지 않고 Summary Statistics을 통해 확인하는 비시각화(Non-Graphic)로 나눌 수 있다.

graphic한 EDA는 그래프를 통해 데이터를 한눈에 파악해야 할 때, non-graphic한 EDA는 정확한 값을 구할 때 사용한다.

변수변환의 필요성과 방법

변수변환(variable transformation) : 데이터 모델링에서 함수에 의한 변수 치환을 나타낸다. 변수변환은 일반적으로 변수의 스케일을 변화시키거나 더 나은 이해를 위해 변수의 값을 표준화(standardize)하거나 복잡한 비선형 관계를 선형 관계로 변환할 때 사용된다.

변수는 로그(Logarithm), 제공/세제곱 루트, Binning(범주화)로 변환된다.

계급 불균형 자료(Imbalanced data) 및 해결법에 대하여 조사 - (정확도의 역설)

계급 불균형 자료(Imbalanced data) : 정상 범주의 관측치 수와 이상 범주의 관측치 수가 현저히 차이나는 데이터

문제점 : 불균형한 데이터 세트는 이상 데이터를 정확히 찾아내지 못할 수 있다는 문제점이 존재

해결방안 : undersampling & oversampling

  • undersampling : 다수 범주의 데이터를 소수 범주의 데이터 수에 맞게 줄이는 방법 다수 범주 데이터의 제거로 계산시간이 감소하지만, 데이터 제거로 인한 정보 손실이 발생할 수 있다. ex. Tomek Links, CNN Rule, One Sided Selection
  • oversampling : 소수 범주의 데이터를 다수 범주의 데이터 수에 맞게 늘리는 방법 데이터를 증가시키기 때문에 정보 손실이 없고, 대부분 undersampling 에 비해 높은 분류 정확도를 보인다. 하지만, 데이터 증가로 인해 계산 시간이 증가할 수 있으며 과적합 가능성이 존재하며, 노이즈나 이상치에 민감하다 ex. Resampling, SMOTE, Borderline SMOTE, ADASYN, GAN

framingham data set을 이용하여 데이터 탐색을 진행


Referance

https://kharshit.github.io/blog/2019/09/20/evaluation-metrics-for-object-detection-and-segmentation

https://ebbnflow.tistory.com/165

https://velog.io/@jhlee508/머신러닝-K-평균K-Means-알고리즘

https://pozalabs.github.io/Dataset_Splitting/

https://velog.io/@bi-sz/8장-머신러닝의-학습과-분류

profile
AI, ML, DL

0개의 댓글