CRISP-DM
- Cross-Industry Standard Process for Data Mining
- 데이터 마이닝을 위해 만들어진 분석방법론
데이터 마이닝
- 대규모로 저장된 데이터안에서 체계적이고 자동적으로 통계적규칙이나 짜임을 분석하여, 가치있는 정보를 빼내는 과정
1. Business Understanding
- 비즈니스 문제를 정의한다.
- 데이터의 분석 방향과 프로젝트 목표를 설정한다.
- 초기 가설을 수립한다.
귀무가설
대립가설
- 새로운 가설
- (우리가 맞다고 확인하고 싶은 가설)
우리는 표본을 가지고 가설검증을 함으로써, 모집단에 대한 가설의 타당성을 확인한다.
Feature (독립변수) & Target (종속변수)
feature에 따라 target이 어떻게 달라질 것이다 / 관계가 있을 것이다 라고 가설을 세우게 된다.
2. Data Understanding
원본 식별
- 현재 보유 중인 데이터 중 바로 바로 사용 가능한 데이터와 가공이 필요한 데이터를 확인한다.
- 보유하고 있지 않은 데이터 중 취득하여 사용할 수 있는 데이터와 취득할 수 없는 데이터를 확인한다.
- 보유하고 있지 않은 데이터 중 취득할 수 있는 데이터까지 가용한 데이터이다.
데이터 전처리
- 여러 가지 데이터셋 등 Raw Data를 하나의 데이터 구조로 만든다.
- EDA와 CDA를 진행하기 위한 데이터 구조(데이터프레임)를 만든다.
EDA (탐색적 데이터 분석)
- Exploratory Data Analysis
- 개별 데이터의 분포와 결측치/이상치를 파악한다.
CDA (확증적 데이터 분석)
- Confirmatory Data Analysis
- 통계적 분석을 사용하여 가설을 검증한다.
3. Data Preparation
데이터 전처리
- 모델링을 위해 데이터를 전처리한다.
- 결측치 제거
- object 자료형을 숫자로 변경
- (선택) 값의 범위를 일치시킨다.
4. Modeling
- 중요 변수 선정
- 모델을 생성하고 성능을 검증한다.
모델링
5. Evaluation
6. Deployment
데이터의 종류
모든 유형의 데이터를 분석할 수 있는 것은 아니며, 분석하고 모델링할 수 있는 데이터의 종류가 정해져있다.
정보 : 변수, 열
분석단위 : 관측치, 행

이미지 출처 : 에이블런
범주형
- 정성적, 질적 데이터
- 숫자로 측정하고 크기를 비교하는 것이 불가능하다.
명목형
순서형
- 연령대, 고객등급, 학점 등 특정 구간으로 나누어져 있는 데이터
수치형
- 정량적, 양적 데이터
- 숫자로 측정하고 크기를 비교하는 것이 가능하다.
이산형
- 나이, 횟수 등 숫자로 측정 가능한 이산적 데이터
연속형
- 온도, 몸무게 등 연속적인 숫자로 나타나는 데이터