01 데이터의 종류
- Numerical
- 수치 값으로 표현되는 데이터
- 연속적: 키, 몸무게 온도 등
- 이산적: 판매 제품 개수, 사람 수 등
- 중앙값, 평균, 표준편차 등 통계적 수치 사용하여 분석 가능
- 시각화: 히스토그램 스캐터 플롯 등
- Categorical
- 명확하게 분류 및 라벨링 될 수 있는 데이터
- 순서가 있는 ordinal: 학력수준 등
- 순서가 없는 nominal: 국적, 색상, 성별 등
- 각 카테고리의 빈도나 비율을 통해 분석
- 평균, 표준편차 등 수치적 통계 X
- 시각화: 바, 파이, 스텍 차트 등
데이터의 종류를 알아야하는 이유
- 분석기법이 달라짐
- 전처리 과정이 다름
- 시각화 방법이 달라짐
02 Metric
-
Metric: 지표
-
Domain metric
-
Ads.
Cost per Aquisition
CTR
ROAS
CTR=광고노출수광고클릭수∗100
ROAS=광고비용광고로인한수익
-
Streaming
DAU
Clicks
Time Spent
Retention
Retention=처음서비스를이용한사용자수특정기간후에도서비스를계속이용하는사용자수∗100
-
Marketing
CAC
NPS
CLTV
Shares
CAC=동기간동안획득한새로운고객수특정기간동안의총마케팅및판매비용
NPS=추천′매우높음′(9,10)응답자비율−추천′낮음′(0−6)응답자비율
CLTV=고객당평균수익∗고객관계평균기간
-
Finance
ROI
CAGR
ROI=투자비용투자로부터의순수익(투자수익−투자비용)∗100
CAGR=초기가치말기가치기간1−1
03 Descriptive statistics
- 분석의 방향성 결정
- 중심 경향성: 자료 전체의 경향
- mean(평균값): 손쉽게 데이터의 경향성 파악. but outlier에 영향을 받는다
- median(중앙값): outlier에 대하여 robust. but 자료의 수가 많아지면 대표성이 사라진다
- mode(최빈값): 숫자로 나타내지 못하는 자료에도 적용 가능. but 자료의 수가 적은 경우 자료 전체의 특징을 반영하지 못할 수도 있음. 중복 발생
- 퍼짐의 척도: 변동성 파악
- residual(오차): 간단히 계산 가능. but 데이터의 퍼진 특성들을 고려하기 어려움
- variance(분산): 자료가 평균에서 얼마나 흩어져 있는지에 대한 대표값으로 사용 가능. but 제곱을 하여 계산하므로 수치가 직관적이지 않음
- standard deviation(표준편차): 자료의 단위와 동일하여 직관적으로 해석하기 용이
- 형태의 척도: 데이터를 다듬어서 모델이 잘 학습할 수 있게 만들기 위한 척도
- skew(왜도): 데이터가 왼쪽이나 오른쪽으로 치우쳐진 정도
- kurtosis(첨도): 데이터의 뾰족함 (높은값은 더 많은 꼬리와 뾰족한 분포를 의미)
- 위치의 척도
- Percentile(백분위수): 전체 데이터 중 특정 백분율이 위치하는 값
ex) 우리 아이는 키 백분위수 95%야 (상위 5%야)
- Quantile(사분위수): 전체 관측값은 작은 순서로 배열했을 때 전체를 사등분 하는 값
ex) 25%, 50%, 75%: 제1사분위수, 제2사분위수, 제3사분위수
04 정규분포와 정규성 검증
- 정규분포인지 알아야하는 이유
- 많은 통계적 방법론과 기법들의 전제가 됨
- 중심극한정리(Central limit theorem): 충분한 양(
n>30)의 데이터 샘플링 시 수집된 데이터는 정규분포를 따른다
- 정규분포 가정을 만족할 때 분석의 정확성을 확보할 수 있음
- 많은 데이터 전처리 과정에서 표준편차를 기반으로 이상치 탐지
- 많은 기계학습 알고리즘은 데이터가 특정 분포를 따른다고 가정함
- A/B 테스트 등 실험 설계 후 결과 해석 시 기본 전제가 됨
- 통계적 추론(Statistical inference)
- 정규성 검정(Normality test): H0(데이터셋이 정규분포를 따른다) vs. H1(데이터셋이 정규분포를 따르지 않는다)
- 샤피로-윌크 검정(Shapiro-Wilk test)
- 클모고로프-스미르노프 검정(Kolmogorov-Smirnov test)
- 엔더슨-달링 검정(Anderson-Darling test)
- QQ-plot(Quantile-quantile plot)
05 상관관계 & 회귀분석
대표 문제 유형
회귀분석
- 목표: 독립변수(x)와 종속변수(y)간의 관계를 모델링하여 주어진 독립변수에 대한 종속변수의 값을 예측하는 것
- 원리: 독립변수(x)와 종속변수(y)간의 관계를 가장 잘 설명하는 선형방정식의 계수를 찾음
- 평가지표(Metric):
- MSE(Mean Squared Error) 예측값과 실제값의 차이를 제곱하여 평균. MSE가 작을 수록 모델의 예측이 더 정확하다고 진단
- RMSE: MSE에 Root씌운 값
- R2(R-squared) 종속변수의 총 변동성 중 모델이 설명할 수 있는 변동성의 비율. 1에 가까울 수록 모델이 데이터를 잘 설명한다고 진단
- 대표 알고리즘: 선형회귀(Linear regression), 다항회귀(Polynomial regression), 릿지회귀(Ridge regression), 라쏘회귀(Lasso regression), 엘라스틱넷(ElasticNet)
이 글은 제로베이스 데이터 분석 취업 스쿨의 강의자료 일부를 발췌하여 작성되었습니다.