스터디노트 5월 24일

Jenny·2024년 5월 26일

01 데이터의 종류

  • Numerical
    • 수치 값으로 표현되는 데이터
    • 연속적: 키, 몸무게 온도 등
    • 이산적: 판매 제품 개수, 사람 수 등
    • 중앙값, 평균, 표준편차 등 통계적 수치 사용하여 분석 가능
    • 시각화: 히스토그램 스캐터 플롯 등
  • Categorical
    • 명확하게 분류 및 라벨링 될 수 있는 데이터
    • 순서가 있는 ordinal: 학력수준 등
    • 순서가 없는 nominal: 국적, 색상, 성별 등
    • 각 카테고리의 빈도나 비율을 통해 분석
    • 평균, 표준편차 등 수치적 통계 X
    • 시각화: 바, 파이, 스텍 차트 등

데이터의 종류를 알아야하는 이유

  • 분석기법이 달라짐
  • 전처리 과정이 다름
  • 시각화 방법이 달라짐

02 Metric

  • Metric: 지표

  • Domain metric

  • Ads.
    Cost per Aquisition
    CTR
    ROAS

    CTR=광고클릭수광고노출수100CTR = {광고 클릭 수 \over광고 노출 수} * 100%
    ROAS=광고로인한수익광고비용ROAS = {광고로 인한 수익 \over 광고 비용}
  • Streaming
    DAU
    Clicks
    Time Spent
    Retention

    Retention=특정기간후에도서비스를계속이용하는사용자수처음서비스를이용한사용자수100Retention = {특정 기간 후에도 서비스를 계속 이용하는 사용자수 \over 처음 서비스를 이용한 사용자수} * 100%
  • Marketing
    CAC
    NPS
    CLTV
    Shares

    CAC=특정기간동안의총마케팅및판매비용동기간동안획득한새로운고객수CAC = {특정 기간 동안의 총 마케팅 및 판매 비용 \over 동기간 동안 획득한 새로운 고객 수}
    NPS=매우높(9,10)응답자비율(06)응답자비율NPS = 추천 '매우높음'(9,10) 응답자 비율 - 추천 '낮음'(0-6) 응답자 비율
    CLTV=고객당평균수익고객관계평균기간CLTV = 고객 당 평균 수익 * 고객 관계 평균 기간
  • Finance
    ROI
    CAGR

    ROI=투자로부터의순수익(투자수익투자비용)투자비용100ROI = {투자로부터의 순수익 (투자수익-투자비용) \over 투자비용} * 100%
    CAGR=말기가치초기가치1기간1CAGR = {말기 가치 \over 초기 가치}^{1\over 기간} -1

03 Descriptive statistics

  • 분석의 방향성 결정
    • 중심 경향성: 자료 전체의 경향
      • mean(평균값): 손쉽게 데이터의 경향성 파악. but outlier에 영향을 받는다
      • median(중앙값): outlier에 대하여 robust. but 자료의 수가 많아지면 대표성이 사라진다
      • mode(최빈값): 숫자로 나타내지 못하는 자료에도 적용 가능. but 자료의 수가 적은 경우 자료 전체의 특징을 반영하지 못할 수도 있음. 중복 발생
    • 퍼짐의 척도: 변동성 파악
      • residual(오차): 간단히 계산 가능. but 데이터의 퍼진 특성들을 고려하기 어려움
      • variance(분산): 자료가 평균에서 얼마나 흩어져 있는지에 대한 대표값으로 사용 가능. but 제곱을 하여 계산하므로 수치가 직관적이지 않음
      • standard deviation(표준편차): 자료의 단위와 동일하여 직관적으로 해석하기 용이
    • 형태의 척도: 데이터를 다듬어서 모델이 잘 학습할 수 있게 만들기 위한 척도
      • skew(왜도): 데이터가 왼쪽이나 오른쪽으로 치우쳐진 정도
      • kurtosis(첨도): 데이터의 뾰족함 (높은값은 더 많은 꼬리와 뾰족한 분포를 의미)
    • 위치의 척도
      • Percentile(백분위수): 전체 데이터 중 특정 백분율이 위치하는 값
        ex) 우리 아이는 키 백분위수 95%야 (상위 5%야)
      • Quantile(사분위수): 전체 관측값은 작은 순서로 배열했을 때 전체를 사등분 하는 값
        ex) 25%, 50%, 75%: 제1사분위수, 제2사분위수, 제3사분위수

04 정규분포와 정규성 검증

  • 정규분포인지 알아야하는 이유
    • 많은 통계적 방법론과 기법들의 전제가 됨
    • 중심극한정리(Central limit theorem): 충분한 양(n>30)의 데이터 샘플링 시 수집된 데이터는 정규분포를 따른다
    • 정규분포 가정을 만족할 때 분석의 정확성을 확보할 수 있음
    • 많은 데이터 전처리 과정에서 표준편차를 기반으로 이상치 탐지
    • 많은 기계학습 알고리즘은 데이터가 특정 분포를 따른다고 가정함
    • A/B 테스트 등 실험 설계 후 결과 해석 시 기본 전제가 됨
  • 통계적 추론(Statistical inference)
  • 정규성 검정(Normality test): H0(데이터셋이 정규분포를 따른다) vs. H1(데이터셋이 정규분포를 따르지 않는다)
    • 샤피로-윌크 검정(Shapiro-Wilk test)
    • 클모고로프-스미르노프 검정(Kolmogorov-Smirnov test)
    • 엔더슨-달링 검정(Anderson-Darling test)
    • QQ-plot(Quantile-quantile plot)

05 상관관계 & 회귀분석

  • 상관관계분석: 연속형 변수로 측정된 두 변수 간의 선형적 관계를 분석하는 것
    -> A 변수가 증가함에 따라 B변수도 증가/감소 되는지 분석하고 그 선형정도를 나타내기 위해 상관계수(correlation coefficient)를 사용

    • 선형관계를 갖는가

    • 선형관계를 갖는다면 어느 방향인가

    • 그 관계는 얼마나 큰가

      피어슨 상관계수 (Pearson correlation coefficient): 1은 완벽한 양의 선형관계, -1은 완벽한 음의 상관관계

대표 문제 유형

  • 회귀
  • 분류
  • 군집
  • 이상탐지

회귀분석

  • 목표: 독립변수(x)와 종속변수(y)간의 관계를 모델링하여 주어진 독립변수에 대한 종속변수의 값을 예측하는 것
  • 원리: 독립변수(x)와 종속변수(y)간의 관계를 가장 잘 설명하는 선형방정식의 계수를 찾음
  • 평가지표(Metric):
    • MSE(Mean Squared Error) 예측값과 실제값의 차이를 제곱하여 평균. MSE가 작을 수록 모델의 예측이 더 정확하다고 진단
    • RMSE: MSE에 Root씌운 값
    • R2(R-squared) 종속변수의 총 변동성 중 모델이 설명할 수 있는 변동성의 비율. 1에 가까울 수록 모델이 데이터를 잘 설명한다고 진단
  • 대표 알고리즘: 선형회귀(Linear regression), 다항회귀(Polynomial regression), 릿지회귀(Ridge regression), 라쏘회귀(Lasso regression), 엘라스틱넷(ElasticNet)

이 글은 제로베이스 데이터 분석 취업 스쿨의 강의자료 일부를 발췌하여 작성되었습니다.

profile
I like to movie movie

0개의 댓글