A/B test & 통계 분석 종류

hyeeun·2025년 2월 8일

bootcamp

목록 보기
3/22
post-thumbnail

1. A/B test

  • A/B test는 두가지 이상의 버전을 비교하여 더 효과적인 옵션을 찾아내는 실험 방법으로, 주로 마케팅, 웹사이트 최적화, 제품 개발 등 다양한 분야에서 사용됨

(1) A/B 테스트의 주요 요소

  • A와 B 버전

    • A : 기존 버전(현재 상태)이나 기본 설정
    • B : 새로운 버전 (변경된 설정, 옵션 등) 또는 실험을 통한 변경사항
  • 목표 : A/B 테스트는 일반적으로 성능 지표(예: 클릭률, 전환율, 사용자 참여도 등)를 기반으로하여 두 가지 버전(A와 B)을 비교하고, 어떤 버전이 더 나은 결과를 도출하는지 분석

  • 무작위 배정 (Randomization) : 실험 참여자를 무작위로 A 또는 B 그룹에 배정

  • 통계적 유의성 : A/B 테스트를 통한 결론은 통계적으로 유의미한지 확인, 신뢰할 수 있는 결과를 얻기 위해 충분한 크기의 sample 필요

(2) A/B 테스트 사례

  • Esty는 검색 결과 페이지의 그리드 UI를 무한 스크롤 방식으로 바꿨지만,
    조회율 / 클릭률 / 장바구니에 담는 비율 / 구매율까지 모두 낮아졌다.

(3) A/B 테스트에서 사용하는 주요 통계 기법

  • t-test: 두 그룹 간 평균 차이가 통계적으로 유의미한지 평가하는 방법

  • p-value: 실험 결과에 대한 유의확률(p-value)를 통해 유의미한지 판단

  • 신뢰구간: 각 버전의 성과 지표가 포함될 가능성이 높은 범위를 제시

(4) AB 테스트의 장단점

  • 장점

    • 직관적이고 실행하기 간단
    • 객관적인 데이터를 바탕으로 의사결정 가능
    • 일부를 대상으로 테스트함으로써 잠재적 리스크 감소
    • 지속적인 최적화 가능
  • 단점

    • 테스트를 설계하고 실행, 분석하는데 상당한 시간과 리소스 필요
    • 한번에 한가지 변수만 테스트할 수 있어, 복잡한 상황에서 테스트 어려움
    • 시즌, 시장변화, 경쟁사 등 외부 요인이 테스트 결과에 영향을 미칠 수 있음


2. 두 모집단의 모평균 차이에 대한 검정

  • 독립된 두 표본을 활용하여 두 모집단의 평균의 차이(u1 -u2)에 대해 추론
    • 추정량 표본의 평균을 이용 (X1X2\overline{X_1} - \overline{X_2})

(1) 모평균차이 μ1μ2\mu_1 - \mu_2에 관한 유의수준 α\alpha의 가설검정

  • 두 모집단이 정규분포이고, 모분산 σ2\sigma^2이 알려지지 않았지만 동일한 경우
    • 검정통계량 (X1X2\overline{X_1} - \overline{X_2})는 귀무가설이 사실일 때,
T=X1X21n1+1n2Sptn1+n22T = \frac{\overline{X}_1 - \overline{X}_2}{\sqrt{\frac{1}{n_1} + \frac{1}{n_2}} \, S_p} \sim t_{n_1 + n_2 - 2}
Sp2=(n11)S12+(n21)S22n1+n22S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2}

  • AB테스트는 동일한 환경에서 독립적으로 수집되는 데이터이므로, 두 모집단의 분산은 알려지지않았으나 동일하다고 가정할 수 있음

  • 실습

AB
표본수88
표본평균14.2519.25
표본분산6.78575.6429
결합분산6.2143
자유도14 (8+8-2)
t-통계량-4.0115= (14.25+19.25)
/ sqrt(6.21*(1/8+1/8))
p-value0.13%= T.DIST.2T(abs(t-통계량),자유도)


3. 통계 분석의 종류

(1) 상관분석(Correlation Analysis)

  • 두 변수 사이의 연관성 분석

  • 상관계수의 유형

    • 피어슨(Pearson) 상관계수 : 연속형의 두 변수들의 상관관계 측정 방식으로 변수가 정규분포를 따른다고 가정할 때 사용, 가장 대표적인 상관계수
    • 스피어만(Spearman) 상관계수 : 정규분포를 심하게 벗어나는 두 변수들의 상관관계를 측정하는 방식으로 순서형 자료의 상관관계를 측정하는 경우에도 이용, 자료의 순위를 이용한 상관계수
    • 켄달(Kendall)의 타우(Tau) : 스피어만 상관계수와 사용목적은 동일하나 계산방식이 다름, 자료의 순위를 이용하여 상관계수를 계산
  • 상관계수의 특성

    • 두 연속형 변수간의 선형적 연관성(linear relation)의 방향 및 강도(strength)를 나타내는 값

    • 상관관계가 있다 하여 두 변수가 인과관계(causal relation)가 있는 것은 아님.

    • 상관계수의 특성

      • 1ρ1-1 \leq \rho \leq 1
      • 0에 가까울 수록 두 변수 사이의 상관은 약함
      • 1에 가까울 수록 강한 비례관계 (한 변수의 값이 증가하면 다른 변수의 값도 증가)-1에 가까울 수록 강한 반비례관계 (한 변수의 값이 증가하면 다른 변수의 값이 감소)

  • 상관계수에 관한 검정
    모상관계수의 추정량인 표본상관계수를 이용하여 모상관계수가 0인지 여부를 판단
    • 가설 :
      • 귀무가설 H0 : 두 변수간에 모상관계수 p = 0이다.
      • 대립가설 H1 : 두 변수간에 모상관계수 p = 0이 아니다.
    • 검정통계량 (xi, yi) i=1,2,...,n 이 주어져 있을 때 피어슨의 표본 상관계수
      r=i=1n(xix)(yiy)i=1n(xix)2i=1n(yiy)2r = \frac{\sum_{i=1}^{n} (x_i - \overline{x})(y_i - \overline{y})}{\sqrt{\sum_{i=1}^{n} (x_i - \overline{x})^2} \cdot \sqrt{\sum_{i=1}^{n} (y_i - \overline{y})^2}}
    • 유의수준 a의 기각역
      • 귀무가설(H0)이 사실인 경우,
        T=rn21r2tn2T = \frac{r \sqrt{n - 2}}{\sqrt{1 - r^2}} \sim t_{n - 2} ,Ttα/2,n2\quad |T| \geq t_{\alpha/2, \, n - 2}이면 H0가 기각
    
profile
hyeeun-techlog

0개의 댓글