
A와 B 버전
목표 : A/B 테스트는 일반적으로 성능 지표(예: 클릭률, 전환율, 사용자 참여도 등)를 기반으로하여 두 가지 버전(A와 B)을 비교하고, 어떤 버전이 더 나은 결과를 도출하는지 분석
무작위 배정 (Randomization) : 실험 참여자를 무작위로 A 또는 B 그룹에 배정
통계적 유의성 : A/B 테스트를 통한 결론은 통계적으로 유의미한지 확인, 신뢰할 수 있는 결과를 얻기 위해 충분한 크기의 sample 필요

t-test: 두 그룹 간 평균 차이가 통계적으로 유의미한지 평가하는 방법
p-value: 실험 결과에 대한 유의확률(p-value)를 통해 유의미한지 판단
신뢰구간: 각 버전의 성과 지표가 포함될 가능성이 높은 범위를 제시
장점
단점


AB테스트는 동일한 환경에서 독립적으로 수집되는 데이터이므로, 두 모집단의 분산은 알려지지않았으나 동일하다고 가정할 수 있음
실습
| A | B | |
|---|---|---|
| 표본수 | 8 | 8 |
| 표본평균 | 14.25 | 19.25 |
| 표본분산 | 6.7857 | 5.6429 |
| 결합분산 | 6.2143 | |
| 자유도 | 14 (8+8-2) | |
| t-통계량 | -4.0115 | = (14.25+19.25) |
| / sqrt(6.21*(1/8+1/8)) | ||
| p-value | 0.13% | = T.DIST.2T(abs(t-통계량),자유도) |
두 변수 사이의 연관성 분석
상관계수의 유형
상관계수의 특성
두 연속형 변수간의 선형적 연관성(linear relation)의 방향 및 강도(strength)를 나타내는 값
상관관계가 있다 하여 두 변수가 인과관계(causal relation)가 있는 것은 아님.
상관계수의 특성
