
Q1) A/B 테스트의 장점과 단점, 그리고 단점을 해결하기 위한 방안들을 설명해 주세요.
1) 인과관계 확인 가능⭐
2) 데이터 기반 의사결정
3) 실제 사용자 행동 기반
4) 작은 리스크로 실험 가능
1) 시간이 오래 걸림
문제
해결 방법
2) 트래픽 부족 문제
문제
해결 방법
3) 외부 요인 영향
문제
해결 방법
4) 잘못된 설계(실험 오류)
5) 단기 지표에 치우침
6) 윤리/사용자 경험 문제
7) 결과 해석 오류
👑 Guardiral Metric
A/B 테스트는 인과관계를 검증하고 데이터 기반 의사결정을 가능하게 한다는 장점이 있음
But, 시간과 트래픽이 많이 필요하고, 외부 요인이나 잘못된 설계로 인해 오류 발생 가능성 있음
이를 해결하기 위해, 사전 샘플 사이즈 계산, 랜덤 분배, Guardrail metric 설정, 그리고 장기 지표를 함께 고려하는 것이 중요!!!
A/B 테스트 = 강력하지만, 설계와 해석이 전부다!!!
Q2) A/B 테스트 결과에서 한 버전이 통계적으로 유의미하게 더 나은 결과를 보여주지 않는다면, 이를 어떻게 해석하고 다음 단계는 무엇인가요?
"차이가 없다" ❌
"차이가 있다고 말할 충분한 증거가 없다" ✅
❌ 잘못된 해석
✅ 올바른 해석
1) 샘플 사이즈 충분한가?
2) 효과 크기 (effect size)
3) 신뢰구간 (Confidence Interval)
4) 실험 기간 충분한가?
5) Guardrail 지표 확인
1) CASE 1: 샘플 부족 / 파워 부족
2) CASE 2: 효과가 너무 작음
3) CASE 3: 가설 자체가 약함
4) CASE 4: 특정 세그먼트에서만 효과 있음
5) CASE 5: 다른 지표에서 영향 발견
통계적으로 유의미하지 않다는 것은 두 버전 간 차이가 없다는 의미가 아니라,
차이가 있다고 판단할 충분할 증거가 없다는 의미
따라서, 샘플 사이즈, 효과 크기, 신뢰구간 등을 확인하고,
필요하다면 실험을 연장하거나 세그먼트 분석을 통해 특정 그룹에서의 효과를 추가로 분석
이후에는 가설을 보완하거나 더 큰 변화를 적용한 새로운 실험 설계
유의미하지 않음 = 실패가 아니라, 다음 실험을 위한 정보
😎