통계적 가설검정
통계적 가설(statistical hypothesis) :
모집단의 특성을 수학적으로 표현한 하나의 특정 주장.
한국 성인 남성의 평균 몸무게는 70kg이다는 통계적 가설이 될 수 있지만, 한국 성인 남성의 몸무게는 크지 않다는 통계적 가설이 될 수 없다.
통계적 가설검정 (statistical hypothesis test) : 표본의 정보를 근거로 모집단에 대한 가설이 통계적으로 타당한지 검정하는 과정
가설검정의 절차 (모수적 추론)
- 예시는 모두 표준 정규분포의 평균에 대한 가설검정(Z-test)을 기준으로 작성한다.
1. 귀무가설과 대립가설 설정
귀무가설 (null hypothesis, ) :
(모집단의 평균이 특정 값 과 같다)
대립가설 (alternative hypothesis, ) : 귀무가설과 반대되는 주장으로, 입증되기를 기대하는 가설
양측검정
단측검정
2. 검정통계량 정의
- 귀무가설이 참일 때, 검정통계량이 따를 확률분포를 설정한다.
검정통계량 (test statistic) :
귀무가설이 참이라는 가정하에 표본 데이터를 기반으로 계산된 통계값
표본이 귀무가설 하에서 예상되는 분포를 따르는지 평가하는 역할을 함
Z-통계량 :
귀무가설이 참이라면, 표본평균 는 정규분포를 따를 것이라고 예상할 수 있음
따라서 이를 정규화한 값(Z-통계량)을 계산하여 표준정규분포와 비교하면, 관측한 표본이 귀무가설과의 차이가 통계적으로 유의한지를 판단할 수 있다
3. 유의수준 설정
- 1종 오류를 범할 확률 설정
유의수준 (significance level, ) : 실제로는 참인 귀무가설을 기각할 최대허용한계
인 경우, 총 100번의 실험 중 약 5번은 우연으로 인해 귀무가설을 기각할 가능성이 있다
귀무가설이 참일 때, 5% 확률로 잘못 기각할 수 있음
4-1. 기각역 설정
임계값 (critical value) : 귀무가설의 기각 여부를 결정하는 기준점
유의수준(), 가정한 분포, 검정 방식(양측/단측)에 따라 결정된다
양측검정 :
단측검정 :
기각역 (critical region) : 귀무가설을 기각하는 검정통계량의 범위

양측검정 (two-tailed test) : 대립가설을 과 같이 설정한 경우 양쪽에 기각역을 설정
단측검정 (one-tailed test) : 대립가설을 과 같이 설정한 경우 한쪽 방향에만 기각역을 설정
4-2. p-값 계산
- p-값은 기각역의 개념을 확률(가정한 분포에서 극단값 관측 빈도)로 확장한 개념이다.
검정통계량()보다 극단적인 값을 관측할 확률
귀무가설의 신뢰구간을 벗어나는 확률
귀무가설을 지지하는 통계적 증거의 양이라고 표현 할 수 있다
양측검정 :
왼쪽 단측검정 :
오른쪽 단측검정 :

예시 : 검정통계량()이 인 경우 p-value 계산 (위 표준정규분포표 기준)
이므로, , 즉 이다
양측검정이므로 , 즉 이다
5. 통계적 의사결정
- 일반적으로 p-value를 기준으로 의사결정을 진행한다
기각역 방식 (단순 비교)
검정통계량이 기각역에 포함되면 귀무가설을 기각함
검정통계량이 기각역에 포함되지 않으면 귀무가설을 기각하지 않는다
p-value 방식 :
: 귀무가설을 기각하지 않는다
=> 표본이 귀무가설을 기각할 만큼 충분한 증거를 제공하지 않는다.
: 귀무가설을 기각하고, 대립가설을 채택한다.
=> 표본이 대립가설을 지지할 충분한 증거가 있다.
p-value 해석의 한계
p-value는 특정 가설이 참일 확률을 의미하지 않는다
따라서, 가설검정 결과를 해석할 때는 p-value뿐만 아니라 다른 요소들도 함께 고려해야 한다.
| 항목 | 설명 |
|---|---|
| 검정통계량 (Test Statistic) | 검정통계량의 크기가 극단적으로 클 경우, 표본 크기나 이상치 문제를 확인해야 함. |
| 신뢰 구간 (Confidence Intervals) | p-value는 유의수준과 비교하여 결과를 판단하지만, 신뢰구간은 "실제 차이가 어느 정도 범위 내에 존재할 가능성이 있는지"를 알려줌. |
| 베이지안 방법 (Bayesian Methods) | 귀무가설과 대립가설이 각각 실제로 참일 확률을 평가하는 방법 (credible intervals, Bayes Factor). |
| 우도비 (Likelihood Ratios) | 귀무가설과 대립가설이 각각 데이터를 설명하는 상대적인 강도를 평가. |
| 허위 발견율 (False Discovery Rates, FDR) | 여러 가설을 동시에 검정할 경우 Bonferroni 보정, Benjamini-Hochberg 방법 등을 적용하여 다중 검정 오류를 보정. |
가설검정의 오류
| 의사결정/의 진위 | 가 실제로 참인 경우 | 가 실제로 거짓인 경우 |
|---|---|---|
| 채택 | 옳은 결정 | 제2종 오류() |
| 기각 | 제1종 오류() | 옳은 결정 |
제1종 오류 (Type I Error): 실제로는 참인 귀무가설을 기각하는 오류.
제1종 오류를 범할 확률의 최대허용한계가 유의수준과 동일한 개념이다.
제1종 오류를 줄이기 위해 유의수준을 낮추면, 특정 상황에서 제2종 오류가 늘어날 수 있다
제2종 오류 (Type II Error): 실제로는 거짓인 귀무가설을 채택하는 오류
검정력 (Statistical Power, ) : 대립가설이 참일 때 이를 올바르게 검출하는 확률. 주어진 유의수준 하에서 검정력은 가능한 크게 유지하는 것이 좋다.
현실적인 관점에서 를 결정짓는 값들을 조정하여 검정력을 높일 수 있을까?
유의수준 (X) : 유의수준을 높게 설정할수록 값은 작아지고, 검정력이 높아진다. 하지만 제1종 오류가 제2종 오류보다 중요하게 여겨지는 경우가 많아 실무에서는 유의수준을 높이는 것이 적절하지 않다.
표본크기 (O) : 표본크기가 커질수록 값은 작아지고, 검정력이 높아진다. 실무에서는 이미 수집된 데이터로 가설검정을 수행하는 경우가 많아, 표본 크기를 쉽게 늘릴 수 없는 경우가 대부분이다. 그러나 데이터 결합, 오버샘플링, 부트스트래핑과 같은 기법을 활용하여 표본 크기를 실질적으로 늘리는 방법이 일부 존재한다.
검정방법 (O) : 검정방법에 따라 를 계산하는 방식이 바뀐다. 따라서, 동일한 데이터에 대해 여러 검정 방법을 비교할 수 있으며, 검정력이 가장 높은 방법을 선택할 수 있다.