가설검정의 개념

한상우·2024년 9월 12일

기초 통계학

목록 보기
8/15

통계적 가설검정

  • 통계적 가설(statistical hypothesis) :

    • 모집단의 특성을 수학적으로 표현한 하나의 특정 주장.

    • 한국 성인 남성의 평균 몸무게는 70kg이다는 통계적 가설이 될 수 있지만, 한국 성인 남성의 몸무게는 크지 않다는 통계적 가설이 될 수 없다.

  • 통계적 가설검정 (statistical hypothesis test) : 표본의 정보를 근거로 모집단에 대한 가설이 통계적으로 타당한지 검정하는 과정

가설검정의 절차 (모수적 추론)

  • 예시는 모두 표준 정규분포의 평균에 대한 가설검정(Z-test)을 기준으로 작성한다.

1. 귀무가설과 대립가설 설정

  • 귀무가설 (null hypothesis, H0H_0) :

    • 모집단에서 차이가 없거나, 통계적으로 유의미한 차이가 없다고 주장하는 가설
    • 기각할 것을 가정하고 설정하는 가설

    H0:μ=μ0  H_0 : \mu = \mu_0\; (모집단의 평균이 특정 값 μ0\mu_0과 같다)

  • 대립가설 (alternative hypothesis, H1H_1) : 귀무가설과 반대되는 주장으로, 입증되기를 기대하는 가설

    H1=μμ0(1)H_1 = \mu \neq \mu_0\dots(1) 양측검정
      H1=μ>μ0    or    H1=μ<μ0...(2)\\\;\\H_1 = \mu > \mu_0 \;\; or \;\; H_1 = \mu < \mu_0...(2) 단측검정

2. 검정통계량 정의

  • 귀무가설이 참일 때, 검정통계량이 따를 확률분포를 설정한다.
  • 검정통계량 (test statistic) :

    • 귀무가설이 참이라는 가정하에 표본 데이터를 기반으로 계산된 통계값

    • 표본이 귀무가설 하에서 예상되는 분포를 따르는지 평가하는 역할을 함

      Z-통계량 : Zobs=Xˉμ0σ/nZ_{obs}={\bar X - \mu_0 \over \sigma / \sqrt n}

      • 귀무가설이 참이라면, 표본평균 Xˉ\bar X는 정규분포를 따를 것이라고 예상할 수 있음

      • 따라서 이를 정규화한 값(Z-통계량)을 계산하여 표준정규분포와 비교하면, 관측한 표본이 귀무가설과의 차이가 통계적으로 유의한지를 판단할 수 있다

3. 유의수준 설정

  • 1종 오류를 범할 확률 설정
  • 유의수준 (significance level, α\alpha) : 실제로는 참인 귀무가설을 기각할 최대허용한계

    α=0.05\alpha = 0.05인 경우, 총 100번의 실험 중 약 5번은 우연으로 인해 귀무가설을 기각할 가능성이 있다

    귀무가설이 참일 때, 5% 확률로 잘못 기각할 수 있음


4-1. 기각역 설정

  • 임계값 (critical value) : 귀무가설의 기각 여부를 결정하는 기준점

    • 유의수준(α\alpha), 가정한 분포, 검정 방식(양측/단측)에 따라 결정된다

      • 양측검정 : ±Zα/2\pm Z_{\alpha / 2}

      • 단측검정 :     Zα      or    Zα\;\;Z_{\alpha} \;\;\; \text{or}\;\;-Z_{\alpha}

  • 기각역 (critical region) : 귀무가설을 기각하는 검정통계량의 범위

    • 임계값을 기준으로 설정되며, 검정통계량이 기각역에 포함되면 귀무가설을 기각함

  • 양측검정 (two-tailed test) : 대립가설을 (1)(1)과 같이 설정한 경우 양쪽에 기각역을 설정

  • 단측검정 (one-tailed test) : 대립가설을 (2)(2)과 같이 설정한 경우 한쪽 방향에만 기각역을 설정

4-2. p-값 계산

  • p-값은 기각역의 개념을 확률(가정한 분포에서 극단값 관측 빈도)로 확장한 개념이다.
  • p-값 (p-value)

    • 검정통계량(ZobsZ_{obs})보다 극단적인 값을 관측할 확률

    • 귀무가설의 신뢰구간을 벗어나는 확률

    • 귀무가설을 지지하는 통계적 증거의 양이라고 표현 할 수 있다

    양측검정 : pvalue=2P(Z>Zobs)p-value = 2\cdot P(Z > |Z_{obs}|)
    왼쪽 단측검정 : pvalue=P(Z<Zobs)p-value = P(Z < Z_{obs})
    오른쪽 단측검정 : pvalue=P(Z>Zobs)p-value = P(Z > Z_{obs})


  • 예시 : 검정통계량(ZobsZ_{obs})이 3.003.00인 경우 p-value 계산 (위 표준정규분포표 기준)

    • P(Z<3.00)=0.9987P(Z < 3.00) = 0.9987이므로, P(Z>3.00)=10.9987P(Z > 3.00) = 1-0.9987, 즉 0.00130.0013이다

    • 양측검정이므로 pvalue=2P(Z>3.00)=20.0013p-value = 2\cdot P(Z > 3.00) = 2 \cdot 0.0013, 즉 0.00260.0026이다

5. 통계적 의사결정

  • 일반적으로 p-value를 기준으로 의사결정을 진행한다
  • 기각역 방식 (단순 비교)

    • 검정통계량이 기각역에 포함되면 귀무가설을 기각함

    • 검정통계량이 기각역에 포함되지 않으면 귀무가설을 기각하지 않는다

  • p-value 방식 :

    • pvalueαp-value \geq \alpha : 귀무가설을 기각하지 않는다
      => 표본이 귀무가설을 기각할 만큼 충분한 증거를 제공하지 않는다.

    • pvalue<αp-value < \alpha : 귀무가설을 기각하고, 대립가설을 채택한다.
      => 표본이 대립가설을 지지할 충분한 증거가 있다.


p-value 해석의 한계

  • p-value는 특정 가설이 참일 확률을 의미하지 않는다

    • "귀무가설이 참일 때, 우리가 얻은 검정통계량 이상의 극단적인 값이 나올 확률"을 의미할 뿐, 귀무가설 자체가 참인지 거짓인지를 직접적으로 알려주지는 않는다
  • 따라서, 가설검정 결과를 해석할 때는 p-value뿐만 아니라 다른 요소들도 함께 고려해야 한다.

항목설명
검정통계량 (Test Statistic)검정통계량의 크기가 극단적으로 클 경우, 표본 크기나 이상치 문제를 확인해야 함.
신뢰 구간 (Confidence Intervals)p-value는 유의수준과 비교하여 결과를 판단하지만, 신뢰구간은 "실제 차이가 어느 정도 범위 내에 존재할 가능성이 있는지"를 알려줌.
베이지안 방법 (Bayesian Methods)귀무가설과 대립가설이 각각 실제로 참일 확률을 평가하는 방법 (credible intervals, Bayes Factor).
우도비 (Likelihood Ratios)귀무가설과 대립가설이 각각 데이터를 설명하는 상대적인 강도를 평가.
허위 발견율 (False Discovery Rates, FDR)여러 가설을 동시에 검정할 경우 Bonferroni 보정, Benjamini-Hochberg 방법 등을 적용하여 다중 검정 오류를 보정.

가설검정의 오류

의사결정/H0H_0의 진위H0H_0가 실제로 참인 경우H0H_0가 실제로 거짓인 경우
H0H_0 채택옳은 결정제2종 오류(β\beta)
H0H_0 기각제1종 오류(α\alpha)옳은 결정

  • 제1종 오류 (Type I Error): 실제로는 참인 귀무가설을 기각하는 오류.

    • 제1종 오류를 범할 확률의 최대허용한계가 유의수준과 동일한 개념이다.

    • 제1종 오류를 줄이기 위해 유의수준을 낮추면, 특정 상황에서 제2종 오류가 늘어날 수 있다

  • 제2종 오류 (Type II Error): 실제로는 거짓인 귀무가설을 채택하는 오류

    • 제2종 오류의 확률은 β\beta로 나타내며, 검정에서 제2종 오류가 적을수록 검정력이 높아진다

  • 검정력 (Statistical Power, 1β1-\beta) : 대립가설이 참일 때 이를 올바르게 검출하는 확률. 주어진 유의수준 하에서 검정력은 가능한 크게 유지하는 것이 좋다.

    • 현실적인 관점에서 β\beta를 결정짓는 값들을 조정하여 검정력을 높일 수 있을까?

      • 유의수준 (X) : 유의수준을 높게 설정할수록 β\beta값은 작아지고, 검정력이 높아진다. 하지만 제1종 오류가 제2종 오류보다 중요하게 여겨지는 경우가 많아 실무에서는 유의수준을 높이는 것이 적절하지 않다.

      • 표본크기 (O) : 표본크기가 커질수록 β\beta값은 작아지고, 검정력이 높아진다. 실무에서는 이미 수집된 데이터로 가설검정을 수행하는 경우가 많아, 표본 크기를 쉽게 늘릴 수 없는 경우가 대부분이다. 그러나 데이터 결합, 오버샘플링, 부트스트래핑과 같은 기법을 활용하여 표본 크기를 실질적으로 늘리는 방법이 일부 존재한다.

      • 검정방법 (O) : 검정방법에 따라 β\beta를 계산하는 방식이 바뀐다. 따라서, 동일한 데이터에 대해 여러 검정 방법을 비교할 수 있으며, 검정력이 가장 높은 방법을 선택할 수 있다.

profile
개인 공부용 블로그입니다

0개의 댓글