Ch5 표본분포

Kamator0·2026년 6월 14일

모집단과 표본분포

모집단(population)

  • 통계조사 대상 전체

표본분포(smapling distribution)

  • 경제적 공간적 시간적 제약으로 인해 모집단을 전체 조사하기 불가능한 경우 전체중에서 몇 개를 표본으로 추출한 자료에 대한 확률분포

모집단과 표본의 관계

  • 모집단의 특성을 나타내는 값을 모수(parameter)라 한다. 예를 들어 모집단의 평균(모평균)을 비롯하여 모집단의 분산(모분산) 또는 모집단의 비율(모비율) 등은 모수이다.
  • 수의 값을 추론하기 위해 표본의 특성을 나타내는 측정값을 이용한다. 이러한 표본의 특성을 나타내는 통계적인 양을 통계량(statistic)이라 한다.

  • 모집단(NN) → 모수: μ\mu, σ2\sigma^2, pp
  • 표본(nn) → 통계량: xˉ\bar{x}, S2S^2, p^\hat{p}

표본추출법

그러면 표본을 어떻게 추출해야 할까? 이상적으로 표본을 추출하기 위해서는 모집단의 특성을 최대한 대표할 수 있는 모집단의 일부를 선택해야 한다. 모집단으로부터 표본을 추출하는 방법에는 확률추출법과 비확률추출법이 있다.

확률추출법(probability sampling)은 모집단의 개체가 표본으로 뽑힐 가능성이 모두 동등하다는 조건하에서 객관적으로 표본을 추출하는 방법으로, 임의추출법(random sampling)이라고도 한다. 이때 확률추출법에 의해 추출된 표본을 확률표본(probability sample) 또는 임의표본(random sample)이라고 한다. 사실 표본을 선정할 때 가장 좋은 방법은 바로 확률추출법이다.

비확률추출법(nonprobability sampling)은 모집단으로부터 표본을 추출할 때, 주관적으로 모집단의 대표를 정하여 표본을 추출하는 방법이다. 이때 각 개체를 추출할 확률을 알 수 없으므로 표본으로부터 모집단에 대한 어떠한 결론을 내릴 때 신뢰 수준을 측정할 수 없다. 따라서 여기에서는 확률추출법만 다루기로 하자.

확률추출법의 종류를 살펴보면 다음과 같다.

■ 단순임의추출법

표본을 동등한 확률로 추출하는 방법을 단순임의추출법(simple random sampling)이라 한다. 이는 가장 간단하며 폭넓게 사용하는 표본추출법이다. 예를 들어 크기 NN인 모집단으로부터 크기 nn인 표본을 추출하는 방법의 수는 NCn_NC_n가지이다.

■ 층화임의추출법

모집단을 성질이 비슷한 것끼리 층(stratum)으로 분류하고, 각 층으로부터 임의로 표본을 추출하는 방법을 층화임의추출법(stratified random sampling)이라 한다. 예를 들어 평균소득을 조사할 때 고소득층, 중간층, 저소득층으로 나눈 후에 각 층에서 표본을 추출하는 방식이다. 층화임의추출법은 추정의 정도를 높일 수 있으며 층별로 추정할 수 있다는 장점이 있다.

■ 계통임의추출법

모집단으로부터 일정한 간격을 두고 추출하는 방법을 말한다. 크기 NN인 모집단으로부터 크기 nn인 표본을 추출한다고 하자. 이때 NNnn으로 나눈 묶음 kk, 나머지를 rr이라 하면 N=kn+rN = kn + r이다. 먼저 1, 2, 3, \cdots, rr 중 임의로 1개의 숫자를 뽑아 ii (1ir1 \le i \le r)라고 하자. 이때 ii임의출발점(random starting point)이라고 하고, 다음과 같이 ii에 차례로 kk만큼씩 더한 수에 해당하는 모집단의 단위를 표본으로 추출하는 방법을 계통임의추출법(systematic random sampling)이라고 한다.

i, i+k, i+2k, , i+jk, , i+(n1)ki, \ i+k, \ i+2k, \ \cdots, \ i+jk, \ \cdots, \ i+(n-1)k

다시 말해, 이 추출법은 임의출발점을 정하고 그로부터 kk번째마다 표본을 뽑는 방법이다. 이때 kk추출 간격(sampling interval)이라고 한다. 계통임의추출법은 대규모 조사에서 주로 사용하는 추출법이며, 단순임의추출법보다 추출 작업이 쉽고 표본의 정밀도가 높기 때문에 실제 조사에서 널리 사용한다.

■ 집락추출법

단순임의추출법, 층화임의추출법, 계통임의추출법은 조사 단위 자체를 추출 단위로 하는 추출 방법이다. 이와 달리 단위 또는 집계 단위를 모은 집락(cluster)을 추출 단위로 하는 추출법을 집락추출법(cluster sampling)이라고 한다.

확률비례추출법(probability proportionate sampling)은 집락을 추출 단위로 하는 집락추출법 중 하나로, 집락의 크기가 현저히 다른 경우에 이용한다. 이때 집락의 크기에 비례하는 확률(probability proportional to size)로 집락을 단순임의추출하고, 여기서 추출한 집락에 포함된 조사 단위 전체를 표본으로 설정한다. 이 방법은 추출한 집락의 조사 단위를 모두 조사하는 것이다. 따라서 모집단이 크고 추출 단위의 리스트를 작성하기 어려운 경우, 집락을 추출 단위로 하면 추출 작업이 편리하다. 또한 단순임의추출법보다 조사 비용이 크게 절약된다는 장점도 있다.

■ 다단추출법

집락추출법에서 집락의 크기가 매우 클 때는 추출한 표본 집락에서 다시 표본을 추출하여 조사하는 것이 비용 절약은 물론이고, 정밀도 면에서도 유리한 경우가 많다. 이러한 추출법을 2단추출법(two-stage sampling) 또는 부차추출법(sub-sampling)이라고 한다. 이때 제1단계의 추출 단위를 제1차 추출 단위(primary sampling unit), 제2단계의 추출 단위를 제2차 추출 단위(secondary sampling unit)라 한다. 이와 같은 방법으로 3단 추출법과 4단 추출법을 정의할 수 있으며, 2단 추출법 이상을 다단추출법(multistage sampling)이라고 한다. 참고로 단순임의추출법, 층화임의추출법, 계통임의추출법은 1단 추출법이다.

표본평균의 분포

  • 표본평균의 분포는 모집단의 특성, 즉 모집단이 유한 또는 무하인지, 정규분포를 따르는지에 띠리 다르다.

유한 또는 무한 모집단에서 표본평균의 분포

표본평균 X\overline{X}의 분포를 생각해보자. 표본평균 X\overline{X}는 표본에 따라 변하므로 확률변수이고, 이러한 확률분포를 표본분포라 한다. 모집단은 변하지 않으므로 모평균 μ\mu도 변하지 않지만, 표본평균 X\overline{X}는 추출한 표본에 따라 변할 수 있으므로 확률변수이다. 따라서 확률변수 X\overline{X}의 확률분포를 이용하면 표본평균 X\overline{X}의 평균과 표준편차를 구할 수 있다.

모집단 {x1,x2,,xN}\{x_1, x_2, \cdots, x_N\}의 모평균 μ\mu와 모분산 σ2\sigma^2은 각각 다음과 같다.

μ=1Ni=1Nxi,σ2=1Ni=1N(xiμ)2\mu = \frac{1}{N}\sum_{i=1}^{N} x_i, \quad \sigma^2 = \frac{1}{N}\sum_{i=1}^{N}(x_i - \mu)^2

유한 모집단에서 복원추출할 경우 표본평균의 기댓값과 분산

  • 모평균이 μ\mu이고 모분산이 σ2\sigma^2인 모집단에서 크기 nn인 표본을 복원추출할 때, E(Xi)=μ\text{E}(X_i) = \mu이고 Var(Xi)=σ2\text{Var}(X_i) = \sigma^2이므로 표본평균 X\overline{X}의 기댓값과 분산은 다음과 같다.

  • 기댓값 : E(X)=μ\text{E}(\overline{X}) = \mu

  • 분산 : Var(X)=σX2=σ2n\text{Var}(\overline{X}) = \sigma_{\overline{X}}^2 = \dfrac{\sigma^2}{n}

유한 모집단에서 비복원추출할 경우 표본평균의 기댓값과 분산

모평균이 μ\mu이고 모분산이 σ2\sigma^2인 크기가 NN인 유한 모집단에서 크기 nn인 표본을 비복원추출할 때, 표본평균 X\overline{X}의 기댓값과 분산은 다음과 같다.

  • 기댓값 : E(X)=μ\text{E}(\overline{X}) = \mu

  • 분산 : Var(X)=NnN1σ2n\text{Var}(\overline{X}) = \dfrac{N-n}{N-1} \cdot \dfrac{\sigma^2}{n}

  • 여기서 NnN1\dfrac{N-n}{N-1}을 유한 모집단 수정계수라 하고, 표본평균의 표준편차 Var(X)=σX\sqrt{\text{Var}(\overline{X})} = \sigma_{\overline{X}}표준오차(standard error)라고 한다.

무한 모집단에서 복원/비복원추출할 경우 표본평균의 분포

  • 무한 모집단에서 NN \to \infty이면 NnN11\dfrac{N-n}{N-1} \to 1이므로 σX2σ2n\sigma_{\overline{X}}^2 \to \dfrac{\sigma^2}{n}이다. 따라서 복원추출이나 비복원추출이나 같은 결과를 얻는다.

추출률(sampling fraction)

  • 추출률(sampling fraction) nN\dfrac{n}{N}이 충분히 작으면 유한 모집단에서도 σX2=σ2n\sigma_{\overline{X}}^2 = \dfrac{\sigma^2}{n}이 성립하므로 복원추출이나 비복원추출이나 동일한 결과를 얻는다. 이러한 결과로부터 표본평균 X\overline{X}의 평균은 모평균과 같으며, 표본 크기 nn이 클수록 X\overline{X}의 분산은 0에 가까워져 X\overline{X}가 모평균 근처에 밀집하여 분포함을 알 수 있다.

모집단이 정규분포를 따를 때 표본평균의 분포

  • 모집단이 정규분포를 따를 때 표본평균도 정규분포를 따른다. 이 사실로부터 정규분포 N(μ,σ2)\text{N}(\mu, \sigma^2)을 따르는 모집단에서 크기 nn인 확률표본을 추출할 때, 표본평균 X\overline{X}는 평균이 μ\mu와 같고, 분산이 σ2n\dfrac{\sigma^2}{n}인 정규분포 N ⁣(μ,σ2n)\text{N}\!\left(\mu, \dfrac{\sigma^2}{n}\right)을 따른다. 이때 표본평균 X\overline{X}를 표준화시킨 확률변수 Z=Xμσ/nZ = \dfrac{\overline{X} - \mu}{\sigma / \sqrt{n}}는 표준정규분포 N(0,1)\text{N}(0, 1)을 따른다.

모집단이 정규분포를 따르지 않을 때 표본평균의 분포

  • 모집단이 정규분포를 따르지 않을 때는 표본평균 X\overline{X}가 정규분포를 따른다고 할 수 없다. 그러나 표본의 크기가 충분히 클 때는 표본평균 X\overline{X}의 분포를 정규분포로 볼 수 있다. 이 내용은 다음으로 살펴볼 중심극한정리(central limit theorem)로 확인할 수 있다.

여러 가지 표본분포

  • 확률변수 XX의 확률밀도함수가 다음과 같이 주어질 때, 확률변수 XX자유도(degree of freedom)가 nnχ2\chi^2-분포(chi-square distribution)를 따른다고 하고, Xχ2(n)X \sim \chi^2(n)으로 나타낸다.
    외국에서는 감마함수를 모수로 표현하여 다르게 나타내기도 한다.

  • f(x)=12n/2Γ ⁣(n2)xn21ex2(0<x<)f(x) = \frac{1}{2^{n/2}\Gamma\!\left(\frac{n}{2}\right)} x^{\frac{n}{2}-1} e^{-\frac{x}{2}} \quad (0 < x < \infty)

  • χ2\chi^2-분포는 자유도 nn의 크기에 따라 분포 모양이 변하는데, 자유도가 커지면 정규분포(대칭)에 가까워진다. 이러한 χ2\chi^2-분포는 여러 집단 사이의 독립성 검정과 적합도 검정을 하는 데 주로 사용한다.

χ2\chi^2-분포의 성질

(1) 표준정규분포를 따르는 확률변수 ZZ의 제곱 Z2Z^2은 자유도 1인 χ2\chi^2-분포를 따른다.

(2) X1,X2,,XnX_1, X_2, \cdots, X_n이 각각 자유도 n1,n2,,nmn_1, n_2, \cdots, n_mχ2\chi^2-분포를 따르는 독립 확률변수이면, Y=i=1nXiY = \sum_{i=1}^{n} X_i는 자유도 ni\sum n_iχ2\chi^2-분포를 따른다.

(3) 평균 μ\mu, 분산이 σ2\sigma^2인 정규분포 N(μ,σ2)\text{N}(\mu, \sigma^2)을 따르는 모집단에서 크기 nn인 확률표본의 표본평균을 X\overline{X}, 표본분산을 S2=1n1i=1n(XiX)2S^2 = \frac{1}{n-1}\sum_{i=1}^{n}(X_i - \overline{X})^2이라고 하면

  • (i) X\overline{X}S2S^2은 서로 독립이다.

  • (ii) Y=1σ2i=1n(XiX)2=(n1)S2σ2Y = \frac{1}{\sigma^2}\sum_{i=1}^{n}(X_i - \overline{X})^2 = \frac{(n-1)S^2}{\sigma^2}은 자유도 (n1)(n-1)χ2\chi^2-분포를 따른다.

(4) 확률변수 XX가 자유도 nnχ2\chi^2-분포를 따를 때, 확률변수 XX의 기댓값과 분산은 다음과 같다.

  • E(X)=n,Var(X)=2n\text{E}(X) = n, \quad \text{Var}(X) = 2n

(5) XX가 자유도 nnχ2\chi^2-분포를 따를 때, XX의 적률생성함수는 다음과 같다.

  • MX(t)=(12t)n/2M_X(t) = (1 - 2t)^{-n/2}

χ2\chi^2-분포와 감마분포의 관계: Parametrization 비교

핵심

  • χ2(n)=Gamma ⁣(n2,  12)(rate parameterization)\chi^2(n) = \text{Gamma}\!\left(\frac{n}{2},\; \frac{1}{2}\right) \quad \text{(rate parameterization)}

  • χ2(n)=Gamma ⁣(n2,  2)(scale parameterization)\chi^2(n) = \text{Gamma}\!\left(\frac{n}{2},\; 2\right) \quad \text{(scale parameterization)}

Blitzstein (shape aa, rate λ\lambda) 기준

Gamma(aa, λ\lambda)의 PDF:

f(x)=λaΓ(a)xa1eλx,x>0f(x) = \frac{\lambda^a}{\Gamma(a)}\,x^{a-1}\,e^{-\lambda x}, \quad x > 0

a=n/2a = n/2, λ=1/2\lambda = 1/2 대입:

f(x)=(1/2)n/2Γ(n/2)xn/21ex/2=12n/2Γ(n/2)xn/21ex/2f(x) = \frac{(1/2)^{n/2}}{\Gamma(n/2)}\,x^{n/2-1}\,e^{-x/2} = \frac{1}{2^{n/2}\,\Gamma(n/2)}\,x^{n/2-1}\,e^{-x/2}

Parameterization 대응 정리

parameterizationχ²(n)의 감마 표현관계
Blitzstein (shape, rate)Gamma(n/2n/2, 1/21/2)rate λ=1/2\lambda = 1/2
한국 교재 (shape, scale)Gamma(n/2n/2, 22)scale β=1/λ=2\beta = 1/\lambda = 2

rate λ\lambda와 scale β\beta는 역수 관계: λ=1/β\lambda = 1/\beta.

MGF 확인

Gamma(aa, λ\lambda)의 MGF:

MX(t)=(λλt)aM_X(t) = \left(\frac{\lambda}{\lambda - t}\right)^a

a=n/2a = n/2, λ=1/2\lambda = 1/2 대입:

MX(t)=(1/21/2t)n/2=(12t)n/2M_X(t) = \left(\frac{1/2}{1/2 - t}\right)^{n/2} = (1 - 2t)^{-n/2}

기댓값·분산 확인

Gamma(aa, λ\lambda)의 기댓값과 분산:

  • E(X)=a/λ\text{E}(X) = a/\lambda, Var(X)=a/λ2\text{Var}(X) = a/\lambda^2

  • E(X)=n/21/2=n,Var(X)=n/2(1/2)2=2n\text{E}(X) = \frac{n/2}{1/2} = n, \qquad \text{Var}(X) = \frac{n/2}{(1/2)^2} = 2n

tt-분포

  • tt-분포는 윌리엄 실리 고셋(William Sealy Gosset)이 Student라는 필명으로 발표한 논문에서 처음 사용하여 Student tt-분포라고도 한다.

  • 서로 독립인 두 확률변수 ZZVV가 각각 ZN(0,1)Z \sim \text{N}(0, 1), Vχ2(n)V \sim \chi^2(n)일 때, 확률변수가 다음과 같은 확률분포를 분자와 분모의 자유도가 nntt-분포(tt-distribution)라 하고, Tt(n)T \sim t(n)으로 나타낸다.

  • T=ZV/nT = \frac{Z}{\sqrt{V/n}}

  • 자유도가 nntt-분포의 확률밀도함수는 다음과 같다.

    • f(t)=Γ ⁣(n+12)nπΓ ⁣(n2)(1+t2n)n+12(<t<)f(t) = \frac{\Gamma\!\left(\frac{n+1}{2}\right)}{\sqrt{n\pi}\,\Gamma\!\left(\frac{n}{2}\right)} \left(1 + \frac{t^2}{n}\right)^{-\frac{n+1}{2}} \quad (-\infty < t < \infty)
  • tt-분포는 자유도 nn값에 따라 모양이 변하며 t=0t = 0을 중심으로 하는 좌우대칭형으로, 자유도가 nn \to \infty일 때는 표준정규분포와 일치한다. tt-분포는 표본 크기 nn이 작을 때, 즉 n<30n < 30일 경우에 주로 이용하며 모평균, 모평균의 차 또는 회귀계수의 추정이나 검정에 쓰인다.

tt-분포의 성질

(1) 확률변수 ZZ가 표준정규분포 N(0,1)\text{N}(0, 1)을 따르고, 확률변수 VV가 자유도 nnχ2\chi^2-분포를 따를 때, 두 확률변수 ZZVV가 서로 독립이면 다음과 같은 확률변수 TT는 자유도 nntt-분포를 따른다.

T=ZV/nT = \frac{Z}{\sqrt{V/n}}

(2) 정규분포 N(μ,σ2)\text{N}(\mu, \sigma^2)을 따르는 모집단으로부터 크기 nn인 확률표본의 표본평균과 표본분산을 X\overline{X}, S2S^2이라 할 때, 다음 통계량은 자유도 (n1)(n-1)tt-분포를 따른다.

T=XμS/nT = \frac{\overline{X} - \mu}{S / \sqrt{n}}

(3) 확률변수 TT가 자유도 nntt-분포를 따를 때, 확률변수 TT의 기댓값과 분산은 다음과 같다.

E(T)=0,Var(T)=nn2(n>2)\text{E}(T) = 0, \quad \text{Var}(T) = \frac{n}{n-2} \quad (n > 2)

t-분포의 유도 (Student's t-distribution)

정규 모집단 X1,X2,,XnN(μ,σ2)X_1, X_2, \ldots, X_n \sim N(\mu, \sigma^2)에서:

1. 표본평균의 표준화 → N(0,1)

Z=Xˉμσ/nN(0,1)Z = \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \sim N(0, 1)

2. 표본분산의 스케일링 → χ²

V=(n1)S2σ2χ2(n1)V = \frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)

3. 독립성

정규 모집단에서 Xˉ\bar{X}S2S^2서로 독립이다.

이 독립성은 직관적이지 않지만, 정규분포의 특수한 성질에서 나온다.
따라서 Z와 V도 독립이다.

σ를 모른다

실전에서 σ는 보통 알 수 없다. 그래서:

  • 알고 있을 때: Z=Xˉμσ/nN(0,1)Z = \dfrac{\bar{X} - \mu}{\sigma / \sqrt{n}} \sim N(0,1) → 정규분포 사용
  • 모를 때: σ 대신 S를 넣으면 → T=XˉμS/nT = \dfrac{\bar{X} - \mu}{S / \sqrt{n}}더 이상 정규분포가 아님!

σ를 S로 대체하는 "대가"로, 분포가 정규분포에서 t-분포로 바뀐다.

핵심 유도: T가 t-분포임을 보이기

  • 출발점

    • T=XˉμS/nT = \frac{\bar{X} - \mu}{S / \sqrt{n}}
  • Step 1 : 분자분모를 σ로 나누기

    • 분자분모에 σ를 끼워넣는다:

    • T=Xˉμσ/nSσT = \frac{\dfrac{\bar{X} - \mu}{\sigma / \sqrt{n}}}{\dfrac{S}{\sigma}}

    • 분자는 바로 Z:

    • 분자=Xˉμσ/n=ZN(0,1)\text{분자} = \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} = Z \sim N(0,1)

  • Step 2 : 분모를 χ² 형태로 변환

    • Sσ=S2σ2\frac{S}{\sigma} = \sqrt{\frac{S^2}{\sigma^2}}
    • 여기서 V=(n1)S2σ2χ2(n1)V = \dfrac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)이므로:
    • S2σ2=Vn1\frac{S^2}{\sigma^2} = \frac{V}{n-1}

    따라서:

    • Sσ=Vn1\frac{S}{\sigma} = \sqrt{\frac{V}{n-1}}
  • Step 3: 결합

    • T=ZV/(n1)T = \frac{Z}{\sqrt{V/(n-1)}}
    • 이것은 t-분포의 정의에서 k=n1k = n-1인 경우이므로:
    • T=XˉμS/nt(n1)\boxed{T = \frac{\bar{X} - \mu}{S / \sqrt{n}} \sim t(n-1)}

σ를 아는 경우 vs 모르는 경우

σ를 아는 경우σ를 모르는 경우
통계량Z=Xˉμσ/nZ = \dfrac{\bar{X} - \mu}{\sigma / \sqrt{n}}T=XˉμS/nT = \dfrac{\bar{X} - \mu}{S / \sqrt{n}}
분포N(0,1)N(0, 1)t(n1)t(n-1)
꼬리가벼움두꺼움 (불확실성 반영)
n → ∞t(n1)N(0,1)t(n-1) \to N(0,1)

n이 커지면 S → σ로 수렴하므로, t-분포는 점점 정규분포에 가까워진다.
일반적으로 n ≥ 30이면 t-분포와 정규분포의 차이가 매우 작다.

FF-분포

서로 독립인 두 확률변수 UU, VV가 각각 Uχ2(m)U \sim \chi^2(m), Vχ2(n)V \sim \chi^2(n)일 때, 다음과 같은 확률변수의 확률분포를 분자와 분모의 자유도가 (m,n)(m, n)FF-분포(FF-distribution)라 하고, FF(m,n)F \sim \text{F}(m, n)으로 나타낸다.

F=U/mV/nF = \frac{U/m}{V/n}

FF-분포의 확률밀도함수는 다음과 같다.

f(x)=Γ ⁣(m+n2)Γ ⁣(m2)Γ ⁣(n2)(mn)m/2xm21(1+mnx)12(m+n)(x>0)f(x) = \frac{\Gamma\!\left(\frac{m+n}{2}\right)}{\Gamma\!\left(\frac{m}{2}\right)\Gamma\!\left(\frac{n}{2}\right)} \left(\frac{m}{n}\right)^{m/2} x^{\frac{m}{2}-1} \left(1 + \frac{m}{n}x\right)^{-\frac{1}{2}(m+n)} \quad (x > 0)

F(m,n)\text{F}(m, n)의 평균과 분산은 다음과 같다.

E(F)=nn2(n3)\text{E}(F) = \frac{n}{n-2} \quad (n \ge 3)

Var(F)=2n2(m+n2)m(n2)2(n4)(n5)\text{Var}(F) = \frac{2n^2(m+n-2)}{m(n-2)^2(n-4)} \quad (n \ge 5)

FF -분포 성질

(1) 서로 독립인 UU, VV가 각각 자유도가 mmnnχ2\chi^2-분포를 따르는 확률변수일 때, 다음과 같은 통계량은 자유도 (m,n)(m, n)FF-분포를 따른다.

F=U/mV/nF = \frac{U/m}{V/n}

(2) 자유도가 (m,n)(m, n)FF-분포의 오른쪽 꼬리 확률 α\alpha에 대한 100(1α)100(1-\alpha)% 백분위수를 Fα(m,n)F_\alpha(m, n)으로 나타낼 때, 다음 관계가 성립한다.

Fα(m,n)=1F1α(n,m)F_\alpha(m, n) = \frac{1}{F_{1-\alpha}(n, m)}

(3) 각각 정규분포 N(μ1,σ12)\text{N}(\mu_1, \sigma_1^2)N(μ2,σ22)\text{N}(\mu_2, \sigma_2^2)을 따르는 두 모집단으로부터 추출한 크기가 n1n_1, n2n_2이고 서로 독립인 표본분산을 각각 S12=1n11i=1n1(XiX)2S_1^2 = \dfrac{1}{n_1 - 1}\displaystyle\sum_{i=1}^{n_1}(X_i - \overline{X})^2S22=1n21j=1n2(YjY)2S_2^2 = \dfrac{1}{n_2 - 1}\displaystyle\sum_{j=1}^{n_2}(Y_j - \overline{Y})^2이라 하면 다음 통계량은 자유도 (n11,n21)(n_1 - 1, \, n_2 - 1)FF-분포를 따른다. 이를 FF-통계량이라고 한다.

F=S12/σ12S22/σ22F(n11,n21)F = \frac{S_1^2 / \sigma_1^2}{S_2^2 / \sigma_2^2} \sim \text{F}(n_1 - 1, \, n_2 - 1)

(4) 확률변수 TT가 자유도 nntt-분포를 따른다고 할 때, 확률변수 T2T^2은 자유도 (1,n)(1, n)FF-분포를 따른다.

FF-분포는 자유도에 따라 모양이 변하며 두 모분산의 비를 추론하는 경우와 분산분석, 실험 계획법 등에서 많이 사용한다.

표본평균 차의 분포

각각 정규분포 N(μ1,σ12)\text{N}(\mu_1, \sigma_1^2)N(μ2,σ22)\text{N}(\mu_2, \sigma_2^2)을 따르면서 서로 독립인 두 모집단이 있다. N(μ1,σ12)\text{N}(\mu_1, \sigma_1^2)을 따르는 모집단으로부터 크기 n1n_1인 확률표본의 표본평균을 X1\overline{X}_1라 하고, N(μ2,σ22)\text{N}(\mu_2, \sigma_2^2)을 따르는 모집단으로부터 추출한 크기 n2n_2인 확률표본의 표본평균을 X2\overline{X}_2라 하자. 이때 표본평균 X1\overline{X}_1X2\overline{X}_2가 독립이라고 가정하고, 표본평균의 차 X1X2\overline{X}_1 - \overline{X}_2의 표본분포를 살펴보면 다음과 같다.

표본평균 차의 분포

두 표본평균 X1\overline{X}_1X2\overline{X}_2는 각각 정규분포 N ⁣(μ1,σ12n1)\text{N}\!\left(\mu_1, \dfrac{\sigma_1^2}{n_1}\right)N ⁣(μ2,σ22n2)\text{N}\!\left(\mu_2, \dfrac{\sigma_2^2}{n_2}\right)을 따르며, 표본평균의 차 X1X2\overline{X}_1 - \overline{X}_2의 평균과 분산은 다음과 같다.

(1) 평균 : E(X1X2)=E(X1)E(X2)=μ1μ2\text{E}(\overline{X}_1 - \overline{X}_2) = \text{E}(\overline{X}_1) - \text{E}(\overline{X}_2) = \mu_1 - \mu_2

(2) 분산 : Var(X1X2)=σX1X22=Var(X1)+Var(X2)=σ12n1+σ22n2\text{Var}(\overline{X}_1 - \overline{X}_2) = \sigma_{\overline{X}_1 - \overline{X}_2}^2 = \text{Var}(\overline{X}_1) + \text{Var}(\overline{X}_2) = \dfrac{\sigma_1^2}{n_1} + \dfrac{\sigma_2^2}{n_2}

따라서 두 표본평균의 차 X1X2\overline{X}_1 - \overline{X}_2는 다음과 같이 정규분포를 따른다.

X1X2N ⁣(μ1μ2, σ12n1+σ22n2)\overline{X}_1 - \overline{X}_2 \sim \text{N}\!\left(\mu_1 - \mu_2, \ \frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}\right)

그러므로 X1X2\overline{X}_1 - \overline{X}_2의 표준화 확률변수 ZZ는 다음과 같이 표준정규분포를 따른다.

Z=(X1X2)(μ1μ2)σ12n1+σ22n2N(0,1)Z = \frac{(\overline{X}_1 - \overline{X}_2) - (\mu_1 - \mu_2)}{\sqrt{\dfrac{\sigma_1^2}{n_1} + \dfrac{\sigma_2^2}{n_2}}} \sim \text{N}(0, 1)

서로 독립인 확률변수 XiN(μ,σ2)X_i \sim \text{N}(\mu, \sigma^2) (i=1,2,,n1)(i = 1, 2, \cdots, n_1), YjN(μ,σ2)Y_j \sim \text{N}(\mu, \sigma^2) (j=1,2,,n2)(j = 1, 2, \cdots, n_2)에 대하여 (두 모집단의 분산이 같을 때) 다음을 합동표본분산(pooled sample variance)이라고 한다.

Sp2=1n1+n22{i=1n1(XiX)2+j=1n2(YjY)2}=1n1+n22{(n11)S12+(n21)S22}S_p^2 = \frac{1}{n_1 + n_2 - 2}\left\{\sum_{i=1}^{n_1}(X_i - \overline{X})^2 + \sum_{j=1}^{n_2}(Y_j - \overline{Y})^2\right\} = \frac{1}{n_1 + n_2 - 2}\left\{(n_1-1)S_1^2 + (n_2-1)S_2^2\right\}

이때 Sp2S_p^2의 양의 제곱근인 합동표본표준편차 SpS_p에 대하여 다음이 성립한다.

V=n1+n22σ2Sp2χ2(n1+n22)V = \frac{n_1 + n_2 - 2}{\sigma^2} S_p^2 \sim \chi^2(n_1 + n_2 - 2)

T=(XY)(μ1μ2)Sp1n1+1n2t(n1+n22)T = \frac{(\overline{X} - \overline{Y}) - (\mu_1 - \mu_2)}{S_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}}} \sim t(n_1 + n_2 - 2)

표본비율의 분포

집단 중 각 단위가 갖는 특성을 '성공' 또는 '실패'와 같이 두 가지 범주로만 구분하고, 그 비율이 일정하게 주어진 특수한 모집단을 이항 모집단(binomial population)이라고 한다.

이항 모집단에서 성공 비율을 pp라 하면 실패 비율은 1p1 - p인데, 이때 pp모비율(population proportion)이라고 한다. 이항 모집단에서 크기가 nn인 표본을 추출하여 성공 횟수를 XX라고 할 때, 다음 p^\hat{p}표본비율(sample proportion)이라고 한다.

p^=Xn\hat{p} = \frac{X}{n}

그러면 표본 크기가 nn인 표본에서 성공횟수를 xx라고 할 때, 확률변수 XX는 확률질량함수가 다음과 같은 이항분포를 따른다.

f(x)=nCxpx(1p)nx(x=0,1,2,,n)f(x) = {}_nC_x \, p^x(1-p)^{n-x} \quad (x = 0, 1, 2, \cdots, n)

이때 평균과 분산은 각각 다음과 같다.

μ=np,σ2=np(1p)\mu = np, \quad \sigma^2 = np(1-p)

따라서 표본비율 p^=Xn\hat{p} = \frac{X}{n}도 이항분포를 따른다.

표본비율의 평균과 분산

이항 모집단에서 크기가 nn인 표본을 추출하여 성공횟수를 XX라고 할 때, 표본비율의 평균과 분산은 다음과 같다.

(1) 평균 : μp^=E(p^)=E ⁣(Xn)=1nnp=p\mu_{\hat{p}} = \text{E}(\hat{p}) = \text{E}\!\left(\frac{X}{n}\right) = \frac{1}{n}np = p

(2) 분산 : σp^2=Var(p^)=Var ⁣(Xn)=1n2Var(X)=1n2np(1p)=p(1p)n\sigma_{\hat{p}}^2 = \text{Var}(\hat{p}) = \text{Var}\!\left(\frac{X}{n}\right) = \frac{1}{n^2}\text{Var}(X) = \frac{1}{n^2}np(1-p) = \frac{p(1-p)}{n}

표본 비율과 정규분포의 관계

일반적으로 np>5np > 5, n(1p)>5n(1-p) > 5일 때, 즉 표본 크기가 크고 pp가 작지 않다면 중심극한정리에 의해 확률변수 XX는 평균이 npnp, 분산이 np(1p)np(1-p)인 정규분포에 가까워진다. 따라서 표본비율 p^\hat{p}의 분포는 정규분포 N ⁣(p, p(1p)n)\text{N}\!\left(p, \ \frac{p(1-p)}{n}\right)에 근사한다. 따라서 nn이 충분히 클 때, 표본비율 p^\hat{p}의 표준화 확률변수 ZZ는 다음과 같이 근사적으로 표준정규분포를 따른다.

Z=p^pp(1p)/nN(0,1)Z = \frac{\hat{p} - p}{\sqrt{p(1-p)/n}} \approx \text{N}(0, 1)

이제 서로 독립인 두 모집단으로부터 추출한 표본에 대하여 표본비율 차의 분포를 알아보자. 두 모집단의 모비율을 각각 p1p_1, p2p_2라 하고, 각 모집단으로부터 n1n_1, n2n_2개의 표본을 추출한다고 하자. 그러면 두 모집단으로부터 추출한 표본의 표본비율 차에 대한 평균과 분산은 다음과 같다.

E(p^1p^2)=E(p^1)E(p^2)=p1p2\text{E}(\hat{p}_1 - \hat{p}_2) = \text{E}(\hat{p}_1) - \text{E}(\hat{p}_2) = p_1 - p_2

Var(p^1p^2)=Var(p^1)+Var(p^2)=p1(1p1)n1+p2(1p2)n2\text{Var}(\hat{p}_1 - \hat{p}_2) = \text{Var}(\hat{p}_1) + \text{Var}(\hat{p}_2) = \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}

또한 두 모집단에서 추출한 표본의 크기가 충분히 클 때, 두 표본비율 차의 분포는 정규분포에 근사한다. 따라서 두 표본비율 차의 표준화 확률변수 ZZ에 대하여 다음이 성립한다.

Z=(p^1p^2)(p1p2)p1(1p1)n1+p2(1p2)n2N(0,1)Z = \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)}{\sqrt{\dfrac{p_1(1-p_1)}{n_1} + \dfrac{p_2(1-p_2)}{n_2}}} \approx \text{N}(0, 1)

0개의 댓글