Lecture 14: Location, Scale, and LOTUS | Statistics 110

Prettypotato·4일 전

Statistics 110

목록 보기
18/18

표준정규분포

표준정규분포는 정규분포 중에서 가장 기본이 되는 분포이다.

Z∼N(0,1)Z\sim N(0,1)

여기서 평균은 00, 분산은 11이다.

표준정규분포를 나타낼 때 관습적으로 ZZ라는 기호를 사용하지만, ZZ라는 문자가 반드시 표준정규분포를 의미하는 것은 아니다.

표준정규분포의 PDF는

fZ(z)=12πe−z2/2f_Z(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}

이다.

이 함수는 zz와 −z-z를 바꾸어도 값이 같으므로 0을 기준으로 대칭이다.

fZ(z)=fZ(−z)f_Z(z)=f_Z(-z)

표준정규분포의 평균과 분산

대칭성을 이용하면 표준정규분포의 평균은 바로 0임을 알 수 있다.

E(Z)=0E(Z)=0

실제로 LOTUS를 이용하면

E(Z)=12π∫−∞∞ze−z2/2 dzE(Z) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{\infty} z e^{-z^2/2}\,dz

인데,

ze−z2/2z e^{-z^2/2}는 홀함수이고 적분 구간이 −∞-\infty부터 ∞\infty까지 대칭이므로 적분값은 0이다.

분산은

Var⁡(Z)=E(Z2)−[E(Z)]2\operatorname{Var}(Z) = E(Z^2)-[E(Z)]^2

이다.

이미 E(Z)=0E(Z)=0이므로

Var⁡(Z)=E(Z2)\operatorname{Var}(Z)=E(Z^2)

이고, 지난 시간의 계산을 통해

E(Z2)=1E(Z^2)=1

임을 얻는다.

따라서

Var⁡(Z)=1\operatorname{Var}(Z)=1

이다.


적률 Moment

E(Z)E(Z), E(Z2)E(Z^2), E(Z3)E(Z^3)처럼 확률변수의 거듭제곱의 기대값을 적률(moment)이라고 한다.

E(Z)E(Z)는 1차 적률, E(Z2)E(Z^2)는 2차 적률, E(Z3)E(Z^3)는 3차 적률이다.

정규분포는 0을 기준으로 대칭이므로 모든 홀수 차수의 적률은 0이 된다.

E(Z)=E(Z3)=E(Z5)=⋯=0E(Z)=E(Z^3)=E(Z^5)=\cdots=0

왜냐하면 홀수 거듭제곱을 포함한 적분의 integrand가 홀함수가 되기 때문이다.

반면 짝수 적률은 일반적으로 0이 아니다.

예를 들어

E(Z2)=1E(Z^2)=1

이다.


표준정규분포의 대칭성

표준정규분포는 0을 기준으로 대칭이므로 ZZ의 부호를 뒤집어도 분포 자체는 변하지 않는다.

−Z∼N(0,1)-Z\sim N(0,1)

즉, ZZ가 양수였던 값을 음수로 바꾸고 음수였던 값을 양수로 바꾸더라도 전체적인 분포는 동일하다.

이것이 정규분포의 대칭성을 나타내는 중요한 표현이다.


표준정규분포의 CDF

표준정규분포의 CDF는 특별히 Φ\Phi라는 기호를 사용한다.

Φ(z)=12π∫−∞ze−t2/2 dt\Phi(z) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z} e^{-t^2/2}\,dt

표준정규분포의 CDF는 일반적인 초등함수의 형태로 쉽게 계산할 수 없기 때문에 Φ\Phi라는 별도의 함수로 정의하여 사용한다.

대칭성 때문에

Φ(−z)=1−Φ(z)\Phi(-z)=1-\Phi(z)

가 성립한다.


표준정규분포에서 일반정규분포 만들기

표준정규분포가 가장 기본적인 정규분포이므로, 상수를 더하고 곱하는 것만으로 다른 정규분포를 만들 수 있다.

X=μ+σZX=\mu+\sigma Z

여기서

  • μ\mu는 평균이며 location 역할을 한다.
  • σ>0\sigma>0은 표준편차이며 scale 역할을 한다.

μ\mu를 더하면 분포가 왼쪽이나 오른쪽으로 이동한다.

반면 σ\sigma를 곱하면 분포의 퍼지는 정도가 달라진다.

따라서

  • μ\mu → 위치를 이동
  • σ\sigma → 분포의 크기와 퍼짐을 조절

한다고 생각하면 된다.

이때

X∼N(μ,σ2)X\sim N(\mu,\sigma^2)

라고 표현한다.

즉, 정규분포는 평균과 분산이라는 두 개의 모수로 결정된다.


일반 정규분포의 평균과 분산

선형성을 이용하면

E(X)=E(μ+σZ)=μ+σE(Z)E(X) = E(\mu+\sigma Z) = \mu+\sigma E(Z)

이고 E(Z)=0E(Z)=0이므로

E(X)=μE(X)=\mu

이다.

분산은 상수를 더해도 변하지 않고, 상수를 곱하면 그 상수의 제곱만큼 변한다.

따라서

Var⁡(X)=Var⁡(μ+σZ)=σ2Var⁡(Z)=σ2\operatorname{Var}(X) = \operatorname{Var}(\mu+\sigma Z) = \sigma^2\operatorname{Var}(Z) = \sigma^2

이다.

결국

X∼N(μ,σ2)X\sim N(\mu,\sigma^2)

에서 평균은 μ\mu, 분산은 σ2\sigma^2이다.


상수를 더하면 분산은 변하지 않는다

확률변수에 상수 cc를 더한다고 해서 퍼지는 정도가 변하지는 않는다.

Var⁡(X+c)=Var⁡(X)\operatorname{Var}(X+c)=\operatorname{Var}(X)

직관적으로도 XX의 모든 값이 똑같이 cc만큼 이동할 뿐이므로 값들 사이의 거리는 그대로이다.


상수를 곱하면 분산은 제곱만큼 변한다

확률변수에 상수 cc를 곱하면

Var⁡(cX)=c2Var⁡(X)\operatorname{Var}(cX)=c^2\operatorname{Var}(X)

가 된다.

여기서 가장 흔한 실수는 cc를 그대로 밖으로 꺼내는 것이다.

Var⁡(cX)≠cVar⁡(X)\operatorname{Var}(cX)\neq c\operatorname{Var}(X)

분산은 거리의 제곱을 이용하기 때문에 cc도 제곱되어 나온다.

특히 cc가 음수인 경우에도 분산은 음수가 될 수 없어야 하므로 c2c^2이 되어야 한다.

대수적 증명
분산은 Var(X)=E[(X−E[X])2]\text{Var}(X)=E\big[(X-E[X])^2\big]이고, 기대값의 선형성에 의해 E[aX]=aE[X]E[aX]=aE[X]이다.

Var⁡(aX)=E[(aX−E[aX])2]=E[(aX−aE[X])2]=E[(a(X−E[X]))2]=E[a2(X−E[X])2]=a2E[(X−E[X])2]=a2Var⁡(X).\begin{aligned} \operatorname{Var}(aX) &= E\big[(aX-E[aX])^2\big] \\ &= E\big[(aX-aE[X])^2\big] \\ &= E\big[\big(a(X-E[X])\big)^2\big] \\ &= E\big[a^2(X-E[X])^2\big] \\ &= a^2E\big[(X-E[X])^2\big] \\ &= a^2\operatorname{Var}(X). \end{aligned}

분산은 항상 0 이상이다

분산의 정의는

Var⁡(X)=E[(X−E(X))2]\operatorname{Var}(X) = E\left[(X-E(X))^2\right]

이다.

제곱은 항상 0 이상이므로

Var⁡(X)≥0\operatorname{Var}(X)\geq0

이다.

또한 분산이 0이라는 것은 XX가 사실상 하나의 상수값만 가진다는 뜻이다.

Var⁡(X)=0  ⟺  P(X=a)=1for some a\operatorname{Var}(X)=0 \iff P(X=a)=1 \quad\text{for some }a

즉, XX가 항상 같은 값이라면 퍼짐이 없으므로 분산은 0이다.


분산은 선형적이지 않다

기댓값은 선형이지만 분산은 선형적이지 않다.

따라서 일반적으로

Var⁡(X+Y)≠Var⁡(X)+Var⁡(Y)\operatorname{Var}(X+Y) \neq \operatorname{Var}(X)+\operatorname{Var}(Y)

이다.

반면 XX와 YY가 독립이면

Var⁡(X+Y)=Var⁡(X)+Var⁡(Y)\operatorname{Var}(X+Y) = \operatorname{Var}(X)+\operatorname{Var}(Y)

가 성립한다.

중요한 점은 기댓값의 선형성에는 독립성이 필요하지 않지만, 분산의 합을 단순히 더하려면 독립성 같은 추가 조건이 필요하다는 것이다.

극단적인 예시로 X+XX+X는 같은 확률변수 XX를 두 번 더한 것이다.

따라서

X+X=2XX+X=2X

이고

Var⁡(X+X)=Var⁡(2X)=4Var⁡(X)\operatorname{Var}(X+X) = \operatorname{Var}(2X) = 4\operatorname{Var}(X)

이다.

XX는 자기 자신과 독립이 아니다.

따라서

Var⁡(X+X)≠Var⁡(X)+Var⁡(X)\operatorname{Var}(X+X) \neq \operatorname{Var}(X)+\operatorname{Var}(X)

이다.

이것은 같은 확률변수를 두 번 더하는 것과 독립인 확률변수 두 개를 더하는 것은 전혀 다르다는 것을 보여준다.


정규분포를 표준정규분포로 바꾸기

앞에서는 표준정규분포에 상수를 더하고 곱해서 일반적인 정규분포를 만들었다.

X=μ+σZX=\mu+\sigma Z

이번에는 반대로 XX에서 ZZ를 구해보자.

Z=X−μσZ=\frac{X-\mu}{\sigma}

이 과정을 표준화(standardization)라고 한다.

즉 평균을 빼고 표준편차로 나누면 표준정규분포로 변환된다.

따라서

X∼N(μ,σ2)X\sim N(\mu,\sigma^2)

이면

X−μσ∼N(0,1)\frac{X-\mu}{\sigma}\sim N(0,1)

이다.

표준화의 직관은 다음과 같다.

  • X−μX-\mu → 평균으로부터 얼마나 떨어져 있는가
  • ÷σ\div\sigma → 그 거리가 표준편차의 몇 배인가

따라서 표준화된 값은 평균으로부터 몇 표준편차 떨어져 있는지를 나타낸다.

또한 단위도 사라진다.

예를 들어 키를 cm로 측정했든 m로 측정했든 표준화하면 단위가 없는 값이 된다.
-> 이건 좀 더 알아 봐야 할 듯


일반 정규분포의 CDF와 PDF 구하기

X∼N(μ,σ2)X\sim N(\mu,\sigma^2)라고 하자. 이는 표준정규분포를 따르는 Z∼N(0,1)Z\sim N(0,1)에 대해

X=μ+σZ(σ>0)X=\mu+\sigma Z \qquad (\sigma>0)

로 쓸 수 있다는 뜻이다. 따라서 Z=X−μσZ=\dfrac{X-\mu}{\sigma}는 표준정규분포를 따른다.

CDF의 정의부터 시작한다.

FX(x)=P(X≤x)F_X(x)=P(X\leq x)

σ>0\sigma>0이므로 양변을 σ\sigma로 나눠도 부등호 방향이 바뀌지 않는다. 따라서 표준화를 적용하면

P(X≤x)=P(X−μσ≤x−μσ)P(X\leq x) = P\left( \frac{X-\mu}{\sigma} \leq \frac{x-\mu}{\sigma} \right)

이다. 확률 안의 X−μσ=Z\dfrac{X-\mu}{\sigma}=Z는 표준정규분포를 따르므로

FX(x)=Φ(x−μσ)F_X(x) = \Phi\left(\frac{x-\mu}{\sigma}\right)

이다.

이제 CDF를 미분하면 PDF를 얻을 수 있다.

fX(x)=ddxΦ(x−μσ)f_X(x) = \frac{d}{dx} \Phi\left(\frac{x-\mu}{\sigma}\right)

연쇄법칙을 사용하면

fX(x)=1σϕ(x−μσ)f_X(x) = \frac{1}{\sigma} \phi\left(\frac{x-\mu}{\sigma}\right)

이고, 표준정규분포의 PDF ϕ(z)=12πe−12z2\phi(z)=\dfrac{1}{\sqrt{2\pi}}e^{-\frac12 z^2}에 z=x−μσz=\dfrac{x-\mu}{\sigma}를 대입하면

fX(x)=1σ2πe−12(x−μσ)2f_X(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac12\left(\frac{x-\mu}{\sigma}\right)^2}

이다.

즉, 일반 정규분포의 PDF를 외울 필요 없이 표준화와 표준정규분포의 PDF를 이용해서 직접 얻을 수 있다.


−X-X의 분포

일반 정규분포도 표준정규분포로 생각하면 변환을 쉽게 알 수 있다.

X=μ+σZX=\mu+\sigma Z

라면

−X=−μ+σ(−Z)-X=-\mu+\sigma(-Z)

이다.

앞에서

−Z∼N(0,1)-Z\sim N(0,1)

임을 알고 있으므로

−X∼N(−μ,σ2)-X\sim N(-\mu,\sigma^2)

이다.

평균의 부호는 바뀌지만 분산은 그대로이다.

분산은 음수가 될 수 없으며, 실제로

Var⁡(−X)=(−1)2Var⁡(X)=Var⁡(X)\operatorname{Var}(-X) = (-1)^2\operatorname{Var}(X) = \operatorname{Var}(X)

이다.


독립인 정규분포의 합

서로 독립인 정규분포를 더하면 결과 역시 정규분포가 된다.

X1∼N(μ1,σ12),X2∼N(μ2,σ22)X_1\sim N(\mu_1,\sigma_1^2), \qquad X_2\sim N(\mu_2,\sigma_2^2)

이고 X1,X2X_1,X_2가 독립이라면

X1+X2∼N(μ1+μ2,σ12+σ22)X_1+X_2 \sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)

이다.

평균은 기댓값의 선형성 때문에 바로 더할 수 있다.

E(X1+X2)=μ1+μ2E(X_1+X_2)=\mu_1+\mu_2

분산은 독립일 때 분산의 합으로 계산할 수 있다.

Var⁡(X1+X2)=σ12+σ22\operatorname{Var}(X_1+X_2) = \sigma_1^2+\sigma_2^2

뺄셈도 마찬가지이다.

X1−X2∼N(μ1−μ2,σ12+σ22)X_1-X_2 \sim N(\mu_1-\mu_2,\sigma_1^2+\sigma_2^2)

분산을 뺄셈으로 계산하면 안 된다.

−X2-X_2를 더한다고 생각하면

X1−X2=X1+(−X2)X_1-X_2=X_1+(-X_2)

이고

Var⁡(−X2)=Var⁡(X2)\operatorname{Var}(-X_2)=\operatorname{Var}(X_2)

이므로 분산은 여전히 더해진다.


68-95-99.7 법칙

정규분포에서는 평균에서 몇 표준편차 이내에 값이 들어오는지를 빠르게 기억할 수 있다.

P(∣X−μ∣≤σ)≈0.68P(|X-\mu|\leq\sigma)\approx0.68

즉, 평균에서 1 표준편차 이내에 약 68%가 있다.

P(∣X−μ∣≤2σ)≈0.95P(|X-\mu|\leq2\sigma)\approx0.95

평균에서 2 표준편차 이내에는 약 95%가 있다.

P(∣X−μ∣≤3σ)≈0.997P(|X-\mu|\leq3\sigma)\approx0.997

평균에서 3 표준편차 이내에는 약 99.7%가 있다.

따라서 정규분포에서는 대략 1σ → 68%, 2σ → 95%, 3σ → 99.7%로 기억하면 된다.

대수적 증명
표준화 Z=X−μσZ = \dfrac{X-\mu}{\sigma}를 하면 어떤 정규분포든 표준정규분포 N(0,1)N(0,1)이 된다.

P(∣X−μ∣≤kσ)=P(∣Z∣≤k)=Φ(k)−Φ(−k)=2Φ(k)−1P(|X-\mu|\le k\sigma) = P(|Z|\le k) = \Phi(k) - \Phi(-k) = 2\Phi(k) - 1

값을 대입하면 다음과 같다.

k=1k=1: 2(0.8413)−1≈0.68272(0.8413)-1 \approx 0.6827
k=2k=2: 2(0.9772)−1≈0.95452(0.9772)-1 \approx 0.9545
k=3k=3: 2(0.9987)−1≈0.99732(0.9987)-1 \approx 0.9973


LOTUS의 핵심

LOTUS는 새로운 확률변수 g(X)g(X)의 분포를 직접 구하지 않고도 그 기대값을 계산할 수 있게 해준다.

이산확률변수 XX에 대해

E[g(X)]=∑xg(x)P(X=x)E[g(X)] = \sum_x g(x)P(X=x)

이다.

핵심은 g(X)g(X)의 분포를 새롭게 구하지 않고, 원래 XX의 PMF를 그대로 사용해서 g(X)g(X)의 기대값을 계산할 수 있다.

예를 들어 E(X2)E(X^2)을 구하고 싶다면

E(X2)=∑xx2P(X=x)E(X^2) = \sum_x x^2P(X=x)

이다.


LOTUS의 대수적 증명

E(g(X))=∑s∈Sg(X(s))P({s})=∑x∑s:X(s)=xg(X(s))P({s})=∑xg(x)∑s:X(s)=xP({s})=∑xg(x)P(X=x)\begin{aligned} E(g(X)) &=\sum_{s\in S}g(X(s))P(\{s\})\\ &=\sum_x\sum_{s:X(s)=x}g(X(s))P(\{s\})\\ &=\sum_x g(x)\sum_{s:X(s)=x}P(\{s\})\\ &=\sum_x g(x)P(X=x) \end{aligned}

XX가 표본공간의 결과들을 숫자로 바꾸는 함수라고 생각하자.

각 결과를 ss라고 하면 X(s)X(s)는 그 결과에서 나온 XX의 값이다.

g(X)g(X)는

g(X(s))g(X(s))

가 된다.

따라서 모든 표본공간의 결과에 대해 직접 평균을 계산하면

∑sg(X(s))P({s})\sum_s g(X(s))P(\{s\})

가 된다.

그런데 같은 XX값을 가지는 결과들을 하나의 그룹으로 묶으면,

∑xg(x)P(X=x)\sum_x g(x)P(X=x)

가 된다.

두 계산은 단지 같은 결과들을 서로 다른 방식으로 묶어서 계산한 것이다.

그래서

E[g(X)]=∑xg(x)P(X=x)E[g(X)] = \sum_x g(x)P(X=x)

가 성립한다.


포아송분포의 평균과 분산

포아송분포의 PMF는

P(X=k)=e−λλkk!P(X=k)=e^{-\lambda}\frac{\lambda^k}{k!}

이다.

포아송분포에서는

E(X)=λE(X)=\lambda

이고, 분산도

Var⁡(X)=λ\operatorname{Var}(X)=\lambda

이다.

평균과 분산이 모두 λ\lambda라는 것이 포아송분포의 중요한 특징이다.


LOTUS를 이용한 포아송분포의 분산

분산 공식에 의해

Var⁡(X)=E(X2)−[E(X)]2\operatorname{Var}(X)=E(X^2)-[E(X)]^2

이미 E(X)=λE(X)=\lambda를 알고 있으므로 E(X2)E(X^2)을 구한다.

LOTUS에 의해

E(X2)=e−λ∑k=0∞k2λkk!E(X^2) =e^{-\lambda}\sum_{k=0}^{\infty}k^2\frac{\lambda^k}{k!}

여기서 k2=k(k−1)+kk^2=k(k-1)+k를 이용하면

E(X2)=e−λ[∑k=0∞k(k−1)λkk!+∑k=0∞kλkk!]\begin{aligned} E(X^2) =e^{-\lambda}\left[ \sum_{k=0}^{\infty}k(k-1)\frac{\lambda^k}{k!} +\sum_{k=0}^{\infty}k\frac{\lambda^k}{k!} \right] \end{aligned}

테일러 급수

eλ=∑k=0∞λkk!e^\lambda=\sum_{k=0}^{\infty}\frac{\lambda^k}{k!}

를 이용한다.

(1) 1차 미분. 양변을 λ\lambda에 대해 한 번 미분하면

eλ=∑k=0∞k λk−1k!e^\lambda=\sum_{k=0}^{\infty}k\,\frac{\lambda^{k-1}}{k!}

양변에 λ\lambda를 곱하면

∑k=0∞k λkk!=λeλ\sum_{k=0}^{\infty}k\,\frac{\lambda^{k}}{k!}=\lambda e^\lambda

(2) 2차 미분. 원래 식 eλ=∑k=0∞λkk!e^\lambda=\sum_{k=0}^{\infty}\frac{\lambda^k}{k!}의 양변을 두 번 미분하면

eλ=∑k=0∞k(k−1) λk−2k!e^\lambda=\sum_{k=0}^{\infty}k(k-1)\,\frac{\lambda^{k-2}}{k!}

양변에 λ2\lambda^2를 곱하면

∑k=0∞k(k−1) λkk!=λ2eλ\sum_{k=0}^{\infty}k(k-1)\,\frac{\lambda^{k}}{k!}=\lambda^2e^\lambda

따라서 두 결과를 대입하면

E(X2)=e−λ(λ2eλ+λeλ)=λ2+λ\begin{aligned} E(X^2) &=e^{-\lambda}(\lambda^2e^\lambda+\lambda e^\lambda)\\ &=\lambda^2+\lambda \end{aligned}

이를 분산 공식에 대입하면

Var⁡(X)=E(X2)−[E(X)]2=(λ2+λ)−λ2=λ\begin{aligned} \operatorname{Var}(X) &=E(X^2)-[E(X)]^2\\ &=(\lambda^2+\lambda)-\lambda^2\\ &=\lambda \end{aligned}

결과적으로 포아송 분포에서

E(X)=λ,Var⁡(X)=λE(X)=\lambda, \qquad \operatorname{Var}(X)=\lambda

이항분포를 지시확률변수의 합으로 표현하기

이항분포는 nn번의 베르누이 시행에서 성공한 횟수이다.

따라서 각 시행의 성공 여부를 지시확률변수로 나타내면

X=I1+I2+⋯+InX=I_1+I_2+\cdots+I_n

으로 표현할 수 있다.

각 IjI_j는 성공하면 1, 실패하면 0인 베르누이 확률변수이다.

Ij∼Bernoulli⁡(p)I_j\sim\operatorname{Bernoulli}(p)

그리고 각 시행이 독립이므로 I1,…,InI_1,\dots,I_n도 독립이다.


이항분포의 E(X2)E(X^2) 계산

먼저

X=I1+⋯+InX=I_1+\cdots+I_n

을 제곱한다.

X2=(I1+⋯+In)(I1+⋯+In)=∑i=1n∑j=1nIiIj=I12+⋯+In2+2∑i<jIiIjX^2=(I_1+\cdots+I_n)(I_1+\cdots+I_n)=\sum_{i=1}^n\sum_{j=1}^n I_iI_j= I_1^2+\cdots+I_n^2 + 2\sum_{i<j}I_iI_j

이다.

기댓값의 선형성을 적용하면

E(X2)=∑i=1nE(Ii2)+2∑i<jE(IiIj)E(X^2) = \sum_{i=1}^nE(I_i^2) + 2\sum_{i<j}E(I_iI_j)

가 된다.

각 IiI_i는 0 또는 1이므로

Ii2=IiI_i^2=I_i

이다.

따라서

E(Ii2)=E(Ii)=pE(I_i^2)=E(I_i)=p

이고 첫 번째 항은

npnp

가 된다.

IiIjI_iI_j는 두 시행이 모두 성공했는지를 나타내는 지시확률변수로 생각할 수 있다.

두 시행이 독립이므로

P(Ii=1,Ij=1)=p2P(I_i=1,I_j=1)=p^2

이다.

따라서

E(IiIj)=p2E(I_iI_j)=p^2

이다.

교차항의 개수는

(n2)\binom{n}{2}

개이므로

2(n2)p2=n(n−1)p22\binom{n}{2}p^2 = n(n-1)p^2

이다.

따라서

E(X2)=np+n(n−1)p2E(X^2) = np+n(n-1)p^2

이고 정리하면

E(X2)=np+n2p2−np2E(X^2) = np+n^2p^2-np^2

이다.


이항분포의 분산

이항분포의 평균은

E(X)=npE(X)=np

이므로

[E(X)]2=n2p2[E(X)]^2=n^2p^2

이다.

따라서

Var⁡(X)=E(X2)−[E(X)]2\operatorname{Var}(X) = E(X^2)-[E(X)]^2

에 대입하면

Var⁡(X)=np+n(n−1)p2−n2p2\operatorname{Var}(X) = np+n(n-1)p^2-n^2p^2

이고

Var⁡(X)=np−np2\operatorname{Var}(X) = np-np^2

이다.

따라서

Var⁡(X)=np(1−p)\operatorname{Var}(X) = np(1-p)

이다.

q=1−pq=1-p라고 하면

Var⁡(X)=npq\operatorname{Var}(X)=npq

가 된다.


초기하분포는 왜 더 복잡한가?

초기하분포도 지시확률변수의 합으로 표현할 수 있다.

하지만 비복원추출이기 때문에 각 지시확률변수가 서로 독립이 아니다.

따라서 평균을 구할 때는 기댓값의 선형성을 사용할 수 있지만,

E(X1+⋯+Xn)=E(X1)+⋯+E(Xn)E(X_1+\cdots+X_n) = E(X_1)+\cdots+E(X_n)

분산을 계산할 때는 단순히 각각의 분산을 더할 수 없다.

즉,

Var⁡(X1+⋯+Xn)≠∑iVar⁡(Xi)\operatorname{Var}(X_1+\cdots+X_n) \neq \sum_i\operatorname{Var}(X_i)

가 일반적으로 성립한다.

초기하분포의 분산은 독립성이 없기 때문에 이항분포보다 더 복잡해진다.

0개의 댓글