표준정규분포
표준정규분포는 정규분포 중에서 가장 기본이 되는 분포이다.
Z∼N(0,1)
여기서 평균은 0, 분산은 1이다.
표준정규분포를 나타낼 때 관습적으로 Z라는 기호를 사용하지만, Z라는 문자가 반드시 표준정규분포를 의미하는 것은 아니다.
표준정규분포의 PDF는
fZ(z)=2π1e−z2/2
이다.
이 함수는 z와 −z를 바꾸어도 값이 같으므로 0을 기준으로 대칭이다.
fZ(z)=fZ(−z)
표준정규분포의 평균과 분산
대칭성을 이용하면 표준정규분포의 평균은 바로 0임을 알 수 있다.
실제로 LOTUS를 이용하면
E(Z)=2π1∫−∞∞ze−z2/2dz
인데,
ze−z2/2는 홀함수이고 적분 구간이 −∞부터 ∞까지 대칭이므로 적분값은 0이다.
분산은
Var(Z)=E(Z2)−[E(Z)]2
이다.
이미 E(Z)=0이므로
Var(Z)=E(Z2)
이고, 지난 시간의 계산을 통해
임을 얻는다.
따라서
Var(Z)=1
이다.
적률 Moment
E(Z), E(Z2), E(Z3)처럼 확률변수의 거듭제곱의 기대값을 적률(moment)이라고 한다.
E(Z)는 1차 적률, E(Z2)는 2차 적률, E(Z3)는 3차 적률이다.
정규분포는 0을 기준으로 대칭이므로 모든 홀수 차수의 적률은 0이 된다.
E(Z)=E(Z3)=E(Z5)=⋯=0
왜냐하면 홀수 거듭제곱을 포함한 적분의 integrand가 홀함수가 되기 때문이다.
반면 짝수 적률은 일반적으로 0이 아니다.
예를 들어
이다.
표준정규분포의 대칭성
표준정규분포는 0을 기준으로 대칭이므로 Z의 부호를 뒤집어도 분포 자체는 변하지 않는다.
−Z∼N(0,1)
즉, Z가 양수였던 값을 음수로 바꾸고 음수였던 값을 양수로 바꾸더라도 전체적인 분포는 동일하다.
이것이 정규분포의 대칭성을 나타내는 중요한 표현이다.
표준정규분포의 CDF
표준정규분포의 CDF는 특별히 Φ라는 기호를 사용한다.
Φ(z)=2π1∫−∞ze−t2/2dt
표준정규분포의 CDF는 일반적인 초등함수의 형태로 쉽게 계산할 수 없기 때문에 Φ라는 별도의 함수로 정의하여 사용한다.
대칭성 때문에
Φ(−z)=1−Φ(z)
가 성립한다.
표준정규분포에서 일반정규분포 만들기
표준정규분포가 가장 기본적인 정규분포이므로, 상수를 더하고 곱하는 것만으로 다른 정규분포를 만들 수 있다.
X=μ+σZ
여기서
- μ는 평균이며 location 역할을 한다.
- σ>0은 표준편차이며 scale 역할을 한다.
μ를 더하면 분포가 왼쪽이나 오른쪽으로 이동한다.
반면 σ를 곱하면 분포의 퍼지는 정도가 달라진다.
따라서
- μ → 위치를 이동
- σ → 분포의 크기와 퍼짐을 조절
한다고 생각하면 된다.
이때
X∼N(μ,σ2)
라고 표현한다.
즉, 정규분포는 평균과 분산이라는 두 개의 모수로 결정된다.
일반 정규분포의 평균과 분산
선형성을 이용하면
E(X)=E(μ+σZ)=μ+σE(Z)
이고 E(Z)=0이므로
이다.
분산은 상수를 더해도 변하지 않고, 상수를 곱하면 그 상수의 제곱만큼 변한다.
따라서
Var(X)=Var(μ+σZ)=σ2Var(Z)=σ2
이다.
결국
X∼N(μ,σ2)
에서 평균은 μ, 분산은 σ2이다.
상수를 더하면 분산은 변하지 않는다
확률변수에 상수 c를 더한다고 해서 퍼지는 정도가 변하지는 않는다.
Var(X+c)=Var(X)
직관적으로도 X의 모든 값이 똑같이 c만큼 이동할 뿐이므로 값들 사이의 거리는 그대로이다.
상수를 곱하면 분산은 제곱만큼 변한다
확률변수에 상수 c를 곱하면
Var(cX)=c2Var(X)
가 된다.
여기서 가장 흔한 실수는 c를 그대로 밖으로 꺼내는 것이다.
Var(cX)=cVar(X)
분산은 거리의 제곱을 이용하기 때문에 c도 제곱되어 나온다.
특히 c가 음수인 경우에도 분산은 음수가 될 수 없어야 하므로 c2이 되어야 한다.
대수적 증명
분산은 Var(X)=E[(X−E[X])2]이고, 기대값의 선형성에 의해 E[aX]=aE[X]이다.
Var(aX)=E[(aX−E[aX])2]=E[(aX−aE[X])2]=E[(a(X−E[X]))2]=E[a2(X−E[X])2]=a2E[(X−E[X])2]=a2Var(X).
분산은 항상 0 이상이다
분산의 정의는
Var(X)=E[(X−E(X))2]
이다.
제곱은 항상 0 이상이므로
Var(X)≥0
이다.
또한 분산이 0이라는 것은 X가 사실상 하나의 상수값만 가진다는 뜻이다.
Var(X)=0⟺P(X=a)=1for some a
즉, X가 항상 같은 값이라면 퍼짐이 없으므로 분산은 0이다.
분산은 선형적이지 않다
기댓값은 선형이지만 분산은 선형적이지 않다.
따라서 일반적으로
Var(X+Y)=Var(X)+Var(Y)
이다.
반면 X와 Y가 독립이면
Var(X+Y)=Var(X)+Var(Y)
가 성립한다.
중요한 점은 기댓값의 선형성에는 독립성이 필요하지 않지만, 분산의 합을 단순히 더하려면 독립성 같은 추가 조건이 필요하다는 것이다.
극단적인 예시로 X+X는 같은 확률변수 X를 두 번 더한 것이다.
따라서
이고
Var(X+X)=Var(2X)=4Var(X)
이다.
X는 자기 자신과 독립이 아니다.
따라서
Var(X+X)=Var(X)+Var(X)
이다.
이것은 같은 확률변수를 두 번 더하는 것과 독립인 확률변수 두 개를 더하는 것은 전혀 다르다는 것을 보여준다.
정규분포를 표준정규분포로 바꾸기
앞에서는 표준정규분포에 상수를 더하고 곱해서 일반적인 정규분포를 만들었다.
X=μ+σZ
이번에는 반대로 X에서 Z를 구해보자.
Z=σX−μ
이 과정을 표준화(standardization)라고 한다.
즉 평균을 빼고 표준편차로 나누면 표준정규분포로 변환된다.
따라서
X∼N(μ,σ2)
이면
σX−μ∼N(0,1)
이다.
표준화의 직관은 다음과 같다.
- X−μ → 평균으로부터 얼마나 떨어져 있는가
- ÷σ → 그 거리가 표준편차의 몇 배인가
따라서 표준화된 값은 평균으로부터 몇 표준편차 떨어져 있는지를 나타낸다.
또한 단위도 사라진다.
예를 들어 키를 cm로 측정했든 m로 측정했든 표준화하면 단위가 없는 값이 된다.
-> 이건 좀 더 알아 봐야 할 듯
일반 정규분포의 CDF와 PDF 구하기
X∼N(μ,σ2)라고 하자. 이는 표준정규분포를 따르는 Z∼N(0,1)에 대해
X=μ+σZ(σ>0)
로 쓸 수 있다는 뜻이다. 따라서 Z=σX−μ는 표준정규분포를 따른다.
CDF의 정의부터 시작한다.
FX(x)=P(X≤x)
σ>0이므로 양변을 σ로 나눠도 부등호 방향이 바뀌지 않는다. 따라서 표준화를 적용하면
P(X≤x)=P(σX−μ≤σx−μ)
이다. 확률 안의 σX−μ=Z는 표준정규분포를 따르므로
FX(x)=Φ(σx−μ)
이다.
이제 CDF를 미분하면 PDF를 얻을 수 있다.
fX(x)=dxdΦ(σx−μ)
연쇄법칙을 사용하면
fX(x)=σ1ϕ(σx−μ)
이고, 표준정규분포의 PDF ϕ(z)=2π1e−21z2에 z=σx−μ를 대입하면
fX(x)=σ2π1e−21(σx−μ)2
이다.
즉, 일반 정규분포의 PDF를 외울 필요 없이 표준화와 표준정규분포의 PDF를 이용해서 직접 얻을 수 있다.
−X의 분포
일반 정규분포도 표준정규분포로 생각하면 변환을 쉽게 알 수 있다.
X=μ+σZ
라면
−X=−μ+σ(−Z)
이다.
앞에서
−Z∼N(0,1)
임을 알고 있으므로
−X∼N(−μ,σ2)
이다.
평균의 부호는 바뀌지만 분산은 그대로이다.
분산은 음수가 될 수 없으며, 실제로
Var(−X)=(−1)2Var(X)=Var(X)
이다.
독립인 정규분포의 합
서로 독립인 정규분포를 더하면 결과 역시 정규분포가 된다.
X1∼N(μ1,σ12),X2∼N(μ2,σ22)
이고 X1,X2가 독립이라면
X1+X2∼N(μ1+μ2,σ12+σ22)
이다.
평균은 기댓값의 선형성 때문에 바로 더할 수 있다.
E(X1+X2)=μ1+μ2
분산은 독립일 때 분산의 합으로 계산할 수 있다.
Var(X1+X2)=σ12+σ22
뺄셈도 마찬가지이다.
X1−X2∼N(μ1−μ2,σ12+σ22)
분산을 뺄셈으로 계산하면 안 된다.
−X2를 더한다고 생각하면
X1−X2=X1+(−X2)
이고
Var(−X2)=Var(X2)
이므로 분산은 여전히 더해진다.
68-95-99.7 법칙
정규분포에서는 평균에서 몇 표준편차 이내에 값이 들어오는지를 빠르게 기억할 수 있다.
P(∣X−μ∣≤σ)≈0.68
즉, 평균에서 1 표준편차 이내에 약 68%가 있다.
P(∣X−μ∣≤2σ)≈0.95
평균에서 2 표준편차 이내에는 약 95%가 있다.
P(∣X−μ∣≤3σ)≈0.997
평균에서 3 표준편차 이내에는 약 99.7%가 있다.
따라서 정규분포에서는 대략 1σ → 68%, 2σ → 95%, 3σ → 99.7%로 기억하면 된다.
대수적 증명
표준화 Z=σX−μ를 하면 어떤 정규분포든 표준정규분포 N(0,1)이 된다.
P(∣X−μ∣≤kσ)=P(∣Z∣≤k)=Φ(k)−Φ(−k)=2Φ(k)−1
값을 대입하면 다음과 같다.
k=1: 2(0.8413)−1≈0.6827
k=2: 2(0.9772)−1≈0.9545
k=3: 2(0.9987)−1≈0.9973
LOTUS의 핵심
LOTUS는 새로운 확률변수 g(X)의 분포를 직접 구하지 않고도 그 기대값을 계산할 수 있게 해준다.
이산확률변수 X에 대해
E[g(X)]=x∑g(x)P(X=x)
이다.
핵심은 g(X)의 분포를 새롭게 구하지 않고, 원래 X의 PMF를 그대로 사용해서 g(X)의 기대값을 계산할 수 있다.
예를 들어 E(X2)을 구하고 싶다면
E(X2)=x∑x2P(X=x)
이다.
LOTUS의 대수적 증명
E(g(X))=s∈S∑g(X(s))P({s})=x∑s:X(s)=x∑g(X(s))P({s})=x∑g(x)s:X(s)=x∑P({s})=x∑g(x)P(X=x)
X가 표본공간의 결과들을 숫자로 바꾸는 함수라고 생각하자.
각 결과를 s라고 하면 X(s)는 그 결과에서 나온 X의 값이다.
g(X)는
가 된다.
따라서 모든 표본공간의 결과에 대해 직접 평균을 계산하면
s∑g(X(s))P({s})
가 된다.
그런데 같은 X값을 가지는 결과들을 하나의 그룹으로 묶으면,
x∑g(x)P(X=x)
가 된다.
두 계산은 단지 같은 결과들을 서로 다른 방식으로 묶어서 계산한 것이다.
그래서
E[g(X)]=x∑g(x)P(X=x)
가 성립한다.
포아송분포의 평균과 분산
포아송분포의 PMF는
P(X=k)=e−λk!λk
이다.
포아송분포에서는
이고, 분산도
Var(X)=λ
이다.
평균과 분산이 모두 λ라는 것이 포아송분포의 중요한 특징이다.
LOTUS를 이용한 포아송분포의 분산
분산 공식에 의해
Var(X)=E(X2)−[E(X)]2
이미 E(X)=λ를 알고 있으므로 E(X2)을 구한다.
LOTUS에 의해
E(X2)=e−λk=0∑∞k2k!λk
여기서 k2=k(k−1)+k를 이용하면
E(X2)=e−λ[k=0∑∞k(k−1)k!λk+k=0∑∞kk!λk]
테일러 급수
eλ=k=0∑∞k!λk
를 이용한다.
(1) 1차 미분. 양변을 λ에 대해 한 번 미분하면
eλ=k=0∑∞kk!λk−1
양변에 λ를 곱하면
k=0∑∞kk!λk=λeλ
(2) 2차 미분. 원래 식 eλ=∑k=0∞k!λk의 양변을 두 번 미분하면
eλ=k=0∑∞k(k−1)k!λk−2
양변에 λ2를 곱하면
k=0∑∞k(k−1)k!λk=λ2eλ
따라서 두 결과를 대입하면
E(X2)=e−λ(λ2eλ+λeλ)=λ2+λ
이를 분산 공식에 대입하면
Var(X)=E(X2)−[E(X)]2=(λ2+λ)−λ2=λ
결과적으로 포아송 분포에서
E(X)=λ,Var(X)=λ
이항분포를 지시확률변수의 합으로 표현하기
이항분포는 n번의 베르누이 시행에서 성공한 횟수이다.
따라서 각 시행의 성공 여부를 지시확률변수로 나타내면
X=I1+I2+⋯+In
으로 표현할 수 있다.
각 Ij는 성공하면 1, 실패하면 0인 베르누이 확률변수이다.
Ij∼Bernoulli(p)
그리고 각 시행이 독립이므로 I1,…,In도 독립이다.
이항분포의 E(X2) 계산
먼저
X=I1+⋯+In
을 제곱한다.
X2=(I1+⋯+In)(I1+⋯+In)=i=1∑nj=1∑nIiIj=I12+⋯+In2+2i<j∑IiIj
이다.
기댓값의 선형성을 적용하면
E(X2)=i=1∑nE(Ii2)+2i<j∑E(IiIj)
가 된다.
각 Ii는 0 또는 1이므로
이다.
따라서
E(Ii2)=E(Ii)=p
이고 첫 번째 항은
가 된다.
IiIj는 두 시행이 모두 성공했는지를 나타내는 지시확률변수로 생각할 수 있다.
두 시행이 독립이므로
P(Ii=1,Ij=1)=p2
이다.
따라서
E(IiIj)=p2
이다.
교차항의 개수는
개이므로
2(2n)p2=n(n−1)p2
이다.
따라서
E(X2)=np+n(n−1)p2
이고 정리하면
E(X2)=np+n2p2−np2
이다.
이항분포의 분산
이항분포의 평균은
이므로
[E(X)]2=n2p2
이다.
따라서
Var(X)=E(X2)−[E(X)]2
에 대입하면
Var(X)=np+n(n−1)p2−n2p2
이고
Var(X)=np−np2
이다.
따라서
Var(X)=np(1−p)
이다.
q=1−p라고 하면
Var(X)=npq
가 된다.
초기하분포는 왜 더 복잡한가?
초기하분포도 지시확률변수의 합으로 표현할 수 있다.
하지만 비복원추출이기 때문에 각 지시확률변수가 서로 독립이 아니다.
따라서 평균을 구할 때는 기댓값의 선형성을 사용할 수 있지만,
E(X1+⋯+Xn)=E(X1)+⋯+E(Xn)
분산을 계산할 때는 단순히 각각의 분산을 더할 수 없다.
즉,
Var(X1+⋯+Xn)=i∑Var(Xi)
가 일반적으로 성립한다.
초기하분포의 분산은 독립성이 없기 때문에 이항분포보다 더 복잡해진다.