Lecture 13: Normal distribution | Statistics 110

Prettypotato·4일 전

Statistics 110

목록 보기
17/18

균등분포의 보편성 (Universality of Uniform)

지난 시간에 배운 균등분포의 보편성을 다시 살펴보자.

핵심 아이디어는 0과 1 사이의 균등분포만 이용해서 원하는 분포를 만들 수 있다는 것이다.

U∼Unif(0,1)U\sim\mathrm{Unif}(0,1)이라고 하고, FF가 연속이고 강한 증가인 누적분포함수라고 하자.

이때 균등분포를 이용해 다음과 같이 새로운 확률변수를 만들 수 있다.

X=F−1(U)X=F^{-1}(U)

그러면 XX는 누적분포함수 FF를 따른다.

즉, 원하는 분포 FF를 직접 시뮬레이션하기 어려워도 먼저 균등분포를 생성한 다음 F−1F^{-1}을 적용하면 된다.

균등분포를 생성 → F−1F^{-1} 적용 → 원하는 분포 생성

실제로는 F−1F^{-1}을 해석적으로 구하기 어려운 경우도 많지만, 이론적으로는 균등분포 하나로 매우 다양한 분포를 만들 수 있다는 것이 핵심이다.


지수분포를 이용한 예시

다음과 같은 누적분포함수를 생각해보자.

F(x)=1−e−x,x>0F(x)=1-e^{-x},\qquad x>0

이것은 모수가 1인 지수분포의 CDF이다.

이 분포를 따르는 확률변수를 시뮬레이션하고 싶다면 먼저 FF의 역함수를 구한다.

u=F(x)u=F(x)라고 놓으면 u=1−e−xu=1-e^{-x}이고, 이를 xx에 대해 풀면 다음과 같다.

F−1(u)=−ln⁡(1−u)F^{-1}(u)=-\ln(1-u)

따라서 U∼Unif(0,1)U\sim\mathrm{Unif}(0,1)을 생성한 뒤

X=−ln⁡(1−U)X=-\ln(1-U)

로 계산하면 XX는 FF를 따른다.

즉, 컴퓨터에서 균등분포를 따르는 난수 10개를 생성하고 각각에 −ln⁡(1−U)-\ln(1-U)를 적용하면 FF를 따르는 10개의 iid(independent and identically distributed) 난수를 얻을 수 있다.

이를 한 줄로 정리하면 다음과 같다.

U∼Unif(0,1)⟹F−1(U)∼FU\sim\mathrm{Unif}(0,1)\quad\Longrightarrow\quad F^{-1}(U)\sim F

균등분포의 대칭성

U∼Unif(0,1)U\sim\mathrm{Unif}(0,1)이면 1−U1-U 역시 Unif(0,1)\mathrm{Unif}(0,1)을 따른다.

직관적으로 생각해보면, UU는 0과 1 사이에서 무작위로 하나의 점을 고르는 것이다.

예를 들어 U=0.2U=0.2라면 0에서 UU까지의 거리는 0.20.2이고, 1에서 UU까지의 거리는 0.80.8이다.

즉, 1−U1-U는 오른쪽 끝(1)에서 UU까지 잰 거리라고 생각할 수 있다. UU는 왼쪽 끝(0)에서부터 잰 위치이고, 1−U1-U는 오른쪽 끝(1)에서부터 잰 위치이므로, 같은 점을 반대 방향에서 측정한 것이다.

0과 1 사이에서 점을 균등하게 고르면, 왼쪽에서부터 재든 오른쪽에서부터 재든 점이 똑같이 균등하게 퍼져 있다. 따라서 UU와 1−U1-U는 값은 다르지만 같은 분포를 따른다. 즉 1−U∼Uniform(0,1)1-U \sim \text{Uniform}(0,1)이다.

수식으로 확인하면 (0≤x≤10\le x\le 1):

P(1−U≤x)=P(U≥1−x)=1−(1−x)=xP(1-U \le x) = P(U \ge 1-x) = 1-(1-x) = x

이는 Uniform(0,1)\text{Uniform}(0,1)의 CDF와 같습니다.

따라서

U∼Unif(0,1)⟹1−U∼Unif(0,1)U\sim\mathrm{Unif}(0,1)\quad\Longrightarrow\quad 1-U\sim\mathrm{Unif}(0,1)

가 성립한다.

이 결과가 중요한 이유는 지수분포를 시뮬레이션할 때 볼 수 있다.

앞에서 지수분포의 역함수가

F−1(u)=−ln⁡(1−u)F^{-1}(u)=-\ln(1-u)

였기 때문에 원래는 −ln⁡(1−U)-\ln(1-U)를 사용해야 한다.

그런데 1−U1-U 역시 똑같은 균등분포를 따르므로, 1−U1-U를 새로운 균등분포 변수라고 생각할 수 있다.

따라서 −ln⁡(1−U)-\ln(1-U)와 −ln⁡U-\ln U는 같은 분포를 갖는다. 즉, 계산할 때는 더 간단하게 −ln⁡U-\ln U를 사용해도 된다.

이것이 균등분포의 중요한 대칭성이다.


반대 방향의 보편성

이번에는 반대 방향을 생각해보자.

앞에서는 균등분포에서 숫자를 하나 뽑은 다음, 그 숫자를 원하는 분포의 값으로 바꾸었다.

U∼Unif(0,1)⟹F−1(U)∼FU\sim\mathrm{Unif}(0,1) \quad\Longrightarrow\quad F^{-1}(U)\sim F

이번에는 반대로, 이미 어떤 분포를 따르는 XX가 있다고 하자.

X∼FX\sim F

이때 XX에 자신의 CDF FF를 적용하면

F(X)F(X)

라는 새로운 확률변수가 만들어진다.

여기서 F(X)F(X)는 단순히 FF에 XX라는 숫자를 넣은 것이다.

CDF의 정의에 따라 F(x)F(x)는 xx보다 작거나 같은 값이 나올 누적확률을 의미한다.

따라서 XX의 실제 값에 FF를 적용하면, 그 값 자체를 보는 것이 아니라 그 값이 전체 분포에서 어느 정도 위치에 있는지를 나타내게 된다.

예를 들어 어떤 값 xx에 대해

F(x)=0.2F(x)=0.2

라면, xx는 자신의 분포에서 누적확률 20% 지점에 있다는 뜻이다.

반대로

F(x)=0.8F(x)=0.8

이라면, xx는 누적확률 80% 지점에 있다는 뜻이다.

즉, XX를 F(X)F(X)로 바꾸면 XX의 "실제 값"이 아니라 "전체 분포에서 몇 % 지점에 있는가"를 나타내게 된다.

그리고 XX가 바로 자신의 분포 FF에서 뽑힌 값이기 때문에, 이러한 위치는 0과 1 사이에서 균등하게 나타난다.

따라서

X∼F⟹F(X)∼Unif(0,1)X\sim F \quad\Longrightarrow\quad F(X)\sim\mathrm{Unif}(0,1)

이것이 반대 방향의 보편성이다.


값과 위치를 서로 바꾸는 관계

이 내용을 더 직관적으로 보면 FF와 F−1F^{-1}은 서로 반대 역할을 한다.

앞 방향

X⟶F(X)X \longrightarrow F(X)

실제 값 → 그 값이 분포에서 차지하는 누적확률(위치)

뒤 방향

균등분포에서 숫자 하나를 뽑았다고 하자.

U=0.7U=0.7

이 숫자는 단순한 숫자라기보다 "70% 지점"이라고 생각할 수 있다.

그러면 F−1F^{-1}은 "누적확률이 70%가 되는 실제 XX의 값은 무엇인가?"를 찾아준다.

즉,

0.7⟶F−1(0.7)0.7 \longrightarrow F^{-1}(0.7)

이렇게 하면 누적확률 70%라는 위치를 실제 분포의 값으로 바꿀 수 있다.

따라서

U⟶F−1(U)U \longrightarrow F^{-1}(U)

는 누적확률(위치) → 그 위치에 해당하는 실제 값이라는 의미가 된다.

결국 이렇게 기억하면 된다.

FF는 "값 → 위치(백분위)"로 바꾸는 함수이고, F−1F^{-1}은 "위치(백분위) → 값"으로 바꾸는 함수이다.

그래서 보편성의 두 방향은 서로 정확히 반대되는 과정이다.

X→FF(X)X \xrightarrow{\quad F\quad} F(X)

실제 값 → 누적확률

반대로

U→F−1F−1(U)U \xrightarrow{\quad F^{-1}\quad} F^{-1}(U)

누적확률 → 실제 값

즉, CDF는 어떤 분포의 값을 0과 1 사이의 위치로 바꾸고, 역 CDF는 그 위치를 다시 원래 분포의 값으로 바꾼다.


F(X)F(X)에서 대문자와 소문자 구분

여기서 F(x)F(x)와 F(X)F(X)를 구분하는 것이 중요하다.

CDF의 정의는 F(x)=P(X≤x)F(x)=P(X\leq x)이다.

여기서 xx는 특정한 값을 의미하는 일반적인 숫자이다.

반면 XX는 확률변수이므로 F(X)F(X)는 함수 FF에 확률변수 XX를 넣어서 얻은 새로운 확률변수이다.

따라서 F(X)F(X)를 단순히 P(X≤X)P(X\leq X)로 생각하면 안 된다.

예를 들어 F(x)=1−e−xF(x)=1-e^{-x}라면 F(X)F(X)는 다음과 같이 계산한다.

F(X)=1−e−XF(X)=1-e^{-X}

즉, 먼저 함수 FF를 생각하고 그 함수의 입력값 xx를 확률변수 XX로 바꾼 것이다.

따라서 F(X)F(X)는 일반적으로 0과 1 사이의 값을 가지는 새로운 확률변수이다.


Independence

이번에는 여러 확률변수 사이의 독립성을 살펴보자.

확률변수 X1,…,XnX_1,\ldots,X_n이 독립이라는 것은 이들의 결합 CDF가 각각의 주변 CDF의 곱으로 분리된다는 뜻이다.

P(X1≤x1,…,Xn≤xn)=∏i=1nP(Xi≤xi)P(X_1\leq x_1,\ldots,X_n\leq x_n) = \prod_{i=1}^{n}P(X_i\leq x_i)

왼쪽의 확률은 여러 확률변수가 동시에 특정 조건을 만족할 확률이므로 joint CDF, 즉 결합 누적분포함수라고 한다.

오른쪽에서는 각각의 확률변수를 따로 계산한 뒤 곱하고 있다.

이것이 확률변수의 독립성을 나타내는 핵심적인 형태이다.

이산확률변수의 경우에는 CDF 대신 PMF를 이용해서 다음과 같이 쓸 수 있다.

P(X1=x1,…,Xn=xn)=∏i=1nP(Xi=xi)P(X_1=x_1,\ldots,X_n=x_n) = \prod_{i=1}^{n}P(X_i=x_i)

Pairwise Independence와 Full Independence

독립성을 이야기할 때 쌍으로 독립(pairwise independence)과 전체 독립(full independence)을 구분해야 한다.

전체 독립이면 모든 변수의 조합에 대해 독립성이 성립하므로 당연히 각각의 두 변수도 독립이다.

하지만 그 반대는 성립하지 않는다.

즉, pairwise independence는 full independence를 보장하지 않는다.

Pairwise Independence의 예시

공정한 동전 두 개의 결과를 나타내는 X1,X2X_1,X_2를 생각하고, 다음과 같이 X3X_3를 정의하자.

X3=I(X1=X2)X_3=I(X_1=X_2)

즉, X1X_1과 X2X_2가 같으면 X3=1X_3=1, 다르면 X3=0X_3=0이다.

이때 X1X_1과 X2X_2는 서로 독립이다.

또한 X1X_1과 X3X_3도 독립이고, X2X_2와 X3X_3도 독립이다.

따라서 각각의 두 변수만 놓고 보면 서로 독립이므로 pairwise independent이다.

하지만 세 변수 전체는 독립이 아니다.

왜냐하면 X1X_1과 X2X_2를 알고 있다면 X3X_3의 값이 완전히 결정되기 때문이다.

예를 들어 X1=X2X_1=X_2라는 것을 알고 있다면 반드시 X3=1X_3=1이다.

따라서 세 변수는 전체적으로 독립이 아니다.

Full independence⟹Pairwise independence\text{Full independence}\Longrightarrow\text{Pairwise independence}

하지만

Pairwise independence⟹̸Full independence\text{Pairwise independence}\not\Longrightarrow\text{Full independence}

Normal Distribution

정규분포는 통계학에서 가장 중요하고 유명한 분포 중 하나이다.

특히 중심극한정리(Central Limit Theorem)와 밀접하게 연결되어 있다.

중심극한정리의 핵심적인 직관은 독립적이고 동일한 분포를 가지는 많은 확률변수를 더하면 그 합의 분포가 정규분포와 비슷한 형태를 보인다는 것이다.

즉, 많은 iid 확률변수의 합은 대략적으로 정규분포처럼 보인다.

정규분포는 평균과 분산에 따라 위치와 크기가 달라질 수 있다.

그중 가장 기본적인 형태가 표준정규분포(Standard Normal Distribution)이다.

Z∼N(0,1)Z\sim N(0,1)

표준정규분포는 평균이 0이고 분산이 1인 정규분포이다.


표준정규분포의 PDF

표준정규분포의 확률밀도함수는 다음과 같은 형태이다.

fZ(z)=12πe−z2/2f_Z(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}

여기서 중요한 것은 앞에 붙어 있는 12π\frac{1}{\sqrt{2\pi}}라는 상수이다.

확률밀도함수는 전체 구간에서 적분했을 때 1이 되어야 한다.

따라서 e−z2/2e^{-z^2/2} 앞에 적절한 정규화 상수를 붙여 전체 넓이가 1이 되도록 만든 것이다.


정규화 상수의 계산

다음 적분을 생각하자.

I=∫−∞∞e−z2/2 dzI=\int_{-\infty}^{\infty}e^{-z^2/2}\,dz

이 적분은 직접 계산하기 어렵기 때문에 I2I^2을 생각한다.

I2=(∫−∞∞e−x2/2 dx)(∫−∞∞e−y2/2 dy)I^2 = \left(\int_{-\infty}^{\infty}e^{-x^2/2}\,dx\right) \left(\int_{-\infty}^{\infty}e^{-y^2/2}\,dy\right)

이를 이중적분으로 합치면 다음과 같다.

I2=∫−∞∞∫−∞∞e−(x2+y2)/2 dx dyI^2 = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} e^{-(x^2+y^2)/2}\,dx\,dy

이제 극좌표를 사용한다.

x=rcos⁡θ,y=rsin⁡θx=r\cos\theta,\qquad y=r\sin\theta

따라서 x2+y2=r2x^2+y^2=r^2이고, 면적 요소는 dx dy=r dr dθdx\,dy=r\,dr\,d\theta가 된다.

그러면

I2=∫02π∫0∞e−r2/2r dr dθI^2 = \int_0^{2\pi}\int_0^\infty e^{-r^2/2}r\,dr\,d\theta

가 된다.

계산하면

I2=2πI^2=2\pi

따라서

I=2πI=\sqrt{2\pi}

이다.

그러므로 전체 적분값이 1이 되도록 만드는 정규화 상수는 12π\frac{1}{\sqrt{2\pi}}이고, 표준정규분포의 PDF는

fZ(z)=12πe−z2/2f_Z(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}

가 된다.


표준정규분포의 평균

표준정규분포의 평균을 구해보자.

E(Z)=12π∫−∞∞ze−z2/2 dzE(Z)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^{\infty}z e^{-z^2/2}\,dz

여기서 e−z2/2e^{-z^2/2}는 짝함수이고 zz는 홀함수이므로 전체 integrand는 홀함수이다.

홀함수는 대칭적인 구간에서 적분하면 0이 된다.

따라서

E(Z)=0E(Z)=0

홀함수와 짝함수

홀함수는 다음 조건을 만족한다.

g(−x)=−g(x)g(-x)=-g(x)

대표적인 예가 sin⁡x\sin x이다.

반면 짝함수는 다음 조건을 만족한다.

g(−x)=g(x)g(-x)=g(x)

정규분포의 PDF에서 zz를 −z-z로 바꾸어도 z2z^2 때문에 값이 변하지 않는다.

따라서 정규분포의 PDF는 짝함수이고, 여기에 zz를 곱하면 홀함수가 된다.

그래서 평균이 0이 되는 것이다.

즉, 표준정규분포의 평균이 0인 이유는 분포가 0을 중심으로 대칭이기 때문이다.


표준정규분포의 분산

분산의 정의는

Var(Z)=E(Z2)−[E(Z)]2Var(Z)=E(Z^2)-[E(Z)]^2

이다.

앞에서 E(Z)=0E(Z)=0임을 구했으므로

Var(Z)=E(Z2)Var(Z)=E(Z^2)

가 된다.

LOTUS를 이용하면

E(Z2)=12π∫−∞∞z2e−z2/2 dzE(Z^2) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{\infty} z^2e^{-z^2/2}\,dz

이고, 이 값을 계산하면 1이 된다.

따라서

Var(Z)=1Var(Z)=1

이다.


표준정규분포의 CDF

표준정규분포의 CDF는 특별한 기호 Φ\Phi를 사용한다.

Φ(z)=12π∫−∞ze−t2/2 dt\Phi(z) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z}e^{-t^2/2}\,dt

정규분포는 매우 중요하기 때문에 이 CDF에는 별도의 표준 표기법을 사용한다.

정규분포의 CDF는 적분을 이용해 정의되지만, 일반적으로 이 적분을 초등함수 형태로 간단하게 계산할 수는 없다.

그래서 Φ\Phi를 하나의 표준 함수처럼 사용하고, 계산기나 컴퓨터에서 그 값을 구한다.


표준정규분포의 대칭성

표준정규분포는 0을 중심으로 대칭이다.

따라서 zz의 왼쪽에 있는 면적과 −z-z의 오른쪽에 있는 면적이 같다.

그 결과 CDF에 다음과 같은 관계가 성립한다.

Φ(−z)=1−Φ(z)\Phi(-z)=1-\Phi(z)

이 관계는 표준정규분포의 확률을 계산할 때 자주 사용하는 중요한 대칭성이다.

0개의 댓글