지난 시간에 배운 균등분포의 보편성을 다시 살펴보자.
핵심 아이디어는 0과 1 사이의 균등분포만 이용해서 원하는 분포를 만들 수 있다는 것이다.
U∼Unif(0,1)이라고 하고, F가 연속이고 강한 증가인 누적분포함수라고 하자.
이때 균등분포를 이용해 다음과 같이 새로운 확률변수를 만들 수 있다.
X=F−1(U)
그러면 X는 누적분포함수 F를 따른다.
즉, 원하는 분포 F를 직접 시뮬레이션하기 어려워도 먼저 균등분포를 생성한 다음 F−1을 적용하면 된다.
균등분포를 생성 → F−1 적용 → 원하는 분포 생성
실제로는 F−1을 해석적으로 구하기 어려운 경우도 많지만, 이론적으로는 균등분포 하나로 매우 다양한 분포를 만들 수 있다는 것이 핵심이다.
지수분포를 이용한 예시
다음과 같은 누적분포함수를 생각해보자.
F(x)=1−e−x,x>0
이것은 모수가 1인 지수분포의 CDF이다.
이 분포를 따르는 확률변수를 시뮬레이션하고 싶다면 먼저 F의 역함수를 구한다.
u=F(x)라고 놓으면 u=1−e−x이고, 이를 x에 대해 풀면 다음과 같다.
F−1(u)=−ln(1−u)
따라서 U∼Unif(0,1)을 생성한 뒤
X=−ln(1−U)
로 계산하면 X는 F를 따른다.
즉, 컴퓨터에서 균등분포를 따르는 난수 10개를 생성하고 각각에 −ln(1−U)를 적용하면 F를 따르는 10개의 iid(independent and identically distributed) 난수를 얻을 수 있다.
이를 한 줄로 정리하면 다음과 같다.
U∼Unif(0,1)⟹F−1(U)∼F
균등분포의 대칭성
U∼Unif(0,1)이면 1−U 역시 Unif(0,1)을 따른다.
직관적으로 생각해보면, U는 0과 1 사이에서 무작위로 하나의 점을 고르는 것이다.
예를 들어 U=0.2라면 0에서 U까지의 거리는 0.2이고, 1에서 U까지의 거리는 0.8이다.
즉, 1−U는 오른쪽 끝(1)에서 U까지 잰 거리라고 생각할 수 있다. U는 왼쪽 끝(0)에서부터 잰 위치이고, 1−U는 오른쪽 끝(1)에서부터 잰 위치이므로, 같은 점을 반대 방향에서 측정한 것이다.
0과 1 사이에서 점을 균등하게 고르면, 왼쪽에서부터 재든 오른쪽에서부터 재든 점이 똑같이 균등하게 퍼져 있다. 따라서 U와 1−U는 값은 다르지만 같은 분포를 따른다. 즉 1−U∼Uniform(0,1)이다.
수식으로 확인하면 (0≤x≤1):
P(1−U≤x)=P(U≥1−x)=1−(1−x)=x
이는 Uniform(0,1)의 CDF와 같습니다.
따라서
U∼Unif(0,1)⟹1−U∼Unif(0,1)
가 성립한다.
이 결과가 중요한 이유는 지수분포를 시뮬레이션할 때 볼 수 있다.
앞에서 지수분포의 역함수가
F−1(u)=−ln(1−u)
였기 때문에 원래는 −ln(1−U)를 사용해야 한다.
그런데 1−U 역시 똑같은 균등분포를 따르므로, 1−U를 새로운 균등분포 변수라고 생각할 수 있다.
따라서 −ln(1−U)와 −lnU는 같은 분포를 갖는다. 즉, 계산할 때는 더 간단하게 −lnU를 사용해도 된다.
이것이 균등분포의 중요한 대칭성이다.
반대 방향의 보편성
이번에는 반대 방향을 생각해보자.
앞에서는 균등분포에서 숫자를 하나 뽑은 다음, 그 숫자를 원하는 분포의 값으로 바꾸었다.
U∼Unif(0,1)⟹F−1(U)∼F
이번에는 반대로, 이미 어떤 분포를 따르는 X가 있다고 하자.
이때 X에 자신의 CDF F를 적용하면
라는 새로운 확률변수가 만들어진다.
여기서 F(X)는 단순히 F에 X라는 숫자를 넣은 것이다.
CDF의 정의에 따라 F(x)는 x보다 작거나 같은 값이 나올 누적확률을 의미한다.
따라서 X의 실제 값에 F를 적용하면, 그 값 자체를 보는 것이 아니라 그 값이 전체 분포에서 어느 정도 위치에 있는지를 나타내게 된다.
예를 들어 어떤 값 x에 대해
라면, x는 자신의 분포에서 누적확률 20% 지점에 있다는 뜻이다.
반대로
이라면, x는 누적확률 80% 지점에 있다는 뜻이다.
즉, X를 F(X)로 바꾸면 X의 "실제 값"이 아니라 "전체 분포에서 몇 % 지점에 있는가"를 나타내게 된다.
그리고 X가 바로 자신의 분포 F에서 뽑힌 값이기 때문에, 이러한 위치는 0과 1 사이에서 균등하게 나타난다.
따라서
X∼F⟹F(X)∼Unif(0,1)
이것이 반대 방향의 보편성이다.
값과 위치를 서로 바꾸는 관계
이 내용을 더 직관적으로 보면 F와 F−1은 서로 반대 역할을 한다.
앞 방향
X⟶F(X)
실제 값 → 그 값이 분포에서 차지하는 누적확률(위치)
뒤 방향
균등분포에서 숫자 하나를 뽑았다고 하자.
이 숫자는 단순한 숫자라기보다 "70% 지점"이라고 생각할 수 있다.
그러면 F−1은 "누적확률이 70%가 되는 실제 X의 값은 무엇인가?"를 찾아준다.
즉,
0.7⟶F−1(0.7)
이렇게 하면 누적확률 70%라는 위치를 실제 분포의 값으로 바꿀 수 있다.
따라서
U⟶F−1(U)
는 누적확률(위치) → 그 위치에 해당하는 실제 값이라는 의미가 된다.
결국 이렇게 기억하면 된다.
F는 "값 → 위치(백분위)"로 바꾸는 함수이고, F−1은 "위치(백분위) → 값"으로 바꾸는 함수이다.
그래서 보편성의 두 방향은 서로 정확히 반대되는 과정이다.
XFF(X)
실제 값 → 누적확률
반대로
UF−1F−1(U)
누적확률 → 실제 값
즉, CDF는 어떤 분포의 값을 0과 1 사이의 위치로 바꾸고, 역 CDF는 그 위치를 다시 원래 분포의 값으로 바꾼다.
F(X)에서 대문자와 소문자 구분
여기서 F(x)와 F(X)를 구분하는 것이 중요하다.
CDF의 정의는 F(x)=P(X≤x)이다.
여기서 x는 특정한 값을 의미하는 일반적인 숫자이다.
반면 X는 확률변수이므로 F(X)는 함수 F에 확률변수 X를 넣어서 얻은 새로운 확률변수이다.
따라서 F(X)를 단순히 P(X≤X)로 생각하면 안 된다.
예를 들어 F(x)=1−e−x라면 F(X)는 다음과 같이 계산한다.
F(X)=1−e−X
즉, 먼저 함수 F를 생각하고 그 함수의 입력값 x를 확률변수 X로 바꾼 것이다.
따라서 F(X)는 일반적으로 0과 1 사이의 값을 가지는 새로운 확률변수이다.
Independence
이번에는 여러 확률변수 사이의 독립성을 살펴보자.
확률변수 X1,…,Xn이 독립이라는 것은 이들의 결합 CDF가 각각의 주변 CDF의 곱으로 분리된다는 뜻이다.
P(X1≤x1,…,Xn≤xn)=i=1∏nP(Xi≤xi)
왼쪽의 확률은 여러 확률변수가 동시에 특정 조건을 만족할 확률이므로 joint CDF, 즉 결합 누적분포함수라고 한다.
오른쪽에서는 각각의 확률변수를 따로 계산한 뒤 곱하고 있다.
이것이 확률변수의 독립성을 나타내는 핵심적인 형태이다.
이산확률변수의 경우에는 CDF 대신 PMF를 이용해서 다음과 같이 쓸 수 있다.
P(X1=x1,…,Xn=xn)=i=1∏nP(Xi=xi)
Pairwise Independence와 Full Independence
독립성을 이야기할 때 쌍으로 독립(pairwise independence)과 전체 독립(full independence)을 구분해야 한다.
전체 독립이면 모든 변수의 조합에 대해 독립성이 성립하므로 당연히 각각의 두 변수도 독립이다.
하지만 그 반대는 성립하지 않는다.
즉, pairwise independence는 full independence를 보장하지 않는다.
Pairwise Independence의 예시
공정한 동전 두 개의 결과를 나타내는 X1,X2를 생각하고, 다음과 같이 X3를 정의하자.
X3=I(X1=X2)
즉, X1과 X2가 같으면 X3=1, 다르면 X3=0이다.
이때 X1과 X2는 서로 독립이다.
또한 X1과 X3도 독립이고, X2와 X3도 독립이다.
따라서 각각의 두 변수만 놓고 보면 서로 독립이므로 pairwise independent이다.
하지만 세 변수 전체는 독립이 아니다.
왜냐하면 X1과 X2를 알고 있다면 X3의 값이 완전히 결정되기 때문이다.
예를 들어 X1=X2라는 것을 알고 있다면 반드시 X3=1이다.
따라서 세 변수는 전체적으로 독립이 아니다.
Full independence⟹Pairwise independence
하지만
Pairwise independence⟹Full independence
Normal Distribution
정규분포는 통계학에서 가장 중요하고 유명한 분포 중 하나이다.
특히 중심극한정리(Central Limit Theorem)와 밀접하게 연결되어 있다.
중심극한정리의 핵심적인 직관은 독립적이고 동일한 분포를 가지는 많은 확률변수를 더하면 그 합의 분포가 정규분포와 비슷한 형태를 보인다는 것이다.
즉, 많은 iid 확률변수의 합은 대략적으로 정규분포처럼 보인다.
정규분포는 평균과 분산에 따라 위치와 크기가 달라질 수 있다.
그중 가장 기본적인 형태가 표준정규분포(Standard Normal Distribution)이다.
Z∼N(0,1)
표준정규분포는 평균이 0이고 분산이 1인 정규분포이다.
표준정규분포의 PDF
표준정규분포의 확률밀도함수는 다음과 같은 형태이다.
fZ(z)=2π1e−z2/2
여기서 중요한 것은 앞에 붙어 있는 2π1라는 상수이다.
확률밀도함수는 전체 구간에서 적분했을 때 1이 되어야 한다.
따라서 e−z2/2 앞에 적절한 정규화 상수를 붙여 전체 넓이가 1이 되도록 만든 것이다.
정규화 상수의 계산
다음 적분을 생각하자.
I=∫−∞∞e−z2/2dz
이 적분은 직접 계산하기 어렵기 때문에 I2을 생각한다.
I2=(∫−∞∞e−x2/2dx)(∫−∞∞e−y2/2dy)
이를 이중적분으로 합치면 다음과 같다.
I2=∫−∞∞∫−∞∞e−(x2+y2)/2dxdy
이제 극좌표를 사용한다.
x=rcosθ,y=rsinθ
따라서 x2+y2=r2이고, 면적 요소는 dxdy=rdrdθ가 된다.
그러면
I2=∫02π∫0∞e−r2/2rdrdθ
가 된다.
계산하면
따라서
이다.
그러므로 전체 적분값이 1이 되도록 만드는 정규화 상수는 2π1이고, 표준정규분포의 PDF는
fZ(z)=2π1e−z2/2
가 된다.
표준정규분포의 평균
표준정규분포의 평균을 구해보자.
E(Z)=2π1∫−∞∞ze−z2/2dz
여기서 e−z2/2는 짝함수이고 z는 홀함수이므로 전체 integrand는 홀함수이다.
홀함수는 대칭적인 구간에서 적분하면 0이 된다.
따라서
홀함수와 짝함수
홀함수는 다음 조건을 만족한다.
g(−x)=−g(x)
대표적인 예가 sinx이다.
반면 짝함수는 다음 조건을 만족한다.
g(−x)=g(x)
정규분포의 PDF에서 z를 −z로 바꾸어도 z2 때문에 값이 변하지 않는다.
따라서 정규분포의 PDF는 짝함수이고, 여기에 z를 곱하면 홀함수가 된다.
그래서 평균이 0이 되는 것이다.
즉, 표준정규분포의 평균이 0인 이유는 분포가 0을 중심으로 대칭이기 때문이다.
표준정규분포의 분산
분산의 정의는
Var(Z)=E(Z2)−[E(Z)]2
이다.
앞에서 E(Z)=0임을 구했으므로
Var(Z)=E(Z2)
가 된다.
LOTUS를 이용하면
E(Z2)=2π1∫−∞∞z2e−z2/2dz
이고, 이 값을 계산하면 1이 된다.
따라서
이다.
표준정규분포의 CDF
표준정규분포의 CDF는 특별한 기호 Φ를 사용한다.
Φ(z)=2π1∫−∞ze−t2/2dt
정규분포는 매우 중요하기 때문에 이 CDF에는 별도의 표준 표기법을 사용한다.
정규분포의 CDF는 적분을 이용해 정의되지만, 일반적으로 이 적분을 초등함수 형태로 간단하게 계산할 수는 없다.
그래서 Φ를 하나의 표준 함수처럼 사용하고, 계산기나 컴퓨터에서 그 값을 구한다.
표준정규분포의 대칭성
표준정규분포는 0을 중심으로 대칭이다.
따라서 z의 왼쪽에 있는 면적과 −z의 오른쪽에 있는 면적이 같다.
그 결과 CDF에 다음과 같은 관계가 성립한다.
Φ(−z)=1−Φ(z)
이 관계는 표준정규분포의 확률을 계산할 때 자주 사용하는 중요한 대칭성이다.