이산분포와 연속분포
지금까지는 이항분포, 포아송분포, 초기하분포 등 이산분포(Discrete distribution)를 배웠다.
이제 연속분포(Continuous distribution)를 배운다.
연속분포의 많은 개념은 이산분포와 대응된다.
| 이산분포 | 연속분포 |
|---|
| 확률변수 X | 확률변수 X |
| PMF | PDF |
| CDF | CDF |
| 합 ∑ | 적분 ∫ |
| E(X)=∑xP(X=x) | E(X)=∫xf(x)dx |
| Var(X) | Var(X) |
핵심은 이산분포에서 합으로 계산하던 것을 연속분포에서는 적분으로 계산한다는 것이다.
PMF와 PDF
이산분포: PMF
이산확률변수에서는 확률질량함수(PMF, Probability Mass Function)를 사용한다.
확률변수 X가 정확히 x의 값을 가질 확률이다.
예를 들어 X가 양의 정수만 가질 수 있다면, P(X=1),P(X=2),P(X=3),⋯와 같이 각각의 값에 확률이 대응한다.
연속분포: PDF
연속확률변수에서는 특정한 한 점을 가질 확률이 0이다.
예를 들어 X가 0과 1 사이의 모든 실수 중 하나를 가질 수 있다고 하자.
0.5, π/4 등 특정한 하나의 값을 정확히 가질 확률은 모두 0이다.
따라서 연속분포에서는 PMF 대신 확률밀도함수(PDF, Probability Density Function)를 사용한다.
보통 fX(x) 또는 간단하게 f(x)로 쓴다.
중요한 점은 PDF 자체는 확률이 아니다. PDF는 확률밀도(density)를 나타낸다.
확률밀도와 확률의 관계
확률을 질량이라고 생각하면 직관적이다.
이산분포에서는 각각의 조약돌에 질량이 존재하고, 모든 질량을 더하면 1이 된다.
연속분포에서는 진흙이 연속적으로 퍼져 있고, 전체 질량이 1이다.
따라서 PDF의 값 자체가 확률이 아니라, PDF를 특정 구간에서 적분한 값이 확률이다.
P(a≤X≤b)=∫abf(x)dx
즉, 확률밀도를 적분하면 확률이 된다.
왜 P(X=x)=0인가?
특정한 하나의 값은 길이가 0인 구간으로 생각할 수 있다.
P(X=x)=∫xxf(t)dt=0
그래프에서 보면 x 하나만 선택하는 것은 폭이 0인 구간의 넓이를 구하는 것과 같다.
따라서 넓이가 0이 된다.
반면 길이가 있는 구간에서는 넓이가 생기므로 확률이 생긴다.
PDF의 직관적 의미
어떤 지점 x0에서 PDF의 값이 f(x0)라고 하자. f(x0) 자체는 확률이 아니다.
하지만 x0 주변의 아주 작은 길이 ε의 구간을 생각하면, 다음과 같다.
P(x0−2ε≤X≤x0+2ε)≈f(x0)ε
왜냐하면 ε이 매우 작다면 그 구간에서 f(x)가 거의 변하지 않기 때문이다.
따라서 작은 구간에서는
확률≈밀도×구간의 길이
가 된다.
즉, f(x0)×ε을 통해 density scale에서 probability scale로 변환할 수 있다.
단, 정확한 확률은 항상 적분으로 계산한다.
PDF가 유효하기 위한 조건
PMF에서는
- 모든 확률이 음수가 아니어야 하고
- 전체 확률의 합이 1이어야 한다.
PDF에서도 비슷하다.
1. 음수가 아니어야 한다.
2. 전체 넓이가 1이어야 한다.
∫−∞∞f(x)dx=1
따라서 PDF가 되기 위한 핵심 조건은 다음과 같다.
f(x)≥0,∫−∞∞f(x)dx=1
PDF의 값 자체는 확률이 아니기에, 1보다 클 수도 있다.
CDF와 PDF
CDF는 이산분포와 연속분포 모두에서 사용할 수 있는 매우 일반적인 개념이다.
CDF의 정의는 FX(x)=P(X≤x)이다.
여기서 아래첨자 X는 어떤 확률변수의 CDF인지 나타낸다.
PDF → CDF
연속확률변수 X의 PDF가 f라면,
FX(x)=P(X≤x)
이고, X가 x 이하일 확률은 −∞부터 x까지의 넓이이므로 다음과 같다.
FX(x)=∫−∞xf(t)dt
즉,
FX(x)=∫−∞xf(t)dt
이다.
CDF → PDF
반대로 연속확률변수의 CDF FX(x)를 알고 있다면 PDF는 미분해서 얻을 수 있다.
fX(x)=FX′(x)
왜냐하면
FX(x)=∫−∞xf(t)dt
이고, 미적분학의 기본정리(FTC, Fundamental Theorem of Calculus)에 의해 미분하면 원래 함수 f(x)가 나오기 때문이다.
따라서
PDF=CDF의 미분,CDF=PDF의 적분
연속분포에서 구간의 양 끝점
이산분포에서는 P(a≤X≤b),P(a<X<b)에서 양 끝점을 포함하는지가 중요하다.
하지만 연속분포에서 P(X=a)=P(X=b)=0이므로 결과가 같다.
따라서
P(a≤X≤b)=P(a<X<b)
이고,
P(a≤X≤b)=FX(b)−FX(a)
이다.
즉, 연속분포에서는 구간의 양 끝점을 포함하는지 여부가 확률에 영향을 주지 않는다.
이산분포와 연속분포의 기대값
이산분포에서는 E(X)=∑xxP(X=x)였다.
연속분포에서는 특정 값의 확률 P(X=x)가 모두 0이므로 합 대신 적분을 사용한다.
따라서
E(X)=∫−∞∞xf(x)dx
만약 X가 0과 1 사이에서만 값을 가진다면, 다음과 같이 실제 범위에서만 적분해도 된다.
E(X)=∫01xf(x)dx
분산과 표준편차
기대값은 분포의 중심을 나타내지만, 분포가 얼마나 퍼져 있는지(spread)는 알려주지 않는다.
이를 나타내기 위해 분산(Variance)을 사용한다.
평균에서 얼마나 떨어져 있는지를 생각하면 X−E(X)가 된다.
하지만 E(X−E(X))=0이므로 단순히 평균을 내면 항상 0이 된다.
그래서 차이를 제곱한다.
Var(X)=E[(X−E(X))2]
즉 분산은 평균으로부터 떨어진 거리의 제곱의 평균이다.
왜 절댓값 대신 제곱을 사용하는가?
절댓값을 사용하면 E(∣X−E(X)∣)를 생각할 수도 있다.
하지만 절댓값 함수는 0에서 미분하기 어렵고 수학적으로 다루기 불편하다.
반면 제곱은 미분하기 쉽고, 기하학적으로도 유클리드 거리 및 피타고라스 정리와 연결되는 좋은 성질을 가진다.
단점은 단위가 바뀐다는 것이다.
예를 들어 X의 단위가 mile이라면 Var(X)의 단위는 mile2가 된다.
그래서 표준편차(Standard Deviation)를 사용한다.
SD(X)=Var(X)
표준편차는 다시 원래 단위로 돌아오기 때문에 해석하기 편하다.
분산의 계산 공식
분산의 정의는 다음과 같다.
Var(X)=E[(X−E(X))2]
이를 전개하고 풀어보면 다음과 같다.
Var(X)=E[X2−2XE(X)+(E(X))2]=E(X2)−[E(X)]2
따라서
Var(X)=E(X2)−[E(X)]2
이다.
여기서 매우 중요한 차이가 있다.
E(X2)=[E(X)]2
일반적으로 제곱을 먼저 하고 기대값을 구하는 것과 기대값을 구한 뒤 제곱하는 것은 다르다.
또한 관습적으로 EX2=E(X2)라고 표기한다.
분산은 항상 음이 아닌가?
분산의 정의에서 (X−E(X))2≥0이므로 그 기대값도 음수가 될 수 없다.
따라서 Var(X)≥0이다.
그리고 X가 상수일 때만 Var(X)=0이다.
즉, X가 변하지 않는 상수라면 모든 값이 평균과 같으므로 퍼짐이 없다.
연속분포의 가장 간단한 예가 균등분포(Uniform distribution)이다.
X가 a와 b 사이에서 균등하게 선택된다고 하자.
X∼Unif(a,b)
균등하다는 것은 단순히 "각 숫자가 나올 확률이 같다"는 뜻으로 생각하면 안 된다.
연속분포에서는 특정한 한 점이 나올 확률이 모두 0이기 때문이다.
대신, 같은 길이의 구간은 같은 확률을 가지며, 구간의 확률은 그 구간의 길이에 비례한다.
즉, 확률∝구간의 길이이다.
예를 들어 어떤 구간의 길이가 다른 구간의 2배라면, 그 구간이 선택될 확률도 2배가 된다.
균등분포의 PDF
균등분포에서는 a와 b 사이에서 확률밀도가 일정해야 한다.
따라서 PDF는
f(x)={c,0,a≤x≤botherwise
형태이다.
전체 적분값이 1이어야 하므로 ∫abcdx=1이고,c(b−a)=1이 성립해야한다.
따라서 c=b−a1이다.
따라서 균등분포의 PDF는
f(x)={b−a1,0,a≤x≤botherwise
이다.
즉, 구간의 길이가 길수록 전체 넓이를 1로 만들기 위해 PDF의 높이는 낮아진다.
균등분포의 CDF
CDF는 FX(x)=P(X≤x)이다.
균등분포에서는 x의 위치에 따라 세 경우로 나누어진다.
1. x<a
X는 항상 a 이상이므로 FX(x)=0이다.
2. a≤x≤b
a부터 x까지의 넓이를 구한다. PDF의 높이는 b−a1이므로 FX(x)=∫axb−a1dt
따라서 FX(x)=b−ax−a이다.
3. x>b
X는 항상 b 이하이므로 FX(x)=1이다.
따라서 전체 CDF는 다음과 같다.
FX(x)=⎩⎪⎪⎨⎪⎪⎧0,b−ax−a,1,x<aa≤x≤bx>b
a에서 CDF는 0이고 b에서 1이 된다.
a와 b 사이에서는 1차 함수처럼 선형적으로 증가한다.
균등분포의 기대값
연속분포의 기대값 공식에 따라 E(X)=∫abxf(x)dx이다.
균등분포에서는 f(x)=b−a1이므로 다음과 같다.
E(X)=∫abb−axdx
적분하면 E(X)=b−a1[2x2]ab=2(b−a)b2−a2이고, b2−a2=(b−a)(b+a)이므로 다음과 같다.
E(X)=2a+b
즉, 균등분포의 기대값은 구간의 중간값이다.
LOTUS: Law of the Unconscious Statistician
분산을 계산하려면 Var(X)=E(X2)−[E(X)]2이므로 E(X2)를 구해야 한다.
처음에는 Y=X2라는 새로운 확률변수를 만들고 Y의 PDF를 구해야 할 것처럼 보인다.
하지만 Y의 PDF를 굳이 구할 필요가 없다.
이때 사용하는 것이 LOTUS (Law of the Unconscious Statistician)이다.
연속확률변수에서의 LOTUS
X의 PDF가 fX(x)이고 g(X)의 기대값을 구하고 싶다면, 다음과 같다.
E[g(X)]=∫−∞∞g(x)fX(x)dx
즉, g(X)의 PDF를 직접 구하지 않고, 원래 X의 PDF를 그대로 사용하면 된다.
예를 들어 E(X2)를 구하고 싶다면, 다음과 같다.
E(X2)=∫−∞∞x2fX(x)dx
따라서 Y=X2의 PDF를 따로 구할 필요가 없다.
이산분포에서의 LOTUS
이산분포에서도 같은 아이디어가 있다.
E[g(X)]=x∑g(x)P(X=x)
즉, g(X)의 PMF를 구할 필요 없이 원래 X의 PMF에 g(x)만 곱하면 된다.
U∼Unif(0,1)의 분산
U∼Unif(0,1)을 생각하자.
PDF는 fU(u)=1,0≤u≤1이고, 기대값은 E(U)=21 이다.
LOTUS를 사용하면 U2의 PDF를 구하지 않고 바로 E(U2)=∫01u2fU(u)du로 계산할 수 있다.
fU(u)=1이므로 E(U2)=∫01u2du=31이다.
따라서
Var(U)=E(U2)−[E(U)]2=31−(21)2=121
균등분포는 왜 전체 실수에서 정의할 수 없는가?
균등분포에서는 PDF가 어떤 구간에서 일정한 상수이다.
예를 들어 a에서 b까지만 균등하면 f(x)=b−a1이다.
그런데 모든 실수에서 균등하다고 생각해보자.
그러면 모든 실수에서 같은 상수 c를 가져야 한다.
하지만 ∫−∞∞cdx는 어떤 양의 상수 c에 대해서도 무한대가 된다.
따라서 전체 적분을 1로 만들 수 없다.
즉 균등분포는 반드시 제한된 범위가 필요하다.
U∼Unif(0,1)의 보편성
0과 1 사이의 균등분포는 특별한 역할을 한다.
U∼Unif(0,1)
하나만 가지고도 원칙적으로 원하는 다른 연속분포를 생성할 수 있다.
이것을 균등분포의 보편성(Universality)이라고 볼 수 있다.
컴퓨터에서 난수를 생성할 때도 중요한 아이디어이다.
컴퓨터가 직접 원하는 복잡한 분포에서 난수를 생성하기 어려워도,
- 0과 1 사이의 균등 난수 U를 생성하고
- 적절한 변환을 적용하여
- 원하는 분포를 따르는 확률변수를 만들 수 있다.
역변환을 이용한 분포 생성
원하는 CDF를 F라고 하자.
U∼Unif(0,1)이고 F가 연속적이며 강한 증가(strictly increasing)한다고 가정하자.
그러면 F−1이 존재한다.
이때 X=F−1(U)라고 정의하면 X는 CDF가 F인 분포를 따른다.
즉, X∼F이다.
원하는 CDF의 역함수에 균등분포 난수를 넣으면 원하는 분포를 만들 수 있다.
왜 X=F−1(U)가 원하는 분포를 만드는가?
X의 CDF를 직접 구해보자.
P(X≤x) 에서 X=F−1(U)이므로 P(F−1(U)≤x)가 된다.
F가 증가함수이므로 양변에 F를 적용하면 P(U≤F(x))가 된다.
그런데 U∼Unif(0,1)이고 F(x)가 CDF이므로 0≤F(x)≤1이다. 따라서 U가 0부터 F(x)까지 있을 확률은 그 구간의 길이와 같으므로 P(U≤F(x))=F(x)이다.
P(X≤x)=F(x)
즉, X의 CDF가 정확히 F이므로 X∼F이다.