Lecture 12: Discrete vs. Continuous, the Uniform | Statistics 110

Prettypotato·4일 전

Statistics 110

목록 보기
16/18

이산분포와 연속분포

지금까지는 이항분포, 포아송분포, 초기하분포 등 이산분포(Discrete distribution)를 배웠다.

이제 연속분포(Continuous distribution)를 배운다.

연속분포의 많은 개념은 이산분포와 대응된다.

이산분포연속분포
확률변수 XX확률변수 XX
PMFPDF
CDFCDF
합 ∑\sum적분 ∫\int
E(X)=∑xP(X=x)E(X)=\sum xP(X=x)E(X)=∫xf(x) dxE(X)=\int xf(x)\,dx
Var⁡(X)\operatorname{Var}(X)Var⁡(X)\operatorname{Var}(X)

핵심은 이산분포에서 합으로 계산하던 것을 연속분포에서는 적분으로 계산한다는 것이다.


PMF와 PDF

이산분포: PMF

이산확률변수에서는 확률질량함수(PMF, Probability Mass Function)를 사용한다.

P(X=x)P(X=x)

확률변수 XX가 정확히 xx의 값을 가질 확률이다.

예를 들어 XX가 양의 정수만 가질 수 있다면, P(X=1),P(X=2),P(X=3),⋯P(X=1),P(X=2),P(X=3),\cdots와 같이 각각의 값에 확률이 대응한다.


연속분포: PDF

연속확률변수에서는 특정한 한 점을 가질 확률이 0이다.

P(X=x)=0P(X=x)=0

예를 들어 XX가 00과 11 사이의 모든 실수 중 하나를 가질 수 있다고 하자.

0.50.5, π/4\pi/4 등 특정한 하나의 값을 정확히 가질 확률은 모두 00이다.

따라서 연속분포에서는 PMF 대신 확률밀도함수(PDF, Probability Density Function)를 사용한다.

보통 fX(x)f_X(x) 또는 간단하게 f(x)f(x)로 쓴다.

중요한 점은 PDF 자체는 확률이 아니다. PDF는 확률밀도(density)를 나타낸다.


확률밀도와 확률의 관계

확률을 질량이라고 생각하면 직관적이다.

  • 이산분포 → 조약돌
  • 연속분포 → 진흙

이산분포에서는 각각의 조약돌에 질량이 존재하고, 모든 질량을 더하면 11이 된다.

연속분포에서는 진흙이 연속적으로 퍼져 있고, 전체 질량이 11이다.

따라서 PDF의 값 자체가 확률이 아니라, PDF를 특정 구간에서 적분한 값이 확률이다.

P(a≤X≤b)=∫abf(x) dxP(a\le X\le b)=\int_a^b f(x)\,dx

즉, 확률밀도를 적분하면 확률이 된다.


왜 P(X=x)=0P(X=x)=0인가?

특정한 하나의 값은 길이가 00인 구간으로 생각할 수 있다.

P(X=x)=∫xxf(t) dt=0P(X=x)=\int_x^x f(t)\,dt=0

그래프에서 보면 xx 하나만 선택하는 것은 폭이 00인 구간의 넓이를 구하는 것과 같다.

따라서 넓이가 00이 된다.

반면 길이가 있는 구간에서는 넓이가 생기므로 확률이 생긴다.


PDF의 직관적 의미

어떤 지점 x0x_0에서 PDF의 값이 f(x0)f(x_0)라고 하자. f(x0)f(x_0) 자체는 확률이 아니다.

하지만 x0x_0 주변의 아주 작은 길이 ε\varepsilon의 구간을 생각하면, 다음과 같다.

P(x0−ε2≤X≤x0+ε2)≈f(x0)εP\left(x_0-\frac{\varepsilon}{2}\le X\le x_0+\frac{\varepsilon}{2}\right) \approx f(x_0)\varepsilon

왜냐하면 ε\varepsilon이 매우 작다면 그 구간에서 f(x)f(x)가 거의 변하지 않기 때문이다.

따라서 작은 구간에서는

확률≈밀도×구간의 길이\text{확률}\approx\text{밀도}\times\text{구간의 길이}

가 된다.

즉, f(x0)×εf(x_0)\times\varepsilon을 통해 density scale에서 probability scale로 변환할 수 있다.

단, 정확한 확률은 항상 적분으로 계산한다.


PDF가 유효하기 위한 조건

PMF에서는

  1. 모든 확률이 음수가 아니어야 하고
  2. 전체 확률의 합이 11이어야 한다.

PDF에서도 비슷하다.

1. 음수가 아니어야 한다.

f(x)≥0f(x)\ge0

2. 전체 넓이가 11이어야 한다.

∫−∞∞f(x) dx=1\int_{-\infty}^{\infty}f(x)\,dx=1

따라서 PDF가 되기 위한 핵심 조건은 다음과 같다.

f(x)≥0,∫−∞∞f(x) dx=1\boxed{f(x)\ge0,\qquad \int_{-\infty}^{\infty}f(x)\,dx=1}

PDF의 값 자체는 확률이 아니기에, 11보다 클 수도 있다.


CDF와 PDF

CDF는 이산분포와 연속분포 모두에서 사용할 수 있는 매우 일반적인 개념이다.

CDF의 정의는 FX(x)=P(X≤x)F_X(x)=P(X\le x)이다.

여기서 아래첨자 XX는 어떤 확률변수의 CDF인지 나타낸다.


PDF → CDF

연속확률변수 XX의 PDF가 ff라면,

FX(x)=P(X≤x)F_X(x)=P(X\le x)

이고, XX가 xx 이하일 확률은 −∞-\infty부터 xx까지의 넓이이므로 다음과 같다.

FX(x)=∫−∞xf(t) dtF_X(x)=\int_{-\infty}^{x}f(t)\,dt

즉,

FX(x)=∫−∞xf(t) dt\boxed{F_X(x)=\int_{-\infty}^{x}f(t)\,dt}

이다.


CDF → PDF

반대로 연속확률변수의 CDF FX(x)F_X(x)를 알고 있다면 PDF는 미분해서 얻을 수 있다.

fX(x)=FX′(x)f_X(x)=F_X'(x)

왜냐하면

FX(x)=∫−∞xf(t) dtF_X(x)=\int_{-\infty}^{x}f(t)\,dt

이고, 미적분학의 기본정리(FTC, Fundamental Theorem of Calculus)에 의해 미분하면 원래 함수 f(x)f(x)가 나오기 때문이다.

따라서

PDF=CDF의 미분,CDF=PDF의 적분\text{PDF}=\text{CDF의 미분}, \text{CDF}=\text{PDF의 적분}

연속분포에서 구간의 양 끝점

이산분포에서는 P(a≤X≤b),P(a<X<b)P(a\le X\le b),\quad P(a<X<b)에서 양 끝점을 포함하는지가 중요하다.

하지만 연속분포에서 P(X=a)=P(X=b)=0P(X=a)=P(X=b)=0이므로 결과가 같다.

따라서

P(a≤X≤b)=P(a<X<b)P(a\le X\le b) = P(a<X<b)

이고,

P(a≤X≤b)=FX(b)−FX(a)P(a\le X\le b)=F_X(b)-F_X(a)

이다.

즉, 연속분포에서는 구간의 양 끝점을 포함하는지 여부가 확률에 영향을 주지 않는다.


이산분포와 연속분포의 기대값

이산분포에서는 E(X)=∑xxP(X=x)E(X)=\sum_x xP(X=x)였다.

연속분포에서는 특정 값의 확률 P(X=x)P(X=x)가 모두 00이므로 합 대신 적분을 사용한다.

따라서

E(X)=∫−∞∞xf(x) dxE(X)=\int_{-\infty}^{\infty}xf(x)\,dx

만약 XX가 00과 11 사이에서만 값을 가진다면, 다음과 같이 실제 범위에서만 적분해도 된다.

E(X)=∫01xf(x) dxE(X)=\int_0^1xf(x)\,dx

분산과 표준편차

기대값은 분포의 중심을 나타내지만, 분포가 얼마나 퍼져 있는지(spread)는 알려주지 않는다.

이를 나타내기 위해 분산(Variance)을 사용한다.

평균에서 얼마나 떨어져 있는지를 생각하면 X−E(X)X-E(X)가 된다.

하지만 E(X−E(X))=0E(X-E(X))=0이므로 단순히 평균을 내면 항상 00이 된다.

그래서 차이를 제곱한다.

Var⁡(X)=E[(X−E(X))2]\operatorname{Var}(X)=E\left[(X-E(X))^2\right]

즉 분산은 평균으로부터 떨어진 거리의 제곱의 평균이다.


왜 절댓값 대신 제곱을 사용하는가?

절댓값을 사용하면 E(∣X−E(X)∣)E(|X-E(X)|)를 생각할 수도 있다.

하지만 절댓값 함수는 00에서 미분하기 어렵고 수학적으로 다루기 불편하다.

반면 제곱은 미분하기 쉽고, 기하학적으로도 유클리드 거리 및 피타고라스 정리와 연결되는 좋은 성질을 가진다.

단점은 단위가 바뀐다는 것이다.

예를 들어 XX의 단위가 mile이라면 Var⁡(X)\operatorname{Var}(X)의 단위는 mile2\text{mile}^2가 된다.

그래서 표준편차(Standard Deviation)를 사용한다.

SD⁡(X)=Var⁡(X)\operatorname{SD}(X)=\sqrt{\operatorname{Var}(X)}

표준편차는 다시 원래 단위로 돌아오기 때문에 해석하기 편하다.


분산의 계산 공식

분산의 정의는 다음과 같다.

Var⁡(X)=E[(X−E(X))2]\operatorname{Var}(X)=E[(X-E(X))^2]

이를 전개하고 풀어보면 다음과 같다.

Var⁡(X)=E[X2−2XE(X)+(E(X))2]=E(X2)−[E(X)]2\operatorname{Var}(X)=E\left[X^2-2XE(X)+(E(X))^2\right] \\=E(X^2)-[E(X)]^2

따라서

Var⁡(X)=E(X2)−[E(X)]2\operatorname{Var}(X)=E(X^2)-[E(X)]^2

이다.

여기서 매우 중요한 차이가 있다.

E(X2)≠[E(X)]2E(X^2)\neq [E(X)]^2

일반적으로 제곱을 먼저 하고 기대값을 구하는 것과 기대값을 구한 뒤 제곱하는 것은 다르다.

또한 관습적으로 EX2=E(X2)EX^2=E(X^2)라고 표기한다.


분산은 항상 음이 아닌가?

분산의 정의에서 (X−E(X))2≥0(X-E(X))^2\ge0이므로 그 기대값도 음수가 될 수 없다.

따라서 Var⁡(X)≥0\operatorname{Var}(X)\ge0이다.

그리고 XX가 상수일 때만 Var⁡(X)=0\operatorname{Var}(X)=0이다.

즉, XX가 변하지 않는 상수라면 모든 값이 평균과 같으므로 퍼짐이 없다.


균등분포 Uniform Distribution

연속분포의 가장 간단한 예가 균등분포(Uniform distribution)이다.

XX가 aa와 bb 사이에서 균등하게 선택된다고 하자.

X∼Unif⁡(a,b)X\sim\operatorname{Unif}(a,b)

균등하다는 것은 단순히 "각 숫자가 나올 확률이 같다"는 뜻으로 생각하면 안 된다.

연속분포에서는 특정한 한 점이 나올 확률이 모두 00이기 때문이다.

대신, 같은 길이의 구간은 같은 확률을 가지며, 구간의 확률은 그 구간의 길이에 비례한다.

즉, 확률∝구간의 길이\text{확률}\propto\text{구간의 길이}이다.

예를 들어 어떤 구간의 길이가 다른 구간의 2배라면, 그 구간이 선택될 확률도 2배가 된다.


균등분포의 PDF

균등분포에서는 aa와 bb 사이에서 확률밀도가 일정해야 한다.

따라서 PDF는

f(x)={c,a≤x≤b0,otherwisef(x)= \begin{cases} c,&a\le x\le b\\ 0,&\text{otherwise} \end{cases}

형태이다.

전체 적분값이 11이어야 하므로 ∫abc dx=1\int_a^b c\,dx=1이고,c(b−a)=1c(b-a)=1이 성립해야한다.

따라서 c=1b−ac=\frac1{b-a}이다.

따라서 균등분포의 PDF는

f(x)={1b−a,a≤x≤b0,otherwisef(x)= \begin{cases} \frac1{b-a},&a\le x\le b\\ 0,&\text{otherwise} \end{cases}

이다.

즉, 구간의 길이가 길수록 전체 넓이를 11로 만들기 위해 PDF의 높이는 낮아진다.


균등분포의 CDF

CDF는 FX(x)=P(X≤x)F_X(x)=P(X\le x)이다.

균등분포에서는 xx의 위치에 따라 세 경우로 나누어진다.

1. x<ax<a

XX는 항상 aa 이상이므로 FX(x)=0F_X(x)=0이다.

2. a≤x≤ba\le x\le b

aa부터 xx까지의 넓이를 구한다. PDF의 높이는 1b−a\frac1{b-a}이므로 FX(x)=∫ax1b−a dtF_X(x)=\int_a^x\frac1{b-a}\,dt

따라서 FX(x)=x−ab−aF_X(x)=\frac{x-a}{b-a}이다.

3. x>bx>b

XX는 항상 bb 이하이므로 FX(x)=1F_X(x)=1이다.

따라서 전체 CDF는 다음과 같다.

FX(x)={0,x<ax−ab−a,a≤x≤b1,x>bF_X(x)= \begin{cases} 0,&x<a\\ \frac{x-a}{b-a},&a\le x\le b\\ 1,&x>b \end{cases}

aa에서 CDF는 00이고 bb에서 11이 된다.

aa와 bb 사이에서는 1차 함수처럼 선형적으로 증가한다.


균등분포의 기대값

연속분포의 기대값 공식에 따라 E(X)=∫abxf(x) dxE(X)=\int_a^b xf(x)\,dx이다.

균등분포에서는 f(x)=1b−af(x)=\frac1{b-a}이므로 다음과 같다.

E(X)=∫abxb−a dxE(X)=\int_a^b\frac{x}{b-a}\,dx

적분하면 E(X)=1b−a[x22]ab=b2−a22(b−a)E(X)=\frac1{b-a}\left[\frac{x^2}{2}\right]_a^b = \frac{b^2-a^2}{2(b-a)}이고, b2−a2=(b−a)(b+a)b^2-a^2=(b-a)(b+a)이므로 다음과 같다.

E(X)=a+b2E(X)=\frac{a+b}{2}

즉, 균등분포의 기대값은 구간의 중간값이다.


LOTUS: Law of the Unconscious Statistician

분산을 계산하려면 Var⁡(X)=E(X2)−[E(X)]2\operatorname{Var}(X)=E(X^2)-[E(X)]^2이므로 E(X2)E(X^2)를 구해야 한다.

처음에는 Y=X2Y=X^2라는 새로운 확률변수를 만들고 YY의 PDF를 구해야 할 것처럼 보인다.

하지만 Y의 PDF를 굳이 구할 필요가 없다.

이때 사용하는 것이 LOTUS (Law of the Unconscious Statistician)이다.


연속확률변수에서의 LOTUS

XX의 PDF가 fX(x)f_X(x)이고 g(X)g(X)의 기대값을 구하고 싶다면, 다음과 같다.

E[g(X)]=∫−∞∞g(x)fX(x) dxE[g(X)]=\int_{-\infty}^{\infty}g(x)f_X(x)\,dx

즉, g(X)g(X)의 PDF를 직접 구하지 않고, 원래 XX의 PDF를 그대로 사용하면 된다.

예를 들어 E(X2)E(X^2)를 구하고 싶다면, 다음과 같다.

E(X2)=∫−∞∞x2fX(x) dxE(X^2)=\int_{-\infty}^{\infty}x^2f_X(x)\,dx

따라서 Y=X2Y=X^2의 PDF를 따로 구할 필요가 없다.


이산분포에서의 LOTUS

이산분포에서도 같은 아이디어가 있다.

E[g(X)]=∑xg(x)P(X=x)E[g(X)]=\sum_x g(x)P(X=x)

즉, g(X)g(X)의 PMF를 구할 필요 없이 원래 XX의 PMF에 g(x)g(x)만 곱하면 된다.


U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)의 분산

U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)을 생각하자.

PDF는 fU(u)=1,0≤u≤1f_U(u)=1,0\le u\le1이고, 기대값은 E(U)=12E(U)=\frac12 이다.

LOTUS를 사용하면 U2U^2의 PDF를 구하지 않고 바로 E(U2)=∫01u2fU(u) duE(U^2)=\int_0^1u^2f_U(u)\,du로 계산할 수 있다.

fU(u)=1f_U(u)=1이므로 E(U2)=∫01u2 du=13E(U^2)=\int_0^1u^2\,du=\frac13이다.

따라서

Var⁡(U)=E(U2)−[E(U)]2=13−(12)2=112\operatorname{Var}(U)=E(U^2)-[E(U)]^2=\frac13-\left(\frac12\right)^2=\frac1{12}

균등분포는 왜 전체 실수에서 정의할 수 없는가?

균등분포에서는 PDF가 어떤 구간에서 일정한 상수이다.

예를 들어 aa에서 bb까지만 균등하면 f(x)=1b−af(x)=\frac1{b-a}이다.

그런데 모든 실수에서 균등하다고 생각해보자.

그러면 모든 실수에서 같은 상수 cc를 가져야 한다.

하지만 ∫−∞∞c dx\int_{-\infty}^{\infty}c\,dx는 어떤 양의 상수 cc에 대해서도 무한대가 된다.

따라서 전체 적분을 11로 만들 수 없다.

즉 균등분포는 반드시 제한된 범위가 필요하다.


U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)의 보편성

00과 11 사이의 균등분포는 특별한 역할을 한다.

U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)

하나만 가지고도 원칙적으로 원하는 다른 연속분포를 생성할 수 있다.

이것을 균등분포의 보편성(Universality)이라고 볼 수 있다.

컴퓨터에서 난수를 생성할 때도 중요한 아이디어이다.

컴퓨터가 직접 원하는 복잡한 분포에서 난수를 생성하기 어려워도,

  1. 00과 11 사이의 균등 난수 UU를 생성하고
  2. 적절한 변환을 적용하여
  3. 원하는 분포를 따르는 확률변수를 만들 수 있다.

역변환을 이용한 분포 생성

원하는 CDF를 FF라고 하자.

U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)이고 FF가 연속적이며 강한 증가(strictly increasing)한다고 가정하자.

그러면 F−1F^{-1}이 존재한다.

이때 X=F−1(U)X=F^{-1}(U)라고 정의하면 XX는 CDF가 FF인 분포를 따른다.

즉, X∼FX\sim F이다.

원하는 CDF의 역함수에 균등분포 난수를 넣으면 원하는 분포를 만들 수 있다.


왜 X=F−1(U)X=F^{-1}(U)가 원하는 분포를 만드는가?

XX의 CDF를 직접 구해보자.

P(X≤x)P(X\le x) 에서 X=F−1(U)X=F^{-1}(U)이므로 P(F−1(U)≤x)P(F^{-1}(U)\le x)가 된다.

FF가 증가함수이므로 양변에 FF를 적용하면 P(U≤F(x))P(U\le F(x))가 된다.

그런데 U∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)이고 F(x)F(x)가 CDF이므로 0≤F(x)≤10\le F(x)\le1이다. 따라서 UU가 00부터 F(x)F(x)까지 있을 확률은 그 구간의 길이와 같으므로 P(U≤F(x))=F(x)P(U\le F(x))=F(x)이다.

P(X≤x)=F(x)P(X\le x)=F(x)

즉, XX의 CDF가 정확히 FF이므로 X∼FX\sim F이다.

0개의 댓글