VAE 탐구 - 2/6

Tetrapod·2024년 5월 21일

VAE 탐구

목록 보기
2/6

이 글에서는 확률론과 확률변수에 대해 정리해보고자 한다.


단순사건과 확률질량함수

  • 유한 개의 사건이 존재하는 경우 각 단순사건에 대한 확률만 정의하는 함수를 확률질량함수 ( probability mass fucntion ) 라고 한다.
  • 확률질량함수는 소문자 pp로 표시한다. 확률과 확률질량함수는 다른 개념이라는 점을 주의한다.
p(a)=P({a})p(1)=P({1})=0.2p(1,2)=P({1,2})=0.3\begin{aligned} p(a)&=P(\{a\}) \\ p(1)&=P(\{1\})=0.2 \\ p(1,2)&=P(\{1,2\})=0.3 \end{aligned}

누적분포함수

  • 무한 개의 사건이 존재하는 경우 시작점을 모두 똑같이 음의 무한대 (-\infty)로 통일한 특수한 구간 SxS_x을 사용한다.
S1={<X1}S0={<X0}S1={<X1}Sx={<Xx}\begin{aligned} S_{-1}&=\{-\infty<X\leq-1\}\\ S_{0}&=\{-\infty<X\leq0\}\\ S_{1}&=\{-\infty<X\leq1\}\\ &\vdots\\ S_{x}&=\{-\infty<X\leq x\} \end{aligned}
  • 이러한 사건의 확률분포를 묘사하는 함수를 누적분포함수(cumulative distribution function)라고 하고 약자로 cdf라고 쓴다.
  • 함수 기호로는 F(x)F(x), 독립변수 xx는 구간의 끝점을 뜻한다.
F(x)=P(Sx)=P({X<x})if  a<xb:P(,b)=P(,a)+P(a,b)F(b)=F(a)+P(a,b)P(a,b)=F(b)F(a)\begin{aligned} F(x)&=P(S_x)=P(\{X<x\}) \\ if\;a<x\leq &b: \\ P(-\infty,b)&=P(-\infty,a)+P(a,b) \\ F(b)&=F(a)+P(a,b) \\ P(a,b)&=F(b)-F(a) \end{aligned}

확률밀도함수

  • 누적분포함수는 분포의 형상을 직관적으로 이해하기 힘든 단점이 있다.
  • 전체구간 ()(-\infty \sim \infty)을 아주 작은 폭 dxdx를 가지는 구간들로 나눈 다음 각 구간의 확률을 살펴보는 것이 편리하다.
P({x1<xx1+dx})=F(x1+dx)F(x1)P(\{x_1<x\leq x_1+dx\})=F(x_1+dx)-F(x_1)
  • 단위구간이 미세하게 줄어들면 누적분포함수의 기울기가 된다.
limdx0F(x1+dx)F(x1)dx\lim_{dx\rightarrow0}\frac{F(x_1+dx)-F(x_1)}{dx}
  • 누적분포함수를 미분하여 구한 도함수를 확률밀도함수 ( probability density function )라고 한다.
    확률질량함수와 마찬가지로 p(x)p(x)로 표기한다.
    그 값 자체가 확률은 아니고 상대적인 값이다.
p(x)=dF(x)dxp(x)=\frac{dF(x)}{dx}

p(x)p(x)pp가 이전 글의 pp 와 의미가 같은 듯 하다.
아래에도 다시 등장한다.


누적분포함수와 확률밀도함수의 관계

F(x2)F(x1)=x1x2p(u)duF(x)=xdF(u)dudu=xp(u)duF(x_2)-F(x_1)=\int_{x_1}^{x_2}p(u)du \\ F(x)=\int_{-\infty}^{x}\frac{dF(u)}{du}du=\int_{-\infty}^{x}p(u)du

F()=1F(\infty)=1이다. 즉, p(x)dx=1\int_{-\infty}^{\infty}p(x)dx=1이다.


결합확률과 조건부 확률

  • 결합확률 ( joint probability )은 사건 A와 B가 동시에 발생할 확률이다.

  • 결합되지 않는 개별 사건의 확률을 주변확률 ( mariginal probability ) 라고 한다.

  • BB가 사실일 경우의 사건 AA에 대한 확률을 사건 BB에 대한 사건 AA의 조건부확률 ( conditional probability )이라고 한다.

    p(AB)  or  P(A,B)P(A)    P(B)P(AB)=P(A,B)P(B)p(A\cap B)\;or\;P(A,B) \\ P(A)\;\;P(B) \\ P(A|B)=\frac{P(A,B)}{P(B)}
  • AABB가 독립인 경우

    P(A,B)=P(A)P(B)P(AB)=P(A,B)P(B)=P(A)P(B)P(B)=P(A)P(A,B)=P(A)P(B)\\ P(A|B)=\frac{P(A,B)}{P(B)}=\frac{P(A)P(B)}{P(B)}=P(A)
  • 결합확률의 정의 바꿔쓰기

P(A,B)=P(AB)P(B)P(A,B)=P(A|B)P(B)

베이즈 정리

P(A,B)=P(AB)P(B)=P(BA)P(A)P(AB)=P(A,B)P(B)=P(BA)P(A)P(B)P(A,B)=P(A|B)P(B)=P(B|A)P(A) \\ P(A|B)=\frac{P(A,B)}{P(B)}=\frac{P(B|A)P(A)}{P(B)}
  • P(AB)P(A|B) : 사후확률 ( posterior )
  • P(A)P(A) : 사전확률 ( prior )
  • P(BA)P(B|A) : 가능도 ( likelihood )
  • P(B)P(B) : 정규화 상수 ( normalizing constant) 또는 증거
P(AB)=P(BA)P(A)P(B)P(A|B)=\frac{P(B|A)P(A)}{P(B)}

확륣변수의 기댓값

  • Uniform이면 p(xi)는 1n이다.Uniform이면\ p(x_i)는\ \frac{1}{n} 이다.
  • 기댓값을 다음과 같이 정의한다.
    μX=E[X]=xiΩxip(xi)\mu_X = E[X] = \sum_{x_i \in \Omega} x_i p(x_i)

확률분포의 분산

  • 분산을 구하는 연산은 영어 Variance의 앞글자를 땀
    계산된 분산값은 σ2\sigma^2로 표기한다.
σ2=Var[X]=E[(Xμ)2]\sigma^2 = Var[X] = E[(X-\mu)^2]
  • 이산확률변수를 다음과 같이 정의한다.
σ2=xiΩ(xiμ)2p(xi)\sigma^2 = \sum_{x_i\in\Omega}(x_i-\mu)^2p(x_i)
  • 연속확률변수를 다음과 같이 정의한다.
σ2=(xμ)2p(x)dx\sigma^2 = \int_{-\infty}^{\infty}(x-\mu)^2p(x)dx

분산의 성질

  • Var[X]0Var[X] \geq 0
  • Var[c]=0Var[c] = 0
  • Var[X]Var[X]를 다음과 같이 다시 정리할 수 있다.
Var[X]=E[(Xμ)2]=E[X22μX+μ2]=E[X2]2μE[X]+μ2=E[X2]2μ2+μ2=E[X2]μ2E[X2]=μ2+Var[X]\begin{aligned} Var[X]&=E[(X-\mu)^2]&\\ &=E[X^2-2\mu X+\mu^2]\\ &=E[X^2] - 2\mu E[X] + \mu^2\\ &=E[X^2] - 2\mu^2 + \mu^2\\ &=E[X^2] - \mu^2\\ \therefore E[X^2]&=\mu^2+Var[X] \end{aligned}

확률분포의 결정

  • 데이터는 0 또는 1 뿐이다. → 베르누이분포
  • 데이터는 카테고리 값이어야 한다. → 카테고리분포
  • 데이터는 0과 1사이의 실수 값이어야 한다. → 베타분포
  • 데이터는 항상 0 또는 양수이어야한다. → 로그정규분포, 감마분포, F분포, 카이제곱분포, 지수분포, 하프코시분포 등
  • 데이터가 크기 제한이 없는 실수다. → 정규분포 또는 스튜던트 t분포, 코시분포, 라플라스분포 등

Reference

데이터 사이언스 스쿨

0개의 댓글