Ch3_확률변수와 확률분포

Kamator0·2026년 4월 17일

확률변수 (random variable) (r.v)

확률변수의 정의

  • 어떤 시행에서 표본공간 Ω\Omega의 각 원소에 하나의 실숫값을 대응하는 함수 XX 를 확률변수라고 한다.

  • X를 1의 눈이 나올 때까지 주사위를 반복해서 던진 횟수라 하면, 확률변수 X의 치역은 X(Ω)X(\Omega) = {1,2,3,4,5 ...}, 즉 자연수 전체 집합임을 알 수 있다. 이와 같이 확률변수 X의 치역이 셀 수 있는(countable) 이산 값으로 주어지는 확률변수 X를 이산확률변수(discrete random variable) 라 하고, 확률 변수 X가 갖는 값 x를 이산점(discrete point) 라 한다.

  • 반지름이 10cm씩 커지는 동심원 10개로 구성된 원판에 양궁선수가 화살을 쏘는 경우, 화살인 꽂힌 2차원 평면상의 위치를 표본공간으로 나타내기는 상당히 어렵다. 그러나 X를 원판의 중심으로부터 떨어진 거리로 정의하면 X의 치역은 다음과 같은 실수 집한으로 나타낼 수 있다.
    X(Ω)X(\Omega) = {xRx \in R, 0<=x<=1000<=x<=100 } 이와 같이 어떤 연속하는 범위 안에서 모든 실숫값을 가지는 확률변수 X를 연속확률변수(continuous random variable) 라 한다.

확률질량 함수 (probability mass function) (PMF)

  • 이산확률변수 X에 대하여 X가 임의의 실수 x를 취할 확률에 대응하는 다음 함수를 이산확률변수 X의 확률질량함수 라고 한다.
    f(x)=P(X=x)f(x) = P(X=x) , {s∈S : X(s) = x}를 간단히 표현 한 것이 왼쪽

  • 이산확률변수 X의 치역, 즉 이산점 x에 대하여 f(x)=P(X=x)f(x) = P(X=x) 는 그 이산점에서의 확률을 의미하므로 0f(x)10\leq f(x) \leq 1이다. 또 P(X=x)P(X=x)는 발생하리라 기대되는 사건의 확률이므로 모든 x에 대하여 f(x)f(x)의 합은 1이어야 한다

  • P(X)라고 쓰는 것은 말이 안 됩니다. 우리는 사건의 확률만 취할 수 있고, r.v.의 확률은 가질 수 없습니다. -> 나중에 헷갈린다.

  • 2번 보충 설명

    • 주사위 x (1~6) 1/6 , x= 7 support 밖이라 0

확률밀도함수 (probability density function) (PDF)

  • 연속확률변수 X에 대하여 aXba \leq X \leq b 인 확률을 다음과 같이 표현할 때, 확률변수 X는 연속확률 분포를 따른다고 한다.
    P(aXb)=abf(x)dxP(a \leq X \leq b) = \int_{a}^{b} f(x)dx 이때 연속함수 f(x)f(x)를 확률변수 X의 확률밀도함수 라고 한다



확률분포

이산확률분포 (discrete probability distribution)

  • 이산확률분포의 그래프는 보통 막대그래프나 확률 히스토그램(probability histogram) 으로 나타낸다.
  • 확률변수의 유형에 관계없이 이런 누적확률의 일반적인 표현 방법이 필요하다. 이때 도입되는 새로운 표현 방법이 분포함수(ditribution function) 이다. 다음과 같은 함수 F(x)를 확률변수 X의 분포함수라고 한다.
    F(x)=P(Xx)F(x) = P(X \leq x)
  • 즉 이산확률변수 X의 분포함수는 임의의 실수 x에 대하여 이산확률변수 X가 x보다 작거나 같은 값을 취하는 확률로 취하는 확률로 정의하므로 분포함수 F(x)를 누적분포함수(cumulative distribution function) 라고도 한다. 확률 질량함수 f(x)f(x) 를 갖는 이산확률변수라면 분포함수 F(x)F(x)는 다음과 같다
  • F(x)=xixf(xi)F(x) = \sum_ {x_i \leq x}^{ } f(x_i)

연속확률분포 (continuous probability distribution)

  • 한편, f(x)f(x) 가 연속확률변수 X의 확률밀도함수일 때 확률변수 X의 분포함수 F(x)F(x) 는 다음과 같. 분포함수는 확률 P(Xx)P(X \leq x) 와 같으므로 다음이 성립한다.

  • 분호 함수의 정의와 미분적분학의 기본정리에 의해 연속확률변수 X의 분포함수 F(x)F(x)는 다음을 만족한다.
    f(x)=dF(x)dxf(x) = \frac {dF(x)}{dx}

확률변수의 기댓값과 분산

확률변수의 기댓값

  • 확률변수 X의 평균을 μ\mu 라 하면 다음이 성립한다
    μ=0f(0)+1f(1)+2f(2)=1\mu = 0 * f(0) + 1 * f(1) + 2 * f(2) =1
    이는 서로 다른 동ㅈ언 2개를 던지는 통계실험을 계속 반복할 때 평균적으로 관측되리라 기대되는 값이 1임을 의미한다. 이와 같이 구한 평균은 기댓값(expected value) 라고 한다.

  • 확률변수 X의 기댓값은 μ\mu 는 X의 확률분포에서 중심 위치를 의미하고 E(x)E(x)로 나타낸다.

  • 정의

기댓값을 일반화하여 확률변수 X의 함수 g(x)에 대한 기댓값을 다음과 같이 표현할 수 있다.

E{g(X)}={x=x1xng(x)f(x)(X:이산확률변수)g(x)f(x)dx(X:연속확률변수)E\{g(X)\} = \begin{cases} \displaystyle\sum_{x=x_1}^{x_n} g(x)f(x) & (X : \text{이산확률변수}) \\[10pt] \displaystyle\int_{-\infty}^{\infty} g(x)f(x)\,dx & (X : \text{연속확률변수}) \end{cases}

확률변수의 분산

  • 확률변수와 확률분포로 확장하면 확률변수 X와 기댓값 E(X)E(X) 의 차 D=XE(X)D = X-E(X) 가 편차이고 DD 의 기댓값은 항상 E(D)=0E(D) = 0 이므로 DD의 기댓값은 확률분포의 흩어진 정도를 나타내는 산포도를 나타낼 수 없다.

  • X의 분산(variance) 라고 하고, Var(X) 로 나타낸다
    Var(X)=E[(XE(x))2]Var(X) = E[(X-E(x))^2]

  • X의 표준편차는 σX\sigma_X 로 표기하며 다음과 같이 정의한다
    σX=Var(X)\sigma_X = \sqrt{Var(X)}

적률생성함수 (moment generating function)

-를 하기전에 적률에 대해서 알아보자

적률 (moment)

  • 왜 적률이 필요한가?

평균과 분산만으로는 분포를 완전히 설명할 수 없다.

  • N(2,12)\mathcal{N}(2, 12) 와 Log-Normal → 평균 2, 분산 12로 같지만 모양이 완전히 다름
  • Bin(10,0.9)\text{Bin}(10, 0.9)8+Bin(10,0.1)8 + \text{Bin}(10, 0.1) → 평균, 분산, 중앙값, 최빈값이 전부 같지만 하나는 왼쪽, 하나는 오른쪽으로 치우침

분포의 더 세밀한 특징을 잡기 위해 적률이 필요하다.


  • 적률의 종류

XX의 평균 μ\mu, 분산 σ2\sigma^2 일 때:

종류수식기준
nn차 적률E(Xn)E(X^n)원점 기준
nn차 중심 적률E((Xμ)n)E((X-\mu)^n)평균 기준
nn차 표준화 적률E((Xμσ)n)E\left(\left(\dfrac{X-\mu}{\sigma}\right)^n\right)단위 제거

각 차수별 의미

  • 1차 적률 → 평균 (Mean)

E(X)=μE(X) = \mu

분포의 무게중심 (물리학의 center of mass)


  • 2차 중심 적률 → 분산 (Variance)

E((Xμ)2)=σ2E((X-\mu)^2) = \sigma^2

물리학의 관성모멘트(moment of inertia) 와 동일. 분포가 평균에서 얼마나 퍼져있는지.


  • 3차 표준화 적률 → 왜도 (Skewness)

Skew(X)=E((Xμσ)3)\text{Skew}(X) = E\left(\left(\frac{X-\mu}{\sigma}\right)^3\right)

분포의 비대칭 정도:

의미
Skew>0\text{Skew} > 0오른쪽 꼬리가 긺
Skew=0\text{Skew} = 0대칭
Skew<0\text{Skew} < 0왼쪽 꼬리가 긺

홀수 거듭제곱이라 양수/음수 방향을 구분 가능. 5차 대신 3차를 쓰는 이유는 계산이 쉽고, 고차일수록 극단값에 민감해 불안정하기 때문.


  • 4차 표준화 적률 → 첨도 (Kurtosis)

Kurt(X)=E((Xμσ)4)3\text{Kurt}(X) = E\left(\left(\frac{X-\mu}{\sigma}\right)^4\right) - 3

분포의 꼬리 두께 (tail heaviness):

의미
Kurt>0\text{Kurt} > 0정규분포보다 꼬리가 두꺼움
Kurt=0\text{Kurt} = 0정규분포와 동일
Kurt<0\text{Kurt} < 0꼬리가 없음 (ex. 균등분포)

3을 빼는 이유: 정규분포의 4차 표준화 적률 = 3 이므로, 3을 빼면 정규분포를 기준(0)으로 비교 가능.


대칭 분포와 홀수 중심 적률

X가 μ에 대해 대칭E((Xμ)m)=0(m이 홀수)X \text{가 } \mu \text{에 대해 대칭} \Rightarrow E((X-\mu)^m) = 0 \quad (m \text{이 홀수})

대칭이면 양쪽이 서로 상쇄되므로 홀수 차 적률은 0.

단, 역은 성립하지 않음 → Skew(X)=0\text{Skew}(X) = 0 이어도 비대칭일 수 있음.


표본 적률 (Sample Moments)

Mk=1nj=1nXjkM_k = \frac{1}{n}\sum_{j=1}^{n} X_j^k

Xˉn=M1=1nj=1nXj(표본평균)\bar{X}_n = M_1 = \frac{1}{n}\sum_{j=1}^{n} X_j \quad \text{(표본평균)}

표본 적률모집단 적률
평균Xˉn\bar{X}_nE(Xj)E(X_j)
의미데이터로 추정한 값진짜 값

주요 분포의 왜도 & 첨도

분포왜도첨도
Expo(1)\text{Expo}(1)2266
Pois(4)\text{Pois}(4)0.50.50.250.25
Unif(0,1)\text{Unif}(0,1)001.2-1.2
N(μ,σ2)\mathcal{N}(\mu, \sigma^2)0000

한 줄 정리

적률 = 분포의 모양을 숫자로 요약하는 도구

  • 1차: 중심 / 2차: 퍼짐 / 3차: 비대칭 / 4차: 꼬리 두께

다음 단계: MGF(적률생성함수) 를 배우면 모든 적률을 한꺼번에 구할 수 있다.

  • 이제 배워보자

적률생성함수

적률을 구하려면 매번 E(Xn)E(X^n)을 직접 계산해야 해서 번거롭다.

E(X)=xf(x)dx,E(X2)=x2f(x)dx,E(X) = \int x f(x) dx, \quad E(X^2) = \int x^2 f(x) dx, \quad \ldots

MGF를 한 번만 구해두면, 미분만으로 모든 적률을 뽑아낼 수 있다.


  • 정의

MX(t)=E(etX)M_X(t) = E(e^{tX})

  • 이산: MX(t)=xetxP(X=x)M_X(t) = \sum_x e^{tx} P(X = x)
  • 연속: MX(t)=etxf(x)dxM_X(t) = \int_{-\infty}^{\infty} e^{tx} f(x)\, dx

tt는 실수이고, MGF가 t=0t=0 근방에서 존재할 때 유효하다.


  • 핵심 성질: 적률 추출

etXe^{tX}를 테일러 전개하면:

etX=1+tX+t2X22!+t3X33!+e^{tX} = 1 + tX + \frac{t^2 X^2}{2!} + \frac{t^3 X^3}{3!} + \cdots

기댓값을 취하면:

MX(t)=1+tE(X)+t2E(X2)2!+t3E(X3)3!+M_X(t) = 1 + tE(X) + \frac{t^2 E(X^2)}{2!} + \frac{t^3 E(X^3)}{3!} + \cdots

따라서 t=0t=0에서 nn번 미분하면:

E(Xn)=MX(n)(0)\boxed{E(X^n) = M_X^{(n)}(0)}

  • 예시
    MX(0)=E(X)(평균)M_X'(0) = E(X) \quad \text{(평균)}

MX(0)=E(X2)(2차 적률)M_X''(0) = E(X^2) \quad \text{(2차 적률)}

Var(X)=MX(0)[MX(0)]2\text{Var}(X) = M_X''(0) - [M_X'(0)]^2


  • 주요 분포의 MGF

    • 베르누이 XBern(p)X \sim \text{Bern}(p)

      MX(t)=1p+petM_X(t) = 1 - p + pe^t

    • 이항 XBin(n,p)X \sim \text{Bin}(n, p)

      MX(t)=(1p+pet)nM_X(t) = (1 - p + pe^t)^n

    • 포아송 XPois(λ)X \sim \text{Pois}(\lambda)

      MX(t)=eλ(et1)M_X(t) = e^{\lambda(e^t - 1)}

    • 정규 XN(μ,σ2)X \sim \mathcal{N}(\mu, \sigma^2)

      MX(t)=eμt+σ2t22M_X(t) = e^{\mu t + \frac{\sigma^2 t^2}{2}}

    • 지수 XExpo(λ)X \sim \text{Expo}(\lambda)

      MX(t)=λλt,t<λM_X(t) = \frac{\lambda}{\lambda - t}, \quad t < \lambda


  • MGF의 중요한 성질
    • (1) 분포를 유일하게 결정

      두 r.v.의 MGF가 같으면 → 분포가 같다

      MX(t)=MY(t) for all tX=dYM_X(t) = M_Y(t) \text{ for all } t \Rightarrow X \overset{d}{=} Y

    • (2) 독립 r.v.의 합

      XXYY가 독립일 때:

      MX+Y(t)=MX(t)MY(t)M_{X+Y}(t) = M_X(t) \cdot M_Y(t)

      합의 분포를 구할 때 매우 강력한 도구!

    • 예시: XiN(μi,σi2)X_i \sim \mathcal{N}(\mu_i, \sigma_i^2) 이고 독립이면:

      MX1+X2(t)=eμ1t+σ12t22eμ2t+σ22t22=e(μ1+μ2)t+(σ12+σ22)t22M_{X_1 + X_2}(t) = e^{\mu_1 t + \frac{\sigma_1^2 t^2}{2}} \cdot e^{\mu_2 t + \frac{\sigma_2^2 t^2}{2}} = e^{(\mu_1+\mu_2)t + \frac{(\sigma_1^2+\sigma_2^2)t^2}{2}}

      X1+X2N(μ1+μ2, σ12+σ22)\therefore X_1 + X_2 \sim \mathcal{N}(\mu_1 + \mu_2,\ \sigma_1^2 + \sigma_2^2)

    • (3) 선형변환

      Y=aX+bY = aX + b 이면:

      MY(t)=ebtMX(at)M_Y(t) = e^{bt} M_X(at)


  • MGF로 적률 계산 예시

    • XExpo(λ)X \sim \text{Expo}(\lambda)의 평균과 분산 구하기

      MX(t)=λλt=λ(λt)1M_X(t) = \frac{\lambda}{\lambda - t} = \lambda(\lambda - t)^{-1}

    • 1차 미분:

      MX(t)=λ(λt)2M_X'(t) = \lambda(\lambda - t)^{-2}

      E(X)=MX(0)=1λE(X) = M_X'(0) = \frac{1}{\lambda}

    • 2차 미분:

      MX(t)=2λ(λt)3M_X''(t) = 2\lambda(\lambda - t)^{-3}

      E(X2)=MX(0)=2λ2E(X^2) = M_X''(0) = \frac{2}{\lambda^2}

    • 분산:

      Var(X)=E(X2)[E(X)]2=2λ21λ2=1λ2\text{Var}(X) = E(X^2) - [E(X)]^2 = \frac{2}{\lambda^2} - \frac{1}{\lambda^2} = \frac{1}{\lambda^2}


  • MGF가 존재하지 않는 경우

MGF는 항상 존재하지 않는다. 예를 들어 Cauchy 분포는 MGF가 존재하지 않음.
이런 경우 대신 특성함수(Characteristic Function) 를 사용:
φX(t)=E(eitX)(i=1)\varphi_X(t) = E(e^{itX}) \quad (i = \sqrt{-1})
특성함수는 항상 존재하지만 복소수를 다뤄야 함.


한 줄 정리

MGF = 분포의 모든 정보를 담은 함수

  • 미분 → 적률 추출
  • 곱셈 → 독립 합의 분포
  • 동일 MGF → 동일 분포

결합확률분포

결합확률질량함수 (joint probability mass function) (joint PMF)

  • 두 확률변수 XXYY결합확률질량함수 라 하고 이를 나타낸 표를 결합분포표 라고 한다.

PX,Y(x,y)=P(X=x,Y=y)P_{X,Y}(x,y) = P(X= x,Y= y).

주변확률질량함수 (marginal probability mass function)

  • 이산확률 변수 XXYY의 결합확률질량함수 f(x,y)f(x,y)가 주어진 확률변수 XX 만의 1차원 확률분포에 대한 함수 h(x)h(x)와 확률변수 YY만의 1차원 확률분포에 대한 함수 g(y)g(y)를 구할 수 있는데, 이를 각각 XXYY주변확률질량함수 라고 한다

두 이산확률변수 XX, YY의 결합확률질량함수 f(x,y)f(x, y)에 대해:

h(x)=P(X=x)=y=y1ymf(x,y)h(x) = P(X = x) = \sum_{y=y_1}^{y_m} f(x, y) , g(y)=P(Y=y)=x=x1xnf(x,y)g(y) = P(Y = y) = \sum_{x=x_1}^{x_n} f(x, y)

조건부 확률질량 함수 (Conditional PMF)

  • 이산확률 변수 XXYY 가 주어졌을 때 X=xX =x 에 대한 YY조건부질량함수
    다음과 같이 나타낸다

P(Y=yX=x)=P(X=x, Y=y)P(X=x)P(Y = y \mid X = x) = \frac{P(X = x,\ Y = y)}{P(X = x)}

"X=xX = x 라는 걸 알고 있을 때, YYyy일 확률"

  • Joint / Marginal / Conditional 관계

P(Y=yX=x)Conditional PMF=P(X=x, Y=y)Joint PMFP(X=x)Marginal PMF\underbrace{P(Y=y \mid X=x)}_{\text{Conditional PMF}} = \frac{\overbrace{P(X=x,\ Y=y)}^{\text{Joint PMF}}}{\underbrace{P(X=x)}_{\text{Marginal PMF}}}

P(X=x, Y=y)=P(Y=yX=x)P(X=x)\therefore \quad P(X=x,\ Y=y) = P(Y=y \mid X=x) \cdot P(X=x)

Joint = Conditional × Marginal

결합(누적)분포함수 (Joint Distribution Function) (Joint Cumulative Distribution Function) (joint CDF)

모든 xx, yy에 대하여 다음을 만족하는 F(x,y)F(x, y)결합분포함수 라 한다.

F(x,y)=uxvyf(u,v)F(x, y) = \sum_{u \leq x} \sum_{v \leq y} f(u, v)


결합확률밀도함수 (joint probability density function)

  • 연속확률변수 XXYY에 대하여 다음을 만족하는 함수 f(x,y)f(x,y)를 두 연속확률 변수 XXYY결합확률밀도함수 라고 한다.

주변확률밀도함수 (marginal probability density function)

  • fx(x)f_x(x)fy(y)f_y(y) 를 각각 다음과 같이 정의한다.

fX(x)=f(x,y)dy,fY(y)=f(x,y)dxf_X(x) = \int_{-\infty}^{\infty} f(x, y)\, dy, \qquad f_Y(y) = \int_{-\infty}^{\infty} f(x, y)\, dx

조건부 확률밀도함수 (Conditional PDF)

  • 연속확률변수 XX, YY의 결합 PDF fX,Yf_{X,Y}에 대해, X=xX = x가 주어졌을 때 YY의 조건부 PDF는:

fYX(yx)=fX,Y(x,y)fX(x)f_{Y \mid X}(y \mid x) = \frac{f_{X,Y}(x, y)}{f_X(x)}

단, fX(x)>0f_X(x) > 0 인 모든 xx에 대해 정의된다.

결합(누적)분포함수 (joint distribution) (Joint Cumulative Distribution Function) (joint CDF)

  • 두 연속확률변수 XX,YY 에 대하여 XXYY의 결합밀도함수 f(x,y)f(x,y)가 음이 아닌 함수라고 하자. 모든 실수 x,y에 대하여 다음을 만족하는 F(x,y)F(x,y)


배이즈 정리

LOTP

이산 vs 연속

이산연속
Joint CDFuxvyf(u,v)\displaystyle\sum_{u \leq x}\sum_{v \leq y} f(u,v)xyf(u,v)dvdu\displaystyle\int_{-\infty}^{x}\int_{-\infty}^{y} f(u,v)\,dv\,du
PMF/PDF 추출f(x,y)f(x,y) = FF의 차분f(x,y)=2Fxy\displaystyle f(x,y) = \frac{\partial^2 F}{\partial x \partial y}

공분산과 상관계수

공분산 (Covariance)

  • 두 확률변수 XXYY 가 가지는 값이 동일한 방향으로 변화하는지, 혹은 반대 방향으로 변화하는지에 대한 결합 산포 정도를 나타내는 척도

  • XXYY 가 같은 방향으로 움직이게 된다면 XEXX -EXYEYY-EY 가 둘다 양수 혹은 음수가 된다면 (XEX)(YEY)(X-EX)(Y-EY) 가 평균적으로 양수이고 양의 값을 가질 것이다. 반대로 다른 방향으로 움직인다면 음의 값을 가질 것이다.
  • 만약 XXYY이 독립이라면 공분산은 0이다 연관이 없다.

공분산 성질 (교재에는 없음)

상관계수 (Correlation coefficient)

  • 두 확률변수 XXYY의 공분산은 확률변수의 단위에 따라 크기가 다르게 나타난다. 공분산을 이용하여 두 자료를 비교하기 곤란할 수 있다. 따라서 단위와 무관하게 두 자료를 비교하기 위한 척도

  • σxy\sigma_{xy} > 0 이면 양의 상관관계가 있다고 하고, σxy\sigma_{xy} < 0 이면
    음의 상관관계가 있다고 한다. 또한 σxy=0\sigma_{xy} = 0 이면 두 확률분포는 상관계가 없다고 한다. σxy\sigma_{xy} = 1 은 완전 양의 상관관계이고 σxy\sigma_{xy} = -1 이면 완전 음의 상관관계이다.

확률변수의 독립 (Independence of r.v.s)

  • 주변확률질량함수가 각각 h(x)h(x)g(X)g(X)인 두 확률변수 XXYY의 결합확률분포에서 모든 (xi,yi)(x_i , y_i) 에 대하여 다음이 성립하면, 두 확률변수 XXYY는 서로 독립(mutually independent) 라 한다.

P(X=xi,Y=yj)=P(X=xi)P(Y=yj)P(X= x_i, Y= y_j) = P(X=x_i)P(Y=y_j) 또는 다음과 같이 나타낼 수 있다.

f(xi,yj)=h(xi)g(yj)f(x_i,y_j) = h(x_i)g(y_j)

두 확률변수 XXYY 가 서로 독립이 아니면 서로 종속(mutually dependent) 라고 한다

  • 성질
    두 확률변수 XX, YY가 서로 독립일 때, 다음이 성립한다.

E(XY)=E(X)E(Y)\quad E(XY) = E(X)E(Y)

Var(X+Y)=Var(X)+Var(Y)\quad \text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)

Cov(X,Y)=0\quad \text{Cov}(X, Y) = 0

Corr(X,Y)=0\quad \text{Corr}(X, Y) = 0

  • 확률 변수 XXYY가 서로 독립이면 공분산과 상관계수가 0임을 알 수 있다. 그러나 그 역은 일반적으로 성립하지 않는다. 즉 두 확률변수의 공분산과 상관계수 0이라 하더라도 서로 독립이 아닌 수 있다.

다항분포 (multinominal) (교재에는 없음)

정의

  • 이항분포의 일반화. nn개의 객체를 kk개의 카테고리에 독립적으로 분류할 때.

X=(X1,,Xk)Multk(n,p)\mathbf{X} = (X_1, \ldots, X_k) \sim \text{Mult}_k(n, \mathbf{p})

조건: p1+p2++pk=1p_1 + p_2 + \cdots + p_k = 1, X1++Xk=nX_1 + \cdots + X_k = n

다항결합확률질량함수 (Multinominal joint PMF)

P(X1=n1,,Xk=nk)=n!n1!n2!nk!p1n1p2n2pknkP(X_1 = n_1, \ldots, X_k = n_k) = \frac{n!}{n_1!\, n_2!\, \cdots\, n_k!} \cdot p_1^{n_1} p_2^{n_2} \cdots p_k^{n_k}

주변분포 (Multinomial Marginals)

XjBin(n,pj)X_j \sim \text{Bin}(n, p_j)

다항분포에서 하나만 보면 이항분포

결합(Lumping) 성질

카테고리를 합칠 수 있다:

Xi+XjBin(n, pi+pj)X_i + X_j \sim \text{Bin}(n,\ p_i + p_j)

XMultk(n,p)(X1+X2,X3,,Xk)Multk1(n, (p1+p2,p3,,pk))\mathbf{X} \sim \text{Mult}_k(n, \mathbf{p}) \Rightarrow (X_1 + X_2, X_3, \ldots, X_k) \sim \text{Mult}_{k-1}(n,\ (p_1+p_2, p_3, \ldots, p_k))

조건부 분포 (Conditioning)

X1=n1X_1 = n_1 이 주어지면 나머지는 확률을 재정규화한 다항분포:

(X2,,Xk)X1=n1Multk1(nn1, (p2,,pk))(X_2, \ldots, X_k) \mid X_1 = n_1 \sim \text{Mult}_{k-1}\left(n - n_1,\ (p_2', \ldots, p_k')\right)

pj=pjp2++pkp_j' = \frac{p_j}{p_2 + \cdots + p_k}


다항분포 공분산

Cov(Xi,Xj)=npipj(ij)\text{Cov}(X_i, X_j) = -np_i p_j \quad (i \neq j)

항상 음의 공분산XiX_i가 크면 XjX_j는 작아질 수밖에 없음 (X1++Xk=nX_1 + \cdots + X_k = n 제약 때문)


다변량 정규분포 (Multivariate Normal, MVN)

정의

kk차원 랜덤벡터 X=(X1,,Xk)\mathbf{X} = (X_1, \ldots, X_k)모든 선형결합이 정규분포를 따르면 MVN.

t1X1++tkXkNt_1 X_1 + \cdots + t_k X_k \sim \mathcal{N}

k=2k = 2 인 특수한 경우 → 이변량 정규분포 (Bivariate Normal, BVN)

BVN의 Joint PDF

N(0,1)\mathcal{N}(0,1) 주변분포, 상관계수 ρ(1,1)\rho \in (-1, 1) 일 때:

fX,Y(x,y)=12πτexp(12τ2(x2+y22ρxy)),τ=1ρ2f_{X,Y}(x,y) = \frac{1}{2\pi\tau} \exp\left(-\frac{1}{2\tau^2}(x^2 + y^2 - 2\rho xy)\right), \quad \tau = \sqrt{1-\rho^2}

  • ρ=0\rho = 0: 등고선이 원형
  • ρ0\rho \neq 0: 등고선이 타원형

MVN의 파라미터

파라미터의미
평균벡터 (μ1,,μk)(\mu_1, \ldots, \mu_k)각 성분의 평균
공분산 행렬 (k×kk \times k)(i,j)(i,j) 원소 = Cov(Xi,Xj)\text{Cov}(X_i, X_j)

BVN (X,Y)(X, Y)를 완전히 특정하려면 5개의 파라미터가 필요:
E(X), E(Y), Var(X), Var(Y), Corr(X,Y)E(X),\ E(Y),\ \text{Var}(X),\ \text{Var}(Y),\ \text{Corr}(X,Y)

핵심: MVN에서만 성립하는 특별한 성질

Corr(X,Y)=0    X 와 Y 는 독립\text{Corr}(X, Y) = 0 \iff X \text{ 와 } Y \text{ 는 독립}

일반적으로 무상관 (Corr(X,Y))Corr(X,Y)) ⇏\not\Rightarrow 독립이지만, MVN에서는 무상관 (Corr(X,Y))Corr(X,Y))= 독립!

왼쪽: σ\sigma = 0 (상관계수가 0)
오른쪽: σ\sigma ≠ 0 (상관계수가 0이 아닌 경우) (σ0\sigma \ge 0) 인 경우 표현

  • 등고선 모양이 상관관계의 존재 여부를 직관적으로 보여줍니다. 원 → 독립, 타원 → 상관관계 존재.
  • 타원의 기울기 방향이 상관관계의 부호를 알려줍니다. 우상향 기울기 → ρ > 0, 좌상향 기울기 → ρ < 0.
  • 상관계수가 0이 아니면 분포가 더 집중되면서(한 방향으로 좁아지면서) 최대 밀도값이 올라갑니다.

BVN 생성 방법

X,Yi.i.d.N(0,1)X, Y \overset{i.i.d.}{\sim} \mathcal{N}(0,1) 일 때, 상관계수 ρ\rho인 BVN (Z,W)(Z, W):

Z=X,W=ρX+1ρ2YZ = X, \qquad W = \rho X + \sqrt{1-\rho^2}\, Y

ρ\rho의미
ρ=1\rho = 1완전 양의 상관: W=ZW = Z
ρ=1\rho = -1완전 음의 상관: W=ZW = -Z
ρ=0\rho = 0독립: (Z,W)=(X,Y)(Z, W) = (X, Y)

Joint MGF

M(t)=E(etX)=E(et1X1++tkXk)M(\mathbf{t}) = E(e^{\mathbf{t}'\mathbf{X}}) = E\left(e^{t_1 X_1 + \cdots + t_k X_k}\right)

BVN의 Joint MGF:

MX,Y(s,t)=exp(sμ1+tμ2+12(s2σ12+t2σ22+2stσ1σ2ρ))M_{X,Y}(s,t) = \exp\left(s\mu_1 + t\mu_2 + \frac{1}{2}(s^2\sigma_1^2 + t^2\sigma_2^2 + 2st\sigma_1\sigma_2\rho)\right)

0개의 댓글