연속확률분포

한상우·2024년 9월 9일

기초 통계학

목록 보기
5/15

균일분포

  • 연속형 균일분포 (continuous uniform distribution) : 확률변수가 취하는 모든 구간에서 각 사건의 발생확률이 일정한 분포.
  • XU(a,b)X \sim U(a,b)
  • PDF : f(X)=1ba,    aXbf(X) = {1\over b-a},\;\;a\leq X \leq b
  • 평균
    E(X)=a+b2E(X) = {a+b\over 2}
  • 분산
    Var(X)=(ba)212Var(X) = {(b-a)^2\over 12}
  • 대칭성 : 평균을 중심으로 대칭적이다

지수분포

  • 지수분포(Exponential Distribution) : 처음 사건이 발생할 때까지 걸리는 시간에 관한 연속확률분포

    • XExp(λ)X\sim Exp(\lambda)

    • 독립성 : 각 사건이 발생하는 시간 간격은 서로 독립적이다

    • 고정된 발생률 : 사건이 발생하는 비율(λ\lambda)이 사간에 따라 일정하다

    • 연속확률분포 중 유일하게 Memorylessness를 가짐 : 사건이 언제 발생했는지와 관계없이 남은 시간이 동일한 확률 분포를 따른다

    • 대기 시간 x : 사건이 발생하기까지의 시간

    • rate parameter λ : 사건이 발생할 평균 횟수(평균율)

    • PDF : f(x)=λeλx,  x0f(x) = \lambda e^{-\lambda x}, \; x\geq 0

    • 형태

      • x가 증가함에 따라 지수적으로 감소한다. 즉, 시간이 지날수록 사건이 발생할 확률은 점점 줄어든다
      • λ\lambda값이 클수록 급격하게 감소한다. 즉, 사건이 빠르게 발생할 가능성이 높다
    • 평균 : E(X)=1λE(X) = {1\over \lambda}

    • 분산 : Var(X)=1λ2Var(X) = {1\over \lambda^2}

감마분포

  • 감마분포 (Gamma Distribution) : k번째 사건이 발생할 때까지 걸리는 시간에 관한 연속확률분포

  • XΓ(k,θ)X\sim \Gamma(k, \theta)

  • 독립성 : 각 사건이 발생하는 시간 간격은 서로 독립적이다

  • 형상모수 k : 사건이 발생할 횟수

  • 척도모수 θ : 사건이 발생할 때까지 소요되는 평균 시간 = 1λ{1\over \lambda}

  • PDF : f(x;k;θ)=xk1ex/θθkΓ(k),    x>0f(x;k;\theta) = {x^{k-1}e^{-x/\theta}\over {\theta^k \Gamma(k)}}, \;\; x > 0

  • 형태

    • k가 커질수록 분포는 종 모양에 가까워지고, 평균값 근처에서 더 많은 값을 가질 가능성이 높아진다
    • θ\theta가 커질수록 분포가 넓고 오른쪽으로 퍼진다
  • 평균 : E(X)=kθE(X) = k\theta

  • 분산 : Var(X)=kθ2Var(X) = k\theta^2

  • 다른 분포와의 관계

    • 지수분포 : 감마분포에서 k=1인 경우 λ=1θ\lambda = {1\over \theta}인 지수분포와 동일하다. 즉, 감마분포는 지수분포의 일반화된 형태이다.

정규분포

  • 정규분포 (normal distribution, gaussian distribution) : 자연현상, 사회현상, 다양한 측정값 등에 매우 자주 나타나는 분포로 수집된 자료의 분포를 근사하는 데에 자주 사용된다.

    • PDF : f(X)=12πσ2e(xμ)/2σ2f(X) = {1\over \sqrt {2\pi \sigma^2}}e^{-(x-\mu)/2\sigma^2}

    • 정규분포의 모양 : 평균을 중심으로 대칭인 종모양(bell shape)이다. 평균으로 위치, 표준편차로 분포의 폭이 결정된다

    • 평균/중앙값/최빈값 : 평균, 중앙값, 최빈값이 모두 동일한 위치에 있다

    • Empirical Rule

      • 약 68%의 데이터가 평균에서 ±1\pm 1 표준편차 범위 내에 존재한다
      • 약 95%의 데이터가 평균에서 ±2\pm 2 표준편차 범위 내에 존재한다
      • 약 99.7%의 데이터가 평균에서 ±3\pm 3 표준편차 범위 내에 존재한다
    • 표준정규분포 : 정규분포를 평균 = 0, 표준편차 = 1이 되도록 표준화 한 것으로 Z-분포라고도 한다.
      Z=XμσZ = {X-\mu\over \sigma}

카이제곱분포

  • 카이제곱분포 (Chi-Square Distribution) : 분산 분석, 적합도 검정, 독립성 검정 등에서 사용되는 연속형 확률분포이다. 카이제곱분포는 자유도(degrees of freedom)에 따라 형태가 달라지며, 정규분포를 따르는 확률변수들의 제곱합으로 정의된다.

    • 정의 : 정규분포를 따르는 k개의 독립적인 표준 정규변수 Z1,Z2,...,ZkZ_1, Z_2, ..., Z_k의 제곱합으로 정의된다

      X=Z12+Z22+...+Zk2X = Z_1^2+Z_2^2+...+Z_k^2

    • 자유도 : k는 자유도 (degree of freedom, dof)로 카이제곱분포의 모양과 특성을 결정한다

    • PDF : f(x;k)=12k/2Γ(k/2)xk/21ex/2,  x>0f(x;k)={1\over 2^{k/2}\Gamma(k/2)}x^{k/2-1}e^{-x/2},\;x\gt 0

    • 자유도에 따른 형태 : dof가 작은 경우 비대칭성이 강하게 나타나며 왼쪽으로 치우친다. dof가 커질수록 좌우 대칭에 가까워 지며 정규분포에 가까워진다

    • 평균 : E(X)=kE(X) = k

    • 분산 : Var(X)=2kVar(X) = 2k

    • 다른 분포와의 관계

      • 감마분포 : 카이제곱분포는 감마 분포의 특수한 형태이다. 감마분포에서 k=n2,  θ=2k = {n\over 2},\; \theta=2일 때 카이제곱분포가 된다

t-분포

  • t-분포 (t-distribution) : 모집단의 표준편차를 모를 때, 작은 표본 크기로부터 모집단의 평균을 추정하는 데 사용되는 연속형 확률분포이다. 정규분포와 유사하지만, 꼬리가 더 두꺼워 이상치에 더 민감하게 반응하는 특징이 있다.

    • Xt(r)X\sim t(r)

    • 확률변수 : X=ZV/rX = {Z\over \sqrt {V/r}}

    • 독립성 : 표준정규 확률변수 Z와 자유도 r인 카이제곱 확률변수 V는 서로 독립이다.

    • PDF : f(x)=Γ((r+1)/2)rπΓ(r/2)(1+x2r)(r+1)/2f(x) = {\Gamma((r+1)/2)\over {\sqrt {r\pi} \Gamma(r/2)}}(1+{x^2\over r})^{-(r+1)/2}

    • 자유도에 따른 형태 :

      • dof가 작을수록 분포의 꼬리가 두껍고, 분포가 평평해진다 (=극단값의 영향을 더 많이 받는다)
      • 자유도가 커질수록 정규분포에 가까워진다.
    • 평균 : E(X)=0E(X) = 0 (r > 1일 경우에 정의됨)

    • 분산 : Var(X)=rr2Var(X) = {r\over r-2} (r > 2일 경우에 정의됨)

F-분포

  • F-분포 (F-Distribution) : 두 개의 독립적인 카이제곱 분포를 따르는 확률변수의 비율을 모델링하는 연속형 확률분포

    • FF(d1,d2)F\sim F(d_1, d_2)

    • 확률변수 : F=(U/d1)(V/d2)F = {(U/d_1)\over (V/d_2)}

    • 독립성 : 카이제곱분포를 따르는 두 확률변수 U, V는 서로 독립이다.

    • PDF : f(x;d1,d2)=(d1xd1x+d2)d1(d2d1x+d2)d2xB(d1/2,d2/2),  x>0f(x;d_1,d_2) = {\sqrt {({d_1x\over d_1x+d_2})^{d_1}({d_2\over d_1x+d_2})^{d_2}} \over xB(d_1/2, d_2/2)}, \; x > 0

    • 자유도에 따른 형태 :

      • 자유도 d1d_1이나 d2d_2가 작을수록 분포는 오른쪽으로 길게 치우쳐 있으며, 꼬리가 두껍다
      • 자유도 d1d_1이나 d2d_2가 커질수록 점점 대칭에 가까워지며 정규분포에 근사한다
    • 평균 : E(F)=d2d22E(F) = {d_2 \over d_2-2} (d2>2d_2 > 2일 경우에 정의됨)

    • 분산 : E(F)=2d22(d1+d22)d1(d22)2(d24)E(F) = {2d_2^2(d_1+d_2-2) \over {d_1(d_2-2)^2(d_2-4)}} (d2>4d_2 > 4일 경우에 정의됨)

profile
개인 공부용 블로그입니다

0개의 댓글