이산확률분포

한상우·2024년 9월 6일

기초 통계학

목록 보기
4/15

이산확률분포

균일분포

  • 이산형 균일분포 (Discrete Uniform Distribution) : 유한한 개수의 가능한 값들이 모두 동일한 확률을 가지는 분포
    • XDU(n)X \sim DU(n)
    • PMF : P(X=x)=1n  for  xx1,x2,...,xnP(X=x) = {1\over n} \; for \; x\in {x_1, x_2, ..., x_n}
    • 평균 : E(X)=n+12E(X) = {n+1 \over 2}
    • 분산 : Var(X)=n2112Var(X) = {n^2-1\over 12} (1부터 n까지 연속적일 경우)

이항분포

  • 베르누이시행 (Bernoulli trial) : 어떤 실험이나 표본을 추출한 결과가 두 가지 사건으로만 나타나는 시행. 일반적으로 성공(S), 실패(F)로 두 결과를 나타낸다.

    • 상호배타적 사건 : 각 시행의 결과는 상호배타적인 두 사건으로 구분된다
    • 사건의 확률 : 성공의 결과가 나타날 확률을 P(S)P(S), 실패가 나타날 확률을 1P(S)1-P(S)로 나타낸다
    • 독립성 : 각 시행은 서로 독립적이다 = 시행마다 성공의 확률은 언제나 일정하다

  • 이항확률변수 (binomial random variable) : 여러 번의 베르누이시행을 할 때 성공 또는 실패 횟수

    • PMF : P(X=x)=Cn,xpx(1p)nxP(X=x)= C_{n,x}p^x(1-p)^{n-x}
  • 이항분포 (binomial distribution) : 이항확률변수의 분포

    • B(n,p)B \sim (n,p)
    • 평균 : E(X)=npE(X) = np
    • 분산 : Var(X)=np(1p)Var(X) = np(1-p)


    • 분포의 범위 : n의 크기에 따라 결정된다
    • 대칭성 : p = 0.5일 경우 대칭성을 갖는다.
    • 다른 분포와의 관계
      • 포아송 분포 : n이 매우 크고, p가 매우 작을 경우 이항분포는 포아송 분포로 근사될 수 있다.
      • 정규 분포 : n이 매우 클 경우 이항분포는 정규분포로 근사될 수 있다
        np5,      n(1p)5np \geq 5, \;\;\; n(1-p) \geq 5일 경우 N(np,np(1p))N(np, np(1-p))로 근사 가능하다

다항분포

  • 다항분포 (Multinomial Distribution) : 이항분포를 일반화한 확률분포로, 각 시행에서 여러 가지 가능한 결과가 있는 경우에 사용한다.

    • (X1,X2,...Xk)Mult(n,p1,p2,...,pk)(X_1, X_2, ... X_k)\sim Mult(n,p_1, p_2, ...,p_k)

    • 고정된 시행 횟수 : 총 n번의 실험을 진행한다

    • 상호 배타적 범주 : 각 시행에서 k개의 가능한 결과(범주)가 존재하며, 각 범주는 상호배타적이다

    • 범주별 확률 : 각 범주가 발생할 확률은 p1,p2,...pkp_1, p_2, ... p_k이며, 이들의 합은 1이다

    • 독립성 : 각 시행은 서로 독립적이다 = 시행마다 성공의 확률은 언제나 일정하다

    • 확률변수 : 확률변수 XiX_i는 범주 i가 n번의 시행 중 몇 번 발생했는지를 나타낸다

    • PMF : P(X=x1,X2=x2,...Xk=xk)=n!x1!x2!...xk!p1x1p2x2...pkxkP(X=x_1,X_2=x_2,...X_k=x_k)={n! \over {x_1!x_2!...x_k!}}p_1^{x_1}p_2^{x_2}...p_k^{x_k}

    • 각 범주의 평균 : E(Xi)=npiE(X_i) = np_i

    • 각 범주의 분산 : Var(Xi)=npi(1pi)Var(X_i) = np_i(1-p_i)

    • 두 범주의 공분산 : Cov(Xi,Xj)=npipjCov(X_i,X_j) = -np_ip_j


  • 다른 분포와의 관계

    • 이항분포
      • 이항분포는 다항분포에서 k=2인 경우이다.
      • 다항분포에서 하나의 범주에 대한 발생 횟수 XiX_i는 이항분포로 볼 수 있다 => XiX_i~B(n,pi)B(n,p_i)
    • 정규분포
      • 하나의 범주에 대한 발생 횟수는 이항분포로 볼 수 있으므로, n이 충분히 크다면 N(npi,npi(1pi))N(np_i, np_i(1-p_i))로 근사할 수 있다.
      • 모든 범주에 대해 기대 발생 횟수가 충분히 큰 경우 (npi5  for  inp_i \geq 5\;for\;\forall i) 다항분포는 다변량 정규분포로 근사 할 수 있다.

초기하분포

  • 초기하분포 (hypergeometric distribution) : 유한한 모집단에서 비복원 추출을 통해 표본을 뽑을 때, 두 가지 사건(성공과 실패) 중 하나가 발생하는 시행에서 특정 사건(성공)이 나타나는 횟수를 모델링하는 확률분포

    • XH(N,K,n)X\sim H(N,K,n)

    • 비복원 추출 : 크기가 N인 모집단에서 복원 없이 샘플을 추출한다. 즉, 종속 사건을 가정한다

    • 성공 항목의 수 K : 모집단에서 관심 있는 특정한 성질을 가진 항목의 수

    • 표본 크기 n : 복원 없이 선택하는 샘플의 크기

    • 성공 횟수 k : 선택된 샘플 중에서 관심 있는 성질을 가진 항목의 수

    • PMF : P(X=k)=CK,kCNK,nkCN,nP(X=k)={C_{K,k}C_{N-K,n-k} \over C_{N,n}}

    • 평균 : E(X)=nKNE(X) = {nK\over N}

    • 분산 : Var(X)=nKN(1KN)(NnN1)Var(X) = {nK\over N}(1-{K\over N})({N-n \over {N-1}})

    • 이항분포와의 관계 : 모집단의 크기 N이 매우 크고, 표본 크기 n이 상대적으로 작을 경우 H(N,K,n)H(N,K,n)를 이항분포 B(n,KN)B(n,{K\over N})로 근사할 수 있다 (비복원 추출의 영향이 미미해져 각 추출이 독립적이라고 간주할 수 있음)

다항초기하분포

  • 다항초기하분포 (Multivariate Hypergeometric Distribution) : 초기하분포를 일반화한 확률분포로, 복원 없이 추출하는 상황에서 여러 범주 중에서 각 범주에 속하는 항목의 수를 모델링하는 이산형 확률분포이다.

    • 비복원 추출 : 크기가 N인 모집단에서 복원 없이 샘플을 추출한다

    • 범주의 수 k : 모집단이 k개의 상호 배타적인 범주로 나뉜다

    • 각 범주에 속하는 항목의 수 : 범주 ii에 속하는 항목의 수는 KiK_i이다

    • 표본 크기 n : 복원 없이 선택하는 샘플의 크기

    • 확률변수 : 표본 중 각 범주 ii에 속하는 항목의 수, XiX_i를 확률변수로 삼는다

    • PMF : P(X=x1,X2=x2,...Xk=xk)=i=1kCKi,xiCN,nP(X=x_1,X_2=x_2,...X_k=x_k)={\prod_{i=1}^k C_{K_i,x_i}\over C_{N,n}}

    • 각 범주의 평균 : E(Xi)=nKiNE(X_i) = n{K_i\over N}

    • 각 범주의 분산 : Var(Xi)=nKiN(1KiN)(NnN1)Var(X_i) = n{K_i\over N}(1-{K_i\over N})({N-n \over {N-1}})

    • 두 범주의 공분산 : Cov(Xi,Xj)=nKiNKjN(NnN1)Cov(X_i, X_j) = -n{K_i\over N}{K_j \over N}({N-n\over N-1})


  • 다른 분포와의 관계

    • 초기하분포
      • 초기하분포는 다항초기하분포에서 k=2인 경우이다.
      • 다항초기하분포에서 하나의 범주에 대한 발생 횟수 XiX_i는 초기하분포로 볼 수 있다 => XiX_i~H(N,Ki,n)H(N,K_i,n)
    • 다항분포
      • 모집단의 크기 N이 매우 크고, 표본 크기 n이 상대적으로 작을 경우 다항분포로 근사할 수 있다

기하분포

  • 기하분포 (Geometric Distribution) : 첫 번째 성공이 발생할 때까지의 시행 횟수를 모델링하는 이산형 분포.

  • XG(p)X\sim G(p)
  • 베르누이 시행 : 베르누이 시행을 가정한다
  • 독립성 : 모든 시행이 서로 독립적이다
  • 형태 : 총 시행 횟수 k가 커질수록 첫 성공이 발생할 확률이 지수적으로 감소한다
  • 이산형 분포 중 유일하게 Memorylessness를 가짐 : 과거의 실패나 경과 시간과 상관없이 앞으로의 성공이나 사건 발생 확률이 변하지 않는 성질. 기하분포에서는 현재까지 실패한 횟수와 관계 없이 앞으로의 시행에서 성공할 확률이 항상 동일하다.
  • PMF = P(X=k)=(1p)k1pP(X=k)=(1-p)^{k-1}p
  • 평균 : E(X)=1pE(X) = {1\over p}
  • 분산 : Var(X)=1pp2Var(X) = {1-p \over p^2}

음이항분포

  • 음이항분포 (negative binomial distribution) : 기하분포를 일반화하여 성공이 일정 횟수 나올 때까지 실패 횟수를 모델링하는 이산형 확률분포.

    • XNB(r,p)X \sim NB(r, p)

    • 베르누이 시행 : 베르누이 시행을 가정한다

    • 독립성 : 모든 시행이 서로 독립적이다

    • 성공 횟수 r : 특정한 성공 횟수 r에 도달할 때 까지의 시행을 다룬다

    • 실패 횟수 k : r번째 성공이 나오기까지의 실패 횟수

    • PMF = P(X=k)=Ck+r1,kpr(1p)kP(X=k)=C_{k+r-1,k}p^r(1-p)^k

    • 평균 : E(X)=rpE(X) = {r\over p}

    • 분산 : Var(X)=r(1p)p2Var(X) = {r(1-p) \over p^2}

포아송 분포

  • 포아송 분포 (Poisson Distribution) : 일정 시간이나 공간에서 발생하는 사건의 수를 모델링하는 분포.

  • XP(m)X\sim P(m)

  • 독립성 : 사건들은 독립적으로 발생한다

  • 고정된 발생률 : 사건이 발생하는 평균율 m은 시간이나 공간에 따라 일정하다

  • 짧은 시간 간격에서의 낮은 발생 확률 : 짧은 시간 간격에서 사건이 발생할 확률은 낮고, 동시에 두 번 이상 발생할 확률은 거의 없다

  • 사건 발생 횟수 k : 사건의 발생 횟수 (k=0,1,2,...k = 0, 1, 2, ...)

  • 형태 : m이 작을 때는 왼쪽으로 치우친 비대칭 모향을 가지며, m이 커질수록 대칭에 가까워지며 정규분포에 근사한다

  • PMF : P(X=k)=mkk!emP(X=k) = {m^k\over k!}e^{-m}

  • 평균 : E(X)=mE(X) = m

  • 분산 : Var(X)=mVar(X) = m

profile
개인 공부용 블로그입니다

0개의 댓글