Ch4_여러 가지 확률분포_1

Kamator0·2026년 4월 18일

이산확률분포(Discrete Probability Distribution)

이산균등분포 (discrete uniform distribution)

정의

  • 확률변수 XX 가 가지는 값(이산점)의 확률이 모두 같은 확률붙포를 이산균등분포라고 한다.

이산균등분포의 평균과 분산

베르누이분포 (Bernoulli distribution)

  • 어떤 시행을 독립적으로 반복할 때, 발생할 수 있는 결과가 오직 두 가지뿐인 경우에 대하여 다음 사항을 만족하는 시행을 베르누이시행(Bernoulli trial) 라고 한다.

    • 각 시행의 결과는 반드시 '성공(S)'과 '실패(F)' 중 하나로 나타난다.
    • 각 시행에서 성광할 확률은 P(S) = p 이고, 실패할 확률은 P(F) = q이다. (단, p+q=1)
    • 각 시행은 독립이다. 즉 어떤 시행 결과는 그 이후의 결과에 전혀 영향을 미치지 않는다.
  • 베르누이시행에서 성공이면 1, 실패면 0으로 대응하는 확률변수를 XX라 하면 확률변수 XX의 확률분포는 다음과 같다.
    P(X=1)=pP(X=1) = p , P(X=0)=1=(1p)P(X=0) = 1 = (1-p) , 0<p<10 < p < 1
    따라서 확률변수 X에 대한 확률질량함수
    f(x)=px(1p)1x(x=0,1)f(x) = p^x(1-p)^{1-x} (x=0,1) 이와 같은 확률 질량 함수를 갖는 확률변수 X의 확률분포를 베르누이분포라 한다


지시확률변수 (Indicator random variable) (교재에는 없음)

정의

사건 AA가 일어나면 1, 안 일어나면 0인 확률변수:

IA={1if A 발생0if A 발생 안 함I_A = \begin{cases} 1 & \text{if } A \text{ 발생} \\ 0 & \text{if } A \text{ 발생 안 함} \end{cases}

IABern(p),p=P(A)I_A \sim \text{Bern}(p), \quad p = P(A)

성질

기댓값:
E(IA)=P(A)E(I_A) = P(A)
지시확률변수의 기댓값 = 사건의 확률

제곱:
IA2=IAI_A^2 = I_A
(0이나 1이니까)

분산:
Var(IA)=p(1p)\text{Var}(I_A) = p(1-p)

Fundamental Bridge

E(IA)=P(A)E(I_A) = P(A)

확률 문제 → 기댓값 문제로 변환 가능!

복잡한 확률변수를 indicator들의 합으로 분해:

X=I1+I2++InX = I_1 + I_2 + \cdots + I_n

Linearity of Expectation으로:

E(X)=P(A1)+P(A2)++P(An)E(X) = P(A_1) + P(A_2) + \cdots + P(A_n)

독립 여부 상관없이 항상 성립!

이항분포

XBin(n,p)X \sim \text{Bin}(n, p) 일 때:

X=I1+I2++InX = I_1 + I_2 + \cdots + I_n

E(X)=E(I1)++E(In)=npE(X) = E(I_1) + \cdots + E(I_n) = np

풀이 전략

어려운 확률을 직접 구하는 대신:

  1. 사건을 indicator I1,I2,I_1, I_2, \ldots 로 분해
  2. X=IjX = \sum I_j 로 표현
  3. E(X)=P(Aj)E(X) = \sum P(A_j) 로 계산

ex : Distinct birthdays, birthday matches

E(Ij)=P(jthdayisrepresented)=1P(noonebornondayj)=1(364365)nE(I_j) = P(jth day is represented) = 1−P(no one born on day j) = 1−(\frac{364}{365})^n

E(x)=365(1(364365)n)E(x) = 365(1- (\frac{364}{365})^n) 상당히 복잡하다

기댓값 계산
같은 생일 쌍의 수 :
X=i<jIijX = \sum_{i < j} I_{ij}

쌍의 수는 총 (n2)\dbinom{n}{2}

두 사람의 생일이 같을 확률:

P(Iij=1)=1365P(I_{ij} = 1) = \frac{1}{365}

Linearity of Expectation으로:

E(X)=i<jE(Iij)=(n2)P(Iij=1)=(n2)1365=n(n1)21365=n(n1)730E(X) = \sum_{i < j} E(I_{ij}) = \binom{n}{2} * P(I_{ij} = 1) =\binom{n}{2} \cdot \frac{1}{365} = \frac{n(n-1)}{2} \cdot \frac{1}{365} = \frac{n(n-1)}{730}


이항분포 (Binominal distribution)

  • 성공률이 p인 n회의 베르누이시행에서 성공회수를 XX라 할 때, 확률변수 XX의 확률분포를 이항분포라 하고 B(n,p)B(n,p) 와 같이 나타낸다.
  • 이항분포의 확률질량함수는 다음과 같다

f(x)=nCxpx(1p)nx(x=0,1,2,...n)f(x) = nC_x p^x(1-p)^{n-x} (x = 0,1,2, ... n)

이때 nCxnC_x를 **이항계수(binomial coeffcient)라 한다.

E(x)=npE(x) = np 유도하는 과정 해볼 것

초기하분포 (hypergeometric distribution)

  • 무한 모집단에서 표본을 비복원추출하거나 유한 모집단에서 복원추출하는 경우에 베르누이 시행의 조건을 만족하므로 이항분포 사용가능
  • 유한 모집단에서 비복원 추출 할때는 각 시행이 독립이 아니므로 베르누이시행의 조건을 만족하지못한다 -> 이항분포 사용불가

정의

  • 크기가 N인 유한 모집단에 특정한 성질을 지닌 원소가 M개 있다고 하자. 여기서 n개의 표본을 비복원추출 하는 실험을 초기하실험이라 하는데, 다음과 같은 성질을 갖는다.
    • 크기가 N인 유한 모집단에서 크기가 n인 확률포본을 취한다.
    • N개 중 특정한 성질을 지닌 M개는 성공 나머지 (N-M)개는 실패로 분류

초기하실험에서 추출한 성공 개수를 X라 하면, 확률변수 X는 초기하분포를 이룬다고 하고 H(N,M,n)H(N,M,n)으로 표기한다.
이때 확률질량함수는 다음과 같다. 여기서 0xM0 \leq x \leq M , 0nxNM0 \leq n-x \leq N- M 이다
f(x)=MCxNMCnxNCnf(x) = \frac{_MC_x * _{N-M}C{n-x}}{_NC_n}

분산에 대한 식의 NnN1\frac{N-n}{N-1}유한 모집단 수정계수(finite population correction coefficient) 라 하며 NN 이 커질수록 이 값은 1에 접근한다. (로피탈 정리) MN=p\frac{M}{N} = p 로 일정하다면 초기하 분포를 이항분포로 근사할 수 있다.

검사특성곡선 (Operating Characteristic curve) (OC curve)

  • 초기하분포는 품질관리에서 주로 사용한다. 표본 n개를 추출할 때 그 안에 포함된 불량품 개수가 미리 정해진 c개 이하이면 합격이라고 하자.
    그 제품이 합격할 확률은 다음과 같다.

x=0cMCxNMCnxNCn\sum_{x=0}^{c} \frac{_MC_x * _{N-M}C{n-x}}{_NC_n}

제품을 불량 p=MNp = \frac{M}{N} 에 대한 함수이다. OC(p)OC(p) 로 나타냄

푸아송분포 (Poissson distribution)

  • 이를 모수 m을 갖는 우아송분포라 하고 P(m)P(m)으로 표기한다. 이때 n이크고p가작되np<5n이 크고 p가 작되 np < 5 이면 푸아송분포로 근사할 수 있다. 즉 시행횟수 n이 아주 크고 사건이 일어날 확률 pp가 매우 작은 경우에 푸아송분포는 이항분포의 근사분포로 사용하며, 푸아송분포는 이항분포의 극한분포(limiting distribution)
  • 확률변수 XX가 모수 mm인 푸아송분포를 따르면 확률변수 XX의 분포함수는 다음과 같다
    P(Xc)=x=0cemmxx!P(X \leq c) =\sum_{x=0}^{c} \frac{e^{-m}m^x}{x!}
  • m,c 값에 따라 확률변수 XX의 분포함수의 값을 계산하여 나타낸 표를 푸아송분포표라고 한다.

기하분포 (geometric distribution)

  • 어느 통계실험에서 첫 번째로 성공할 때까지 시행한 회수를 XX로 정의하고, 확률변수 XX에 대한 확률을 생각해보자.
    -처음으로 성공할 때까지의 시행횟수라고 하면 확률변수 XX의 확률질량함수는 다음과 같다
    f(x)=qx1p(x=0,1,2,...)f(x) = q^{x-1}p (x = 0,1,2, ...)
  • 이러한 확률분포를 기하분포 라 하고, Geo(p),NB(1,p)Geo(p), NB(1,p)로 표기한다
  • 확률변수 XX의 분포함수는 다음과 같다
    P(Xk)=1qkP(X \leq k ) = 1 - q^k


음이항분포 (negative binomial distribution)

시행횟수 n을 미리 정하지 않고, 주어진 성공횟수가 나올 때까지 베르누이시행을 반복하는 경우를 생각해보자. 즉 k번 성공할 때까지의 시행횟수를 XX라 하면, P(X=x)P(X=x)는 실험을 x번 시행한 중에 (k1)(k-1)번 성공하고 (xk)(x-k)번 실패한 후, 맨 마지막에 성공하는 확률을 의미한다. 따라서 각 경우의 확률은

pk1qxkp=pkqxk(:p+q=1)p^{k-1}q^{x-k}p = p^kq^{x-k}(단 : p+q =1) 이다.

x번의 시행에서 맨 마지막에 성공하는 시행을 뺀 (x1)(x-1)번의 시행 중 (k1)(k-1) 번은 성공하고, (x-k) 번은 실패하는 모든 경우의 수는 다음과 같다

x1Ck1=(x1)!(k1)!(xk)!(k=1,2,...x)_{x-1}C_{k-1} = \frac{(x-1)!}{(k-1)!(x-k)!} (k = 1,2, ... x)

따라서 성공할 확률이 P, 실패학 확률이 q=1-p 인 독립적인 반복 시행에서 k번 성공할때까지의 시행횟수를 XX라 하면 확률변수 XX의 확률질량함수는 다음과 같다

f(x)=x1Ck1pk1qxkp=pkqxk(x=k,k+1,..)f(x) = _{x-1}C_{k-1}p^{k-1}q^{x-k}p = p^kq^{x-k} (x = k,k+1, ..)

이러한 확률분포를 음이항분포 라 하며 NB(k,p)NB(k,p)로 표기한다. 음이항분포의 확률지량함수를 보면 k=1일 때 음이항분포는 기하분포이다. 음이항분포의 평균과 분산은 다음과 같이 구할 수 있다.

0개의 댓글