이산확률분포(Discrete Probability Distribution)
정의
- 확률변수 X 가 가지는 값(이산점)의 확률이 모두 같은 확률붙포를 이산균등분포라고 한다.
이산균등분포의 평균과 분산

베르누이분포 (Bernoulli distribution)
-
어떤 시행을 독립적으로 반복할 때, 발생할 수 있는 결과가 오직 두 가지뿐인 경우에 대하여 다음 사항을 만족하는 시행을 베르누이시행(Bernoulli trial) 라고 한다.
- 각 시행의 결과는 반드시 '성공(S)'과 '실패(F)' 중 하나로 나타난다.
- 각 시행에서 성광할 확률은 P(S) = p 이고, 실패할 확률은 P(F) = q이다. (단, p+q=1)
- 각 시행은 독립이다. 즉 어떤 시행 결과는 그 이후의 결과에 전혀 영향을 미치지 않는다.
-
베르누이시행에서 성공이면 1, 실패면 0으로 대응하는 확률변수를 X라 하면 확률변수 X의 확률분포는 다음과 같다.
P(X=1)=p , P(X=0)=1=(1−p) , 0<p<1
따라서 확률변수 X에 대한 확률질량함수
f(x)=px(1−p)1−x(x=0,1) 이와 같은 확률 질량 함수를 갖는 확률변수 X의 확률분포를 베르누이분포라 한다


지시확률변수 (Indicator random variable) (교재에는 없음)
정의
사건 A가 일어나면 1, 안 일어나면 0인 확률변수:
IA={10if A 발생if A 발생 안 함
IA∼Bern(p),p=P(A)
성질
기댓값:
E(IA)=P(A)
지시확률변수의 기댓값 = 사건의 확률
제곱:
IA2=IA
(0이나 1이니까)
분산:
Var(IA)=p(1−p)
Fundamental Bridge
E(IA)=P(A)
확률 문제 → 기댓값 문제로 변환 가능!
복잡한 확률변수를 indicator들의 합으로 분해:
X=I1+I2+⋯+In
Linearity of Expectation으로:
E(X)=P(A1)+P(A2)+⋯+P(An)
독립 여부 상관없이 항상 성립!
이항분포
X∼Bin(n,p) 일 때:
X=I1+I2+⋯+In
E(X)=E(I1)+⋯+E(In)=np
풀이 전략
어려운 확률을 직접 구하는 대신:
- 사건을 indicator I1,I2,… 로 분해
- X=∑Ij 로 표현
- E(X)=∑P(Aj) 로 계산
ex : Distinct birthdays, birthday matches
E(Ij)=P(jthdayisrepresented)=1−P(noonebornondayj)=1−(365364)n
E(x)=365(1−(365364)n) 상당히 복잡하다
기댓값 계산
같은 생일 쌍의 수 :
X=∑i<jIij
쌍의 수는 총 (2n)개
두 사람의 생일이 같을 확률:
P(Iij=1)=3651
Linearity of Expectation으로:
E(X)=∑i<jE(Iij)=(2n)∗P(Iij=1)=(2n)⋅3651=2n(n−1)⋅3651=730n(n−1)
이항분포 (Binominal distribution)
- 성공률이 p인 n회의 베르누이시행에서 성공회수를 X라 할 때, 확률변수 X의 확률분포를 이항분포라 하고 B(n,p) 와 같이 나타낸다.
- 이항분포의 확률질량함수는 다음과 같다
f(x)=nCxpx(1−p)n−x(x=0,1,2,...n)
이때 nCx를 **이항계수(binomial coeffcient)라 한다.


E(x)=np 유도하는 과정 해볼 것

초기하분포 (hypergeometric distribution)
- 무한 모집단에서 표본을 비복원추출하거나 유한 모집단에서 복원추출하는 경우에 베르누이 시행의 조건을 만족하므로 이항분포 사용가능
- 유한 모집단에서 비복원 추출 할때는 각 시행이 독립이 아니므로 베르누이시행의 조건을 만족하지못한다 -> 이항분포 사용불가

정의
- 크기가 N인 유한 모집단에 특정한 성질을 지닌 원소가 M개 있다고 하자. 여기서 n개의 표본을 비복원추출 하는 실험을 초기하실험이라 하는데, 다음과 같은 성질을 갖는다.
- 크기가 N인 유한 모집단에서 크기가 n인 확률포본을 취한다.
- N개 중 특정한 성질을 지닌 M개는 성공 나머지 (N-M)개는 실패로 분류
초기하실험에서 추출한 성공 개수를 X라 하면, 확률변수 X는 초기하분포를 이룬다고 하고 H(N,M,n)으로 표기한다.
이때 확률질량함수는 다음과 같다. 여기서 0≤x≤M , 0≤n−x≤N−M 이다
f(x)=NCnMCx∗N−MCn−x

분산에 대한 식의 N−1N−n을 유한 모집단 수정계수(finite population correction coefficient) 라 하며 N 이 커질수록 이 값은 1에 접근한다. (로피탈 정리) NM=p 로 일정하다면 초기하 분포를 이항분포로 근사할 수 있다.
검사특성곡선 (Operating Characteristic curve) (OC curve)
- 초기하분포는 품질관리에서 주로 사용한다. 표본 n개를 추출할 때 그 안에 포함된 불량품 개수가 미리 정해진 c개 이하이면 합격이라고 하자.
그 제품이 합격할 확률은 다음과 같다.
∑x=0cNCnMCx∗N−MCn−x
제품을 불량 p=NM 에 대한 함수이다. OC(p) 로 나타냄
푸아송분포 (Poissson distribution)
- 이를 모수 m을 갖는 우아송분포라 하고 P(m)으로 표기한다. 이때 n이크고p가작되np<5 이면 푸아송분포로 근사할 수 있다. 즉 시행횟수 n이 아주 크고 사건이 일어날 확률 p가 매우 작은 경우에 푸아송분포는 이항분포의 근사분포로 사용하며, 푸아송분포는 이항분포의 극한분포(limiting distribution)
- 확률변수 X가 모수 m인 푸아송분포를 따르면 확률변수 X의 분포함수는 다음과 같다
P(X≤c)=∑x=0cx!e−mmx
- m,c 값에 따라 확률변수 X의 분포함수의 값을 계산하여 나타낸 표를 푸아송분포표라고 한다.


기하분포 (geometric distribution)
- 어느 통계실험에서 첫 번째로 성공할 때까지 시행한 회수를 X로 정의하고, 확률변수 X에 대한 확률을 생각해보자.
-처음으로 성공할 때까지의 시행횟수라고 하면 확률변수 X의 확률질량함수는 다음과 같다
f(x)=qx−1p(x=0,1,2,...)
- 이러한 확률분포를 기하분포 라 하고, Geo(p),NB(1,p)로 표기한다
- 확률변수 X의 분포함수는 다음과 같다
P(X≤k)=1−qk


음이항분포 (negative binomial distribution)
시행횟수 n을 미리 정하지 않고, 주어진 성공횟수가 나올 때까지 베르누이시행을 반복하는 경우를 생각해보자. 즉 k번 성공할 때까지의 시행횟수를 X라 하면, P(X=x)는 실험을 x번 시행한 중에 (k−1)번 성공하고 (x−k)번 실패한 후, 맨 마지막에 성공하는 확률을 의미한다. 따라서 각 경우의 확률은
pk−1qx−kp=pkqx−k(단:p+q=1) 이다.
x번의 시행에서 맨 마지막에 성공하는 시행을 뺀 (x−1)번의 시행 중 (k−1) 번은 성공하고, (x-k) 번은 실패하는 모든 경우의 수는 다음과 같다
x−1Ck−1=(k−1)!(x−k)!(x−1)!(k=1,2,...x)
따라서 성공할 확률이 P, 실패학 확률이 q=1-p 인 독립적인 반복 시행에서 k번 성공할때까지의 시행횟수를 X라 하면 확률변수 X의 확률질량함수는 다음과 같다
f(x)=x−1Ck−1pk−1qx−kp=pkqx−k(x=k,k+1,..)
이러한 확률분포를 음이항분포 라 하며 NB(k,p)로 표기한다. 음이항분포의 확률지량함수를 보면 k=1일 때 음이항분포는 기하분포이다. 음이항분포의 평균과 분산은 다음과 같이 구할 수 있다.
