이항분포 (Binomial Distribution)
이항분포는 n개의 독립적인 베르누이 시행에서 성공한 횟수를 나타내는 분포이다.
X∼Bin(n,p)
- n: 시행 횟수
- p: 각 시행의 성공확률
- 각 시행은 독립적이어야 한다.
- 성공과 실패는 서로 배타적이며, 성공은 원하는 대로 정의할 수 있다.
이항분포를 이해하는 3가지 관점
1. 성공 횟수
n개의 독립적인 시행에서 성공한 횟수가 X이다.
예: 동전을 n번 던져 앞면을 성공으로 정의하면 X는 앞면이 나온 횟수이다.
2. 지시확률변수의 합
각 시행을 지시확률변수로 나타낼 수 있다.
X=X1+X2+⋯+Xn
여기서 Xj는 성공이면 1, 실패하면 0이다.
따라서 성공할 때마다 1을 더하면 전체 성공 횟수가 된다.
X1,…,Xn∼i.i.d.Bern(p)
- independent: 서로 독립
- identically distributed: 모두 같은 Bern(p) 분포를 따른다
3. 확률질량함수 (PMF)
정확히 k번 성공할 확률은
P(X=k)=(kn)pk(1−p)n−k
하나의 특정한 성공·실패 배열이 나올 확률은 pk(1−p)n−k이고, 성공이 일어날 위치를 고르는 경우의 수가 (kn)이다.
확률변수와 분포
확률변수는 수학적으로 함수이다.
X:S→R
- 표본공간 S: 가능한 모든 결과
- 결과 s: 하나의 구체적인 outcome
- 확률변수 X: 각 outcome에 숫자를 대응시키는 함수
특히 X=7은 단순히 숫자 7을 계산한다는 의미가 아니라,
X의 값이 7인 outcome들을 모은 하나의 사건을 의미한다.
따라서 P(X=7)은 그 사건이 발생할 확률이다.
확률변수와 분포는 다르다.
- 확률변수: 실제로 숫자를 대응시키는 함수
- 분포: 그 확률변수가 어떤 값을 가질 확률에 대한 정보
같은 분포를 가지는 서로 다른 확률변수도 존재할 수 있다.
누적분포함수 (CDF)
X=x뿐만 아니라 X≤x도 하나의 사건이다.
따라서
F(x)=P(X≤x)
로 정의하며 이를 누적분포함수(CDF)라고 한다.
CDF는 확률변수의 분포를 나타내는 방법 중 하나이며, 모든 확률변수에 사용할 수 있다.
이산확률변수와 연속확률변수
이산확률변수
가능한 값을 열거할 수 있는 확률변수이다.
a1,a2,a3,…
유한하게 끝날 수도 있고 무한히 이어질 수도 있다.
이항분포는 0,1,…,n의 정수값만 가지므로 이산확률변수이다.
연속확률변수
구간 안의 실수처럼 연속적인 값을 가질 수 있는 확률변수이다.
이산과 연속의 성질을 동시에 가지는 확률변수도 존재할 수 있다.
확률질량함수 (PMF)
PMF는 이산확률변수에서 특정 값을 가질 확률을 나타낸다.
가능한 값을 a1,a2,…라 하면
Pj=P(X=aj)
PMF가 유효하려면 두 조건을 만족해야 한다.
- 모든 j에 대해 Pj≥0
- 모든 가능한 값에 대한 확률의 합이 1, ∑jPj=1
CDF는 모든 확률변수에 사용할 수 있지만, PMF는 이산확률변수에만 사용할 수 있다.
이항분포의 PMF가 유효한 이유
∑k=0n(kn)pkqn−k
여기서 q=1−p이다.
이항정리에 의해 ∑k=0n(kn)pkqn−k=(p+q)n=1이다.
따라서 이항분포의 PMF는 모든 가능한 값의 확률을 더하면 1이 된다.
두 이항분포의 합
독립인 두 확률변수가 X∼Bin(n,p),Y∼Bin(m,p)이면 X+Y∼Bin(n+m,p)이다.
직관적으로:
- X: n번의 시행에서 성공한 횟수
- Y: 추가적인 m번의 시행에서 성공한 횟수
- X+Y: 총 n+m번의 시행에서 성공한 횟수
단, 두 분포의 성공확률 p가 같고 독립적이어야 한다.
지시확률변수 관점
X=X1+⋯+XnY=Y1+⋯+Ym
따라서 X+Y=X1+⋯+Xn+Y1+⋯+Ym이다.
즉, 독립적인 Bern(p) 확률변수 n+m개의 합이므로 Bin(n+m,p)가 된다.
PMF 관점
X+Y=k의 확률을 구하려면 Law of the probability를 통해 계산할 수 있다.
여기서 주의해야하는 점은 Y가 X에 의해 정해지지만 확률에 까지 영향을 끼치지 않기에 독립이라고 볼 수 있다.
P(X+Y=k)=∑jP(X+Y=k∣X=j)P(X=j)=∑jP(Y=k−j∣X=j)(jn)pjqn−j=∑jP(Y=k−j)(jn)pjqn−j=∑j(k−jm)pk−jqm−k+j(jn)pjqn−j=pkqm+n−k∑j(jn)(k−jm)=pkqm+n−k(kn+m)
계산 과정에서 ∑j(jn)(k−jm)가 등장하고, 이는 방데르몽드 항등식에 의해 (kn+m)가 된다.
결과적으로 X+Y의 PMF가 Bin(n+m,p)의 PMF와 같아진다.
이항분포가 아닌 경우
이항분포의 핵심 조건은 각 시행이 독립적이고, 각 시행의 성공확률이 동일하다는 것 이다.
따라서 시행마다 성공확률이 달라지거나 시행들이 독립적이지 않으면 이항분포가 아니다.
카드에서 에이스 개수
52장 카드에서 5장을 복원 없이 뽑고, 에이스의 개수를 X라고 하자.
가능한 값은 X=0,1,2,3,4이다.
52장 중 5장을 뽑는 모든 경우는 (552)개이고, 정확히 k장의 에이스를 뽑으려면
- 4장의 에이스 중 k장 선택
- 48장의 나머지 카드 중 5−k장 선택
해야 한다.
따라서
P(X=k)=(552)(k4)(5−k48)
이는 이항분포가 아니다.
카드를 뽑은 후 다시 넣지 않기 때문에 다음 카드가 에이스일 확률이 이전 결과에 영향을 받는다.
즉, 시행들이 독립적이지 않다.
초기하분포 (Hypergeometric Distribution)
초기하분포는 복원 없이 표본을 추출할 때 특정 집단의 개수를 세는 분포이다.
흰 구슬 w개와 검은 구슬 b개가 있고, 총 n개를 복원 없이 뽑는다고 하자.
X를 뽑힌 흰 구슬의 개수라고 하면
P(X=k)=(nw+b)(kw)(n−kb)
조건은 0≤k≤w,0≤n−k≤b이다.
이항분포와의 차이
- 이항분포: 복원 추출 → 각 시행이 독립
- 초기하분포: 비복원 추출 → 각 시행이 독립이 아님
따라서 매우 큰 모집단에서 아주 적은 수를 추출하는 경우에는 두 분포의 차이가 작아져 초기하분포를 이항분포로 근사할 수 있다.
CDF의 형태
F(x)=P(X≤x)
연속확률변수
x가 증가할수록 P(X≤x)가 증가하므로 부드럽게 증가하는 형태가 된다.
이산확률변수
가능한 값에서만 확률이 추가되므로 계단 형태가 된다.
따라서 이산확률변수에서는 CDF보다 PMF를 사용하는 것이 일반적으로 더 편리하다.
핵심 정리
- Bernoulli: 한 번의 성공/실패 시행
- Binomial: 독립적인 Bernoulli 시행 n번에서 성공한 횟수
- Hypergeometric: 비복원 추출에서 특정 집단의 개수
- Random Variable: outcome에 숫자를 대응시키는 함수
- PMF: 이산확률변수가 특정 값을 가질 확률
- CDF: X≤x일 확률
- Binomial의 핵심 조건: 독립 + 동일한 성공확률
- Hypergeometric의 핵심 조건: 비복원 추출
- CDF는 모든 확률변수, PMF는 이산확률변수에 사용