Lecture 8: Random Variables and Their Distributions | Statistics 110

Prettypotato·2026년 9월 20일

Statistics 110

목록 보기
11/18

이항분포 (Binomial Distribution)

이항분포는 n개의 독립적인 베르누이 시행에서 성공한 횟수를 나타내는 분포이다.

X∼Bin(n,p)X \sim Bin(n,p)
  • nn: 시행 횟수
  • pp: 각 시행의 성공확률
  • 각 시행은 독립적이어야 한다.
  • 성공과 실패는 서로 배타적이며, 성공은 원하는 대로 정의할 수 있다.

이항분포를 이해하는 3가지 관점

1. 성공 횟수

nn개의 독립적인 시행에서 성공한 횟수가 XX이다.

예: 동전을 nn번 던져 앞면을 성공으로 정의하면 XX는 앞면이 나온 횟수이다.

2. 지시확률변수의 합

각 시행을 지시확률변수로 나타낼 수 있다.

X=X1+X2+⋯+XnX=X_1+X_2+\cdots+X_n

여기서 XjX_j는 성공이면 1, 실패하면 0이다.

따라서 성공할 때마다 11을 더하면 전체 성공 횟수가 된다.

X1,…,Xn∼i.i.d.Bern(p)X_1,\ldots,X_n \overset{i.i.d.}{\sim} Bern(p)

  • independent: 서로 독립
  • identically distributed: 모두 같은 Bern(p)Bern(p) 분포를 따른다

3. 확률질량함수 (PMF)

정확히 kk번 성공할 확률은

P(X=k)=(nk)pk(1−p)n−kP(X=k)=\binom{n}{k}p^k(1-p)^{n-k}

하나의 특정한 성공·실패 배열이 나올 확률은 pk(1−p)n−kp^k(1-p)^{n-k}이고, 성공이 일어날 위치를 고르는 경우의 수가 (nk)\binom{n}{k}이다.


확률변수와 분포

확률변수는 수학적으로 함수이다.

X:S→RX:S\rightarrow\mathbb{R}
  • 표본공간 SS: 가능한 모든 결과
  • 결과 ss: 하나의 구체적인 outcome
  • 확률변수 XX: 각 outcome에 숫자를 대응시키는 함수

특히 X=7X=7은 단순히 숫자 7을 계산한다는 의미가 아니라,

XX의 값이 7인 outcome들을 모은 하나의 사건을 의미한다.

따라서 P(X=7)P(X=7)은 그 사건이 발생할 확률이다.

확률변수와 분포는 다르다.

  • 확률변수: 실제로 숫자를 대응시키는 함수
  • 분포: 그 확률변수가 어떤 값을 가질 확률에 대한 정보

같은 분포를 가지는 서로 다른 확률변수도 존재할 수 있다.


누적분포함수 (CDF)

X=xX=x뿐만 아니라 X≤xX\le x도 하나의 사건이다.

따라서

F(x)=P(X≤x)F(x)=P(X\le x)

로 정의하며 이를 누적분포함수(CDF)라고 한다.

CDF는 확률변수의 분포를 나타내는 방법 중 하나이며, 모든 확률변수에 사용할 수 있다.


이산확률변수와 연속확률변수

이산확률변수

가능한 값을 열거할 수 있는 확률변수이다.

a1,a2,a3,…a_1,a_2,a_3,\ldots

유한하게 끝날 수도 있고 무한히 이어질 수도 있다.

이항분포는 0,1,…,n0,1,\ldots,n의 정수값만 가지므로 이산확률변수이다.

연속확률변수

구간 안의 실수처럼 연속적인 값을 가질 수 있는 확률변수이다.

이산과 연속의 성질을 동시에 가지는 확률변수도 존재할 수 있다.


확률질량함수 (PMF)

PMF는 이산확률변수에서 특정 값을 가질 확률을 나타낸다.

가능한 값을 a1,a2,…a_1,a_2,\ldots라 하면

Pj=P(X=aj)P_j=P(X=a_j)

PMF가 유효하려면 두 조건을 만족해야 한다.

  1. 모든 jj에 대해 Pj≥0P_j\ge0
  2. 모든 가능한 값에 대한 확률의 합이 11, ∑jPj=1\sum_j P_j=1

CDF는 모든 확률변수에 사용할 수 있지만, PMF는 이산확률변수에만 사용할 수 있다.


이항분포의 PMF가 유효한 이유

∑k=0n(nk)pkqn−k\sum_{k=0}^{n}\binom{n}{k}p^kq^{n-k}

여기서 q=1−pq=1-p이다.

이항정리에 의해 ∑k=0n(nk)pkqn−k=(p+q)n=1\sum_{k=0}^{n}\binom{n}{k}p^kq^{n-k}=(p+q)^n=1이다.

따라서 이항분포의 PMF는 모든 가능한 값의 확률을 더하면 11이 된다.


두 이항분포의 합

독립인 두 확률변수가 X∼Bin(n,p),Y∼Bin(m,p)X\sim Bin(n,p), Y\sim Bin(m,p)이면 X+Y∼Bin(n+m,p)X+Y\sim Bin(n+m,p)이다.

직관적으로:

  • XX: nn번의 시행에서 성공한 횟수
  • YY: 추가적인 mm번의 시행에서 성공한 횟수
  • X+YX+Y: 총 n+mn+m번의 시행에서 성공한 횟수

단, 두 분포의 성공확률 pp가 같고 독립적이어야 한다.

지시확률변수 관점

X=X1+⋯+XnY=Y1+⋯+YmX=X_1+\cdots+X_n\\Y=Y_1+\cdots+Y_m

따라서 X+Y=X1+⋯+Xn+Y1+⋯+YmX+Y=X_1+\cdots+X_n+Y_1+\cdots+Y_m이다.

즉, 독립적인 Bern(p)Bern(p) 확률변수 n+mn+m개의 합이므로 Bin(n+m,p)Bin(n+m,p)가 된다.

PMF 관점

X+Y=kX+Y=k의 확률을 구하려면 Law of the probability를 통해 계산할 수 있다.

여기서 주의해야하는 점은 Y가 X에 의해 정해지지만 확률에 까지 영향을 끼치지 않기에 독립이라고 볼 수 있다.

P(X+Y=k)=∑jP(X+Y=k∣X=j)P(X=j)=∑jP(Y=k−j∣X=j)(nj)pjqn−j=∑jP(Y=k−j)(nj)pjqn−j=∑j(mk−j)pk−jqm−k+j(nj)pjqn−j=pkqm+n−k∑j(nj)(mk−j)=pkqm+n−k(n+mk)P(X+Y=k) = \sum_j P(X+Y=k\mid X=j)P(X=j) \\= \sum_j P(Y=k-j\mid X=j)\binom{n}{j}p^jq^{n-j} \\= \sum_j P(Y=k-j)\binom{n}{j}p^jq^{n-j} = \sum_j \binom{m}{k-j}p^{k-j}q^{m-k+j}\binom{n}{j}p^jq^{n-j} \\= p^kq^{m+n-k}\sum_j\binom{n}{j}\binom{m}{k-j} = p^kq^{m+n-k}\binom{n+m}{k}

계산 과정에서 ∑j(nj)(mk−j)\sum_j\binom{n}{j}\binom{m}{k-j}가 등장하고, 이는 방데르몽드 항등식에 의해 (n+mk)\binom{n+m}{k}가 된다.

결과적으로 X+YX+Y의 PMF가 Bin(n+m,p)Bin(n+m,p)의 PMF와 같아진다.


이항분포가 아닌 경우

이항분포의 핵심 조건은 각 시행이 독립적이고, 각 시행의 성공확률이 동일하다는 것 이다.

따라서 시행마다 성공확률이 달라지거나 시행들이 독립적이지 않으면 이항분포가 아니다.


카드에서 에이스 개수

52장 카드에서 5장을 복원 없이 뽑고, 에이스의 개수를 XX라고 하자.

가능한 값은 X=0,1,2,3,4X=0,1,2,3,4이다.

52장 중 5장을 뽑는 모든 경우는 (525)\binom{52}{5}개이고, 정확히 kk장의 에이스를 뽑으려면

  • 4장의 에이스 중 kk장 선택
  • 48장의 나머지 카드 중 5−k5-k장 선택

해야 한다.

따라서

P(X=k)=(4k)(485−k)(525)P(X=k)=\frac{\binom{4}{k}\binom{48}{5-k}}{\binom{52}{5}}

이는 이항분포가 아니다.

카드를 뽑은 후 다시 넣지 않기 때문에 다음 카드가 에이스일 확률이 이전 결과에 영향을 받는다.

즉, 시행들이 독립적이지 않다.


초기하분포 (Hypergeometric Distribution)

초기하분포는 복원 없이 표본을 추출할 때 특정 집단의 개수를 세는 분포이다.

흰 구슬 ww개와 검은 구슬 bb개가 있고, 총 nn개를 복원 없이 뽑는다고 하자.

XX를 뽑힌 흰 구슬의 개수라고 하면

P(X=k)=(wk)(bn−k)(w+bn)P(X=k)=\frac{\binom{w}{k}\binom{b}{n-k}}{\binom{w+b}{n}}

조건은 0≤k≤w,0≤n−k≤b0\le k\le w,0\le n-k\le b이다.

이항분포와의 차이

  • 이항분포: 복원 추출 → 각 시행이 독립
  • 초기하분포: 비복원 추출 → 각 시행이 독립이 아님

따라서 매우 큰 모집단에서 아주 적은 수를 추출하는 경우에는 두 분포의 차이가 작아져 초기하분포를 이항분포로 근사할 수 있다.


CDF의 형태

F(x)=P(X≤x)F(x)=P(X\le x)

연속확률변수

xx가 증가할수록 P(X≤x)P(X\le x)가 증가하므로 부드럽게 증가하는 형태가 된다.

이산확률변수

가능한 값에서만 확률이 추가되므로 계단 형태가 된다.

따라서 이산확률변수에서는 CDF보다 PMF를 사용하는 것이 일반적으로 더 편리하다.


핵심 정리

  • Bernoulli: 한 번의 성공/실패 시행
  • Binomial: 독립적인 Bernoulli 시행 nn번에서 성공한 횟수
  • Hypergeometric: 비복원 추출에서 특정 집단의 개수
  • Random Variable: outcome에 숫자를 대응시키는 함수
  • PMF: 이산확률변수가 특정 값을 가질 확률
  • CDF: X≤xX\le x일 확률
  • Binomial의 핵심 조건: 독립 + 동일한 성공확률
  • Hypergeometric의 핵심 조건: 비복원 추출
  • CDF는 모든 확률변수, PMF는 이산확률변수에 사용

0개의 댓글