Lecture 11: The Poisson distribution | Statistics 110

Prettypotato·2026년 10월 1일

Statistics 110

목록 보기
15/18

확률변수와 분포를 혼동하지 않기

이산형 분포에서 가장 흔한 실수 중 하나는 확률변수(random variable)와 그 분포(distribution)를 혼동하는 것이다.

Don't confuse a random variable with its distribution.

확률변수를 더하는 것과 확률질량함수(PMF)를 더하는 것은 전혀 다르다.

예를 들어 두 확률변수 X,YX,Y가 있을 때 관심 있는 것은 확률변수 X+YX+Y이다.

P(X+Y=t)P(X+Y=t)

이것은 XX와 YY의 확률질량함수를 단순히 더한 것이 아니다.

P(X=x)+P(Y=y)P(X=x)+P(Y=y)

이 식은 각각 xx와 yy에 대한 확률이므로 x+yx+y의 확률질량함수가 될 수 없다.

즉,

  • 확률변수: X,Y,X+YX,Y,X+Y와 같은 대상
  • 분포: 그 확률변수가 어떤 값을 가질 확률을 나타내는 설명

확률변수 XX를 변형해서 X3X^3을 만들었다고 해서 그 분포나 PMF를 단순히 세제곱하는 것도 아니다.

분포는 확률변수를 설명하는 것이지, 확률변수 그 자체가 아니다.

집과 설계도 비유

  • 확률변수 = 집
  • 분포 = 집의 설계도

하나의 설계도에서 여러 개의 집을 만들 수 있듯이, 서로 다른 여러 확률변수가 같은 분포를 가질 수 있다.

따라서 같은 분포를 가진다고 해서 반드시 같은 확률변수인 것은 아니다.


포아송 분포

이번에 배우는 마지막 이산형 분포는 포아송 분포(Poisson distribution)이다.

포아송 분포는 수를 세는(counting) 상황에서 매우 중요하게 사용된다.

X∼Pois⁡(λ)X\sim\operatorname{Pois}(\lambda)로 표기하며, 확률질량함수는 P(X=k)=e−λλkk!,P(X=k)=e^{-\lambda}\frac{\lambda^k}{k!}, k=0,1,2,…k=0,1,2,\ldots이다.

여기서 kk는 음이 아닌 정수이고, λ\lambda는 양수인 parameter이다.


포아송 PMF가 유효한지 확인

PMF가 되려면

  1. 모든 확률이 음수가 아니어야 하고
  2. 모든 확률의 합이 11이어야 한다.

포아송 PMF는 음수가 아니며, 모든 확률의 합은 다음과 같다.

∑k=0∞e−λλkk!=e−λ∑k=0∞λkk!\sum_{k=0}^{\infty}e^{-\lambda}\frac{\lambda^k}{k!}=e^{-\lambda}\sum_{k=0}^{\infty}\frac{\lambda^k}{k!}

그런데 eλ=∑k=0∞λkk!e^\lambda=\sum_{k=0}^{\infty}\frac{\lambda^k}{k!}이므로, e−λeλ=1e^{-\lambda}e^\lambda=1이 된다.

따라서 포아송 PMF는 유효한 확률질량함수이다.


포아송 분포의 기대값

X∼Pois⁡(λ)X\sim\operatorname{Pois}(\lambda)라 하자.

기대값의 정의에 따라 E(X)=∑k=0∞kP(X=k)E(X)=\sum_{k=0}^{\infty}kP(X=k)이고, E(X)=e−λ∑k=0∞kλkk!E(X)=e^{-\lambda}\sum_{k=0}^{\infty}k\frac{\lambda^k}{k!}이다.

k=0k=0인 항은 0이므로 k=1k=1부터 시작하면, E(X)=e−λ∑k=1∞kλkk!E(X)=e^{-\lambda}\sum_{k=1}^{\infty}\frac{k\lambda^k}{k!}이다.

k!=k(k−1)!k!=k(k-1)!이므로 kλkk!=λk(k−1)!\frac{k\lambda^k}{k!}=\frac{\lambda^k}{(k-1)!}이다.

따라서 E(X)=e−λ∑k=1∞λk(k−1)!E(X)=e^{-\lambda}\sum_{k=1}^{\infty}\frac{\lambda^k}{(k-1)!}이고 λ\lambda를 앞으로 빼면, E(X)=λe−λ∑k=1∞λk−1(k−1)!E(X)=\lambda e^{-\lambda}\sum_{k=1}^{\infty}\frac{\lambda^{k-1}}{(k-1)!}이 된다.

여기서 지수의 형태를 보면 다시 eλe^\lambda의 테일러 급수임을 알 수 있다.

E(X)=λe−λeλ=λE(X)=\lambda e^{-\lambda}e^\lambda=\lambda이다. 즉 포아송 분포의 평균은 λ\lambda이다.


포아송 분포가 사용되는 상황

포아송 분포는 일반적으로

많은 기회가 있지만, 각각의 기회에서 사건이 발생할 확률은 매우 작은 경우

에 사건의 발생 횟수를 모델링하는 데 사용된다.

예를 들어

  • 한 시간 동안 받는 이메일의 수
  • 쿠키에 들어 있는 초콜릿 칩의 수
  • 특정 지역에서 1년 동안 발생하는 지진의 수
  • 특정 영역에 떨어지는 빗방울의 수

등이 있다.

이때 실제 데이터가 정확히 포아송 분포를 따른다는 의미는 아니다.

실제 상황에서는 상한이 존재하거나 사건 사이에 의존성이 있을 수 있기 때문에 적절한 근사 모델로 포아송 분포를 사용하는 것이다.


포아송 패러다임

A1,A2,…,AnA_1,A_2,\ldots,A_n이라는 많은 사건이 있다고 하자.

각 사건의 발생 확률을

P(Aj)=pjP(A_j)=p_j

라고 하면, 포아송 패러다임은 대략 다음과 같은 상황을 말한다.

  • 사건의 개수 nn이 크다.
  • 각각의 발생 확률 pjp_j는 작다.
  • 사건들이 서로 독립이거나 약하게 의존한다.

이때 발생한 사건의 총 개수는 포아송 분포로 근사할 수 있다.

포아송 분포의 평균이 λ\lambda였으므로 λ\lambda는 이러한 사건들의 기대 발생 횟수가 된다.

지시확률변수와 선형성을 이용하면 λ=∑jpj\lambda=\sum_j p_j가 된다.


이항분포와 포아송 분포

이항분포는

  • 독립적인 시행
  • 모든 시행의 성공확률이 동일한 pp

를 가정한다.

반면 포아송 패러다임에서는

  • 각 사건의 확률 pjp_j가 서로 달라도 되고
  • 약한 의존성도 허용될 수 있으며
  • 각각의 확률은 작아야 한다.

따라서 포아송 분포는 이항분포보다 더 일반적인 상황에서 사용할 수 있다.

특히 nn이 크고 pp가 작을 때 이항분포는 포아송 분포로 근사할 수 있다.


이항분포의 포아송 근사

X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p)라고 하자.

포아송 분포와 연결하기 위해 n→∞,p→0n\to\infty, p\to0으로 보낸다.

이때 중요한 조건은 λ=np\lambda=np를 일정한 상수로 유지하는 것이다.

이는 두 분포의 기대값을 연결한다.

E(XBin)=np=λE(X_{\mathrm{Bin}})=np=\lambda
E(XPois)=λE(X_{\mathrm{Pois}})=\lambda

따라서 p=λ/np=\lambda/n으로 놓을 수 있다.

이항분포의 PMF는

P(X=k)=(nk)pk(1−p)n−kP(X=k)=\binom nkp^k(1-p)^{n-k}

이고 p=λ/np=\lambda/n을 대입하면 다음과 같다.

P(X=k)=(nk)(λn)k(1−λn)n−kP(X=k)=\binom nk\left(\frac{\lambda}{n}\right)^k\left(1-\frac{\lambda}{n}\right)^{n-k}

조합식을 (nk)=n(n−1)⋯(n−k+1)k!\binom nk=\frac{n(n-1)\cdots(n-k+1)}{k!}로 바꾸면,P(X=k)=λkk!n(n−1)⋯(n−k+1)nk(1−λn)n−kP(X=k)=\frac{\lambda^k}{k!}\frac{n(n-1)\cdots(n-k+1)}{n^k}\left(1-\frac{\lambda}{n}\right)^{n-k}이 된다.

kk는 고정된 상수이고 n→∞n\to\infty이므로 n(n−1)⋯(n−k+1)nk→1\frac{n(n-1)\cdots(n-k+1)}{n^k}\to1이다.

또한 (1−λn)−k→1\left(1-\frac{\lambda}{n}\right)^{-k}\to1이고, (1−λn)n→e−λ\left(1-\frac{\lambda}{n}\right)^n\to e^{-\lambda}이다.

따라서 P(X=k)→e−λλkk!P(X=k)\to e^{-\lambda}\frac{\lambda^k}{k!}가 된다.

즉, Bin⁡(n,p)→Pois⁡(λ)\operatorname{Bin}(n,p)\to\operatorname{Pois}(\lambda)이다.

큰 nn, 작은 pp, 일정한 np=λnp=\lambda라는 조건에서 이항분포를 포아송 분포로 근사할 수 있다.


빗방울 예시

종이를 아주 작은 사각형으로 많이 나누고, 일정 시간 동안 각 사각형에 빗방울이 떨어지는지를 생각해보자.

  • 사각형의 개수는 매우 많다.
  • 각각의 사각형에 빗방울이 떨어질 확률은 매우 작다.
  • 각 사각형을 하나의 시행으로 볼 수 있다.

따라서 전체 빗방울의 개수는 포아송 분포로 근사할 수 있다.

완벽하게 이항분포를 적용하려면 각 사각형에 빗방울이 0개 또는 1개만 떨어져야 하지만, 실제로는 한 사각형에 2개 이상의 빗방울이 떨어질 가능성도 있다.

또한 큰 nn에서 이항분포의 계산은 복잡해질 수 있으므로 포아송 근사가 계산상 편리하다.


생일 문제와 포아송 근사

nn명의 사람 중 3명의 생일이 같은 경우를 생각하자.

각 3명 집단에 대해 지시확률변수를 정의한다.

Iijk=I(i,j,k의 생일이 모두 같다)I_{ijk}=I(\text{$i,j,k$의 생일이 모두 같다})

3명의 생일이 모두 같을 확률은 P(Iijk=1)=13652P(I_{ijk}=1)=\frac{1}{365^2}이다.

3명 집단의 개수는 (n3)\binom n3이므로 선형성과 대칭성에 의해 정확한 기대값은 E(X)=(n3)13652E(X)=\binom n3\frac{1}{365^2}이다.

이 값을 포아송 분포의 모수 λ\lambda로 사용한다.

λ=(n3)13652\lambda=\binom n3\frac{1}{365^2}

포아송 근사가 적절한 이유는

  • 가능한 3명 집단이 많고
  • 각 집단에서 생일이 모두 같을 확률은 매우 작으며
  • 집단들 사이에는 약한 의존성이 있기 때문이다.

예를 들어 I123I_{123}과 I124I_{124}는 완전히 독립적이지 않다. 1,2,31,2,3의 생일이 같다는 정보가 1,2,41,2,4의 생일이 같을 확률에 영향을 주기 때문이다.

하지만 각 사건의 확률 자체가 매우 작기 때문에 포아송 근사를 사용할 수 있다.

적어도 한 집단에서 3명의 생일이 같은 확률은 P(X≥1)=1−P(X=0)P(X\ge1)=1-P(X=0)이고 포아송 근사를 사용하면, 다음과 같다.

P(X≥1)≈1−e−λλ00!=1−e−λP(X\ge1)\approx1-e^{-\lambda}\frac{\lambda^0}{0!}=1-e^{-\lambda}

이처럼 포아송 근사는 복잡한 정확한 계산 대신 간단한 형태로 발생 횟수의 확률을 근사할 수 있다는 장점이 있다.

0개의 댓글