확률변수와 분포를 혼동하지 않기
이산형 분포에서 가장 흔한 실수 중 하나는 확률변수(random variable)와 그 분포(distribution)를 혼동하는 것이다.
Don't confuse a random variable with its distribution.
확률변수를 더하는 것과 확률질량함수(PMF)를 더하는 것은 전혀 다르다.
예를 들어 두 확률변수 X,Y가 있을 때 관심 있는 것은 확률변수 X+Y이다.
P(X+Y=t)
이것은 X와 Y의 확률질량함수를 단순히 더한 것이 아니다.
P(X=x)+P(Y=y)
이 식은 각각 x와 y에 대한 확률이므로 x+y의 확률질량함수가 될 수 없다.
즉,
- 확률변수: X,Y,X+Y와 같은 대상
- 분포: 그 확률변수가 어떤 값을 가질 확률을 나타내는 설명
확률변수 X를 변형해서 X3을 만들었다고 해서 그 분포나 PMF를 단순히 세제곱하는 것도 아니다.
분포는 확률변수를 설명하는 것이지, 확률변수 그 자체가 아니다.
집과 설계도 비유
하나의 설계도에서 여러 개의 집을 만들 수 있듯이, 서로 다른 여러 확률변수가 같은 분포를 가질 수 있다.
따라서 같은 분포를 가진다고 해서 반드시 같은 확률변수인 것은 아니다.
포아송 분포
이번에 배우는 마지막 이산형 분포는 포아송 분포(Poisson distribution)이다.
포아송 분포는 수를 세는(counting) 상황에서 매우 중요하게 사용된다.
X∼Pois(λ)로 표기하며, 확률질량함수는 P(X=k)=e−λk!λk, k=0,1,2,…이다.
여기서 k는 음이 아닌 정수이고, λ는 양수인 parameter이다.
포아송 PMF가 유효한지 확인
PMF가 되려면
- 모든 확률이 음수가 아니어야 하고
- 모든 확률의 합이 1이어야 한다.
포아송 PMF는 음수가 아니며, 모든 확률의 합은 다음과 같다.
k=0∑∞e−λk!λk=e−λk=0∑∞k!λk
그런데 eλ=∑k=0∞k!λk이므로, e−λeλ=1이 된다.
따라서 포아송 PMF는 유효한 확률질량함수이다.
포아송 분포의 기대값
X∼Pois(λ)라 하자.
기대값의 정의에 따라 E(X)=∑k=0∞kP(X=k)이고, E(X)=e−λ∑k=0∞kk!λk이다.
k=0인 항은 0이므로 k=1부터 시작하면, E(X)=e−λ∑k=1∞k!kλk이다.
k!=k(k−1)!이므로 k!kλk=(k−1)!λk이다.
따라서 E(X)=e−λ∑k=1∞(k−1)!λk이고 λ를 앞으로 빼면, E(X)=λe−λ∑k=1∞(k−1)!λk−1이 된다.
여기서 지수의 형태를 보면 다시 eλ의 테일러 급수임을 알 수 있다.
E(X)=λe−λeλ=λ이다. 즉 포아송 분포의 평균은 λ이다.
포아송 분포가 사용되는 상황
포아송 분포는 일반적으로
많은 기회가 있지만, 각각의 기회에서 사건이 발생할 확률은 매우 작은 경우
에 사건의 발생 횟수를 모델링하는 데 사용된다.
예를 들어
- 한 시간 동안 받는 이메일의 수
- 쿠키에 들어 있는 초콜릿 칩의 수
- 특정 지역에서 1년 동안 발생하는 지진의 수
- 특정 영역에 떨어지는 빗방울의 수
등이 있다.
이때 실제 데이터가 정확히 포아송 분포를 따른다는 의미는 아니다.
실제 상황에서는 상한이 존재하거나 사건 사이에 의존성이 있을 수 있기 때문에 적절한 근사 모델로 포아송 분포를 사용하는 것이다.
포아송 패러다임
A1,A2,…,An이라는 많은 사건이 있다고 하자.
각 사건의 발생 확률을
P(Aj)=pj
라고 하면, 포아송 패러다임은 대략 다음과 같은 상황을 말한다.
- 사건의 개수 n이 크다.
- 각각의 발생 확률 pj는 작다.
- 사건들이 서로 독립이거나 약하게 의존한다.
이때 발생한 사건의 총 개수는 포아송 분포로 근사할 수 있다.
포아송 분포의 평균이 λ였으므로 λ는 이러한 사건들의 기대 발생 횟수가 된다.
지시확률변수와 선형성을 이용하면 λ=∑jpj가 된다.
이항분포와 포아송 분포
이항분포는
- 독립적인 시행
- 모든 시행의 성공확률이 동일한 p
를 가정한다.
반면 포아송 패러다임에서는
- 각 사건의 확률 pj가 서로 달라도 되고
- 약한 의존성도 허용될 수 있으며
- 각각의 확률은 작아야 한다.
따라서 포아송 분포는 이항분포보다 더 일반적인 상황에서 사용할 수 있다.
특히 n이 크고 p가 작을 때 이항분포는 포아송 분포로 근사할 수 있다.
이항분포의 포아송 근사
X∼Bin(n,p)라고 하자.
포아송 분포와 연결하기 위해 n→∞,p→0으로 보낸다.
이때 중요한 조건은 λ=np를 일정한 상수로 유지하는 것이다.
이는 두 분포의 기대값을 연결한다.
E(XBin)=np=λ
E(XPois)=λ
따라서 p=λ/n으로 놓을 수 있다.
이항분포의 PMF는
P(X=k)=(kn)pk(1−p)n−k
이고 p=λ/n을 대입하면 다음과 같다.
P(X=k)=(kn)(nλ)k(1−nλ)n−k
조합식을 (kn)=k!n(n−1)⋯(n−k+1)로 바꾸면,P(X=k)=k!λknkn(n−1)⋯(n−k+1)(1−nλ)n−k이 된다.
k는 고정된 상수이고 n→∞이므로 nkn(n−1)⋯(n−k+1)→1이다.
또한 (1−nλ)−k→1이고, (1−nλ)n→e−λ이다.
따라서 P(X=k)→e−λk!λk가 된다.
즉, Bin(n,p)→Pois(λ)이다.
큰 n, 작은 p, 일정한 np=λ라는 조건에서 이항분포를 포아송 분포로 근사할 수 있다.
빗방울 예시
종이를 아주 작은 사각형으로 많이 나누고, 일정 시간 동안 각 사각형에 빗방울이 떨어지는지를 생각해보자.
- 사각형의 개수는 매우 많다.
- 각각의 사각형에 빗방울이 떨어질 확률은 매우 작다.
- 각 사각형을 하나의 시행으로 볼 수 있다.
따라서 전체 빗방울의 개수는 포아송 분포로 근사할 수 있다.
완벽하게 이항분포를 적용하려면 각 사각형에 빗방울이 0개 또는 1개만 떨어져야 하지만, 실제로는 한 사각형에 2개 이상의 빗방울이 떨어질 가능성도 있다.
또한 큰 n에서 이항분포의 계산은 복잡해질 수 있으므로 포아송 근사가 계산상 편리하다.
생일 문제와 포아송 근사
n명의 사람 중 3명의 생일이 같은 경우를 생각하자.
각 3명 집단에 대해 지시확률변수를 정의한다.
Iijk=I(i,j,k의 생일이 모두 같다)
3명의 생일이 모두 같을 확률은 P(Iijk=1)=36521이다.
3명 집단의 개수는 (3n)이므로 선형성과 대칭성에 의해 정확한 기대값은 E(X)=(3n)36521이다.
이 값을 포아송 분포의 모수 λ로 사용한다.
λ=(3n)36521
포아송 근사가 적절한 이유는
- 가능한 3명 집단이 많고
- 각 집단에서 생일이 모두 같을 확률은 매우 작으며
- 집단들 사이에는 약한 의존성이 있기 때문이다.
예를 들어 I123과 I124는 완전히 독립적이지 않다. 1,2,3의 생일이 같다는 정보가 1,2,4의 생일이 같을 확률에 영향을 주기 때문이다.
하지만 각 사건의 확률 자체가 매우 작기 때문에 포아송 근사를 사용할 수 있다.
적어도 한 집단에서 3명의 생일이 같은 확률은 P(X≥1)=1−P(X=0)이고 포아송 근사를 사용하면, 다음과 같다.
P(X≥1)≈1−e−λ0!λ0=1−e−λ
이처럼 포아송 근사는 복잡한 정확한 계산 대신 간단한 형태로 발생 횟수의 확률을 근사할 수 있다는 장점이 있다.