도박꾼의 파산 문제 (Gambler's Ruin)
조건부 확률을 활용하는 중요한 예제로 도박꾼의 파산 문제를 살펴보자.
두 도박꾼 A,B가 매 라운드마다 1달러씩 걸고 게임을 반복한다고 하자.
- A가 이길 확률: p
- B가 이길 확률: q=1−p
한 라운드가 끝나면 1달러가 한 사람에게 이동한다.
한 사람이 파산하면 게임을 종료한다.
문제 풀이
Set of the problem
총 돈은 N달러로 고정되어 있다고 하자.
처음에 A는 i달러, B는 N−i달러를 가지고 시작한다.
게임 전체에서 돈이 외부로 들어오거나 나가지 않으므로 항상 총 N달러가 유지된다.
따라서 A가 가질 수 있는 돈은 0,1,…,N이다.
우리가 구하고 싶은 것은
처음에 i달러를 가진 A가 게임 전체에서 승리할 확률
이다.
Random Walk
이 문제를 A의 돈만 추적하는 문제로 생각할 수 있다.
현재 A가 i달러를 가지고 있다면 다음 라운드에서
- A가 이기면 i+1
- A가 지면 i−1
이 된다.
따라서 A의 돈은 i→i+1 또는 i→i−1로 한 칸씩 움직이는 무작위 행보(Random Walk)가 된다.
양 끝의 0과 N에 도달하면 게임이 끝난다.
- 0: A가 파산 → 게임 종료
- N: B가 파산 → 게임 종료
이처럼 한 번 도달하면 더 이상 움직이지 않는 상태를 흡수 상태(absorbing state)라고 한다.
First-Step Analysis
이 문제에서 중요한 전략은 첫 단계에 조건을 거는 것이다.
모든 미래의 결과를 한꺼번에 분석하려고 하지 말고, 첫 번째 라운드에서 무슨 일이 일어났는지를 기준으로 나눈다.
A가 처음에 i달러를 가지고 시작했을 때 게임에서 이길 확률을 pi라고 하자.
pi=P(A가 게임에서 승리∣A가 처음에 i달러)
첫 번째 라운드에서 두 가지 경우만 발생한다.
-
A가 이길 확률은 p
- 돈이 i+1달러가 된다.
- 이후에는 처음부터 i+1달러를 가지고 시작하는 것과 같은 문제가 된다.
- 따라서 이후 게임에서 이길 확률은 pi+1이다.
-
A가 질 확률은 q
- 돈이 i−1달러가 된다.
- 이후에는 처음부터 i−1달러를 가지고 시작하는 것과 같은 문제가 된다.
- 따라서 이후 게임에서 이길 확률은 pi−1이다.
따라서 전체확률법칙에 의해 pi=ppi+1+qpi−1이 된다.
이 식이 이 문제의 핵심적인 재귀식(recursion)이다.
즉, 현재 상태 i에서의 승리 확률은 다음 상태들의 승리 확률을 가중평균한 것이다.
경계 조건
위의 재귀식은 1≤i≤N−1에서 적용된다.
양 끝에서는 게임이 이미 끝난 상태이므로 확률이 바로 결정된다.
- i=0: A가 이미 파산했으므로 p0=0
- i=N: A가 모든 돈을 가지고 있으므로 pN=1
따라서 p0=0,pN=1이다.
이 두 조건을 경계 조건(boundary conditions)이라고 한다.
결국 문제는
pi=ppi+1+qpi−1,(p0=0,pN=1)
을 만족하는 pi를 찾는 문제가 된다.
차분방정식 (Difference Equation)
재귀식 pi=ppi+1+qpi−1은 현재 값과 주변의 값 사이의 관계를 나타내므로 차분방정식(difference equation)이라고 한다.
미분방정식이 연속적인 변화의 관계를 다룬다면, 차분방정식은 이산적인 단계에서의 변화를 다룬다.
이 문제에서는 돈이 한 번에 1달러씩 이동하므로 차분방정식이 자연스럽게 등장한다.
차분방정식 풀기
식을 정리하면 ppi+1−pi+qpi−1=0이 된다.
여기서 지수 형태의 해를 추측해보자.
pi=xi
이를 원래 식에 대입하면 xi=pxi+1+qxi−1이 된다.
x=0이라고 하고 xi−1로 나누면
px2−x+q=0
이라는 2차 방정식을 얻는다.
특성방정식의 해
근의 공식을 사용하면 x=2p1±1−4pq이다.
여기서 q=1−p이므로 1−4pq=1−4p(1−p)=(2p−1)2가 된다.
따라서 두 해는 x=1,x=pq가 된다.
즉, p=q일 때 두 개의 기본적인 해는1i,(pq)i이다.
왜 pi=A+B(q/p)i인가?
차분방정식이 선형이므로, 두 해를 각각 상수배하여 더한 것도 해가 된다.
따라서 두 기본해의 선형결합으로 일반해를 만들 수 있다.
pi=A⋅1i+B(pq)i
1i=1이므로 pi=A+B(pq)i가 된다.
여기서 A,B는 새로운 상수가 아니라 경계 조건을 만족시키기 위해 결정해야 하는 상수이다.
경계 조건 적용
먼저 p0=0을 대입하면 0=A+B이다.
따라서 B=−A이다.
그러므로 pi=A−A(pq)i=A(1−(pq)i)가 된다.
이제 pN=1을 대입하면 1=A(1−(pq)N)이다.
따라서 A=1−(pq)N1이다.
이를 대입하면 최종적으로 pi=1−(pq)N1−(pq)i을 얻는다.
이는 p=q인 불공평한 게임에서 A가 게임에서 승리할 확률이다.
공평한 게임: p=q
이제 p=q인 경우를 생각하자.
p+q=1이므로 p=q=21이다.
앞의 식에 p=q를 직접 대입하면 분자와 분모가 모두 0이 되어 사용할 수 없다.
대신 x=q/p라고 두면 pi=1−xN1−xi이고, 공평한 게임에서는 x→1로 생각할 수 있다.
따라서 극한을 계산하면 limx→11−xN1−xi=Ni이 된다.
따라서 공평한 게임에서는 pi=Ni이다.
공평한 게임의 직관
공평한 게임에서는 A가 게임에서 승리할 확률이 처음 가지고 있던 돈의 비율과 정확히 같다.
예를 들어 전체 돈이 N달러이고 A가 2N/3을 가지고 시작한다면, A가 최종적으로 모든 돈을 차지할 확률도 2/3이다.
특히
- i가 0에 가까우면 A의 승리 확률도 0에 가까워진다.
- i가 N에 가까우면 A의 승리 확률도 1에 가까워진다.
약간의 불공평함이 큰 차이를 만든다
공평한 게임에서 조금만 벗어나도 장기적으로 결과가 크게 달라질 수 있다.
예를 들어 p=0.49, q=0.51이고 두 도박꾼이 같은 돈으로 시작한다고 하자.
N=20이면 A의 승리 확률은 약 40%이다.
하지만 N=100이면 약 12%까지 떨어지고, N=200이면 약 2%까지 떨어진다.
즉, 한 라운드에서는 아주 작은 불리함이라도 게임을 반복하면서 누적되면 최종 결과에 큰 영향을 줄 수 있다.
이것이 도박꾼의 파산이라고 부르는 이유이다.
게임이 영원히 지속될 수 있는가?
공평한 게임에서 A가 승리할 확률은 i/N이다.
반대로 B가 승리할 확률은 B의 초기 자금 비율인 (N−i)/N이다.
따라서 Ni+NN−i=1이다.
즉, A가 승리하거나 B가 승리할 확률의 합이 이미 1이다.
따라서 남는 확률이 없으므로 게임이 영원히 지속될 확률은 0이다.
수학적으로 무한히 계속 움직이는 경로 자체는 생각할 수 있지만, 그러한 경로가 발생할 확률은 0이다.
도박꾼의 파산 문제에서 얻을 것
핵심은 두 가지이다.
-
문제의 구조를 파악한다.
- 도박꾼의 파산 문제는 성공/실패가 반복되고 상태가 한 단계씩 변하는 문제이다.
- 따라서 Random Walk와 같은 구조로 볼 수 있다.
-
첫 단계에 조건을 건다.
- 첫 번째 단계에서 발생할 수 있는 경우를 나누면 이후에는 동일한 문제가 반복된다.
- 이 구조를 이용하면 재귀식을 만들 수 있다.
- pi=ppi+1+qpi−1
확률변수 (Random Variable)
지금까지 확률은 주로 사건(event)에 대해 정의했다.
하지만 다양한 확률 실험을 다루다 보면 사건을 계속 만들어야 하기 때문에 표기법이 복잡해진다.
예를 들어
- A가 i달러를 가지고 시작하는 사건
- 7번째 라운드에서 A가 i달러를 가지고 있는 사건
- 특정 시점에 A가 가진 돈이 i인 사건
등을 모두 사건으로 표현하려 하면 불편하다.
이를 숫자로 다루기 위해 확률변수를 사용한다.
확률변수의 정의
확률변수는 이름에 변수라고 들어가지만, 본질적으로는 함수이다.
확률변수 X는 표본공간 S의 각 결과를 실수에 대응시키는 함수이다.
X:S→R
즉, 확률변수는 확률실험의 결과를 숫자로 바꾸어 주는 함수이다.
여기서 중요한 것은 확률변수 X라는 대응 규칙이 매번 바뀌는 것이 아니라, 확률실험의 결과가 무작위이기 때문에 그 결과를 숫자로 나타내는 확률변수의 값도 무작위로 결정된다는 것이다.
확률변수의 직관
확률변수를 확률실험의 어떤 측면을 나타내는 수치적인 "요약"이라고 생각할 수 있다.
확률실험이 끝나기 전에는 어떤 결과가 나올지 모르기 때문에 X가 어떤 값을 가질지도 모른다.
하지만 실험이 끝나면 하나의 결과 s가 관찰되고, 확률변수 X는 그 결과를 하나의 숫자 X(s)로 대응시킨다.
즉, 확률실험 → 결과 s → 숫자 X(s)의 구조이다.
확률변수의 무작위성은 함수 자체에서 나오는 것이 아니라 확률실험의 무작위성에서 나온다.
사건과 확률변수의 관계
확률변수 X가 있을 때 X=1이라는 표현은 하나의 사건을 의미한다.
형식적으로는 {s∈S:X(s)=1}이다.
즉, 표본공간의 결과 중에서 확률변수가 1이라는 숫자로 대응되는 결과들을 모아놓은 집합이다.
따라서 P(X=1)은 그 사건이 일어날 확률을 의미한다.
베르누이 분포 (Bernoulli Distribution)
가장 간단한 확률변수 중 하나는 두 가지 값만 가지는 확률변수이다.
X가 0과 1만 가질 수 있다고 하자.
이를 Bernoulli(p)라고 한다.
P(X=1)=p,P(X=0)=1−p
여기서 성공을 1, 실패를 0으로 정의할 수 있다.
중요한 점은 성공이 무엇인지는 우리가 문제에 맞게 정의할 수 있다는 것이다.
따라서 Bernoulli 확률변수는 하나의 시행에서
으로 결과를 숫자로 표현하는 확률변수라고 생각할 수 있다.
이항분포 (Binomial Distribution)
Bernoulli 시행을 여러 번 반복하면 이항분포가 등장한다.
X가 n개의 독립적인 Bernoulli(p) 시행에서 성공한 횟수라고 하자.
그러면 X∼Bin(n,p)라고 한다.
여기서
- n: 시행 횟수
- p: 한 번의 시행에서 성공할 확률
- X: 전체 n번 중 성공한 횟수
이다.
따라서 X는 0,1,…,n 중 하나의 값을 가진다.
이항분포의 PMF
X=k라는 것은 n번의 시행 중 정확히 k번 성공했다는 뜻이다.
특정한 순서로 k번 성공하고 n−k번 실패하는 경우의 확률은pk(1−p)n−k이다.
하지만 성공이 나타나는 순서는 여러 가지가 있을 수 있다.
n개의 위치 중 성공이 나타날 k개의 위치를 선택하는 방법은 (kn)가지이다.
따라서
P(X=k)=(kn)pk(1−p)n−k,0≤k≤n
이다.
이를 확률질량함수(PMF, Probability Mass Function)라고 한다.
즉, PMF는 확률변수가 각각의 값을 가질 확률을 나타낸다.
이항분포의 덧셈 성질
X∼Bin(n,p)이고 Y∼Bin(m,p)라고 하자.
또한 X,Y가 서로 독립이라고 하자.
그러면 X+Y∼Bin(n+m,p)이다.
- X: 처음 n번의 Bernoulli(p) 시행에서 성공한 횟수
- Y: 다음 m번의 Bernoulli(p) 시행에서 성공한 횟수
- X+Y: 총 n+m번의 시행에서 성공한 횟수
따라서 X+Y는 정의상 Bin(n+m,p)가 된다.
이 결과는 복잡한 계산 없이 이항분포의 정의만으로 이해할 수 있다.