Lecture 7: Gambler's Ruin and Random Variables | Statistics 110

Prettypotato·2026년 9월 19일

Statistics 110

목록 보기
9/18

도박꾼의 파산 문제 (Gambler's Ruin)

조건부 확률을 활용하는 중요한 예제로 도박꾼의 파산 문제를 살펴보자.

두 도박꾼 A,BA,B가 매 라운드마다 11달러씩 걸고 게임을 반복한다고 하자.

  • AA가 이길 확률: pp
  • BB가 이길 확률: q=1−pq=1-p

한 라운드가 끝나면 11달러가 한 사람에게 이동한다.

한 사람이 파산하면 게임을 종료한다.


문제 풀이

Set of the problem

총 돈은 NN달러로 고정되어 있다고 하자.

처음에 AA는 ii달러, BB는 N−iN-i달러를 가지고 시작한다.

게임 전체에서 돈이 외부로 들어오거나 나가지 않으므로 항상 총 NN달러가 유지된다.

따라서 AA가 가질 수 있는 돈은 0,1,…,N0,1,\dots,N이다.

우리가 구하고 싶은 것은

처음에 ii달러를 가진 AA가 게임 전체에서 승리할 확률

이다.


Random Walk

이 문제를 AA의 돈만 추적하는 문제로 생각할 수 있다.

현재 AA가 ii달러를 가지고 있다면 다음 라운드에서

  • AA가 이기면 i+1i+1
  • AA가 지면 i−1i-1

이 된다.

따라서 AA의 돈은 i→i+1i\rightarrow i+1 또는 i→i−1i\rightarrow i-1로 한 칸씩 움직이는 무작위 행보(Random Walk)가 된다.

양 끝의 00과 NN에 도달하면 게임이 끝난다.

  • 00: AA가 파산 → 게임 종료
  • NN: BB가 파산 → 게임 종료

이처럼 한 번 도달하면 더 이상 움직이지 않는 상태를 흡수 상태(absorbing state)라고 한다.


First-Step Analysis

이 문제에서 중요한 전략은 첫 단계에 조건을 거는 것이다.

모든 미래의 결과를 한꺼번에 분석하려고 하지 말고, 첫 번째 라운드에서 무슨 일이 일어났는지를 기준으로 나눈다.

AA가 처음에 ii달러를 가지고 시작했을 때 게임에서 이길 확률을 pip_i라고 하자.

pi=P(A가 게임에서 승리∣A가 처음에 i달러)p_i=P(A\text{가 게임에서 승리}\mid A\text{가 처음에 }i\text{달러})

첫 번째 라운드에서 두 가지 경우만 발생한다.

  • AA가 이길 확률은 pp

    • 돈이 i+1i+1달러가 된다.
    • 이후에는 처음부터 i+1i+1달러를 가지고 시작하는 것과 같은 문제가 된다.
    • 따라서 이후 게임에서 이길 확률은 pi+1p_{i+1}이다.
  • AA가 질 확률은 qq

    • 돈이 i−1i-1달러가 된다.
    • 이후에는 처음부터 i−1i-1달러를 가지고 시작하는 것과 같은 문제가 된다.
    • 따라서 이후 게임에서 이길 확률은 pi−1p_{i-1}이다.

따라서 전체확률법칙에 의해 pi=ppi+1+qpi−1p_i=pp_{i+1}+qp_{i-1}이 된다.

이 식이 이 문제의 핵심적인 재귀식(recursion)이다.

즉, 현재 상태 ii에서의 승리 확률은 다음 상태들의 승리 확률을 가중평균한 것이다.


경계 조건

위의 재귀식은 1≤i≤N−11\leq i\leq N-1에서 적용된다.

양 끝에서는 게임이 이미 끝난 상태이므로 확률이 바로 결정된다.

  • i=0i=0: AA가 이미 파산했으므로 p0=0p_0=0
  • i=Ni=N: AA가 모든 돈을 가지고 있으므로 pN=1p_N=1

따라서 p0=0,pN=1p_0=0,\quad p_N=1이다.

이 두 조건을 경계 조건(boundary conditions)이라고 한다.

결국 문제는

pi=ppi+1+qpi−1,(p0=0,pN=1)p_i=pp_{i+1}+qp_{i-1},\quad(p_0=0,\quad p_N=1)

을 만족하는 pip_i를 찾는 문제가 된다.


차분방정식 (Difference Equation)

재귀식 pi=ppi+1+qpi−1p_i=pp_{i+1}+qp_{i-1}은 현재 값과 주변의 값 사이의 관계를 나타내므로 차분방정식(difference equation)이라고 한다.

미분방정식이 연속적인 변화의 관계를 다룬다면, 차분방정식은 이산적인 단계에서의 변화를 다룬다.

이 문제에서는 돈이 한 번에 11달러씩 이동하므로 차분방정식이 자연스럽게 등장한다.


차분방정식 풀기

식을 정리하면 ppi+1−pi+qpi−1=0pp_{i+1}-p_i+qp_{i-1}=0이 된다.

여기서 지수 형태의 해를 추측해보자.

pi=xip_i=x^i

이를 원래 식에 대입하면 xi=pxi+1+qxi−1x^i=px^{i+1}+qx^{i-1}이 된다.

x≠0x\neq0이라고 하고 xi−1x^{i-1}로 나누면

px2−x+q=0px^2-x+q=0

이라는 2차 방정식을 얻는다.


특성방정식의 해

근의 공식을 사용하면 x=1±1−4pq2px=\frac{1\pm\sqrt{1-4pq}}{2p}이다.

여기서 q=1−pq=1-p이므로 1−4pq=1−4p(1−p)=(2p−1)21-4pq=1-4p(1-p)=(2p-1)^2가 된다.

따라서 두 해는 x=1,x=qpx=1,x=\frac{q}{p}가 된다.

즉, p≠qp\neq q일 때 두 개의 기본적인 해는1i,(qp)i1^i, \left(\frac qp\right)^i이다.


왜 pi=A+B(q/p)ip_i=A+B(q/p)^i인가?

차분방정식이 선형이므로, 두 해를 각각 상수배하여 더한 것도 해가 된다.

따라서 두 기본해의 선형결합으로 일반해를 만들 수 있다.

pi=A⋅1i+B(qp)ip_i=A\cdot1^i+B\left(\frac qp\right)^i

1i=11^i=1이므로 pi=A+B(qp)ip_i=A+B\left(\frac qp\right)^i가 된다.

여기서 A,BA,B는 새로운 상수가 아니라 경계 조건을 만족시키기 위해 결정해야 하는 상수이다.


경계 조건 적용

먼저 p0=0p_0=0을 대입하면 0=A+B0=A+B이다.

따라서 B=−AB=-A이다.

그러므로 pi=A−A(qp)i=A(1−(qp)i)p_i=A-A\left(\frac qp\right)^i=A\left(1-\left(\frac qp\right)^i\right)가 된다.

이제 pN=1p_N=1을 대입하면 1=A(1−(qp)N)1=A\left(1-\left(\frac qp\right)^N\right)이다.

따라서 A=11−(qp)NA=\frac{1}{1-\left(\frac qp\right)^N}이다.

이를 대입하면 최종적으로 pi=1−(qp)i1−(qp)Np_i=\frac{1-\left(\frac qp\right)^i}{1-\left(\frac qp\right)^N}을 얻는다.

이는 p≠qp\neq q인 불공평한 게임에서 AA가 게임에서 승리할 확률이다.


공평한 게임: p=qp=q

이제 p=qp=q인 경우를 생각하자.

p+q=1p+q=1이므로 p=q=12p=q=\frac12이다.

앞의 식에 p=qp=q를 직접 대입하면 분자와 분모가 모두 00이 되어 사용할 수 없다.

대신 x=q/px=q/p라고 두면 pi=1−xi1−xNp_i=\frac{1-x^i}{1-x^N}이고, 공평한 게임에서는 x→1x\rightarrow1로 생각할 수 있다.

따라서 극한을 계산하면 lim⁡x→11−xi1−xN=iN\lim_{x\to1}\frac{1-x^i}{1-x^N}=\frac{i}{N}이 된다.

따라서 공평한 게임에서는 pi=iNp_i=\frac{i}{N}이다.


공평한 게임의 직관

공평한 게임에서는 AA가 게임에서 승리할 확률이 처음 가지고 있던 돈의 비율과 정확히 같다.

예를 들어 전체 돈이 NN달러이고 AA가 2N/32N/3을 가지고 시작한다면, AA가 최종적으로 모든 돈을 차지할 확률도 2/32/3이다.

특히

  • ii가 00에 가까우면 AA의 승리 확률도 00에 가까워진다.
  • ii가 NN에 가까우면 AA의 승리 확률도 11에 가까워진다.

약간의 불공평함이 큰 차이를 만든다

공평한 게임에서 조금만 벗어나도 장기적으로 결과가 크게 달라질 수 있다.

예를 들어 p=0.49p=0.49, q=0.51q=0.51이고 두 도박꾼이 같은 돈으로 시작한다고 하자.

N=20N=20이면 AA의 승리 확률은 약 40%40\%이다.

하지만 N=100N=100이면 약 12%12\%까지 떨어지고, N=200N=200이면 약 2%2\%까지 떨어진다.

즉, 한 라운드에서는 아주 작은 불리함이라도 게임을 반복하면서 누적되면 최종 결과에 큰 영향을 줄 수 있다.

이것이 도박꾼의 파산이라고 부르는 이유이다.


게임이 영원히 지속될 수 있는가?

공평한 게임에서 AA가 승리할 확률은 i/Ni/N이다.

반대로 BB가 승리할 확률은 BB의 초기 자금 비율인 (N−i)/N(N-i)/N이다.

따라서 iN+N−iN=1\frac{i}{N}+\frac{N-i}{N}=1이다.

즉, AA가 승리하거나 BB가 승리할 확률의 합이 이미 11이다.

따라서 남는 확률이 없으므로 게임이 영원히 지속될 확률은 00이다.

수학적으로 무한히 계속 움직이는 경로 자체는 생각할 수 있지만, 그러한 경로가 발생할 확률은 00이다.


도박꾼의 파산 문제에서 얻을 것

핵심은 두 가지이다.

  1. 문제의 구조를 파악한다.

    • 도박꾼의 파산 문제는 성공/실패가 반복되고 상태가 한 단계씩 변하는 문제이다.
    • 따라서 Random Walk와 같은 구조로 볼 수 있다.
  2. 첫 단계에 조건을 건다.

    • 첫 번째 단계에서 발생할 수 있는 경우를 나누면 이후에는 동일한 문제가 반복된다.
    • 이 구조를 이용하면 재귀식을 만들 수 있다.
    • pi=ppi+1+qpi−1p_i=pp_{i+1}+qp_{i-1}

확률변수 (Random Variable)

지금까지 확률은 주로 사건(event)에 대해 정의했다.

하지만 다양한 확률 실험을 다루다 보면 사건을 계속 만들어야 하기 때문에 표기법이 복잡해진다.

예를 들어

  • AA가 ii달러를 가지고 시작하는 사건
  • 7번째 라운드에서 AA가 ii달러를 가지고 있는 사건
  • 특정 시점에 AA가 가진 돈이 ii인 사건

등을 모두 사건으로 표현하려 하면 불편하다.

이를 숫자로 다루기 위해 확률변수를 사용한다.


확률변수의 정의

확률변수는 이름에 변수라고 들어가지만, 본질적으로는 함수이다.

확률변수 XX는 표본공간 SS의 각 결과를 실수에 대응시키는 함수이다.

X:S→RX:S\rightarrow\mathbb R

즉, 확률변수는 확률실험의 결과를 숫자로 바꾸어 주는 함수이다.

여기서 중요한 것은 확률변수 XX라는 대응 규칙이 매번 바뀌는 것이 아니라, 확률실험의 결과가 무작위이기 때문에 그 결과를 숫자로 나타내는 확률변수의 값도 무작위로 결정된다는 것이다.


확률변수의 직관

확률변수를 확률실험의 어떤 측면을 나타내는 수치적인 "요약"이라고 생각할 수 있다.

확률실험이 끝나기 전에는 어떤 결과가 나올지 모르기 때문에 XX가 어떤 값을 가질지도 모른다.

하지만 실험이 끝나면 하나의 결과 ss가 관찰되고, 확률변수 XX는 그 결과를 하나의 숫자 X(s)X(s)로 대응시킨다.

즉, 확률실험 → 결과 ss → 숫자 X(s)X(s)의 구조이다.

확률변수의 무작위성은 함수 자체에서 나오는 것이 아니라 확률실험의 무작위성에서 나온다.


사건과 확률변수의 관계

확률변수 XX가 있을 때 X=1X=1이라는 표현은 하나의 사건을 의미한다.

형식적으로는 {s∈S:X(s)=1}\{s\in S:X(s)=1\}이다.

즉, 표본공간의 결과 중에서 확률변수가 1이라는 숫자로 대응되는 결과들을 모아놓은 집합이다.

따라서 P(X=1)P(X=1)은 그 사건이 일어날 확률을 의미한다.


베르누이 분포 (Bernoulli Distribution)

가장 간단한 확률변수 중 하나는 두 가지 값만 가지는 확률변수이다.

XX가 00과 11만 가질 수 있다고 하자.

이를 Bernoulli(p)(p)라고 한다.

P(X=1)=p,P(X=0)=1−pP(X=1)=p,\qquad P(X=0)=1-p

여기서 성공을 11, 실패를 00으로 정의할 수 있다.

중요한 점은 성공이 무엇인지는 우리가 문제에 맞게 정의할 수 있다는 것이다.

따라서 Bernoulli 확률변수는 하나의 시행에서

  • 성공 → 11
  • 실패 → 00

으로 결과를 숫자로 표현하는 확률변수라고 생각할 수 있다.


이항분포 (Binomial Distribution)

Bernoulli 시행을 여러 번 반복하면 이항분포가 등장한다.

XX가 nn개의 독립적인 Bernoulli(p)(p) 시행에서 성공한 횟수라고 하자.

그러면 X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p)라고 한다.

여기서

  • nn: 시행 횟수
  • pp: 한 번의 시행에서 성공할 확률
  • XX: 전체 nn번 중 성공한 횟수

이다.

따라서 XX는 0,1,…,n0,1,\dots,n 중 하나의 값을 가진다.


이항분포의 PMF

X=kX=k라는 것은 nn번의 시행 중 정확히 kk번 성공했다는 뜻이다.

특정한 순서로 kk번 성공하고 n−kn-k번 실패하는 경우의 확률은pk(1−p)n−kp^k(1-p)^{n-k}이다.

하지만 성공이 나타나는 순서는 여러 가지가 있을 수 있다.

nn개의 위치 중 성공이 나타날 kk개의 위치를 선택하는 방법은 (nk)\binom nk가지이다.

따라서

P(X=k)=(nk)pk(1−p)n−k,0≤k≤nP(X=k)=\binom nk p^k(1-p)^{n-k},\qquad 0\leq k\leq n

이다.

이를 확률질량함수(PMF, Probability Mass Function)라고 한다.

즉, PMF는 확률변수가 각각의 값을 가질 확률을 나타낸다.


이항분포의 덧셈 성질

X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p)이고 Y∼Bin⁡(m,p)Y\sim\operatorname{Bin}(m,p)라고 하자.

또한 X,YX,Y가 서로 독립이라고 하자.

그러면 X+Y∼Bin⁡(n+m,p)X+Y\sim\operatorname{Bin}(n+m,p)이다.

  • XX: 처음 nn번의 Bernoulli(p)(p) 시행에서 성공한 횟수
  • YY: 다음 mm번의 Bernoulli(p)(p) 시행에서 성공한 횟수
  • X+YX+Y: 총 n+mn+m번의 시행에서 성공한 횟수

따라서 X+YX+Y는 정의상 Bin⁡(n+m,p)\operatorname{Bin}(n+m,p)가 된다.

이 결과는 복잡한 계산 없이 이항분포의 정의만으로 이해할 수 있다.

0개의 댓글