Lecture 10: Expectation Continued | Statistics 110

Prettypotato·2026년 9월 21일

Statistics 110

목록 보기
13/18

기대값의 선형성 (Linearity)

두 확률변수의 합을 T=X+YT=X+Y라고 하자.

기대값의 선형성은 다음과 같다.

E(T)=E(X)+E(Y)E(T)=E(X)+E(Y)

중요한 점은 X,YX,Y가 독립인지 여부와 관계없이 성립한다는 것이다.


선형성의 증명

이산확률변수의 기대값은 두 가지 방식으로 표현할 수 있다.

E(X)=∑xxP(X=x)=∑s∈SX(s)P({s})E(X)=\sum_x xP(X=x)=\sum_{s\in S}X(s)P(\{s\})

첫 번째 표현은 같은 값을 가진 결과들을 그룹으로 묶어서 계산하는 방식이고, 두 번째 표현은 각 결과를 하나씩 더하는 방식이다.

이는 숫자들의 평균을

  • 각각의 숫자를 직접 더하는 방법
  • 같은 숫자를 그룹으로 묶어 가중평균을 구하는 방법

으로 계산하는 것과 같은 원리이다.

T=X+YT=X+Y라 하면,

E(T)=∑s∈ST(s)P({s})E(T)=\sum_{s\in S}T(s)P(\{s\})

그리고 T=X+YT=X+Y이므로

E(X+Y)=∑s∈S(X(s)+Y(s))P({s})E(X+Y)=\sum_{s\in S}(X(s)+Y(s))P(\{s\})

분배법칙을 적용하면

E(X+Y)=∑s∈SX(s)P({s})+∑s∈SY(s)P({s})E(X+Y)=\sum_{s\in S}X(s)P(\{s\})+\sum_{s\in S}Y(s)P(\{s\})

따라서

E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)

즉, 기대값은 합에 대해 선형적이다.

이 증명에서는 독립성을 전혀 사용하지 않았기 때문에 X,YX,Y가 종속되어 있어도 성립한다.


상수배에 대한 선형성

상수 cc에 대해서도

E(cX)=cE(X)E(cX)=cE(X)

가 성립한다.

예를 들어 모든 값에 2를 곱하면 평균 역시 2배가 된다.

따라서 기대값의 선형성은

E(aX+bY)=aE(X)+bE(Y)E(aX+bY)=aE(X)+bE(Y)

와 같이 사용할 수 있다.


선형성의 직관

독립인 경우에는 E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)가 직관적으로 이해하기 쉽다.

하지만 가장 극단적인 종속 관계인 X=YX=Y에서도

E(X+Y)=E(2X)=2E(X)=E(X)+E(Y)E(X+Y)=E(2X)=2E(X)=E(X)+E(Y)

가 성립한다.

즉, 독립성은 선형성에 필요한 조건이 아니다.


음이항분포 (Negative Binomial Distribution)

음이항분포는 rr번째 성공이 나올 때까지의 실패 횟수를 나타낸다.

각 시행은 독립적인 Bernoulli(pp) 시행이라고 하자.

  • 성공 확률: pp
  • 실패 확률: q=1−pq=1-p
  • rr개의 성공을 얻을 때까지 시행
  • XX = rr번째 성공 전까지의 실패 횟수

기하분포는 첫 번째 성공까지 기다리는 경우이므로, 음이항분포는 이를 rr번째 성공까지 확장한 것이다.

즉, X∼NB(r,p)X\sim NB(r,p)이다.


음이항분포의 PMF

X=nX=n이라는 것은 rr번째 성공이 나오기 전까지 실패가 nn번 있었다는 뜻이다.

마지막 시행은 반드시 성공이어야 한다.

따라서 특정한 순서 하나의 확률은

pr(1−p)np^r(1-p)^n

이다.

마지막 성공을 제외하면 그 앞에는

  • 성공 r−1r-1개
  • 실패 nn개

가 있다.

이들의 순서는 자유롭게 바꿀 수 있으므로 경우의 수는 (n+r−1r−1)\binom{n+r-1}{r-1}이다.

P(X=n)=(n+r−1r−1)pr(1−p)n,n=0,1,2,…P(X=n)=\binom{n+r-1}{r-1}p^r(1-p)^n,\qquad n=0,1,2,\ldots

음이항분포의 기대값

PMF를 이용해 직접 기대값을 계산하면 복잡하다.

대신 기하분포로 분해한다.

XjX_j를 (j−1)(j-1)번째 성공과 jj번째 성공 사이의 실패 횟수라고 하자.

그러면

X=X1+X2+⋯+XrX=X_1+X_2+\cdots+X_r

각 XjX_j는 기하분포를 따르므로

Xj∼Geom(p)X_j\sim Geom(p)

이고, 이전에 구한 기하분포의 기대값은

E(Xj)=qpE(X_j)=\frac{q}{p}

이다.

따라서 선형성에 의해

E(X)=E(X1)+⋯+E(Xr)=rqpE(X)=E(X_1)+\cdots+E(X_r)=r\frac{q}{p}

즉,

E(X)=r(1−p)pE(X)=\frac{r(1-p)}{p}

이다.

핵심: rr번째 성공까지 기다리는 것은
첫 번째 성공까지 기다리는 것 + 두 번째 성공까지 추가로 기다리는 것 + ⋯\cdots와 같다.


기하분포와 First Success Distribution

기하분포의 관례는 책마다 다르다.

이 강의에서는 성공을 제외한 실패 횟수를 센다.

반면 첫 성공 자체를 포함하여 시행 횟수를 세는 경우를 First Success Distribution이라고 할 수 있다.

XX를 첫 성공까지의 시행 횟수라고 하고 Y=X−1Y=X-1로 정의하면 Y∼Geom(p)Y\sim Geom(p)이다.

따라서 X=Y+1X=Y+1이므로

E(X)=E(Y)+1=qp+1=1pE(X)=E(Y)+1=\frac{q}{p}+1=\frac{1}{p}

이다.

즉, 성공 확률이 pp일 때 첫 성공까지 걸리는 시행 횟수의 기대값은 1/p1/p이다.

예를 들어 성공 확률이 1/101/10이면 첫 성공까지 걸리는 시행 횟수의 평균은 10회이다.


관례(Convention)에 주의

기하분포와 음이항분포는 책에 따라 확률변수가 무엇을 세는지가 다를 수 있다.

  • 실패 횟수를 세는 경우
  • 성공을 포함한 시행 횟수를 세는 경우

따라서 공식을 사용할 때는 그 책에서 XX가 무엇을 세는지 먼저 확인해야 한다.


순열의 극대값 (Local Maxima)

1,2,…,n1,2,\ldots,n의 임의의 순열을 생각하자.

모든 n!n!개의 순열은 동일한 확률을 가진다.

Local maximum은 자신의 이웃보다 큰 값이다.

  • 양 끝의 값: 이웃이 하나뿐이므로 그 이웃보다 크면 극대값
  • 가운데 값: 양쪽 이웃보다 모두 커야 극대값

문제는 순열에서 극대값의 개수의 기대값을 구하는 것이다.


지시확률변수로 극대값 세기

jj번째 위치가 극대값이면 1, 아니면 0이 되도록

Ij=I(j번째 위치가 local maximum)I_j=I(\text{$j$번째 위치가 local maximum})

으로 정의한다.

그러면 전체 극대값의 개수 NN은 N=I1+I2+⋯+InN=I_1+I_2+\cdots+I_n이다.

따라서 선형성에 의해

E(N)=E(I1)+⋯+E(In)E(N)=E(I_1)+\cdots+E(I_n)

이다.

여기서 중요한 점은 각 IjI_j가 서로 독립일 필요가 없다는 것이다.


가운데 위치의 극대값 확률

가운데 위치에는 양쪽에 이웃이 두 개 있다.

세 숫자 중 가장 큰 숫자가 가운데에 올 확률을 생각하면 된다.

어느 위치에든 가장 큰 값이 올 수 있으므로

P(Ij=1)=13P(I_j=1)=\frac13

이다.

따라서 Fundamental Bridge에 의해

E(Ij)=P(Ij=1)=13E(I_j)=P(I_j=1)=\frac13

이다.

가운데 위치는 총 n−2n-2개이므로

n−23\frac{n-2}{3}

이다.


끝 위치의 극대값 확률

끝 위치에는 이웃이 하나뿐이다.

서로 다른 두 숫자 중 하나가 다른 하나보다 클 확률은 각각 1/21/2이므로

P(I1=1)=P(In=1)=12P(I_1=1)=P(I_n=1)=\frac12

이다.

따라서 두 끝 위치의 기대값은

2⋅12=12\cdot\frac12=1

이다.


극대값의 기대 개수

따라서

E(N)=(n−2)13+212E(N)=(n-2)\frac13+2\frac12

이고,

E(N)=n+13E(N)=\frac{n+1}{3}

이다.

핵심 전략

  1. 각 위치에 지시확률변수를 정의한다.
  2. 전체 개수를 지시확률변수의 합으로 표현한다.
  3. 선형성을 적용한다.
  4. 대칭성을 이용해 각 지시확률변수의 확률을 구한다.
  5. Fundamental Bridge를 사용한다.

즉, 지시확률변수 + 선형성 + 대칭성을 이용하면 직접 순열을 하나씩 세지 않고도 기대값을 구할 수 있다.


상트페테르부르크 역설 (St. Petersburg Paradox)

공정한 동전을 계속 던져 처음 앞면이 나오는 순간 게임을 끝낸다.

첫 앞면이 kk번째 시행에서 나오면 2k2^k달러를 받는다.

여기서 XX를 첫 앞면이 나오는 시행 횟수라고 하면

P(X=k)=(12)kP(X=k)=\left(\frac12\right)^k

이다.

지급액을 Y=2XY=2^X라고 하자.


상트페테르부르크 게임의 기대 지급액

기대값의 정의에 따라

E(Y)=∑k=1∞2kP(X=k)E(Y)=\sum_{k=1}^{\infty}2^kP(X=k)

이다.

공정한 동전이므로

E(Y)=∑k=1∞2k(12)kE(Y)=\sum_{k=1}^{\infty}2^k\left(\frac12\right)^k

이고,

E(Y)=∑k=1∞1E(Y)=\sum_{k=1}^{\infty}1

이다.

따라서

E(Y)=∞E(Y)=\infty

이다.

즉, 이론적인 기대 지급액은 무한대이다.


현실적인 상한을 둔다면

현실에서는 무한한 돈을 지급할 수 없으므로 지급액에 상한을 둘 수 있다. 예를 들어 최대 지급액을 2402^{40}으로 제한한다고 하자.

첫 앞면이 kk번째에 나오고 k≤40k\le 40이면 원래 규칙대로 2k2^k를 지급한다.

따라서 첫 앞면이 k=1,…,40k=1,\ldots,40번째에 나오는 경우의 기대 지급액은 각 항이

2kP(X=k)=2k(12)k=12^kP(X=k)=2^k\left(\frac12\right)^k=1

이므로 총 4040이다.

그런데 첫 앞면이 41번째 이후에 나오는 경우도 있다.

이때 X>40X>40이라는 것은 첫 40번의 시행에서 모두 뒷면이 나왔다는 뜻이므로

P(X>40)=(12)40P(X>40)=\left(\frac12\right)^{40}

이다.

원래 규칙이라면 첫 앞면이 41번째, 42번째, 43번째, …\ldots에 나오는 경우 각각 241,242,243,…2^{41},2^{42},2^{43},\ldots를 지급해야 한다.

하지만 지급액의 상한을 2402^{40}으로 정했으므로 41번째 이후에 첫 앞면이 나와도 항상 2402^{40}을 지급한다.

따라서 41번째 이후 꼬리 부분의 기대 지급액은 각 경우를 모두 합하여

∑n=41∞240P(X=n)\sum_{n=41}^{\infty} 2^{40}P(X=n)

이다.

첫 앞면이 nn번째에 나올 확률은

P(X=n)=(12)nP(X=n)=\left(\frac12\right)^n

이므로

∑n=41∞240(12)n\sum_{n=41}^{\infty} 2^{40}\left(\frac12\right)^n

이 된다.

이를 계산하면

∑n=41∞240(12)n=240∑n=41∞(12)n=240⋅(1/2)411−1/2=240(12)40=1.\begin{aligned} \sum_{n=41}^{\infty} 2^{40}\left(\frac12\right)^n &= 2^{40}\sum_{n=41}^{\infty}\left(\frac12\right)^n\\ &= 2^{40}\cdot\frac{(1/2)^{41}}{1-1/2}\\ &= 2^{40}\left(\frac12\right)^{40}\\ &=1. \end{aligned}

따라서 전체 기대 지급액은

40+1=4140+1=41

이다.

즉, 지급액에 상한을 두면 기대값은 유한해진다. 상한을 2N2^N으로 두면 기대값은 N+1N+1이 되며, 상한이 높을수록 기대값은 커지지만 그 증가는 매우 느리다(로그적으로 증가한다).


기대값과 함수의 관계

매우 중요한 주의점이 있다.

일반적으로

E(2X)≠2E(X)E(2^X)\neq2^{E(X)}

이다.

예를 들어 이 게임에서 XX는 첫 성공까지의 시행 횟수이고

E(X)=2E(X)=2

이지만,

2E(X)=42^{E(X)}=4

라고 해서

E(2X)=4E(2^X)=4

인 것은 아니다.

실제로

E(2X)=∞E(2^X)=\infty

이다.

즉, 기대값을 함수 안으로 임의로 이동시킬 수 없다.

선형성은

E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)

또는

E(cX)=cE(X)E(cX)=cE(X)

와 같은 선형적인 연산에 대해서만 사용할 수 있다.

0개의 댓글