Lecture 9: Expectation, Indicator Random Variables, Linearity | Statistics 110

Prettypotato·2026년 9월 20일

Statistics 110

목록 보기
12/18

누적분포함수 (CDF)

누적분포함수는 모든 확률변수에 대해 정의된다.

F(x)=P(X≤x)F(x) = P(X \le x)

즉, xx 이하의 값을 가질 확률을 누적해서 나타낸 함수이다.

이산확률변수에서의 CDF

이산확률변수의 CDF는 계단함수 형태로 나타난다.

  • 각 점에서 위로 점프한다.
  • 점프의 높이 = 해당 값의 확률질량함수(PMF)
  • 따라서 PMF를 모두 더하면 CDF가 되고, CDF의 점프 높이를 보면 PMF를 알 수 있다.

예를 들어 XX가 0,1,2,30,1,2,3의 값을 가진다면

  • x=0x=0에서의 점프 높이 → P(X=0)P(X=0)
  • x=1x=1에서의 점프 높이 → P(X=1)P(X=1)
  • x=2x=2에서의 점프 높이 → P(X=2)P(X=2)
  • x=3x=3에서의 점프 높이 → P(X=3)P(X=3)

CDF는 왼쪽에서 오른쪽으로 갈수록 확률을 계속 누적하기 때문에 감소할 수 없다.

구간의 확률

CDF를 이용하면 구간의 확률을 구할 수 있다.

P(a<X≤b)=F(b)−F(a)P(a < X \le b) = F(b)-F(a)

즉, bb까지 누적된 확률에서 aa까지 누적된 확률을 빼면 aa와 bb 사이의 확률이 남는다.

단, 이산확률변수에서는 <<와 ≤\le의 차이에 주의해야 한다. 연속확률변수에서는 한 점에서의 확률이 0이므로 이 차이가 중요하지 않다.

CDF의 3가지 성질

  1. 단조 증가

    • xx가 커질수록 F(x)F(x)는 감소하지 않는다.
  2. 우연속(right-continuous)

    • 어떤 점에서 오른쪽으로 접근하면 함수값이 그 점의 함수값으로 수렴한다.
    • 이산확률변수의 계단함수에서는 점프한 뒤의 값이 그 점의 값이다.
  3. 양끝에서의 극한

    • x→−∞x\to-\infty이면 F(x)→0F(x)\to0
    • x→∞x\to\infty이면 F(x)→1F(x)\to1

이 세 성질을 만족하는 함수는 유효한 CDF가 된다.


확률변수의 독립성

확률변수 X,YX,Y가 독립이라는 것은 XX의 값을 알아도 YY에 대한 정보를 얻을 수 없다는 것이다.

모든 x,yx,y에 대해

P(X≤x,Y≤y)=P(X≤x)P(Y≤y)P(X\le x,Y\le y)=P(X\le x)P(Y\le y)

왼쪽은 X,YX,Y를 동시에 고려하는 확률이므로 결합누적분포함수(Joint CDF) 라고 한다.

이산확률변수

이산확률변수에서는 CDF보다 결합확률질량함수(Joint PMF) 를 사용하는 것이 편리하다.

독립이라면

P(X=x,Y=y)=P(X=x)P(Y=y)P(X=x,Y=y)=P(X=x)P(Y=y)

즉, X=xX=x라는 정보가 Y=yY=y의 확률에 영향을 주지 않는다.


평균과 기대값

일반적으로 아무 설명 없이 average라고 하면 mean(평균값) 을 의미한다.

평균에는 여러 종류가 있다.

  • mean: 평균값
  • median: 중간값
  • mode: 최빈값
  • weighted average: 가중평균

평균은 단순히 숫자들의 합을 숫자의 개수로 나눈 것이다.

mean=전체 합개수\text{mean}=\frac{\text{전체 합}}{\text{개수}}

평균은 복잡한 분포를 하나의 숫자로 요약하여 분포의 중심을 나타낸다.

하지만 평균만으로는 분포가 얼마나 퍼져 있는지 알 수 없기 때문에 이후 분산, 표준편차 등 산포도(measures of variability) 를 사용한다.


등차수열의 평균

1,2,3,4,5,61,2,3,4,5,6의 평균은 3.53.5이다.

등차수열에서는 전체를 모두 더하지 않아도 첫 번째 값과 마지막 값의 평균으로 전체 평균을 구할 수 있다.

따라서 11부터 nn까지의 평균은 1+n2\frac{1+n}{2}이고, 합은 n(n+1)2\frac{n(n+1)}{2}이다.

가우스의 11부터 100100까지의 합 계산처럼, 양 끝의 숫자를 묶으면 각 쌍의 합이 동일해진다는 원리를 이용할 수 있다.

  • 1+100=1011+100=101
  • 2+99=1012+99=101
  • 3+98=1013+98=101
  • ...
  • 총 50쌍

따라서 101×50=5050101\times50=5050이다.

등차수열과 등비수열

  • 등차수열: 일정한 값을 계속 더함
  • 등비수열: 일정한 값을 계속 곱함

가중평균 (Weighted Average)

같은 숫자가 여러 번 반복된다면 숫자를 그룹으로 묶어 가중평균으로 계산할 수 있다.

예를 들어

  • 11이 5개
  • 33이 2개
  • 55가 1개

라면 총 8개의 숫자가 있다.

각 값에 해당 값이 전체에서 차지하는 비율을 가중치로 부여하면

58(1)+28(3)+18(5)\frac58(1)+\frac28(3)+\frac18(5)

가 된다.

여기서

58+28+18=1\frac58+\frac28+\frac18=1

이다.

즉, 가중치는 음수가 아니며 전체 가중치의 합은 1이다.

반대로 모든 숫자에 동일하게 1/n1/n의 가중치를 주면 비가중평균(unweighted average) 이 된다.

핵심: 반복되는 숫자를 그룹으로 묶고, 각 숫자가 전체에서 차지하는 비율을 가중치로 주어 평균을 구할 수 있다.


확률변수의 평균 = 기대값

이제 가중평균을 확률변수에 적용한다.

이산확률변수 XX의 평균은 기대값(Expected Value) 이라고 하며 E(X)E(X)로 표현한다.

E(X)=∑xxP(X=x)E(X)=\sum_x xP(X=x)

여기서

  • xx → 확률변수가 가질 수 있는 값
  • P(X=x)P(X=x) → 그 값이 나올 확률 = 가중치

즉, 확률변수의 기대값은 확률을 가중치로 사용하는 가중평균이다.

가능한 값이 유한 개라면 유한합이고, 셀 수 있는 무한 개라면 무한합으로 계산한다.


베르누이 분포의 기대값

X∼Bern(p)X\sim Bern(p)라고 하자.

베르누이 확률변수는

  • 성공 → 11, 확률 pp
  • 실패 → 00, 확률 1−p1-p

를 가진다.

따라서

E(X)=1⋅P(X=1)+0⋅P(X=0)=pE(X)=1\cdot P(X=1)+0\cdot P(X=0)=p

즉,

X∼Bern(p)⇒E(X)=pX\sim Bern(p)\quad\Rightarrow\quad E(X)=p

지시확률변수 (Indicator Random Variable)

관심 있는 사건 AA가 있을 때

X=IA={1A가 발생0A가 발생하지 않음X=I_A=\begin{cases}1 & A\text{가 발생}\\0 & A\text{가 발생하지 않음}\end{cases}

처럼 정의한 확률변수를 지시확률변수라고 한다.

지시확률변수는 0 또는 1, 즉 A가 발생 안한다, 한다이기에 결국 베르누이 확률변수이므로

E(IA)=P(A)E(I_A)=P(A)

이다.

즉, 지시확률변수의 기대값은 해당 사건의 확률과 같다.

이를 강의에서는 Fundamental Bridge라고 부른다.

확률 P(A)P(A)를 구하는 문제를 지시확률변수의 기대값 E(IA)E(I_A)를 구하는 문제로 바꿀 수 있다.


이항분포의 기대값

X∼Bin(n,p)X\sim Bin(n,p)라면

E(X)=∑k=0nkP(X=k)E(X)=\sum_{k=0}^{n}kP(X=k)

이항분포의 PMF를 대입하면

E(X)=∑k=0nk(nk)pkqn−kE(X)=\sum_{k=0}^{n}k\binom nkp^kq^{n-k}

이고, 조합식의 성질

k(nk)=n(n−1k−1)k\binom nk=n\binom{n-1}{k-1}

을 이용한 뒤 이항정리를 적용하면

E(X)=∑k=0nk(nk)pkqn−k=∑k=1nn(n−1k−1)pkqn−k=np∑k=1n(n−1k−1)pk−1qn−k=np∑j=0n−1(n−1j)pjqn−j−1=npE(X)=\sum_{k=0}^{n}k\binom nkp^kq^{n-k} \\= \sum_{k=1}^{n}n\binom{n-1}{k-1}p^kq^{n-k}\\= np\sum_{k=1}^{n}\binom{n-1}{k-1}p^{k-1}q^{n-k}\\=np\sum_{j=0}^{n-1}\binom{n-1}{j}p^{j}q^{n-j-1} \\=np

를 얻는다.

하지만 더 중요한 방법은 선형성을 이용하는 것이다.


기대값의 선형성 (Linearity)

기대값에서 가장 중요한 성질 중 하나이다.

E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)

특히 중요한 점은 X,YX,Y가 서로 의존하더라도 항상 성립한다는 것이다.

또한 상수 cc에 대해서

E(cX)=cE(X)E(cX)=cE(X)

가 성립한다.

따라서

E(cX+dY)=cE(X)+dE(Y)E(cX+dY)=cE(X)+dE(Y)

처럼 사용할 수 있다.

이항분포에 적용

이항분포는 독립적인 베르누이 확률변수 nn개의 합으로 생각할 수 있다.

X=X1+X2+⋯+XnX=X_1+X_2+\cdots+X_n

각 Xi∼Bern(p)X_i\sim Bern(p)이므로 E(Xi)=pE(X_i)=p이다.

선형성에 의해 E(X)=E(X1)+⋯+E(Xn)=npE(X)=E(X_1)+\cdots+E(X_n)=np 이다.

따라서 이항분포의 기대값은 매우 쉽게 E(X)=npE(X)=np가 된다.


초기하분포의 기대값

초기하분포는 비복원추출이므로 각 시행이 서로 의존한다.

예를 들어 52장의 카드에서 5장을 뽑고 XX를 에이스의 개수라고 하자.

각 카드가 에이스인지 나타내는 지시확률변수를 Xj=I(j번째 카드가 에이스)X_j=I(\text{$j$번째 카드가 에이스})라고 하면 X=X1+X2+⋯+X5X=X_1+X_2+\cdots+X_5이다.

선형성에 의해 E(X)=E(X1)+⋯+E(X5)E(X)=E(X_1)+\cdots+E(X_5)가 된다.

각 카드의 위치는 대칭적이므로, 어느 위치의 카드든 에이스일 확률은 동일하게 4/52=1/134/52=1/13이다.

따라서

E(X)=5⋅113=513E(X)=5\cdot\frac1{13}=\frac5{13}

여기서 중요한 점

X1,…,X5X_1,\dots,X_5는 서로 독립이 아니다.

예를 들어 앞의 4장이 모두 에이스라면 5번째 카드가 에이스일 수 없다.

하지만 기대값의 선형성에는 독립성이 필요하지 않다.

따라서

지시확률변수 + 선형성 + 대칭성 + Fundamental Bridge

를 이용하면 복잡한 초기하분포의 기대값도 쉽게 계산할 수 있다.

일반적으로 초기하분포에서도 E(X)=n×(한 번 뽑은 대상이 원하는 속성을 가질 확률)E(X)=n\times(\text{한 번 뽑은 대상이 원하는 속성을 가질 확률})과 같은 형태로 생각할 수 있다.


기하분포 (Geometric Distribution)

기하분포는 독립적인 베르누이 시행을 성공할 때까지 반복하는 상황에서 사용한다.

X∼Geom(p)X\sim Geom(p)에서 강의의 정의는 첫 번째 성공이 나오기 전까지의 실패 횟수이다.

따라서 성공 자체는 횟수에 포함하지 않는다.

예를 들어 FFFFFS라면 첫 성공 전까지 실패가 5번이므로 X=5X=5이다.

실패확률을 q=1−pq=1-p라고 하면 X=kX=k가 되려면 FFF...FFS처럼 정확히 kk번 실패한 뒤 성공해야 한다.

따라서 P(X=k)=qkpP(X=k)=q^kp, k=0,1,2,…k=0,1,2,\ldots이다.


기하분포 PMF가 유효한 이유

PMF가 유효하려면

  1. 확률이 음수가 아니어야 한다.
  2. 모든 확률의 합이 1이어야 한다.

확률의 합은

∑k=0∞pqk=p∑k=0∞qk\sum_{k=0}^{\infty}pq^k=p\sum_{k=0}^{\infty}q^k

이고 무한등비급수의 합은

∑k=0∞qk=11−q\sum_{k=0}^{\infty}q^k=\frac1{1-q}

이므로

p11−q=p1p=1p\frac1{1-q}=p\frac1p=1

이다.

따라서 유효한 PMF이다.


기하분포의 기대값

정의에 따라

E(X)=∑k=0∞kP(X=k)=∑k=0∞kpqkE(X)=\sum_{k=0}^{\infty}kP(X=k)=\sum_{k=0}^{\infty}kpq^k

이다.

방법 1: 미분을 이용

무한등비급수

∑k=0∞qk=11−q\sum_{k=0}^{\infty}q^k=\frac1{1-q}

를 qq에 대해 미분하면

∑k=1∞kqk−1=1(1−q)2\sum_{k=1}^{\infty}kq^{k-1}=\frac1{(1-q)^2}

양변에 qq를 곱하면

∑k=1∞kqk=q(1−q)2=qp2\sum_{k=1}^{\infty}kq^k=\frac{q}{(1-q)^2}=\frac{q}{p^2}

따라서

E(X)=p∑k=1∞kqk=pqp2=qpE(X)=p\sum_{k=1}^{\infty}kq^k=p\frac{q}{p^2}=\frac qp

즉,

E(X)=1−ppE(X)=\frac{1-p}{p}

이다.


기하분포 기대값의 직관적 계산

미분을 사용하지 않고도 구할 수 있다.

기대값을 C=E(X)C=E(X)라고 하자.

첫 번째 시행에서

  • 성공: 확률 pp, 실패 횟수는 00
  • 실패: 확률 qq, 이미 실패가 1번 발생했고 이후에는 처음과 똑같은 문제가 다시 시작됨

따라서

C=0⋅p+q(1+C)C=0\cdot p + q(1+C)

이고 이를 풀면

C=q+qCC=q+qC
C(1−q)=qC(1-q)=q
C=qpC=\frac qp

이다.

따라서 기하분포의 기대값은

E(X)=qp=1−ppE(X)=\frac qp=\frac{1-p}{p}

이다.

핵심 직관: 첫 번째 시행이 실패하면 이미 실패 1회를 세고, 이후에는 원래 문제와 동일한 상황이 다시 시작된다.

0개의 댓글