누적분포함수 (CDF)
누적분포함수는 모든 확률변수에 대해 정의된다.
F(x)=P(X≤x)
즉, x 이하의 값을 가질 확률을 누적해서 나타낸 함수이다.
이산확률변수에서의 CDF
이산확률변수의 CDF는 계단함수 형태로 나타난다.
- 각 점에서 위로 점프한다.
- 점프의 높이 = 해당 값의 확률질량함수(PMF)
- 따라서 PMF를 모두 더하면 CDF가 되고, CDF의 점프 높이를 보면 PMF를 알 수 있다.
예를 들어 X가 0,1,2,3의 값을 가진다면
- x=0에서의 점프 높이 → P(X=0)
- x=1에서의 점프 높이 → P(X=1)
- x=2에서의 점프 높이 → P(X=2)
- x=3에서의 점프 높이 → P(X=3)
CDF는 왼쪽에서 오른쪽으로 갈수록 확률을 계속 누적하기 때문에 감소할 수 없다.
구간의 확률
CDF를 이용하면 구간의 확률을 구할 수 있다.
P(a<X≤b)=F(b)−F(a)
즉, b까지 누적된 확률에서 a까지 누적된 확률을 빼면 a와 b 사이의 확률이 남는다.
단, 이산확률변수에서는 <와 ≤의 차이에 주의해야 한다. 연속확률변수에서는 한 점에서의 확률이 0이므로 이 차이가 중요하지 않다.
CDF의 3가지 성질
-
단조 증가
- x가 커질수록 F(x)는 감소하지 않는다.
-
우연속(right-continuous)
- 어떤 점에서 오른쪽으로 접근하면 함수값이 그 점의 함수값으로 수렴한다.
- 이산확률변수의 계단함수에서는 점프한 뒤의 값이 그 점의 값이다.
-
양끝에서의 극한
- x→−∞이면 F(x)→0
- x→∞이면 F(x)→1
이 세 성질을 만족하는 함수는 유효한 CDF가 된다.
확률변수의 독립성
확률변수 X,Y가 독립이라는 것은 X의 값을 알아도 Y에 대한 정보를 얻을 수 없다는 것이다.
모든 x,y에 대해
P(X≤x,Y≤y)=P(X≤x)P(Y≤y)
왼쪽은 X,Y를 동시에 고려하는 확률이므로 결합누적분포함수(Joint CDF) 라고 한다.
이산확률변수
이산확률변수에서는 CDF보다 결합확률질량함수(Joint PMF) 를 사용하는 것이 편리하다.
독립이라면
P(X=x,Y=y)=P(X=x)P(Y=y)
즉, X=x라는 정보가 Y=y의 확률에 영향을 주지 않는다.
평균과 기대값
일반적으로 아무 설명 없이 average라고 하면 mean(평균값) 을 의미한다.
평균에는 여러 종류가 있다.
- mean: 평균값
- median: 중간값
- mode: 최빈값
- weighted average: 가중평균
평균은 단순히 숫자들의 합을 숫자의 개수로 나눈 것이다.
mean=개수전체 합
평균은 복잡한 분포를 하나의 숫자로 요약하여 분포의 중심을 나타낸다.
하지만 평균만으로는 분포가 얼마나 퍼져 있는지 알 수 없기 때문에 이후 분산, 표준편차 등 산포도(measures of variability) 를 사용한다.
등차수열의 평균
1,2,3,4,5,6의 평균은 3.5이다.
등차수열에서는 전체를 모두 더하지 않아도 첫 번째 값과 마지막 값의 평균으로 전체 평균을 구할 수 있다.
따라서 1부터 n까지의 평균은 21+n이고, 합은 2n(n+1)이다.
가우스의 1부터 100까지의 합 계산처럼, 양 끝의 숫자를 묶으면 각 쌍의 합이 동일해진다는 원리를 이용할 수 있다.
- 1+100=101
- 2+99=101
- 3+98=101
- ...
- 총 50쌍
따라서 101×50=5050이다.
등차수열과 등비수열
- 등차수열: 일정한 값을 계속 더함
- 등비수열: 일정한 값을 계속 곱함
가중평균 (Weighted Average)
같은 숫자가 여러 번 반복된다면 숫자를 그룹으로 묶어 가중평균으로 계산할 수 있다.
예를 들어
라면 총 8개의 숫자가 있다.
각 값에 해당 값이 전체에서 차지하는 비율을 가중치로 부여하면
85(1)+82(3)+81(5)
가 된다.
여기서
85+82+81=1
이다.
즉, 가중치는 음수가 아니며 전체 가중치의 합은 1이다.
반대로 모든 숫자에 동일하게 1/n의 가중치를 주면 비가중평균(unweighted average) 이 된다.
핵심: 반복되는 숫자를 그룹으로 묶고, 각 숫자가 전체에서 차지하는 비율을 가중치로 주어 평균을 구할 수 있다.
확률변수의 평균 = 기대값
이제 가중평균을 확률변수에 적용한다.
이산확률변수 X의 평균은 기대값(Expected Value) 이라고 하며 E(X)로 표현한다.
E(X)=x∑xP(X=x)
여기서
- x → 확률변수가 가질 수 있는 값
- P(X=x) → 그 값이 나올 확률 = 가중치
즉, 확률변수의 기대값은 확률을 가중치로 사용하는 가중평균이다.
가능한 값이 유한 개라면 유한합이고, 셀 수 있는 무한 개라면 무한합으로 계산한다.
베르누이 분포의 기대값
X∼Bern(p)라고 하자.
베르누이 확률변수는
- 성공 → 1, 확률 p
- 실패 → 0, 확률 1−p
를 가진다.
따라서
E(X)=1⋅P(X=1)+0⋅P(X=0)=p
즉,
X∼Bern(p)⇒E(X)=p
지시확률변수 (Indicator Random Variable)
관심 있는 사건 A가 있을 때
X=IA={10A가 발생A가 발생하지 않음
처럼 정의한 확률변수를 지시확률변수라고 한다.
지시확률변수는 0 또는 1, 즉 A가 발생 안한다, 한다이기에 결국 베르누이 확률변수이므로
E(IA)=P(A)
이다.
즉, 지시확률변수의 기대값은 해당 사건의 확률과 같다.
이를 강의에서는 Fundamental Bridge라고 부른다.
확률 P(A)를 구하는 문제를 지시확률변수의 기대값 E(IA)를 구하는 문제로 바꿀 수 있다.
이항분포의 기대값
X∼Bin(n,p)라면
E(X)=k=0∑nkP(X=k)
이항분포의 PMF를 대입하면
E(X)=k=0∑nk(kn)pkqn−k
이고, 조합식의 성질
k(kn)=n(k−1n−1)
을 이용한 뒤 이항정리를 적용하면
E(X)=k=0∑nk(kn)pkqn−k=k=1∑nn(k−1n−1)pkqn−k=npk=1∑n(k−1n−1)pk−1qn−k=npj=0∑n−1(jn−1)pjqn−j−1=np
를 얻는다.
하지만 더 중요한 방법은 선형성을 이용하는 것이다.
기대값의 선형성 (Linearity)
기대값에서 가장 중요한 성질 중 하나이다.
E(X+Y)=E(X)+E(Y)
특히 중요한 점은 X,Y가 서로 의존하더라도 항상 성립한다는 것이다.
또한 상수 c에 대해서
E(cX)=cE(X)
가 성립한다.
따라서
E(cX+dY)=cE(X)+dE(Y)
처럼 사용할 수 있다.
이항분포에 적용
이항분포는 독립적인 베르누이 확률변수 n개의 합으로 생각할 수 있다.
X=X1+X2+⋯+Xn
각 Xi∼Bern(p)이므로 E(Xi)=p이다.
선형성에 의해 E(X)=E(X1)+⋯+E(Xn)=np 이다.
따라서 이항분포의 기대값은 매우 쉽게 E(X)=np가 된다.
초기하분포의 기대값
초기하분포는 비복원추출이므로 각 시행이 서로 의존한다.
예를 들어 52장의 카드에서 5장을 뽑고 X를 에이스의 개수라고 하자.
각 카드가 에이스인지 나타내는 지시확률변수를 Xj=I(j번째 카드가 에이스)라고 하면 X=X1+X2+⋯+X5이다.
선형성에 의해 E(X)=E(X1)+⋯+E(X5)가 된다.
각 카드의 위치는 대칭적이므로, 어느 위치의 카드든 에이스일 확률은 동일하게 4/52=1/13이다.
따라서
E(X)=5⋅131=135
여기서 중요한 점
X1,…,X5는 서로 독립이 아니다.
예를 들어 앞의 4장이 모두 에이스라면 5번째 카드가 에이스일 수 없다.
하지만 기대값의 선형성에는 독립성이 필요하지 않다.
따라서
지시확률변수 + 선형성 + 대칭성 + Fundamental Bridge
를 이용하면 복잡한 초기하분포의 기대값도 쉽게 계산할 수 있다.
일반적으로 초기하분포에서도 E(X)=n×(한 번 뽑은 대상이 원하는 속성을 가질 확률)과 같은 형태로 생각할 수 있다.
기하분포 (Geometric Distribution)
기하분포는 독립적인 베르누이 시행을 성공할 때까지 반복하는 상황에서 사용한다.
X∼Geom(p)에서 강의의 정의는 첫 번째 성공이 나오기 전까지의 실패 횟수이다.
따라서 성공 자체는 횟수에 포함하지 않는다.
예를 들어 FFFFFS라면 첫 성공 전까지 실패가 5번이므로 X=5이다.
실패확률을 q=1−p라고 하면 X=k가 되려면 FFF...FFS처럼 정확히 k번 실패한 뒤 성공해야 한다.
따라서 P(X=k)=qkp, k=0,1,2,…이다.
기하분포 PMF가 유효한 이유
PMF가 유효하려면
- 확률이 음수가 아니어야 한다.
- 모든 확률의 합이 1이어야 한다.
확률의 합은
k=0∑∞pqk=pk=0∑∞qk
이고 무한등비급수의 합은
k=0∑∞qk=1−q1
이므로
p1−q1=pp1=1
이다.
따라서 유효한 PMF이다.
기하분포의 기대값
정의에 따라
E(X)=k=0∑∞kP(X=k)=k=0∑∞kpqk
이다.
방법 1: 미분을 이용
무한등비급수
k=0∑∞qk=1−q1
를 q에 대해 미분하면
k=1∑∞kqk−1=(1−q)21
양변에 q를 곱하면
k=1∑∞kqk=(1−q)2q=p2q
따라서
E(X)=pk=1∑∞kqk=pp2q=pq
즉,
E(X)=p1−p
이다.
기하분포 기대값의 직관적 계산
미분을 사용하지 않고도 구할 수 있다.
기대값을 C=E(X)라고 하자.
첫 번째 시행에서
- 성공: 확률 p, 실패 횟수는 0
- 실패: 확률 q, 이미 실패가 1번 발생했고 이후에는 처음과 똑같은 문제가 다시 시작됨
따라서
C=0⋅p+q(1+C)
이고 이를 풀면
이다.
따라서 기하분포의 기대값은
E(X)=pq=p1−p
이다.
핵심 직관: 첫 번째 시행이 실패하면 이미 실패 1회를 세고, 이후에는 원래 문제와 동일한 상황이 다시 시작된다.