
확률분포를 보면 값이 어떻게 퍼져 있는지는 알 수 있지만, 분포 전체를 매번 그래프로 비교하기는 어렵다.
그래서 확률과 통계에서는 분포의 특징을 몇 개의 숫자로 요약한다.
- 중심은 어디인가: 기댓값
- 얼마나 퍼져 있는가: 분산과 표준편차
- 두 변수가 함께 움직이는가: 공분산과 상관계수
- 다른 변수를 알았을 때 평균이 어떻게 달라지는가: 조건부 기댓값
이번 글에서는 위 개념을 수식 암기보다 의미와 연결 관계를 중심으로 정리한다.
1. 확률을 반영한 평균 기댓값
기댓값은 확률변수를 여러 번 관찰했을 때 장기적으로 기대되는 평균이다.
단순히 값을 더해 개수로 나누는 것이 아니라, 각 값이 발생할 확률을 가중치로 사용한다.
이산확률변수
확률변수 X가 x1,x2,…의 값을 가질 때,
E[X]=x∑xpX(x)
예를 들어 X가 1, 2, 3을 각각 0.2, 0.5, 0.3의 확률로 가진다면,
E[X]=1(0.2)+2(0.5)+3(0.3)=2.1
기댓값 2.1은 반드시 실제로 관측되는 값일 필요는 없다. 반복 관찰의 평균이 2.1에 가까워진다는 의미다.
연속확률변수
연속확률변수에서는 합 대신 적분을 사용한다.
E[X]=∫−∞∞xfX(x)dx
여기서 fX(x)는 확률밀도함수다.
적분기호 ∫는 매우 작은 구간의 값들을 모두 더한다는 뜻으로 받아들이면 된다.
확률변수의 함수에 대한 기댓값
X 자체가 아니라 g(X)의 평균을 구할 수도 있다.
E[g(X)]=∫−∞∞g(x)fX(x)dx
이산형이라면 다음과 같다.
E[g(X)]=x∑g(x)pX(x)
기댓값의 선형성
상수 a,b와 확률변수 X,Y에 대해,
E[aX+bY]=aE[X]+bE[Y]
이 성질은 X와 Y가 독립이 아니어도 성립한다. 기댓값 계산에서 가장 자주 사용하는 성질 중 하나다.
2. 결합분포에서의 기댓값
두 확률변수 X,Y를 함께 다룰 때는 결합확률분포를 사용한다.
연속확률변수에서 함수 g(X,Y)의 기댓값은 다음과 같다.
E[g(X,Y)]=∫−∞∞∫−∞∞g(x,y)fX,Y(x,y)dxdy
특히 g(X,Y)=XY이면,
E[XY]=∫−∞∞∫−∞∞xyfX,Y(x,y)dxdy
이 E[XY]는 뒤에서 공분산을 계산할 때 사용한다.
3. 평균에서 얼마나 퍼져 있는 분산
평균만으로는 데이터의 모양을 충분히 설명할 수 없다.
평균이 같은 두 데이터도 하나는 평균 근처에 모이고, 다른 하나는 넓게 퍼질 수 있다.
분산은 값들이 평균으로부터 얼마나 떨어져 있는지를 제곱해 평균낸 값이다.
Var(X)=E[(X−E[X])2]
μ=E[X]라고 쓰면 다음과 같다.
Var(X)=E[(X−μ)2]
계산할 때는 아래 형태도 자주 사용한다.
Var(X)=E[X2]−(E[X])2
간단한 예시
X={2,4,6}이고 각 값의 확률이 모두 1/3이라고 하자.
평균은
E[X]=32+4+6=4
분산은
Var(X)=3(2−4)2+(4−4)2+(6−4)2=38
분산이 크면 값이 평균에서 넓게 퍼져 있고, 작으면 평균 근처에 모여 있다.
4. 표준편차: 분산을 원래 단위로 되돌리기
분산은 차이를 제곱하므로 단위도 제곱된다.
이를 원래 단위로 되돌리기 위해 분산에 제곱근을 취한다.
σX=Var(X)
이 값을 표준편차라고 한다.
예를 들어 키를 cm로 측정했다면 분산의 단위는 cm2이지만 표준편차는 다시 cm가 된다.
그래서 실제 데이터의 퍼짐 정도를 해석할 때는 분산보다 표준편차가 직관적이다.
5. 두 변수가 함께 움직이는 방향 공분산
공분산은 두 확률변수 X,Y가 평균을 기준으로 함께 움직이는지를 나타낸다.
Cov(X,Y)=E[(X−E[X])(Y−E[Y])]
계산식으로 전개하면,
Cov(X,Y)=E[XY]−E[X]E[Y]
공분산의 부호는 다음처럼 해석한다.
| 공분산 | 의미 |
|---|
| 양수 | X가 커질 때 Y도 커지는 경향 |
| 음수 | X가 커질 때 Y는 작아지는 경향 |
| 0 | 선형적인 동조 경향이 없음 |
주의할 점은 공분산이 0이라고 해서 반드시 독립은 아니라는 것이다.
두 변수 사이에 비선형 관계가 존재할 수도 있다.
같은 변수를 두 번 넣으면 공분산은 분산이 된다.
Cov(X,X)=Var(X)
6. 공분산을 비교 가능한 값으로 표준화 상관계수 하기
공분산은 변수의 단위와 크기에 영향을 받는다.
키를 cm로 재느냐 m로 재느냐에 따라 값이 달라지므로 서로 다른 데이터의 관계를 직접 비교하기 어렵다.
상관계수는 공분산을 각 변수의 표준편차로 나누어 단위를 제거한다.
ρX,Y=σXσYCov(X,Y)=Var(X)Var(Y)Cov(X,Y)
상관계수의 범위는 다음과 같다.
−1≤ρX,Y≤1
| 상관계수 | 일반적인 해석 |
|---|
| 1에 가까움 | 강한 양의 선형관계 |
| 0에 가까움 | 선형관계가 약함 |
| -1에 가까움 | 강한 음의 선형관계 |
상관계수는 선형관계를 측정한다.
ρ=0이어도 곡선 형태의 관계가 있을 수 있으며, 상관관계가 높다고 해서 한 변수가 다른 변수의 원인이라는 뜻도 아니다.
7. 독립과 무상관은 다르다
X와 Y가 독립이면 결합분포가 주변분포의 곱으로 분해된다.
fX,Y(x,y)=fX(x)fY(y)
독립이고 필요한 기댓값이 존재하면,
E[XY]=E[X]E[Y]
따라서
Cov(X,Y)=0
즉, 일반적으로 다음 방향은 성립한다.
독립⇒공분산 0
그러나 역방향은 일반적으로 성립하지 않는다.
공분산 0⇏독립
예를 들어 X가 −1,0,1을 각각 같은 확률로 가지고 Y=X2라고 하자. Y는 X에 의해 완전히 결정되므로 두 변수는 독립이 아니다.
하지만 대칭성 때문에 E[XY]=E[X3]=0이고 E[X]=0이므로 공분산은 0이다.
단, X,Y가 공동 정규분포를 따른다는 추가 조건이 있으면 공분산 0에서 독립을 결론 내릴 수 있다.
8. 조건부 기댓값
조건부 기댓값은 Y에 대한 정보를 알고 있을 때 X의 평균이 어떻게 달라지는지를 나타낸다.
연속확률변수에서는
E[X∣Y=y]=∫−∞∞xfX∣Y(x∣y)dx
이산확률변수에서는
E[X∣Y=y]=x∑xpX∣Y(x∣y)
y를 특정 값으로 고정하지 않으면 E[X∣Y]는 Y의 값에 따라 결과가 달라지는 확률변수다.
전체기댓값의 법칙
조건부 기댓값을 다시 평균내면 원래 기댓값을 얻는다.
E[X]=E[E[X∣Y]]
이를 전체기댓값의 법칙 또는 반복기댓값의 법칙이라고 한다.
전체분산의 법칙
전체 분산은 조건 안에서 남는 불확실성과 조건에 따라 평균이 달라지는 불확실성으로 나눌 수 있다.
Var(X)=E[Var(X∣Y)]+Var(E[X∣Y])
쉽게 말하면 다음 두 부분의 합이다.
- 같은 Y 안에서도 X가 흔들리는 정도
- Y가 달라질 때 X의 평균 자체가 흔들리는 정도
9. 표본, i.i.d.와 경험분포
확률분포 pX(x)에서 데이터를 N개 뽑았다고 하자.
x(1),x(2),…,x(N)
각 데이터가 서로 독립이고 같은 분포에서 추출되었다면 independent and identically distributed 표본이라고 한다.
- independent: 서로 독립
- identically distributed: 모두 같은 분포를 따름
표본평균은 다음과 같다.
xˉ=N1i=1∑Nx(i)
표본 수가 충분히 커지고 적절한 조건이 충족되면 표본평균은 모집단의 기댓값에 가까워진다.
xˉ⟶E[X]
이것이 큰 수의 법칙이 전달하는 핵심이다.
경험분포
관측된 표본에 같은 가중치 1/N을 주면 경험분포를 만들 수 있다.
p^N(x)=N1i=1∑Nδ(x−x(i))
이 식은 관측된 각 위치에 확률질량 1/N씩 놓았다는 의미다.
그러면 경험분포 아래에서 계산한 평균은 표본평균이 된다.
∫−∞∞xp^N(x)dx=N1i=1∑Nx(i)
10. 디랙 델타 함수
디랙 델타는 일반적인 함수라기보다 적분 안에서 특정 위치의 값을 골라내는 수학적 도구다.
핵심 성질은 다음과 같다.
δ(x−a)=0(x=a)
∫−∞∞δ(x−a)dx=1
∫−∞∞g(x)δ(x−a)dx=g(a)
마지막 성질을 샘플링 성질이라고 한다.
델타 함수가 x=a 위치에 있는 g(a)를 집어낸다고 이해하면 된다.
확률변수 X가 항상 3이라는 값만 가진다면 이를 형식적으로 다음과 같이 표현할 수 있다.
fX(x)=δ(x−3)
11. 가우시안 확률변수
가우시안 분포 또는 정규분포는 평균 주변에 값이 많이 모이고 멀어질수록 밀도가 작아지는 종 모양 분포다.
X∼N(μ,σ2)
확률밀도함수는 다음과 같다.
fX(x)=2πσ21exp(−2σ2(x−μ)2)
- μ: 분포의 중심인 평균
- σ2: 퍼짐 정도를 나타내는 분산
- σ: 표준편차
평균은 그래프의 중심을 옮기고, 분산은 그래프가 얼마나 넓거나 좁게 퍼지는지를 결정한다.
12. AI와 강화학습에서 왜 필요한가
이 개념들은 단순한 수학 장식이 아니다.
손실과 보상의 평균
머신러닝은 데이터 전체에 대한 평균 손실을 최소화한다.
θminE[L(θ;X,Y)]
강화학습의 가치함수도 미래 누적 보상의 조건부 기댓값이다.
Vπ(s)=Eπ[Gt∣St=s]
불확실성 측정
분산과 표준편차는 모델의 예측이나 보상이 얼마나 불안정한지를 나타낸다.
평균 보상이 같아도 분산이 크면 결과의 변동성이 크다.
변수 관계 분석
공분산과 상관계수는 입력 특성들이 함께 움직이는지 확인하는 데 사용한다.
다만 높은 상관관계만 보고 원인과 결과를 단정해서는 안 된다.
실제 데이터로 모집단 추정
현실에서는 전체 분포를 알 수 없으므로 표본을 수집하고 표본평균과 경험분포로 모집단의 특성을 추정한다.
모델 학습도 결국 유한한 표본을 이용해 보지 못한 데이터의 분포를 추정하는 과정이다.
13. 핵심 수식 한 번에 정리
| 개념 | 수식 | 의미 |
|---|
| 기댓값 | E[X] | 확률을 반영한 평균 |
| 분산 | E[(X−E[X])2] | 평균에서 퍼진 정도 |
| 표준편차 | Var(X) | 원래 단위로 본 퍼짐 |
| 공분산 | E[XY]−E[X]E[Y] | 두 변수의 공동 변화 방향 |
| 상관계수 | σXσYCov(X,Y) | 표준화된 선형관계 |
| 조건부 기댓값 | E[X∣Y=y] | Y=y를 알 때의 X 평균 |
| 표본평균 | N1∑ix(i) | 관측 데이터의 평균 |
마무리
확률분포는 불확실성을 전체 모양으로 표현하고, 기댓값과 분산은 그 분포의 중심과 퍼짐을 요약한다.
공분산과 상관계수는 두 변수의 관계를 살피고, 조건부 기댓값은 새로운 정보가 주어졌을 때 평균이 어떻게 달라지는지를 보여준다.
학습 순서는 다음처럼 잡으면 된다.
평균
→ 기댓값
→ 분산과 표준편차
→ 결합분포
→ 공분산
→ 상관계수
→ 조건부 기댓값
→ 표본과 경험분포
수식을 처음부터 암기할 필요는 없다.
각 수식이 무엇을 더하고, 무엇과 비교하며, 결과가 무엇을 뜻하는지 말로 설명할 수 있으면 제대로 이해하기 시작한 것이다.