기댓값·분산·공분산·상관계수 기초|AI를 위한 확률과 통계 정리

궁금하면 500원·2026년 9월 17일

AI 미생지능

목록 보기
139/139

확률분포를 보면 값이 어떻게 퍼져 있는지는 알 수 있지만, 분포 전체를 매번 그래프로 비교하기는 어렵다.
그래서 확률과 통계에서는 분포의 특징을 몇 개의 숫자로 요약한다.

  • 중심은 어디인가: 기댓값
  • 얼마나 퍼져 있는가: 분산과 표준편차
  • 두 변수가 함께 움직이는가: 공분산과 상관계수
  • 다른 변수를 알았을 때 평균이 어떻게 달라지는가: 조건부 기댓값

이번 글에서는 위 개념을 수식 암기보다 의미와 연결 관계를 중심으로 정리한다.


1. 확률을 반영한 평균 기댓값

기댓값은 확률변수를 여러 번 관찰했을 때 장기적으로 기대되는 평균이다.
단순히 값을 더해 개수로 나누는 것이 아니라, 각 값이 발생할 확률을 가중치로 사용한다.

이산확률변수

확률변수 XX가 x1,x2,…x_1,x_2,\ldots의 값을 가질 때,

E[X]=∑xx pX(x)E[X]=\sum_x x\,p_X(x)

예를 들어 XX가 1, 2, 3을 각각 0.20.2, 0.50.5, 0.30.3의 확률로 가진다면,

E[X]=1(0.2)+2(0.5)+3(0.3)=2.1E[X]=1(0.2)+2(0.5)+3(0.3)=2.1

기댓값 2.1은 반드시 실제로 관측되는 값일 필요는 없다. 반복 관찰의 평균이 2.1에 가까워진다는 의미다.

연속확률변수

연속확률변수에서는 합 대신 적분을 사용한다.

E[X]=∫−∞∞xfX(x) dxE[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx

여기서 fX(x)f_X(x)는 확률밀도함수다.
적분기호 ∫\int는 매우 작은 구간의 값들을 모두 더한다는 뜻으로 받아들이면 된다.

확률변수의 함수에 대한 기댓값

XX 자체가 아니라 g(X)g(X)의 평균을 구할 수도 있다.

E[g(X)]=∫−∞∞g(x)fX(x) dxE[g(X)]=\int_{-\infty}^{\infty}g(x)f_X(x)\,dx

이산형이라면 다음과 같다.

E[g(X)]=∑xg(x)pX(x)E[g(X)]=\sum_x g(x)p_X(x)

기댓값의 선형성

상수 a,ba,b와 확률변수 X,YX,Y에 대해,

E[aX+bY]=aE[X]+bE[Y]E[aX+bY]=aE[X]+bE[Y]

이 성질은 XX와 YY가 독립이 아니어도 성립한다. 기댓값 계산에서 가장 자주 사용하는 성질 중 하나다.


2. 결합분포에서의 기댓값

두 확률변수 X,YX,Y를 함께 다룰 때는 결합확률분포를 사용한다.

연속확률변수에서 함수 g(X,Y)g(X,Y)의 기댓값은 다음과 같다.

E[g(X,Y)]=∫−∞∞∫−∞∞g(x,y)fX,Y(x,y) dx dyE[g(X,Y)] =\int_{-\infty}^{\infty}\int_{-\infty}^{\infty} g(x,y)f_{X,Y}(x,y)\,dx\,dy

특히 g(X,Y)=XYg(X,Y)=XY이면,

E[XY]=∫−∞∞∫−∞∞xyfX,Y(x,y) dx dyE[XY] =\int_{-\infty}^{\infty}\int_{-\infty}^{\infty} xyf_{X,Y}(x,y)\,dx\,dy

이 E[XY]E[XY]는 뒤에서 공분산을 계산할 때 사용한다.


3. 평균에서 얼마나 퍼져 있는 분산

평균만으로는 데이터의 모양을 충분히 설명할 수 없다.
평균이 같은 두 데이터도 하나는 평균 근처에 모이고, 다른 하나는 넓게 퍼질 수 있다.

분산은 값들이 평균으로부터 얼마나 떨어져 있는지를 제곱해 평균낸 값이다.

Var⁡(X)=E[(X−E[X])2]\operatorname{Var}(X)=E[(X-E[X])^2]

μ=E[X]\mu=E[X]라고 쓰면 다음과 같다.

Var⁡(X)=E[(X−μ)2]\operatorname{Var}(X)=E[(X-\mu)^2]

계산할 때는 아래 형태도 자주 사용한다.

Var⁡(X)=E[X2]−(E[X])2\operatorname{Var}(X)=E[X^2]-(E[X])^2

간단한 예시

X={2,4,6}X=\{2,4,6\}이고 각 값의 확률이 모두 1/31/3이라고 하자.

평균은

E[X]=2+4+63=4E[X]=\frac{2+4+6}{3}=4

분산은

Var⁡(X)=(2−4)2+(4−4)2+(6−4)23=83\operatorname{Var}(X) =\frac{(2-4)^2+(4-4)^2+(6-4)^2}{3} =\frac{8}{3}

분산이 크면 값이 평균에서 넓게 퍼져 있고, 작으면 평균 근처에 모여 있다.


4. 표준편차: 분산을 원래 단위로 되돌리기

분산은 차이를 제곱하므로 단위도 제곱된다.
이를 원래 단위로 되돌리기 위해 분산에 제곱근을 취한다.

σX=Var⁡(X)\sigma_X=\sqrt{\operatorname{Var}(X)}

이 값을 표준편차라고 한다.

예를 들어 키를 cm로 측정했다면 분산의 단위는 cm2cm^2이지만 표준편차는 다시 cm가 된다.
그래서 실제 데이터의 퍼짐 정도를 해석할 때는 분산보다 표준편차가 직관적이다.


5. 두 변수가 함께 움직이는 방향 공분산

공분산은 두 확률변수 X,YX,Y가 평균을 기준으로 함께 움직이는지를 나타낸다.

Cov⁡(X,Y)=E[(X−E[X])(Y−E[Y])]\operatorname{Cov}(X,Y) =E[(X-E[X])(Y-E[Y])]

계산식으로 전개하면,

Cov⁡(X,Y)=E[XY]−E[X]E[Y]\operatorname{Cov}(X,Y)=E[XY]-E[X]E[Y]

공분산의 부호는 다음처럼 해석한다.

공분산의미
양수XX가 커질 때 YY도 커지는 경향
음수XX가 커질 때 YY는 작아지는 경향
0선형적인 동조 경향이 없음

주의할 점은 공분산이 0이라고 해서 반드시 독립은 아니라는 것이다.
두 변수 사이에 비선형 관계가 존재할 수도 있다.

같은 변수를 두 번 넣으면 공분산은 분산이 된다.

Cov⁡(X,X)=Var⁡(X)\operatorname{Cov}(X,X)=\operatorname{Var}(X)

6. 공분산을 비교 가능한 값으로 표준화 상관계수 하기

공분산은 변수의 단위와 크기에 영향을 받는다.
키를 cm로 재느냐 m로 재느냐에 따라 값이 달라지므로 서로 다른 데이터의 관계를 직접 비교하기 어렵다.

상관계수는 공분산을 각 변수의 표준편차로 나누어 단위를 제거한다.

ρX,Y=Cov⁡(X,Y)σXσY=Cov⁡(X,Y)Var⁡(X)Var⁡(Y)\rho_{X,Y} =\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y} =\frac{\operatorname{Cov}(X,Y)} {\sqrt{\operatorname{Var}(X)\operatorname{Var}(Y)}}

상관계수의 범위는 다음과 같다.

−1≤ρX,Y≤1-1\le\rho_{X,Y}\le1
상관계수일반적인 해석
1에 가까움강한 양의 선형관계
0에 가까움선형관계가 약함
-1에 가까움강한 음의 선형관계

상관계수는 선형관계를 측정한다.
ρ=0\rho=0이어도 곡선 형태의 관계가 있을 수 있으며, 상관관계가 높다고 해서 한 변수가 다른 변수의 원인이라는 뜻도 아니다.


7. 독립과 무상관은 다르다

XX와 YY가 독립이면 결합분포가 주변분포의 곱으로 분해된다.

fX,Y(x,y)=fX(x)fY(y)f_{X,Y}(x,y)=f_X(x)f_Y(y)

독립이고 필요한 기댓값이 존재하면,

E[XY]=E[X]E[Y]E[XY]=E[X]E[Y]

따라서

Cov⁡(X,Y)=0\operatorname{Cov}(X,Y)=0

즉, 일반적으로 다음 방향은 성립한다.

독립⇒공분산 0\text{독립}\Rightarrow\text{공분산 0}

그러나 역방향은 일반적으로 성립하지 않는다.

공분산 0⇏독립\text{공분산 0}\nRightarrow\text{독립}

예를 들어 XX가 −1,0,1-1,0,1을 각각 같은 확률로 가지고 Y=X2Y=X^2라고 하자. YY는 XX에 의해 완전히 결정되므로 두 변수는 독립이 아니다.
하지만 대칭성 때문에 E[XY]=E[X3]=0E[XY]=E[X^3]=0이고 E[X]=0E[X]=0이므로 공분산은 0이다.

단, X,YX,Y가 공동 정규분포를 따른다는 추가 조건이 있으면 공분산 0에서 독립을 결론 내릴 수 있다.


8. 조건부 기댓값

조건부 기댓값은 YY에 대한 정보를 알고 있을 때 XX의 평균이 어떻게 달라지는지를 나타낸다.

연속확률변수에서는

E[X∣Y=y]=∫−∞∞xfX∣Y(x∣y) dxE[X\mid Y=y] =\int_{-\infty}^{\infty}x f_{X\mid Y}(x\mid y)\,dx

이산확률변수에서는

E[X∣Y=y]=∑xxpX∣Y(x∣y)E[X\mid Y=y] =\sum_x x p_{X\mid Y}(x\mid y)

yy를 특정 값으로 고정하지 않으면 E[X∣Y]E[X\mid Y]는 YY의 값에 따라 결과가 달라지는 확률변수다.

전체기댓값의 법칙

조건부 기댓값을 다시 평균내면 원래 기댓값을 얻는다.

E[X]=E[E[X∣Y]]E[X]=E[E[X\mid Y]]

이를 전체기댓값의 법칙 또는 반복기댓값의 법칙이라고 한다.

전체분산의 법칙

전체 분산은 조건 안에서 남는 불확실성과 조건에 따라 평균이 달라지는 불확실성으로 나눌 수 있다.

Var⁡(X)=E[Var⁡(X∣Y)]+Var⁡(E[X∣Y])\operatorname{Var}(X) =E[\operatorname{Var}(X\mid Y)] +\operatorname{Var}(E[X\mid Y])

쉽게 말하면 다음 두 부분의 합이다.

  1. 같은 YY 안에서도 XX가 흔들리는 정도
  2. YY가 달라질 때 XX의 평균 자체가 흔들리는 정도

9. 표본, i.i.d.와 경험분포

확률분포 pX(x)p_X(x)에서 데이터를 NN개 뽑았다고 하자.

x(1),x(2),…,x(N)x^{(1)},x^{(2)},\ldots,x^{(N)}

각 데이터가 서로 독립이고 같은 분포에서 추출되었다면 independent and identically distributed 표본이라고 한다.

  • independent: 서로 독립
  • identically distributed: 모두 같은 분포를 따름

표본평균은 다음과 같다.

xˉ=1N∑i=1Nx(i)\bar{x}=\frac{1}{N}\sum_{i=1}^{N}x^{(i)}

표본 수가 충분히 커지고 적절한 조건이 충족되면 표본평균은 모집단의 기댓값에 가까워진다.

xˉ⟶E[X]\bar{x}\longrightarrow E[X]

이것이 큰 수의 법칙이 전달하는 핵심이다.

경험분포

관측된 표본에 같은 가중치 1/N1/N을 주면 경험분포를 만들 수 있다.

p^N(x)=1N∑i=1Nδ(x−x(i))\hat p_N(x) =\frac{1}{N}\sum_{i=1}^{N}\delta(x-x^{(i)})

이 식은 관측된 각 위치에 확률질량 1/N1/N씩 놓았다는 의미다.
그러면 경험분포 아래에서 계산한 평균은 표본평균이 된다.

∫−∞∞xp^N(x) dx=1N∑i=1Nx(i)\int_{-\infty}^{\infty}x\hat p_N(x)\,dx =\frac{1}{N}\sum_{i=1}^{N}x^{(i)}

10. 디랙 델타 함수

디랙 델타는 일반적인 함수라기보다 적분 안에서 특정 위치의 값을 골라내는 수학적 도구다.

핵심 성질은 다음과 같다.

δ(x−a)=0(x≠a)\delta(x-a)=0\qquad(x\ne a)
∫−∞∞δ(x−a) dx=1\int_{-\infty}^{\infty}\delta(x-a)\,dx=1
∫−∞∞g(x)δ(x−a) dx=g(a)\int_{-\infty}^{\infty}g(x)\delta(x-a)\,dx=g(a)

마지막 성질을 샘플링 성질이라고 한다.
델타 함수가 x=ax=a 위치에 있는 g(a)g(a)를 집어낸다고 이해하면 된다.

확률변수 XX가 항상 3이라는 값만 가진다면 이를 형식적으로 다음과 같이 표현할 수 있다.

fX(x)=δ(x−3)f_X(x)=\delta(x-3)

11. 가우시안 확률변수

가우시안 분포 또는 정규분포는 평균 주변에 값이 많이 모이고 멀어질수록 밀도가 작아지는 종 모양 분포다.

X∼N(μ,σ2)X\sim\mathcal N(\mu,\sigma^2)

확률밀도함수는 다음과 같다.

fX(x)=12πσ2exp⁡(−(x−μ)22σ2)f_X(x) =\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)
  • μ\mu: 분포의 중심인 평균
  • σ2\sigma^2: 퍼짐 정도를 나타내는 분산
  • σ\sigma: 표준편차

평균은 그래프의 중심을 옮기고, 분산은 그래프가 얼마나 넓거나 좁게 퍼지는지를 결정한다.


12. AI와 강화학습에서 왜 필요한가

이 개념들은 단순한 수학 장식이 아니다.

손실과 보상의 평균

머신러닝은 데이터 전체에 대한 평균 손실을 최소화한다.

min⁡θE[L(θ;X,Y)]\min_\theta E[L(\theta;X,Y)]

강화학습의 가치함수도 미래 누적 보상의 조건부 기댓값이다.

Vπ(s)=Eπ[Gt∣St=s]V^\pi(s)=E_\pi[G_t\mid S_t=s]

불확실성 측정

분산과 표준편차는 모델의 예측이나 보상이 얼마나 불안정한지를 나타낸다.
평균 보상이 같아도 분산이 크면 결과의 변동성이 크다.

변수 관계 분석

공분산과 상관계수는 입력 특성들이 함께 움직이는지 확인하는 데 사용한다.
다만 높은 상관관계만 보고 원인과 결과를 단정해서는 안 된다.

실제 데이터로 모집단 추정

현실에서는 전체 분포를 알 수 없으므로 표본을 수집하고 표본평균과 경험분포로 모집단의 특성을 추정한다.
모델 학습도 결국 유한한 표본을 이용해 보지 못한 데이터의 분포를 추정하는 과정이다.


13. 핵심 수식 한 번에 정리

개념수식의미
기댓값E[X]E[X]확률을 반영한 평균
분산E[(X−E[X])2]E[(X-E[X])^2]평균에서 퍼진 정도
표준편차Var⁡(X)\sqrt{\operatorname{Var}(X)}원래 단위로 본 퍼짐
공분산E[XY]−E[X]E[Y]E[XY]-E[X]E[Y]두 변수의 공동 변화 방향
상관계수Cov⁡(X,Y)σXσY\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y}표준화된 선형관계
조건부 기댓값E[X∣Y=y]E[X\mid Y=y]Y=yY=y를 알 때의 XX 평균
표본평균1N∑ix(i)\frac1N\sum_i x^{(i)}관측 데이터의 평균

마무리

확률분포는 불확실성을 전체 모양으로 표현하고, 기댓값과 분산은 그 분포의 중심과 퍼짐을 요약한다.
공분산과 상관계수는 두 변수의 관계를 살피고, 조건부 기댓값은 새로운 정보가 주어졌을 때 평균이 어떻게 달라지는지를 보여준다.

학습 순서는 다음처럼 잡으면 된다.

평균
→ 기댓값
→ 분산과 표준편차
→ 결합분포
→ 공분산
→ 상관계수
→ 조건부 기댓값
→ 표본과 경험분포

수식을 처음부터 암기할 필요는 없다.
각 수식이 무엇을 더하고, 무엇과 비교하며, 결과가 무엇을 뜻하는지 말로 설명할 수 있으면 제대로 이해하기 시작한 것이다.

profile
레거시를 이해하면서도 새로운 기술을 현실적으로 적용할 수 있는 백엔드 개발자가 되는 것이 목표입니다.

0개의 댓글