이 글에서는 확률론과 확률변수에 대해 정리해보고자 한다.
단순사건과 확률질량함수
- 유한 개의 사건이 존재하는 경우 각 단순사건에 대한 확률만 정의하는 함수를 확률질량함수 ( probability mass fucntion ) 라고 한다.
- 확률질량함수는 소문자 p로 표시한다. 확률과 확률질량함수는 다른 개념이라는 점을 주의한다.
p(a)p(1)p(1,2)=P({a})=P({1})=0.2=P({1,2})=0.3
누적분포함수
- 무한 개의 사건이 존재하는 경우 시작점을 모두 똑같이 음의 무한대 (−∞)로 통일한 특수한 구간 Sx을 사용한다.
S−1S0S1Sx={−∞<X≤−1}={−∞<X≤0}={−∞<X≤1}⋮={−∞<X≤x}
- 이러한 사건의 확률분포를 묘사하는 함수를 누적분포함수(cumulative distribution function)라고 하고 약자로 cdf라고 쓴다.
- 함수 기호로는 F(x), 독립변수 x는 구간의 끝점을 뜻한다.
F(x)ifa<x≤P(−∞,b)F(b)P(a,b)=P(Sx)=P({X<x})b:=P(−∞,a)+P(a,b)=F(a)+P(a,b)=F(b)−F(a)
확률밀도함수
- 누적분포함수는 분포의 형상을 직관적으로 이해하기 힘든 단점이 있다.
- 전체구간 (−∞∼∞)을 아주 작은 폭 dx를 가지는 구간들로 나눈 다음 각 구간의 확률을 살펴보는 것이 편리하다.
P({x1<x≤x1+dx})=F(x1+dx)−F(x1)
- 단위구간이 미세하게 줄어들면 누적분포함수의 기울기가 된다.
dx→0limdxF(x1+dx)−F(x1)
- 누적분포함수를 미분하여 구한 도함수를 확률밀도함수 ( probability density function )라고 한다.
확률질량함수와 마찬가지로 p(x)로 표기한다.
그 값 자체가 확률은 아니고 상대적인 값이다.
p(x)=dxdF(x)
p(x)의 p가 이전 글의 p 와 의미가 같은 듯 하다.
아래에도 다시 등장한다.
누적분포함수와 확률밀도함수의 관계
F(x2)−F(x1)=∫x1x2p(u)duF(x)=∫−∞xdudF(u)du=∫−∞xp(u)du
F(∞)=1이다. 즉, ∫−∞∞p(x)dx=1이다.
결합확률과 조건부 확률
-
결합확률 ( joint probability )은 사건 A와 B가 동시에 발생할 확률이다.
-
결합되지 않는 개별 사건의 확률을 주변확률 ( mariginal probability ) 라고 한다.
-
B가 사실일 경우의 사건 A에 대한 확률을 사건 B에 대한 사건 A의 조건부확률 ( conditional probability )이라고 한다.
p(A∩B)orP(A,B)P(A)P(B)P(A∣B)=P(B)P(A,B)
-
A와 B가 독립인 경우
P(A,B)=P(A)P(B)P(A∣B)=P(B)P(A,B)=P(B)P(A)P(B)=P(A)
-
결합확률의 정의 바꿔쓰기
P(A,B)=P(A∣B)P(B)
베이즈 정리
P(A,B)=P(A∣B)P(B)=P(B∣A)P(A)P(A∣B)=P(B)P(A,B)=P(B)P(B∣A)P(A)
- P(A∣B) : 사후확률 ( posterior )
- P(A) : 사전확률 ( prior )
- P(B∣A) : 가능도 ( likelihood )
- P(B) : 정규화 상수 ( normalizing constant) 또는 증거
P(A∣B)=P(B)P(B∣A)P(A)
확륣변수의 기댓값
- Uniform이면 p(xi)는 n1이다.
- 기댓값을 다음과 같이 정의한다.
μX=E[X]=xi∈Ω∑xip(xi)
확률분포의 분산
- 분산을 구하는 연산은 영어 Variance의 앞글자를 땀
계산된 분산값은 σ2로 표기한다.
σ2=Var[X]=E[(X−μ)2]
σ2=xi∈Ω∑(xi−μ)2p(xi)
σ2=∫−∞∞(x−μ)2p(x)dx
분산의 성질
- Var[X]≥0
- Var[c]=0
- Var[X]를 다음과 같이 다시 정리할 수 있다.
Var[X]∴E[X2]=E[(X−μ)2]=E[X2−2μX+μ2]=E[X2]−2μE[X]+μ2=E[X2]−2μ2+μ2=E[X2]−μ2=μ2+Var[X]
확률분포의 결정
- 데이터는 0 또는 1 뿐이다. → 베르누이분포
- 데이터는 카테고리 값이어야 한다. → 카테고리분포
- 데이터는 0과 1사이의 실수 값이어야 한다. → 베타분포
- 데이터는 항상 0 또는 양수이어야한다. → 로그정규분포, 감마분포, F분포, 카이제곱분포, 지수분포, 하프코시분포 등
- 데이터가 크기 제한이 없는 실수다. → 정규분포 또는 스튜던트 t분포, 코시분포, 라플라스분포 등
Reference
데이터 사이언스 스쿨