불확실성의 원인
Probability Theory는 이러한 불확실성을 정량화(quantification)하고 모델링하여 더 정확한 예측과 의사결정을 가능하게 함
• 확률변수(Random Variables)
• 시행(trials)과 표본(sample)
총 시행 횟수 = N
• 빈도(frequency) 표
: 이면서 인 경우가 몇 번 나왔는지 (빈도)
: 인 경우가 총 몇 번 나왔는지 =
: 인 경우가 총 몇 번 나왔는지 =
• Joint Probability
두 확률변수 X와 Y가 동시에 특정 값을 갖는 확률.
• Marginal Probability
여러 확률변수 중 특정 변수 하나(또는 일부)만의 확률
• Conditional Probability (조건부 확률)
가 주어졌을 때, 가 될 확률
• Product Rule
두 확률변수 X,Y의 joint probability(공동 확률)을,
한 변수의 Conditional Probability과 다른 변수의 Marginal Probability의 곱으로 표현하는 공식.
• Sum Rule
확률변수 X의 marginal probability을 구할 때,
다른 변수 Y에 대한 joint probability를 모두 합산하는 규칙
• Bayes’ theorem
p(Y∣X): X를 관측한 후, Y가 참일 확률
p(X∣Y): Y가 참일 때, X가 관측될 확률
p(Y): 사전확률(prior), X를 관측하기 전에 Y가 참일 것으로 믿는 정도
p(X): 정규화 상수(normalizing constant), X가 관측될 전체 확률
→ 새로운 정보 X가 관측되었을 때,
사건 Y에 대한 믿음(확률)을 어떻게 업데이트할 것인지를 보여줌
•Independence (독립성)
한쪽 사건이 일어났는지 여부가 다른 쪽에 전혀 영향을 주지 않음
연속형 확률변수 X가 특정 값 x 근처에서 어떤 밀도를 가지는지를 나타내는 함수
함수값 p(x) : 확률이 아니라, 밀도(density)의 의미
구간 (a,b) 내에서 X가 존재할 확률은 PDF를 구간 (a,b)에서 적분한 값
조건
이산형(discrete) 확률변수에 대한 확률 함수
연속형: 확률 밀도 함수(PDF) → 구간 적분으로 확률 계산
이산형: 확률 질량 함수(PMF) → 개별 값 확률의 합으로 계산
확률변수 X가 z 이하의 값을 가질 확률,P(X≤z)을 나타내는 함수
z가 증가함에 따라 0에서 1 사이를 단조증가
p(x) : PDF
P(x) : CDF
δx : PDF p(x) 값에 폭 δx를 곱한 면적,
x 주변의 아주 좁은 구간 [x,x+δx]에서 X가 나올 확률
이산형 확률변수 X가 가질 수 있는 각 값 x에 대해,
해당 값이 발생할 확률 p(x)와 함수 f(x)의 곱을 모두 합한 값
연속형 확률변수 X에서, 확률 밀도 함수 p(x)를 구간별로 적분하여 구한 값
2차원 확률변수 (X,Y)가 있고,
이 변수에 대한 어떤 함수 f(x,y)가 있을 때, x에 대한 기대값 :
는 y에 대한 함수 → x 적분 후 y만 남음
분포 p(x)로부터 N개의 표본 을 뽑을 경우,
실제 분포(이산&연속)에서 데이터를 많이 모아 함수 f에 대해 평균을 내면, 이론적 기대값과 비슷해짐
Y=y가 주어졌을 때 X에 관한 함수 f(x)의 기대값
기대값의 선형성(linearity)에 의해,
X와 Y가 independent일 필요 없이 언제나 성립
확률변수(또는 함수) f(x)가 평균 E[f(x)]에서 얼마나 떨어져 있는지를 제곱하여 평균낸 값
두 확률변수 x와 y가 각각의 평균에서 얼마나 함께 변동하는지를 나타내는 값
cov[x,y]>0 : x가 평균보다 클 때 y도 평균보다 클 확률이 높음
cov[x,y]<0 : x가 평균보다 클 때 y는 평균보다 작을 확률이 높음
cov[x,y] = 0 : 두 변수 간에 선형적 상관이 없음
X와 Y가 독립일 경우, Cov(X,Y)=0이므로
: 확률을 어떤 사건이 반복되는 trials에서 특정 결과가 발생하는 비율(빈도)로 해석
반복된 실험에서 얻은 결과(빈도)에 지나치게 의존하여,
데이터가 가지는 우연적 특징(노이즈)에 overfitting)할 위험 존재
실제로 반복하기 어려운 상황이나 샘플 수가 적은 상황에서는 빈도주의 해석이 직관적으로 맞지 않을 수 있음
: 확률을 어떤 사건(가설)에 대한 불확실성(uncertainty)의 정도로 해석
사건이 실제로 일어날 가능성을 숫자로 표현
prior knowledge를 확률 모델에 반영할 수 있음
새로운 정보(데이터)가 들어올 때마다 사후확률(posterior)을 업데이트 가능
: 사후확률(posterior)은 likelihood와 사전확률(prior)의 곱에 비례
p(w) : w에 대해 미리 가지고 있는 가정 (ex.곡선의 특정 형태)
p(D∣w) : w로 인해 만들어진 곡선이 데이터를 얼마나 잘 설명하는지 → MAP
p(w∣D): 실제 관측된 데이터를 본 뒤, w에 대한 가정을 갱신한 결과 → MLE
이진 변수 X가 0 또는 1의 값을 가질 때 사용하는 이산형 확률분포
μ = X가 1일 확률
• 베르누이 분포에서 기댓값 = X가 1일 확률 = μ
• 베르누이 분포에서 확률 질량 함수 (PMF)
• 베르누이 분포에서 분산(Variance)
μ가 0.5에 가까울수록, X가 0 또는 1이 될 가능성이 비슷하므로 분산이 커짐
• 베르누이 분포에서 MLE (Maximum Likelihood Estimation)
데이터셋
: 인 이진 관측값들의 모음
각 x_n 은 동일한 확률 μ로 1이 되고, 1−μ로 0이 된다고 가정 (독립)
Likelihood : 주어진 파라미터 μ 하에서 데이터셋 D가 관측될 확률
전체 데이터셋 D에 대한 Likelihood는, 독립 가정을 적용하여
모든 데이터 점에 대한 확률의 곱으로 나타냄
Log-likelihood : 로그를 취해 Likelihood를 합 형태로 변환
Maximum Likelihood Estimation (MLE)
: ln 를 μ에 대해 최대로 하는 값
ln 를 μ에 대해 미분하고 0으로 두어 해를 구함
→ 데이터에서 1이 나온 횟수를 전체 횟수로 나눈 값이 μ의 MLE가 됨
• 베르누이 분포에서 이항분포(Binomial distribution)
: 개별 시행이 베르누이 분포(x∈{0,1})를 따르고,
총 N번의 독립 시행에서 성공(x=1)이 몇 번 나오는지를 나타내는 분포
m: N번의 시행 중에서 성공(1)이 발생한 총 횟수
확률 질량 함수 (PMF)
: 어느 시행에서 성공/실패가 발생했는지를 고려
기대값과 분산
기대값 : N번 시행 중 성공이 m번 일어날 것으로 기대하는 횟수는 Nμ
분산(Variance) : 성공 확률 μ가 0.5에 가까울수록 시행 결과가 다양하게 나오므로 분산이 커짐
• Multinomial Distribution (다항 분포)
: 시행 결과의 종류가 두 가지 이상일 때 여러 번의 독립적 실험 결과가
특정한 분포를 따르는지 설명하는 확률 분포
K : 가능한 결과의 개수
: 3번째 항목이 나온 것
: 각 결과가 나올 확률
모든 확률의 합 = 1 :
다항 분포의 확률 질량 함수 (PMF)
: 결과의 순서가 어떻게 배치될 수 있는지
: 각 결과가 나올 확률을 곱한 값
• Gaussian distribution (정규분포)
: 연속적인 확률 분포의 일종으로, 데이터가 평균값 주변에 집중되고
양쪽 꼬리가 점차 감소하는 종 모양의 곡선
분포는 평균을 중심으로 좌우 대칭
분포의 위치는 평균(μ)에 의해,
퍼짐 정도는 분산() 또는 표준편차()에 의해 결정됨
정규분포의 확률밀도함수(PDF)
: 확률의 총합이 1이 되도록 하는 정규화 상수 (면적이 1이 되도록 함)
exp : 평균에서 멀어질수록 확률 밀도가 기하급수적으로 감소함
작은 σ 값: 데이터가 평균에 더 많이 몰려 있어 곡선이 좁고 뾰족함