다변량 확률분포

yst3147·2022년 8월 9일

수리통계학

목록 보기
5/10

Wackerly et al., Mathematical Statistics with Applications을 읽고
책 내용을 정리하였습니다.

5.1 서론

5.2 이변량과 다변량 확률분포

결합 확률함수

Y1,Y2Y_1, Y_2를 이산확률 변수라 할 때
Y1,Y2Y_1, Y_2결합 (또는 이변량) 확률함수(join (or bivariate) probability function)은 다음과 같다.

p(y1,y2)=P(Y1=y1,Y2=y2),<y1<,<y2<p(y_1, y_2) = P(Y_1 = y_1, Y_2 = y_2), -\infin < y_1 < \infin, -\infin < y_2 < \infin

결합 확률함수 성질

Y1,Y2Y_1, Y_2가 결합확률함수 p(y1,y2)p(y_1, y_2)를 갖는 이산확률변수이면,
1. 모든 y1,y2y_1, y_2에 대해 p(y1,y2)0p(y_1, y_2) \geq 0
2. y1,y2p(y1,y2)=1\sum_{y1,y2}p(y_1, y_2) = 1이다. 여기서 합은 0이 아닌 확률들이 할당된 모든 값 (y1,y2)(y1, y2)에 대한 것이다.

결합(이변량)분포함수

임의의 확률변수 Y1,Y2Y_1, Y_2에 대해,
결합(이변량)분포함수 F(y1,y2)F(y_1, y_2)는 다음과 같이 정의
F(y1,y2)=P(Y1y1,Y2y2),<y1<,<y2<F(y_1, y_2) = P(Y_1 \leq y_1, Y_2 \leq y_2), -\infin < y_1 < \infin, -\infin < y_2 < \infin

공동연속

  • 두 확률변수의 결합분포함수 F(y1,y2)F(y_1, y_2)가 연속이면, 두 확률변수들이 공동연속(jointly continuous)이라고 한다.

  • Y1,Y2Y_1, Y_2가 결합분포함수 F(y1,y2)F(y_1, y_2)를 연속확률변수라 할 때
    만일 모든 <y1<,<y2<-\infin < y_1 < \infin, -\infin < y_2 < \infin에 대해

    F(y1,y2)=y1y2f(t1,t2)dt2,dt1F(y1, y2) = \int_{-\infin}^{y1}\int_{-\infin}^{y2} f(t_1, t_2)\, dt_2,dt_1

을 만족하는 음이 아닌 함수 f(y1,y2)f(y_1, y_2)가 존재하면
Y1Y_1Y2Y_2공동확률변수(jointly continuous random variable)라 한다.
f(y1,y2)f(y_1, y_2)결합확률밀도함수(joint probability density function)이라 한다.

결합분포함수 성질

Y1,Y2Y_1, Y_2가 결합분포함수 F(y1,y2)F(y_1, y_2)를 갖는 확률변수이면 다음이 성립,
1. F(,)=F(,y2)=F(y1,)=0F(-\infin, -\infin) = F(-\infin, y_2) = F(y_1, -\infin) = 0
2. F(,)=1F(\infin, \infin) = 1
3. y1y1,y2y2y_1^* \geq y_1, y_2^* \geq y_2이면
F(y1,y2)F(y1,y2)F(y1,y2)+F(y1,y2)0F(y_1^*, y_2^*)-F(y_1^*, y_2)-F(y_1, y_2^*)+F(y_1, y_2) \geq 0

공동연속확률변수 성질

Y1,Y2Y_1, Y_2가 결합밀도함수 f(y1,y2)f(y_1, y_2)를 갖는 공동연속확률변수이면 다음이 성립,
1. 모든 y1,y2y_1, y_2에 대해, f(y1,y2)0f(y_1, y_2) \geq 0
2. f(y1,y2)dy1,dy2=1\int_{-\infin}^{\infin}\int_{-\infin}^{\infin} f(y_1, y_2)\, dy_1,dy_2 = 1

5.3 주변과 조건부확률분포

주변확률함수

Y1,Y2Y_1, Y_2는 확률함수 p(y1,y2)p(y_1, y_2)를 갖는 공동 이산확률변수이면 Y1,Y2Y_1, Y_2주변확률함수(marginal probability function)는 각각 다음과 같음

p1(y1)=모든y2p(y1,y2),p2(y2)=모든y1p(y1,y2)p_1(y_1) = \sum_{모든 y_2}p(y_1, y_2), p_2(y_2) = \sum_{모든 y_1}p(y_1, y_2)

주변밀도함수

Y1,Y2Y_1, Y_2는 결합밀도함수 f(y1,y2)f(y_1, y_2)를 갖는 공동 연속확률변수이면 Y1,Y2Y_1, Y_2주변밀도함수(marginal density function)는 각각 다음과 같음

f1(y1)=f(y1,y2)dy2,f2(y2)=f(y1,y2)dy1f_1(y_1) = \int_{-\infin}^{\infin} f(y_1, y_2)dy_2, f_2(y_2) = \int_{-\infin}^{\infin}f(y_1, y_2)dy_1

조건부이산확률함수

Y1,Y2Y_1, Y_2는 결합확률함수가 p(y1,y2)p(y_1, y_2)이고 각각의 주변확률함수가 p1(y1),p2(y2)p_1(y_1), p_2(y_2)인 공동 이산확률변수이면,
Y2Y_2가 주어졌을 때 Y1Y_1조건부이산확률함수(conditional discrete probability function)p2(y2)>0p_2(y_2) >0일 때 다음과 같이 정의

p(y1y2)=P(Y1=y1Y2=y2)=P(Y1=y1,Y2=y2)P(Y2=y2)=p(y1,y2)p2(y2)p(y_1|y_2) = P(Y_1 = y_1|Y_2 = y_2) = \frac{P(Y_1 = y_1, Y_2 = y_2)}{P(Y_2 = y_2)} = \frac{p(y_1, y_2)}{p_2(y_2)}

조건부분포함수

Y1,Y2Y_1, Y_2는 결합밀도함수 f(y1,y2)f(y_1, y_2)를 갖는 공동 연속확률변수이면
Y2=y2Y_2 = y_2가 주어졌을 때, Y1Y_1조건부분포함수(conditional distribution function)는 다음과 같음

F(y1y2)=P(Y1y1Y2=y2)F(y_1|y_2) = P(Y_1 \leq y_1|Y_2 = y_2)

조건부밀도함수

Y1,Y2Y_1, Y_2는 결합밀도함수 f(y1,y2)f(y_1, y_2)와 주변밀도함수 f1(y1),f2(y2)f_1(y_1), f_2(y_2)를 갖는 공동 연속확률변수라 하면
f2(y2)>0f_2(y_2) > 0을 만족하는 임의의 y2y_2에 대해, Y2=y2Y_2 = y_2가 주어졌을 때, Y1Y_1조건부밀도함수

f(y1y2)=f(y1,y2)f2(y2)f(y_1|y_2) = \frac {f(y_1, y_2)}{f_2(y_2)}

f1(y1)>0f_1(y_1) > 0을 만족하는 임의의 y1y_1에 대해, Y1=y1Y_1 = y_1가 주어졌을 때, Y2Y_2조건부밀도함수

f(y2y1)=f(y1,y2)f1(y1)f(y_2|y_1) = \frac {f(y_1, y_2)}{f_1(y_1)}

5.4 독립 확률변수

독립, 종속

Y1Y_1은 분포함수 F1(y1)F_1(y_1)을 갖고, Y2Y_2는 분포함수 F2(y2)F_2(y_2)을 가지며, Y1,Y2Y_1, Y_2는 결합분포함수 F(y1,y2)F(y_1, y_2)를 가진다 하자
모든 실수들의 쌍 (y1,y2)(y_1, y_2)에 대해 F(y1,y2)=F1(y1)F2(y2)F(y_1, y_2) = F_1(y_1)F_2(y_2)
Y1,Y2Y_1, Y_2독립(independent)
Y1Y_1Y2Y_2가 독립이 아니면 종속(dependent)

결합확률함수, 결합밀도함수 독립

Y1,Y2Y_1, Y_2는 결합확률함수가 p(y1,y2)p(y_1, y_2)이고 각각의 주변확률함수가 p1(y1),p2(y2)p_1(y_1), p_2(y_2)인 이산확률변수이면,
Y1,Y2Y_1, Y_2가 독립일 필요충분조건은 모든 실수들의 쌍(y1,y2)(y_1, y_2)에 대해

p(y1,y2)=p1(y1)p2(y2)p(y_1, y_2) = p_1(y_1)p_2(y_2)

Y1,Y2Y_1, Y_2는 결합밀도함수가 f(y1,y2)f(y_1, y_2)이고 각각의 주변밀도함수가 f1(y1),f2(y2)f_1(y_1), f_2(y_2)인 이산확률변수이면,
Y1,Y2Y_1, Y_2가 독립일 필요충분조건은 모든 실수들의 쌍(y1,y2)(y_1, y_2)에 대해

f(y1,y2)=f1(y1)f2(y2)f(y_1, y_2) = f_1(y_1)f_2(y_2)

Y1,Y2Y_1, Y_2의 결합밀도함수가 f(y1,y2)f(y_1, y_2)가 양일 필요충분조건이
상수 a,b,c,da,b,c,d에 대해 ay1ba \leq y_1 \leq bcy2dc \leq y_2 \leq d이며
그 외에는 f(y1,y2)=0f(y_1, y_2) = 0 이라 하자
그러면 Y1Y2Y_1과 Y_2가 독립일 필요충분조건은

f(y1,y2)=g(y1)h(y2)f(y_1, y_2) = g(y_1)h(y_2)

이다. 여기서 g(y1)g(y_1)y1y_1만의 함수로 음이 아니며 h(y2)h(y_2)y2y_2만의 함수로 음이 아니다.
=> 두 함수가 밀도함수일 필요는 없다

5.5 확률변수들의 함수의 기댓값

결합확률함수 기댓값

g(Y1,Y2,...Yk)g(Y_1, Y_2, ... Y_k)는 결합확률함수 p(y1,y2,...,yk)p(y_1, y_2, ..., y_k)를 갖는 이산확률변수 Y1,Y2,...,YkY_1, Y_2, ..., Y_k라 하자
이 때 g(Y1,Y2,...Yk)g(Y_1, Y_2, ... Y_k)기댓값

E[g(Y1,Y2,...Yk)]=[모든yk]...[모든y2][모든y1]g(y1,y2,...yk)p(y1,y2,...yk)E[g(Y_1, Y_2, ... Y_k)] = \sum_{[모든 y_k]}...\sum_{[모든 y_2]}\sum_{[모든 y_1]}g(y_1, y_2, ... y_k)p(y_1, y_2, ... y_k)

결합밀도함수 기댓값

Y1,Y2,...,YkY_1, Y_2, ..., Y_k가 결합밀도함수 f(y1,y2,...,yk)f(y_1, y_2, ..., y_k)를 갖는 연속확률변수라면

E[g(Y1,Y2,...Yk)]=...g(y1,y2,...yk)f(y1,y2,...yk)dy1dy2...dykE[g(Y_1, Y_2, ... Y_k)] = \int_{-\infin}^{\infin}...\int_{-\infin}^{\infin}\int_{-\infin}^{\infin}g(y_1, y_2, ... y_k)f(y_1, y_2, ... y_k)dy_1dy_2...dy_k

5.6 특별한 정리

상수 기댓값

cc가 상수이면 다음이 성립,

E(c)=cE(c) = c

확률함수 상수곱 기댓값

g(Y1,Y2)g(Y_1, Y_2)는 확률변수 Y1,y2Y_1, y_2의 함수이고 cc가 상수이면 다음이 성립

E[cg(Y1,Y2)]=cE[g(Y1,Y2)]E[cg(Y_1, Y_2)] = cE[g(Y_1, Y_2)]

기댓값 합

Y1,Y2Y_1, Y_2는 확률변수이고 g1(Y1,Y2),g2(Y1,Y2),...,gk(Y1,Y2)g_1(Y_1, Y_2), g_2(Y_1, Y_2), ..., g_k(Y_1, Y_2)Y1,Y2Y_1, Y_2의 함수이면 다음이 성립,

E[g1(Y1,Y2)+g2(Y1,Y2)+...+gk(Y1,Y2)]=E[g1(Y1,Y2)]+E[g2(Y1,Y2)]+...+E[gk(Y1,Y2)]E[g_1(Y_1, Y_2) + g_2(Y_1, Y_2) + ... + g_k(Y_1, Y_2)] \\ = E[g_1(Y_1, Y_2)] + E[g_2(Y_1, Y_2)] + ... + E[g_k(Y_1, Y_2)]

확률변수 독립일 때 기댓값

Y1,Y2Y_1, Y_2가 독립인 확률변수이고 g(Y1)g(Y_1)h(Y2)h(Y_2)가 각각 Y1,Y2Y_1, Y_2만의 함수이며 기댓값이 존재하면 다음이 성립

E[g(Y1)h(Y2)]=E[g(Y1)]E[h(Y2)]E[g(Y_1)h(Y_2)] = E[g(Y_1)]E[h(Y_2)]

5.7 두 확률변수의 공분산

공분산

Y1,Y2Y_1, Y_2가 각각 평균 μ1,μ2\mu_1, \mu_2를 갖는 확률변수이면
Y1Y2Y_1과 Y_2공분산(covariance)은 다음과 같다.

Cov(Y1,Y2)=E[(Y1μ1)(Y2μ2)]Cov(Y_1, Y_2) = E[(Y_1- \mu_1)(Y_2 - \mu_2)]

무상관

공분산이 0이면 변수들이 무상관(uncorrelated)

상관계수(correlation coefficient)

상관계수(correlation coefficient) ρ\rho 식은 다음과 같다
=> 공분산을 표준화

ρ=Cov(Y1,Y2)σ1σ2\rho = \frac{Cov(Y_1, Y_2)}{\sigma_1\sigma_2}

공분산 계산공식

Y1Y_1Y2Y_2가 각각 평균 μ1\mu_1μ2\mu_2를 갖는 확률변수라 하면 다음이 성립

Cov(Y1,Y2)=E[(Y1μ1)(Y2μ2)]=E(Y1Y2)E(Y1)E(Y2)Cov(Y_1, Y_2) = E[(Y_1 - \mu_1)(Y_2 - \mu_2)] = E(Y_1Y_2) - E(Y_1)E(Y_2)

독립일 때 공분산

만일 Y1Y_1Y2Y_2가 독립 확률변수이면

Cov(Y1,Y2)=0Cov(Y_1, Y_2)=0

이다. 그러므로 독립 확률변수들은 무상관이다.

5.8 확률변수들의 선형함수에 대한 기댓값과 분산

두 선형조합 사이의 공분산

만일 Y1,Y2,...YnY_1, Y_2, ... Y_nX1,X2,...,XmX_1, X_2, ..., X_mE(Yi)=μiE(Y_i) = \mu_i이고 E(Xi)=ξjE(X_i) = \xi_j인 확률변수라 하면
상수 a1,a2,...,ana_1, a_2, ..., a_nb1,b2,...bmb_1, b_2, ... b_m에 대해

U1=i=1naiYi,U2==1nbjXjU_1 = \sum_{i=1}^na_iY_i, U_2 = \sum_{=1}^nb_jX_j

라 하면, 다음이 성립
a. E(U1)=i=1naiμiE(U_1) = \sum_{i=1}^{n}a_i\mu_i
b. V(U1)=i=1nai2V(Yi)+21i<jnaiajCov(Yi,yj)V(U_1) = \sum_{i=1}^{n}a_i^2V(Y_i) + 2 \sum\sum_{1 \leq i < j \leq n}a_ia_jCov(Y_i, y_j),
여기서 이중 합은 i<ji < j인 모든 쌍 (i,j)(i, j)에 대한 합
c. Cov(U1,U2)=i=1nj=1maibjCov(Yi,Xj)Cov(U_1, U_2) = \sum_{i=1}^n\sum_{j=1}^ma_ib_jCov(Y_i, X_j)

5.9 다항확률분포

다항실험

다항실험(multinomial experiment)은 다음 성질을 갖는다.
1. 실험은 n번의 동일한 시행으로 구성되어 있다.
2. 각 시행의 기본결과는 k개의 부류나 셀 중의 하나에 해당한다.
3. 단일 시행의 기본결과가 ii번째 부류에 속할 확률은 pi,i=1,2,...,kp_i, i = 1,2,...,k이고 시행마다 동일하게 유지된다.
p1+p2+p3+...+pk=1p_1 + p_2 + p_3 + ... + p_k = 1
4. 시행들은 독립이다.
5. 관심있는 확률변수들은 Y1,Y2,...,YkY_1, Y_2, ..., Y_k이다. 여기서 YiY_i 기본결과가 ii번째 부류에 속하는 시행의 횟수이다.
Y1+Y2+...+Yk=nY_1 + Y_2 + ... + Y_k = n

다항분포

p1,p2,...,pkp_1, p_2, ..., p_ki=1kpi=1\sum_{i=1}^kp_i=1이며
i=1,2,...,ki =1,2, ..., k에 대해 pi>0p_i > 0이라 하자.
만일 Y1,Y2,...,YkY_1, Y_2, ..., Y_k의 결합확률 함수가 다음과 같으면,
확률변수 Y1,Y2,...,YkY_1, Y_2, ..., Y_k는 모수 n과 p1,p2,...,pkp_1, p_2, ..., p_k를 갖는 다항분포(multinomial distribution)을 따른다.

p(y1,y2,...,yk)=n!y1!y2!...yk!p1y1p2y2...pkykp(y_1, y_2, ..., y_k) = \frac{n!}{y_1!y_2!...y_k!}p_1^{y_1}p_2^{y_2}...p_k^{y_k}

여기서 각 ii에 대해, yi=0,1,2,...,ny_i = 0, 1, 2, ..., n이며 i=1kyi=n\sum_{i=1}^{k}y_i = n

다항분포 평균, 분산, 공분산

만일 Y1,Y2,...,YkY_1, Y_2, ..., Y_k가 모수 nnp1,p2,...,pkp_1, p_2, ..., p_k를 갖는 다항분포를 따른다면 다음 성립
1. E(Yi)=npi,V(Yi)=npiqiE(Y_i) = np_i, V(Y_i) = np_iq_i
2. Cov(Ys,Yt)=npspt,stCov(Y_s, Y_t) = -np_sp_t, s \neq t

5.10 이변량 정규분포(선택)

5.11 조건부 기댓값

조건부기댓값

만일 Y1Y_1Y2Y_2가 임의의 확률변수이면, Y2=y2Y_2 = y_2가 주어진 경우 g(Y1)g(Y_1)조건부기댓값(conditional expectation)
만일 Y1,Y2Y_1, Y_2가 공동연속이면

E(g(Y1)Y2=y2)=g(y1)f(y1y2)dy1E(g(Y_1)|Y_2=y_2) = \int_{-\infin}{\infin}g(y_1)f(y_1|y_2)dy_1

만일 Y1Y_1Y2Y_2가 공동이산이면

E(g(Y1)Y2=y2)=모든y1g(y1)p(y1y2)E(g(Y_1)|Y_2=y_2) = \sum_{모든 y1}g(y_1)p(y_1|y_2)

확률변수 평균

Y1Y_1Y2Y_2를 확률변수라 하자, 그러면

E(Y1)=E[E(Y1Y2)]E(Y_1) = E[E(Y_1|Y_2)]

이다. 여기서 오른쪽 내부의 기댓값은 Y2Y_2가 주어진 경우 Y1Y_1의 조건부분포에 관한 것이고 외부의 기댓값은 Y2Y_2의 분포에 관한 것이다.

확률변수 분산

Y1Y_1Y2Y_2를 확률변수라 하자, 그러면

V(Y1)=E[V(Y1Y2)]+V[E(Y1Y2)]V(Y_1) = E[V(Y_1|Y_2)] + V[E(Y_1|Y_2)]

5.12 요약

0개의 댓글