08 독립동일분포

Sirius·2023년 6월 20일

1 독립동일분포

동일한 조건 아래에서 수행되는 실험이나 관측을 여러번 반복해서 데이터를 얻는 것
즉 서로 독립이고 각각 동일한 확률분포를 따르는 다차원 확률변수는 독립동일분포(iid)이다.

ex> 우연히 만난 20명의 점수 -> 서로 독립인 20차원의 확률변수

2 독립성의 정의

2개 이상의 확률변수가 서로 영향안끼치고 관계도 없음

즉 확률변수가 독립일때 결합확률은 주변확률의 곱으로 작성할 수 있음


3 독립성과 무상관성

독립성 > 무상관성

둘다 서로 관계가 없음을 나타냄
그러나 2개의 확률변수 X, Y가 독립일때 X와 Y는 무상관이지만, X와 Y가 무상관이라고 해서 X와 Y가 반드시 독립인 것은 아니다.

즉 무상관인데 독립이 아닐 수도 있다.

4 합의분포

1 기댓값

2 분산

1 정규분포의 합의분포(재생성)

X~N(1, 2)와 Y~N(2, 3)


2 포아송분포의 합의분포(재생성)

X~Poi(3)과 Y~Poi(4)


3 베르누이분포의 합의분포(재생성X)


베르누이 분포의 기댓값은 p, 분산은 p(1-p)

5 표본평균의 분포

무작위 표본: 표본이 독립적으로 얻어졌으며, 같은 모집단의 분포로부터 얻어짐

1 표본추출

모집단의 특성에 대해 추측할 수 있도록 신뢰할만한 정보를 얻기위한것

표본오차: 표본의 추출을 통하여 모집단의 특성을 통계적으로 추측하는 과정에서 발생하는 오차

통계적 추측절차: 표본오차를 확률적으로 평가함으로써 불확실한 부분을 객관화하는 과정

비표본오차: 표본선정을 부적절하게하여 발생하는 오차

2 표본평균의 표본분포

노동자 10,000명의 평균임금이 150만원이고
25명의 평균임금은 150만원을 중심으로 좌우대칭인 정규분포를 보인다고 가정하자. 만일 25명의 평균임금의 표준편차가 10만원이라고 하면 모평균에서 +-3시그마인 120만원과 180만원 사이에 가능한 모든 표본에서 계산된 25명의 평균임금 관측치의 99.73%가 존재하게 될 것이다. 즉 모평균과 표본평균의 오차가 30만원 이상될 확률은 0.27%밖에 되지 않는다

1 표본평균의 기댓값(모집단과 동일)

Q 문제
Fraud 로 판명된 거래가 100,000개 있다. 평균 거래액은 500,000원이고 표준편차는 20,000원이다. 100개의 무작위 표본을 추출했을 때 표본평균이 500,000원보다 4,000 이상 작을 확률을 구하여라

A답안
표본평균 뮤=500000, 표준편차=20000/10 = 2000
표본평균보다 4000원 작은값은 496000
따라서 (496000 - 500000)/ 2000 = -2
Z=-2이하는 2.28%

2 표본평균의 분산(모집단보다 작음)


6 정규분포의 표본평균의 분포

7 포아송분포의 표본평균의 분포

기댓값 1, 분산 3/10
기댓값이 분산과 다름
표본평균은 포아송분포의 형태를 띠지 않음

8 대수의법칙(점점 모평균과 가까워짐)

표본크기를 키우면 표본평균은 모평균에 수렴
주사위를 굴리는 횟수를 늘리면 6이 나올 확률이 1/6에 수렴

9 중심극한정리(정규분포에 가까워진다)

n이 커짐에 따라 표본평균의 분포는 정규분포에 가까워짐

0개의 댓글