동일한 조건 아래에서 수행되는 실험이나 관측을 여러번 반복해서 데이터를 얻는 것
즉 서로 독립이고 각각 동일한 확률분포를 따르는 다차원 확률변수는 독립동일분포(iid)이다.
ex> 우연히 만난 20명의 점수 -> 서로 독립인 20차원의 확률변수
2개 이상의 확률변수가 서로 영향안끼치고 관계도 없음
즉 확률변수가 독립일때 결합확률은 주변확률의 곱으로 작성할 수 있음


독립성 > 무상관성
둘다 서로 관계가 없음을 나타냄
그러나 2개의 확률변수 X, Y가 독립일때 X와 Y는 무상관이지만, X와 Y가 무상관이라고 해서 X와 Y가 반드시 독립인 것은 아니다.
즉 무상관인데 독립이 아닐 수도 있다.
1 기댓값

2 분산

X~N(1, 2)와 Y~N(2, 3)



X~Poi(3)과 Y~Poi(4)




베르누이 분포의 기댓값은 p, 분산은 p(1-p)

무작위 표본: 표본이 독립적으로 얻어졌으며, 같은 모집단의 분포로부터 얻어짐
모집단의 특성에 대해 추측할 수 있도록 신뢰할만한 정보를 얻기위한것
표본오차: 표본의 추출을 통하여 모집단의 특성을 통계적으로 추측하는 과정에서 발생하는 오차
통계적 추측절차: 표본오차를 확률적으로 평가함으로써 불확실한 부분을 객관화하는 과정
비표본오차: 표본선정을 부적절하게하여 발생하는 오차
노동자 10,000명의 평균임금이 150만원이고
25명의 평균임금은 150만원을 중심으로 좌우대칭인 정규분포를 보인다고 가정하자. 만일 25명의 평균임금의 표준편차가 10만원이라고 하면 모평균에서 +-3시그마인 120만원과 180만원 사이에 가능한 모든 표본에서 계산된 25명의 평균임금 관측치의 99.73%가 존재하게 될 것이다. 즉 모평균과 표본평균의 오차가 30만원 이상될 확률은 0.27%밖에 되지 않는다

Q 문제
Fraud 로 판명된 거래가 100,000개 있다. 평균 거래액은 500,000원이고 표준편차는 20,000원이다. 100개의 무작위 표본을 추출했을 때 표본평균이 500,000원보다 4,000 이상 작을 확률을 구하여라
A답안
표본평균 뮤=500000, 표준편차=20000/10 = 2000
표본평균보다 4000원 작은값은 496000
따라서 (496000 - 500000)/ 2000 = -2
Z=-2이하는 2.28%



기댓값 1, 분산 3/10
기댓값이 분산과 다름
표본평균은 포아송분포의 형태를 띠지 않음
표본크기를 키우면 표본평균은 모평균에 수렴
주사위를 굴리는 횟수를 늘리면 6이 나올 확률이 1/6에 수렴
n이 커짐에 따라 표본평균의 분포는 정규분포에 가까워짐
