표본조사
표본 오차
표본 추출 오차 (sampling error) : 모집단을 대표하지 못하는 표본을 추출하여 발생하는 오차 (우연성)
표본편의 (sampling bias) : 모집단의 구성원 중 특수한 성격을 가지고 있는 구성원을 선호하는 경향
비표본추출오차 (non-sampling error) : 표본 선택 방법과는 관계없이 발생하는 다양한 종류의 오차로, 표본의 크기와 비례하여 커진다.
응답 오류 : 설문 문항이 모호하거나 복잡해서 응답자가 오해하여 부정확한 정보를 제공하는 오류
측정 오류 : 조사도구의 설계 결함, 조사자의 부주의 등으로 발생하는 오류
자료 처리 오류 : 수집된 데이터를 입력하거나 분석하는 과정에서 발생하는 오류
표본추출방법
확률적 표본 추출 (probability sampling) : 모집단이 속해 있는 각 구성원이 표본으로 선택될 가능성이 일정하도록 하는 표본 추출 방법. 특정 구성원이 선호 대상이 되는 일은 없어지므로 편의는 제거되지만, 우연성에 의한 오류는 없어지지 않는다.
우연성에 의한 오류가 사라지지 않아도 통계학에서는 기본적으로 확률표본추출을 가정한다. 그 이유는 확률표본에서 생길 수 있는 우연성에 의한 오차는 정규분포의 형태를 이루므로 오차의 정도를 예측할 수 있기 때문이다.
대표적인 확률 표본 추출
단순 무작위 추출(simple random sampling) : 모집단의 모든 구성원의 성격이 비슷하고, 분석도 단일성격에 대한 것일 때 효과적이다
ex) 난수표, 난수 생성기 등을 사용하여 표본을 추출한다.
층별 추출 (층화 추출, stratified sampling) : 모집단의 성격에 따라 여러 집단(또는 층)으로 분류한 다음 각 집단에서 표본을 무작위로 추출하는 방법이다.
ex) 연령대별로 집단을 나누어 각각의 연령대에서 무작위로 표본을 추출한다
군집 추출 (집락 추출, cluster sampling) : 표본을 뽑을 때 직접 개별적인 구성원을 선택하는 것이 아니라, 자연적/인위적인 집단을 뽑고, 그 집단 중에서 필요한 만큼의 표본을 추출하는 방법이다.
ex) 전국의 초등학교를 대상으로 학력 조사를 할 때, 몇 개의 학교(군집)를 무작위로 선택하고, 해당 학교의 학생들을 표본으로 사용한다.
체게적 추출(계통 추출, systematic sampling) : 하나의 모집단배열이 무작위로 되어 있을 경우 체계적인 수단을 동원하여 표본을 추출하는 방법이다.
ex) 특정 사이트에 방문하는 ip 중 3의 배수만 표본으로 추출한다.
비확률표본추출 (nonprobability sampling) : 연구자가 모집단과 비슷하다고 생각되는 표본을 추출해내는 방식. 특정 표본이 선정될 확률을 알 수 없기 때문에 선호되지 않는다.
편의추출 (convenience sampling) : 연구자가 가장 쉽게 구할 수 있는 구성원을 선택하여 표본으로 사용하는 방법. 표본추출오차가 크고 결과를 일반화하기 어렵지만, 시간/비용적으로 경제적인 방법이다.
판단추출 (judgement sampling) : 모집단의 성격에 대한 도메인 지식이 있는 연구자가 판단하기에 가장 효과적이라고 생각되는 구성원을 표본으로 사용하는 방법. 모집단의 성격 및 연구자의 지식에 따라 확률표본추출보다 더 효과적일 수 있다.
표집분포
한 모집단에서 크기 n의 표본을 반복적으로 추출 후 그 표본들의 통계량의 분포를 분석하면 우리가 뽑은 표본이 모집단에서 어떤 위치에 있는지, 또는 모집단의 분포 및 특성이 어떠한지를 추론할 수 있다.
평균의 표집분포
평균의 표집분포 (sampling distribution of means) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 평균들의 확률분포
표본 평균의 표집분포의 평균 =
표본평균 는 표본의 각 관측값 의 합을 표본 크기 n으로 나눈 값이다.
는 서로 독립적이고 동일한 분포 (i.i.d)를 따른다
이때, 표본 평균의 기대값은 다음과 같다.
모든 는 동일한 분포를 따르므로 모든 에 대해 이다. 따라서,
결국, 표본 평균의 기대값은 모집단의 평균과 같다.
표본 평균의 표집분포의 분산 =
표본 평균의 분산은 다음과 같다.
분산의 성질에 따라, 상수 을 밖으로 빼낼 수 있다
모든 는 동일한 분포를 따르므로, 이다.
또한, 각 는 독립이므로, 각 변수의 분산을 더할 수 있다. 따라서,
표본 평균의 분산은 모집단의 분산을 표본크기로 나눈 값과 같다.
이는 표본 크기가 커질수록 표본 평균의 변동성이 감소함을 의미한다.
유한 모집단 수정계수 (Finate Population Correction, FPC) : 모집단이 유한하고 그 크기가 작을 때 표본추출의 영향을 고려하여 표본 평균의 분산의 추정치를 조정해주는 계수
정의 :
비복원 추출 : FPC는 표본 추출이 비복원 방식일 때 적용한다. 복원 추출인 경우 표본이 모집단에 영향을 주지 않기 때문에 FPC가 필요하지 않다.
적용 조건 : 일반적으로 일 경우 FPC를 적용한다
효과 : 유한모집단의 크기가 작을 경우 모집단의 상당 부분을 표본으로 포함하고 있기 때문에 표본 간 변동이 줄어드는 현상을 반영해준다. 따라서, 유한모집단의 크기가 작을 경우 FPC를 적용하면 표본 분산의 추정이 더 정확해지는 효과가 있다.
적용시 표본 평균의 분산 :
중심극한정리
중심극한정리 (Central Limit Theorem, CLT) : 모집단의 분포와 관계없이, 동일 크기n의 표본을 반복적으로 추출할 때, 표본의 크기 n이 충분히 클 경우 표본 평균의 분포(=평균의 포집분포)는 정규분포에 근사한다.
표준화 한 표본 평균 :
일반적으로 이면 CLT가 성립한다고 한다.
정규분포 근사
가정
가정 1과 2를 합쳐 i.i.d (independent and identically distributed)라고 하며, 이는 CLT에서 완화 가능한 조건이다. 종속적이거나 비동일 분포의 경우에도 CLT가 성립 할 수 있다.
가정 3(유한한 분산)은 필수적이며, 무한한 분산을 가진 경우에는 CLT가 성립하지 않는다
분산의 표집분포
분산의 표집분포 (sampling distribution of variance) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 분산들의 확률분포
표본 분산의 표집분포의 평균 =
표본 분산의 정의는 다음과 같다
따라서, 표본 분산의 기대값은 다음과 같이 표현할 수 있다.
이때, 는 들의 평균이므로 이다.
또한, 는 상수이기 때문에 의 식은 다음과 같이 정리할 수 있다
이때, 이며, 이므로 의 식은 다음과 같이 정리할 수 있다.
따라서, 이다
표본분산의 기대값이 모분산과 일치한다는 특성은 모집단의 분포에 상관없이 성립한다
모집단이 정규분포인 경우, 표본 분산의 표집분포는 자유도 (n-1)인 카이제곱 분포를 따른다
비율의 표집분포
비율의 표집분포 (sampling distribution of proportion) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 비율(또는 성공률)들의 확률분포
비율의 포집분포는 주로 이항분포를 기반으로 하며, 표본 크기가 충분히 큰 경우 정규분포에 근사하게 된다
모집단의 비율 : 를 특정 특성을 가진 모집단의 개수(성공 횟수)라고 할 때 모집단에서 성공의 비율은 다음과 같이 정의된다
, (은 모집단의 크기)
표본비율 : 를 특정 특성을 가진 표본의 개수(성공 횟수)라고 할 때 표본 비율은 다음과 같다
, (은 표본의 크기)
표본 비율의 표집분포의 평균 =
표본 비율의 기대값은 모집단의 비율과 같다
표본 비율의 표집분포의 분산 =
유한 모집단 수정계수(FPC) : 비율의 표집분포에서도 FPC를 적용 가능하다.
FPC 적용시 분산 :
근사 정규분포
표본 크기 n이 충분히 크고, 모집단 비율 p가 극단적으로 작거나 크지 않은 경우
() 비율의 포집분포는 정규분포에 근사할 수 있다.
다항분포나 포아송분포의 경우도 비율의 포집분포의 계산이 가능하다.