표본 및 표집분포

한상우·2024년 9월 10일

기초 통계학

목록 보기
6/15

표본조사

표본 오차

  • 표본 추출 오차 (sampling error) : 모집단을 대표하지 못하는 표본을 추출하여 발생하는 오차 (우연성)

    • 표본의 크기가 커지면 작아지고, 전수조사에서는 0이된다.
  • 표본편의 (sampling bias) : 모집단의 구성원 중 특수한 성격을 가지고 있는 구성원을 선호하는 경향

    • 확률화(Randomization), 혹은 표본 추출 계획으로 최소화하거나 없앨 수 있다.
  • 비표본추출오차 (non-sampling error) : 표본 선택 방법과는 관계없이 발생하는 다양한 종류의 오차로, 표본의 크기와 비례하여 커진다.

    • 응답 오류 : 설문 문항이 모호하거나 복잡해서 응답자가 오해하여 부정확한 정보를 제공하는 오류

    • 측정 오류 : 조사도구의 설계 결함, 조사자의 부주의 등으로 발생하는 오류

    • 자료 처리 오류 : 수집된 데이터를 입력하거나 분석하는 과정에서 발생하는 오류

표본추출방법

  • 확률적 표본 추출 (probability sampling) : 모집단이 속해 있는 각 구성원이 표본으로 선택될 가능성이 일정하도록 하는 표본 추출 방법. 특정 구성원이 선호 대상이 되는 일은 없어지므로 편의는 제거되지만, 우연성에 의한 오류는 없어지지 않는다.

  • 우연성에 의한 오류가 사라지지 않아도 통계학에서는 기본적으로 확률표본추출을 가정한다. 그 이유는 확률표본에서 생길 수 있는 우연성에 의한 오차는 정규분포의 형태를 이루므로 오차의 정도를 예측할 수 있기 때문이다.

  • 대표적인 확률 표본 추출

    • 단순 무작위 추출(simple random sampling) : 모집단의 모든 구성원의 성격이 비슷하고, 분석도 단일성격에 대한 것일 때 효과적이다
      ex) 난수표, 난수 생성기 등을 사용하여 표본을 추출한다.

    • 층별 추출 (층화 추출, stratified sampling) : 모집단의 성격에 따라 여러 집단(또는 층)으로 분류한 다음 각 집단에서 표본을 무작위로 추출하는 방법이다.
      ex) 연령대별로 집단을 나누어 각각의 연령대에서 무작위로 표본을 추출한다

    • 군집 추출 (집락 추출, cluster sampling) : 표본을 뽑을 때 직접 개별적인 구성원을 선택하는 것이 아니라, 자연적/인위적인 집단을 뽑고, 그 집단 중에서 필요한 만큼의 표본을 추출하는 방법이다.
      ex) 전국의 초등학교를 대상으로 학력 조사를 할 때, 몇 개의 학교(군집)를 무작위로 선택하고, 해당 학교의 학생들을 표본으로 사용한다.

    • 체게적 추출(계통 추출, systematic sampling) : 하나의 모집단배열이 무작위로 되어 있을 경우 체계적인 수단을 동원하여 표본을 추출하는 방법이다.
      ex) 특정 사이트에 방문하는 ip 중 3의 배수만 표본으로 추출한다.


  • 비확률표본추출 (nonprobability sampling) : 연구자가 모집단과 비슷하다고 생각되는 표본을 추출해내는 방식. 특정 표본이 선정될 확률을 알 수 없기 때문에 선호되지 않는다.

    • 편의추출 (convenience sampling) : 연구자가 가장 쉽게 구할 수 있는 구성원을 선택하여 표본으로 사용하는 방법. 표본추출오차가 크고 결과를 일반화하기 어렵지만, 시간/비용적으로 경제적인 방법이다.

    • 판단추출 (judgement sampling) : 모집단의 성격에 대한 도메인 지식이 있는 연구자가 판단하기에 가장 효과적이라고 생각되는 구성원을 표본으로 사용하는 방법. 모집단의 성격 및 연구자의 지식에 따라 확률표본추출보다 더 효과적일 수 있다.

표집분포

한 모집단에서 크기 n의 표본을 반복적으로 추출 후 그 표본들의 통계량의 분포를 분석하면 우리가 뽑은 표본이 모집단에서 어떤 위치에 있는지, 또는 모집단의 분포 및 특성이 어떠한지를 추론할 수 있다.

  • 표집분포 (sampling distribution) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 통계량의 확률분포를 의미한다.

평균의 표집분포

  • 평균의 표집분포 (sampling distribution of means) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 평균들의 확률분포

    • 표본 평균의 표집분포의 평균 = μ\mu

      표본평균 Xˉ\bar X는 표본의 각 관측값 X1,X2,...,XnX_1, X_2, ..., X_n의 합을 표본 크기 n으로 나눈 값이다.

      Xˉ=1ni=1nXi\bar X = {1\over n}\sum_{i=1}^n X_i XiX_i는 서로 독립적이고 동일한 분포 (i.i.d)를 따른다

      이때, 표본 평균의 기대값은 다음과 같다.

      E(Xˉ)=E(1ni=1nXi)=1ni=1nE(Xi)E(\bar X) = E({1\over n}\sum_{i=1}^n X_i)={1\over n}\sum_{i=1}^n E(X_i)

      모든 XiX_i는 동일한 분포를 따르므로 모든 ii에 대해 E(Xi)=μE(X_i) = \mu이다. 따라서,

      E(Xˉ)=1ni=1nE(Xi)=1nnμ=μE(\bar X) = {1\over n}\sum_{i=1}^n E(X_i)={1\over n}*n\mu = \mu

      결국, 표본 평균의 기대값은 모집단의 평균과 같다.

    • 표본 평균의 표집분포의 분산 = σ2n{\sigma^2\over n}

      표본 평균의 분산은 다음과 같다.

      Var(Xˉ)=Var(1ni=1nXi)Var(\bar X)=Var({1\over n}\sum_{i=1}^n X_i)

      분산의 성질에 따라, 상수 1n1\over n을 밖으로 빼낼 수 있다

      Var(Xˉ)=1n2Var(i=1nXi)Var(\bar X)={1\over n^2}Var(\sum_{i=1}^n X_i)

      모든 XiX_i는 동일한 분포를 따르므로, Var(Xi)=σ2Var(X_i) = \sigma^2이다.
      또한, 각 XiX_i는 독립이므로, 각 변수의 분산을 더할 수 있다. 따라서,

      Var(Xˉ)=1n2nσ2=σ2nVar(\bar X)={1\over n^2}*n\sigma^2={\sigma^2\over n}

      표본 평균의 분산은 모집단의 분산을 표본크기로 나눈 값과 같다.
      이는 표본 크기가 커질수록 표본 평균의 변동성이 감소함을 의미한다.

  • 유한 모집단 수정계수 (Finate Population Correction, FPC) : 모집단이 유한하고 그 크기가 작을 때 표본추출의 영향을 고려하여 표본 평균의 분산의 추정치를 조정해주는 계수

    • 정의 : FPC=NnN1FPC = {N-n\over {N-1}}

    • 비복원 추출 : FPC는 표본 추출이 비복원 방식일 때 적용한다. 복원 추출인 경우 표본이 모집단에 영향을 주지 않기 때문에 FPC가 필요하지 않다.

    • 적용 조건 : 일반적으로 n/N>=0.05n/N >= 0.05일 경우 FPC를 적용한다

    • 효과 : 유한모집단의 크기가 작을 경우 모집단의 상당 부분을 표본으로 포함하고 있기 때문에 표본 간 변동이 줄어드는 현상을 반영해준다. 따라서, 유한모집단의 크기가 작을 경우 FPC를 적용하면 표본 분산의 추정이 더 정확해지는 효과가 있다.

    • 적용시 표본 평균의 분산 : σ2nNnN1{\sigma^2 \over n}{N-n\over {N-1}}

중심극한정리

  • 중심극한정리 (Central Limit Theorem, CLT) : 모집단의 분포와 관계없이, 동일 크기n의 표본을 반복적으로 추출할 때, 표본의 크기 n이 충분히 클 경우 표본 평균의 분포(=평균의 포집분포)는 정규분포에 근사한다.

    • 표준화 한 표본 평균 : (X1+X2+...XN)NμσN{(X_1+X_2+...X_N) - N*\mu \over \sigma \sqrt N}

    • 일반적으로 N30N \geq 30이면 CLT가 성립한다고 한다.

    • 정규분포 근사

      • limN>infP(a<(X1+X2+...XN)NμσN<b)=ab12πex2/2dx\lim_{N->\inf} P(a < {(X_1+X_2+...X_N) - N*\mu \over \sigma \sqrt N} < b) = \int_a^b {1\over \sqrt{2\pi}}e^{-x^2/2} dx
    • 가정

        1. 모든 XiX_i는 서로 독립이다
        1. 각각의 XiX_i는 같은 확률분포에서 유래한다
        1. 계산된 분산이 유한한 값을 가져야 한다 (0<Var(Xi)<inf0 < Var(X_i) < \inf)
    • 가정 1과 2를 합쳐 i.i.d (independent and identically distributed)라고 하며, 이는 CLT에서 완화 가능한 조건이다. 종속적이거나 비동일 분포의 경우에도 CLT가 성립 할 수 있다.

    • 가정 3(유한한 분산)은 필수적이며, 무한한 분산을 가진 경우에는 CLT가 성립하지 않는다

분산의 표집분포

  • 분산의 표집분포 (sampling distribution of variance) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 분산들의 확률분포

    • 표본 분산의 표집분포의 평균 = σ2\sigma^2

      표본 분산의 정의는 다음과 같다

      S2=1n1i=1n(XiXˉ)2S^2={1\over{n-1}}\sum_{i=1}^n(X_i-\bar X)^2

      따라서, 표본 분산의 기대값은 다음과 같이 표현할 수 있다.

      E(S2)=E(1n1i=1n(XiXˉ)2)  =1n1E(i=1n(XiXˉ)2)=1n1E(i=1n(XiμXˉ+μ)2)  =1n1E(i=1n[(Xiμ)2+(Xˉμ)22(Xiμ)(Xˉμ)])  =1n1E(i=1n(Xiμ)2+i=1n(Xˉμ)22i=1n(Xiμ)(Xˉμ)) (1)  E(S^2) = E({1\over{n-1}}\sum_{i=1}^n(X_i-\bar X)^2) \\\;\\={1\over {n-1}}E(\sum_{i=1}^n(X_i-\bar X)^2) = {1\over {n-1}}E(\sum_{i=1}^n(X_i-\mu-\bar X+\mu)^2)\\\;\\={1\over {n-1}}E(\sum_{i=1}^n[(X_i-\mu)^2+(\bar X-\mu)^2-2(X_i-\mu)(\bar X-\mu)])\\\;\\={1\over {n-1}}E(\sum_{i=1}^n(X_i-\mu)^2+ \sum_{i=1}^n(\bar X-\mu)^2-2\sum_{i=1}^n(X_i-\mu)(\bar X-\mu))\ \dots (1)\\\;\\

      이때, Xˉ\bar XXiX_i들의 평균이므로 i=1n(Xiμ)=(Xˉμ)\sum_{i=1}^n(X_i-\mu)=(\bar X-\mu) 이다.

      또한, (Xˉμ)(\bar X-\mu)는 상수이기 때문에 (1)(1)의 식은 다음과 같이 정리할 수 있다

      (1)=1n1E(i=1n(Xiμ)2+n(Xˉμ)22n(Xˉμ)2)  =1n1E(i=1n(Xiμ)2n(Xˉμ)2)  =1n1(E(i=1n(Xiμ)2)nE(Xˉμ)2)(2)  (1) = {1\over {n-1}}E(\sum_{i=1}^n(X_i-\mu)^2 + n(\bar X-\mu)^2 -2n(\bar X-\mu)^2)\\\;\\={1\over {n-1}}E(\sum_{i=1}^n(X_i-\mu)^2 -n(\bar X-\mu)^2)\\\;\\={1\over {n-1}}(E(\sum_{i=1}^n(X_i-\mu)^2) -n*E(\bar X-\mu)^2)\dots (2)\\\;\\

      이때, E(i=1n(Xiμ)2)=nσ2E(\sum_{i=1}^n(X_i-\mu)^2)=n\sigma^2이며, Var(Xˉ)=E(Xˉμ)2=σ2nVar(\bar X) = E(\bar X-\mu)^2 = {\sigma^2\over n}이므로 (2)(2)의 식은 다음과 같이 정리할 수 있다.

      (2)=1n1(nσ2nσ2n)  =1n1((n1)σ2)=σ2(2)={1\over {n-1}}(n\sigma^2 -n*{\sigma^2\over n})\\\;\\={1\over {n-1}}((n-1)\sigma^2)=\sigma^2

      따라서, E(S2)=σ2E(S^2) = \sigma^2이다

      표본분산의 기대값이 모분산과 일치한다는 특성은 모집단의 분포에 상관없이 성립한다

    • 모집단이 정규분포인 경우, 표본 분산의 표집분포는 자유도 (n-1)인 카이제곱 분포를 따른다

      (n1)S2σ2χ2(n1){(n-1)S^2\over \sigma^2}\sim \chi^2(n-1)

비율의 표집분포

  • 비율의 표집분포 (sampling distribution of proportion) : 동일 모집단에서 일정한 크기의 표본을 반복적으로 추출할 때 표본 비율(또는 성공률)들의 확률분포

    • 비율의 포집분포는 주로 이항분포를 기반으로 하며, 표본 크기가 충분히 큰 경우 정규분포에 근사하게 된다

    • 모집단의 비율 : XX를 특정 특성을 가진 모집단의 개수(성공 횟수)라고 할 때 모집단에서 성공의 비율은 다음과 같이 정의된다
      p=XNp = {X\over N}, (NN은 모집단의 크기)

    • 표본비율 : XX를 특정 특성을 가진 표본의 개수(성공 횟수)라고 할 때 표본 비율은 다음과 같다
      p^=Xn\hat p = {X\over n}, (nn은 표본의 크기)

    • 표본 비율의 표집분포의 평균 = pp

      E(p^)=E(X/n)=np/n=pE(\hat p) = E(X / n) = np / n = p
      표본 비율의 기대값은 모집단의 비율과 같다

    • 표본 비율의 표집분포의 분산 = p(1p)n{p(1-p)\over n}

      Var(p^)=Var(X/n)=Var(X)/n2=np(1p)/n2=p(1p)nVar(\hat p) = Var(X / n)=Var(X)/n^2=np(1-p)/n^2 = {p(1-p)\over n}

    • 유한 모집단 수정계수(FPC) : 비율의 표집분포에서도 FPC를 적용 가능하다.

      FPC 적용시 분산 : Var(p^)=p(1p)nNnN1Var(\hat p) = {p(1-p)\over n}*{N-n\over {N-1}}

    • 근사 정규분포

      • 표본 크기 n이 충분히 크고, 모집단 비율 p가 극단적으로 작거나 크지 않은 경우
        (np5    and    n(1p)5np \geq 5 \;\;and\;\; n(1-p)\geq 5) 비율의 포집분포는 정규분포에 근사할 수 있다.

        p^N(p,p(1p)n)\hat p \sim N(p, {p(1-p)\over n})

    • 다항분포나 포아송분포의 경우도 비율의 포집분포의 계산이 가능하다.

profile
개인 공부용 블로그입니다

0개의 댓글