통계적 추정

한상우·2024년 9월 11일

기초 통계학

목록 보기
7/15

통계적 추정

  • 추정값 (estimate) : 모수를 추정하여 나온 결과값

    ex) 모집단의 평균을 추정할 때 계산된 표본 평균이 추정값이된다

  • 추정량 (추정치, estimator) : 추정값을 구하기 위하여 사용되는 추정방법, 또는 추정값 계산을 위한 통계량

    ex) 표본 평균은 모집단 평균을 추정하는 추정량이다


점추정 (Point Estimation)

  • 모수를 하나의 값(점)으로 추정하는 방법
  • 점추정량을 구하는 방법

    • 적률법 (Method of Moments, MM) : 표본의 기댓값을 통해 모수를 추정하는 방법

    • 최대우도추정 (Maximum Likelihood Estimation, MLE) : 주어진 데이터가 가장 발생할 가능성이 높은(우도가 최대가 되는) 모집단의 모수를 찾는 방법

    • 최소제곱법 (Least Squares Estimation, LSE) : 오차를 제곱한 합이 최소가 되는 함수를 구하는 방법

  • 장점 : 모수를 하나의 값으로 추정하므로 모집단의 특성을 간단하고 직관적으로 나타낼 수 있다.

  • 한계 : 점추정은 추정의 불확실성을 반영하지 않는다. 추정값의 변동성이나 신뢰도를 평가할 수 없기 때문에, 이 값이 얼마나 정확한지에 대해 확신할 수 없다.

구간추정 (interval estimation)

  • 모수가 포함될 가능성이 높은 범위(구간)을 제시하는 추정법이다
  • 불확실성 반영 : 점추정과 다르게 불확실성을 반영하여 추정값이 얼마나 정확한지에 대해 신뢰할 수 있는 수준을 알 수 있다.

  • 신뢰수준과 정보력 : 추정의 결과가 주는 정보의 효과와 추정구간의 크기는 상반관계(trade-off)에 있다.

    • 추정구간을 모집단의 모든 범위로 설정하면 추정이 맞을 가능성은 100%이지만 그것이 주는 정보의 가치가 없다. 반대로, 추정구간을 좁히면 추정의 정확성은 내려가지만 그것이 주는 정보의 가치가 커진다.

  • 용어 정리

    • 유의수준 (significance level, α\alpha)

      • 신뢰구간이 참된 모수를 포함하지 않을 확률을 의미한다.
      • 즉, 동일한 방법으로 신뢰구간을 여러 번 구했을 때, 그중 α\alpha의 비율만큼 모수를 포함하지 못할 것으로 기대됨
    • 신뢰수준 (신뢰도, confidence level) : 구간추정의 신뢰도를 나타내며, 구간이 참된 모수를 포함할 확률을 의미한다.

      신뢰수준=1α\text{신뢰수준} = 1 - \alpha

      • 즉, 동일한 방법으로 신뢰구간을 여러 번 구하면, 그중 1α1 - \alpha의 비율만큼 모수를 포함할 것으로 기대됨
    • 표준오차 (Standard Error) : 추정량의 표집분포의 표준편차로, 표본평균이 모평균 주위에서 얼마나 변동하는지 측정하는 값이다.

      SE=σnsnSE = {\sigma\over \sqrt n} \approx {s\over \sqrt n}

    • 오차한계 (Margin of Error, MOE) : 특정한 신뢰수준에서 점추정치가 포함될 수 있는 최대 허용 오차를 의미하며, 임계값(Critical Value)과 표준오차를 곱하여 계산한다.

      MOE=Zα/2SEMOE=Z_{\alpha/2} * SE

      • 구간 추정에서 표본 추출 오차(Sampling Error)를 수치적으로 정의한 값으로 볼 수 있음
  • 신뢰구간 (confidence interval, CI) : 모수가 포함될 것으로 기대되는 범위.

    CI=점추정치±MOECI=점추정치\pm MOE


모집단 평균의 구간추정

  • 모분산을 알거나, 표본 크기가 충분히 클 경우 (표준정규분포)

    신뢰구간=Xˉ±Zα/2σn=\bar X\pm Z_{\alpha/2}*{\sigma \over \sqrt n}

    • 표본크기 설정

      nZα/22σ2오차한계2n \geq {Z_{\alpha/2}^2\sigma^2\over {오차한계}^2}


  • 모분산을 모르고, 표본 크기가 작을 경우 (자유도 n-1인 t-분포)

    신뢰구간 =Xˉ±tα/2S,    =\bar X\pm t_{\alpha/2}*S,\;\; (S=(XiXˉ)n1S = \sqrt {\sum(X_i-\bar X)\over {n-1}})

    • 표본크기 설정

      ntα/22S2오차한계2n \geq {t_{\alpha/2}^2S^2\over {오차한계}^2}

모집단 비율의 구간추정

  • 정규근사법이 적용 가능한 경우를 가정한다

    신뢰구간 =p^±Zα/2S,    =\hat p\pm Z_{\alpha/2}*S,\;\;(S=p^(1p^)nS={\sqrt {\hat p(1-\hat p)\over n}})

    • 표본크기 설정

      nZα/22p^(1p^)오차한계2n \geq {Z_{\alpha/2}^2*\hat p(1-\hat p)\over {오차한계}^2}

모집단 분산의 구간추정

  • 사용 확률분포 : 표본의 크기에 따라 카이제곱분포, 표준정규분포를 사용하여 모집단 분산의 구간추정을 진행할 수 있다.

  • 점추정량을 사용하는 이유 : 분산은 변동성을 측정하는 보조적인 지표로 사용되는 경우가 많아, 평균이나 비율처럼 직접적인 의사결정에 활용되기보다는 데이터의 신뢰성 평가 등에 더 자주 사용된다.
    따라서, 구간추정보다는 분산의 점추정량인 표본 분산을 활용하여 모집단의 분산을 대략적으로 추정하는 경우가 많다.

좋은 추정량의 조건

  • 불편성 (unbiasedness) : 추정량의 기대값이 추정하려는 모수의 실제값과 같을 때, 그 추정량을 불편추정량이라 한다

    E(θ^)=θ,    bias=0E(\hat \theta) = \theta, \;\rightarrow \; bias = 0

    • 점추정에서 가장 중요한 조건이다
  • 효율성 (efficiency) : 주어진 모수에 대한 여러 불편추정량이 있을 때, 가장 작은 분산을 가진 추정량이 효율적이다

    • 구간추정에서 신뢰구간의 길이는 짧을수록 좋다
  • 일치성 (consistency) : 표본의 크기 n이 무한히 증가하면 추정량이 모수에 가까워져야 한다

    limninfP(θ^θ<ϵ)=1  \lim_{n\rightarrow\inf}P(|\hat \theta - \theta| < \epsilon) = 1\; (ϵ\epsilon은 임의의 양수)

    • 구간 추정에서 표본 크기가 증가할수록 신뢰구간이 좁아져야 한다
  • 충분성 (sufficiency) : 추정량이 모수에 대하여 가장 많은 정보를 제공해야 한다.

    즉, 다른 정보를 추가로 고려하지 않아도 충분히 모집단을 잘 설명해야 한다.

    • 일반적으로 다루는 평균, 분산은 이미 충분한 추정량으로 작동한다.

  • 충분성과 강건성

    • 분포를 알 수 없는 상황에서는 충분성보다 이상치나 비정규성에도 영향을 덜 받는 성질인 강건성(Robustness)이 중요해진다.
      특성충분성 (Sufficiency)강건성 (Robustness)
      적용 대상미리 정의된 분포 (정규분포 등)정의되지 않은 분포 (비모수적 분포)
      핵심 목표모집단의 정보를 최대한 반영이상치의 영향을 최소화
      대표적인 추정량평균 (Mean), 분산 (Variance)중앙값 (Median), 순위 기반 방법
      이상치 영향이상치에 취약함이상치에 강건함
      사용 예시정규분포 가정하의 통계 분석분포를 모를 때, 이상치가 많은 경우
  • 충분성과 강건성은 서로 Trade-off 관계에 있으며, 모집단의 특성을 알고 있을 때는 충분성이 중요하고, 모를 때는 강건성이 중요해진다.
profile
개인 공부용 블로그입니다

0개의 댓글