분포의 특성

한상우·2024년 9월 3일

기초 통계학

목록 보기
2/15

중심경향

  • 관찰된 자료들의 중심이 어디에 있는가를 나타내 주는 것
  • 중심경항을 나타내는 수치를 분포의 대푯값이라고 한다
  • 최빈값 (mode) : 빈도수가 가장 많이 발생한 관찰값
    • 사용 범위 : 질적자료와 양적자료에서 모두 사용 가능하다
      • 연속형 자료의 경우는 최빈등급 (modal class)을 선정할 수 있다. 이때, 같은 등급 안에서는 등급의 중간에 빈도수가 집중되어 있다고 가정한다.
    • 대표성 부족 : 분포가 정규분포에 가깝지 않을 때에는 신뢰할 만한 대푯값이 되지 못한다
    • 수학적 연산 불가능 : 수학적 연산이 제한되어 있어, 다른 통계적 처리를 위한 기초자료로 사용하기 어렵다

  • 중앙값 (median) : 자료를 크기 순서대로 나열할 때 가장 가운데에 위치하는 관찰값

    • 사용 범위 : 양적자료

    • robustness : 극단적인 관찰값에 강건하다

    • 수학적 연산 불가능 : 수학적 연산이 제한되어 있어, 다른 통계적 처리를 위한 기초자료로 사용하기 어렵다

      Md=(n+1)2Md = {(n+1)\over 2} 번째 관찰값 (n이 홀수)
      Md=n2Md = {n\over 2} 번째 관찰값 +(n2+1)+({n\over 2}+1) 번째 관찰값의 평균 (n이 짝수)


  • 산술평균 (arithmetic mean, mean) : 값들의 무게 중심이 어디인지를 나타내는 값으로, 중심경향을 나타내는 척도 중에서 가장 많이 사용되는 값이다

    • 사용 범위 : 양적자료

    • 이상치에 민감 : 모든 관찰값으로부터 영향을 받으므로 극단적인 관찰값에 민감하다

    • 수학적 연산 가능 : 수학적 연산이 가능하다

    • 신뢰성 : 모집단에서 여러개의 표본을 선정하여 중심경향값들을 비교해보면, 평균이 가장 비슷한 값들을 갖는다. 이는 모집단의 중심 위치를 추정할 때 산술평균이 모집단의 중심경향값을 나타내는 가장 신뢰할 만한 추정값이라는 것을 의미한다.

    • 모집단 및 표본에서의 계산방식이 같다

      μ=X1+X2+...+XNN=XiN\mu = {X_1 + X_2+...+X_N\over N}={\sum X_i \over N}

      Xˉ=X1+X2+...+XNn=Xin\bar X = {X_1 + X_2+...+X_N\over n}={\sum X_i \over n}


  • 가중산술평균 (weighted arithmetic mean) : 크기가 다른 여러 집단을 합친 전체 집단의 평균

    Xˉall=n1X1+n2X2+...+nkXkn1+n2+...+nk=niXini\bar X_{all} = {n_1X_1 + n_2X_2+...+n_kX_k\over {n_1+n_2+...+n_k}}={\sum n_iX_i \over \sum n_i}

분산도

  • 관찰된 자료가 흩어져 있는 정도

  • 범위 (range) : 관찰값들 중에서 가장 큰 수치와 가장 작은 수치의 차이

    range=Max(X)Min(X)range = Max(X) - Min(X)

    • 간편함 : 양극단의 두 수치가 얼마나 떨어져 있는지 편하게 확인 가능하다
    • 한계 : 분포양상은 설명할 수 없다

  • 사분위수 범위 (IQR) : 가운데 50%의 데이터가 위치하는 범위

    IQR=Q3Q1IQR = Q3 - Q1

    • 이상치 검출에 활용 가능하다

  • 편차 (Deviation) : 관찰값에서 평균을 뺀 값

    deviation=XiXˉdeviation = X_i - \bar X


  • 평균편차 (average deviation) : 편차 절댓값의 평균

    AD=XiXˉnAD = {{\sum |X_i-\bar X|}\over n}

    • 의미 : 평균을 중심으로 하여 평균적으로 ADAD만큼 관찰값들이 떨어져 있다는 것을 의미한다.

    • robustness, 변동성 반영 부족 : 절대값을 사용하여 계산되기 때문에 이상치에 대해 상대적으로 덜 민감하지만, 분포의 실제 변동성을 충분하게 반영하지 못할 수 있다.

    • 절대 기준 없음 : 두 집단 이상의 평균편차를 비교하면 상대적인 분산도를 확인할 수 있지만, 하나의 집단에 대해서는 절대적 의미에서 분산도의 크기를 알 수 없다.


  • 분산 (Variance) : 편차 제곱의 평균

    σ2=(Xiμ)2N\sigma^2 = {\sum(X_i-\mu)^2\over N}

    • 가중치 부여 : 제곱을 사용하여 큰 편차에 더 큰 가중치를 부여한다. 따라서 변동성이 큰 데이터를 분석할 때 중요한 정보를 놓지지 않게 해준다.

    • 수학적 특성 : 제곱을 사용하여 미분이나 다른 수학적 조작이 용이하다(통계적 추론, 최소자승법, ...)

    • 단위의 변화 : 분산은 관찰값의 단위에도 제곱을 하게 되어 직관적인 해석이 어렵다


  • 표준편차 (Standard Deviation) : 분산에 제곱근을 취한 값

    σ=(Xiμ)2N\sigma = \sqrt {\sum(X_i-\mu)^2\over N}

    • 분산의 특성 유지 : 분산의 특성은 모두 유지하면서도 데이터의 변동성을 반영한다.

    • 이상치의 영향 : 여전히 이상치에 민감하지만, 제곱근을 취함으로써 그 영향이 (분산에 비해) 줄어든다

    • 단위 유지 : 표준편차는 관찰값과 동일한 단위로 사용하기 때문에 변동성을 직관적으로 파악할 수 있다

Bessel's Correction

  • 가정 :
    • 모집단에서 여러 번 독립적으로 표본을 추출하면, 표본 평균은 불편추정량이다.
    • 하지만, 우리가 실제 사용하는 데이터는 단 하나의 표본이므로 표본 평균이 항상 불편하지 않다.
    • 표본 분산(s2s^2)을 보정(n1n-1로 나눠주기)해야 불편추정량이 된다.

1. 수학적 접근

  • 모집단에서 표본을 크기 nn만큼 추출한 경우, 모집단의 편차 제곱의 기대값은 다음과 같다

    nσ2=E[i=1n(Xiμ)2]n\sigma^2 = E[\sum_{i=1}^n (X_i - \mu)^2] \cdots ㄱ

  • 모집단의 평균(μ\mu)을 모르는 경우, 표본평균(Xˉ\bar X)을 사용하여 모집단의 분산을 추정해야 한다.
    이때, 표본평균이 불편할 수 있기 때문에 다음과 같은 관계가 성립한다

    i=1n(Xiμ)2=i=1n(XiXˉ)2+n(Xˉμ)2\sum_{i=1}^n (X_i - \mu)^2 = \sum_{i=1}^n(X_i - \bar X)^2 + n(\bar X - \mu)^2 \cdots ㄴ

    • i=1n(XiXˉ)2\sum_{i=1}^n(X_i - \bar X)^2 : 표본 내부의 변동성
    • n(Xˉμ)2n(\bar X - \mu)^2 : 표본 평균과 모집단 평균 간의 차이로 인한 추가 변동성
  • 의 기댓값을 취하면 다음과 같다

    E[i=1n(Xiμ)2]=E[i=1n(XiXˉ)2]+nE[(Xˉμ)2]E[\sum_{i=1}^n (X_i - \mu)^2] = E[\sum_{i=1}^n(X_i - \bar X)^2] + nE[(\bar X - \mu)^2] \cdots ㄷ

  • 과 모집단 분산의 성질(E[(Xˉμ)2]=σ2nE[(\bar X - \mu)^2] = {\sigma^2 \over n})로 을 정리하면 다음과 같다.

    nσ2=E[i=1n(XiXˉ)2]+σ2n\sigma^2 = E[\sum_{i=1}^n(X_i - \bar X)^2] + \sigma^2 \\
    E[i=1n(XiXˉ)2]=(n1)σ2∴ E[\sum_{i=1}^n(X_i - \bar X)^2] = (n-1)\sigma^2

  • 표본 분산의 기대값은 모집단 분산의 (n1)/n(n−1)/n 만큼 과소추정된다

    • 결과적으로, 표본 분산(s2s^2)을 보정하기 위해 n1n−1로 나눠야 불편추정량이 된다.

2. 자유도로 접근

  • 자유도(degrees of freedom)추정할 때 자유롭게 변할 수 있는 독립적인 데이터 포인트의 개수를 의미한다.

  • 표본 분산을 계산할 때, 모집단 평균을 모르기 때문에 표본 평균을 사용한다.

  • 표본 평균을 계산하면 표본 내에서 변할 수 있는 독립적인 데이터 포인트의 개수가 하나 줄어든다.

    • n개의 표본에 대해, n-1개의 값을 알고 있으면 마지막 하나의 데이터 포인트는 변할 수 없는 종속적인 값이 된다.
  • 결과적으로, 표본의 크기가 n일 때, 표본 분산을 계산하는 실제 자유도는 n−1이 되고, 표본 분산을 계산할 때 n-1로 나누어야 한다.


  • 변동계수 (CV, Coefficient of Variation) : 평균에 대한 표준편차의 비율

    CV=sXˉCV = {s \over \bar X}

    • 표본 변동성 비교 : 단위가 다르거나, 평균의 차이가 큰 표본들의 변동성 비교에 사용한다

    • 평균에 따른 제한 : 평균이 0이면 계산이 불가능하고, 일반적으로 양수 평균인 표본에서 사용한다.


비대칭도

  • 대칭분포 (symmetric distribution) : 평균을 중심으로 관측값들이 대칭을 이루는 분포. 평균, 중앙값, 최빈값이 모두 같은 위치에 있다.

  • 왜도(skewness) : 분포의 모양이 대칭분포에서 얼마나 벗어났는가를 수치로 나타낸 값. 분포의 비대칭성을 측정하며, 절댓값이 클수록 대칭에서 벗어난 정도가 크다.

    • 피어슨 비대칭도 (Pearson's coefficient of skewness) : 왜도를 측정하는 가장 일반적인 방법으로, 산술평균과 중앙값의 차이가 표준편차에 비하여 얼마나 떨어져 있는가를 나타낸다.

      Sk=3(XˉMd)SSk={3(\bar X - Md)\over S}

    • 왜도의 해석

      • Sk < 0 : 평균이 중앙값보다 작으며, 왼쪽으로 긴 꼬리(Negative-Skewed)를 가진 분포이다
      • Sk = 0 : 평균과 중앙값이 같으며, 대칭분포(Symmetric)이다
      • Sk > 0 : 평균이 중앙값보다 크며, 오른쪽으로 긴 꼬리(Positive-Skewed)를 가진 분포이다

profile
개인 공부용 블로그입니다

0개의 댓글