모집단과 표본 분포

JERRY·2025년 3월 16일

Statistics

목록 보기
4/19
post-thumbnail

1. 모집단과 표본

  1. 모집단(Population), 표본(Sample)

  2. 표본추출(Sampling)
    모집단으로 부터 표본을 추출 하는 것을 Sampling이라고 하며, 표본으로부터 그 특성을 찾아내고 모집단의 특성을 추론하고자 함

    • 복원추출(Sampling with replacement) : 모집단에서 데이터를 추출 할 때 하나를 추출하고 다시 넣고 추출하는 방법으로 동일한 표본이 추출 될 수 있음
    • 비복원추출(Sampling without replacement) : 모집단에서 데이터를 추출 할 때 추출한 데이터를 다시 넣지 않고 추출하는 방법
    • Random Sampling : 모집단에서 데이터를 추출할 때 주의할 점은 편향되지 않아야 함, 각 개체가 모두 동일한 확률로 추출하는 방법
  3. 불균형 데이터(Imbalanced Data)의 문제

    • 데이터가 불균형 데이터 일 경우 문제가 생김

    • 우리가 예측모형을 만드는 목적은 관심이 있는 대상이 발생할 확률을 예측하는 경우가 대부분임, 그런데 예측 대상이 전체 대비 아주 낮다면? 모형의 성능이 괜찮을가? (ex : 신용 평가 모형 개발, 제조 불량 예측 등)

  4. 불균형 데이터(Imbalanced Data)의 해결

    • Sampling 기법을 통하여 해결

    • 모델을 통한 성능 개선(ex: Cost-sensitive learning)

  5. Sampling 기법

    • Over Sampling

      • 타겟 데이터 적은 class의 수를 많은 class의 비율만큼 증가 시킴(일정 비율로 복원추출 하는 개념)
      • 과도적합의 문제 발생할 수 있음
    • Under sampling

      • 타겟 데이터의 많은 class의 수를 적은 class의 비율만큼 감소 시킴

      • 임의로 뽑은 데이터가 biased(편향)될 수 있고, 모형의 성능이 떨어질 수 있음


2. 표본 분포

  1. 통계량(Statistic) : 표본에 기초하여 계산되는 수치 함수를 통계량이라고 함

    Xˉ=x1+x2++xnn\bar X = \frac{x_1+x_2+\dots+x_n}{n}, S2=1n1i=1n(xixˉ)2S^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \bar x)^2

  2. 표본 분포(Sampling distribution) : 통계량들이 이루는 분포를 표본 분포라고 함

  3. 표본 평균(Sample mean)

    Xˉ=1ni=1nXi=1n(x1+x2++xn)\bar X = \frac{1}{n} \sum_{i=1}^n X_i = \frac{1}{n} (x_1 + x_2 + \dots + x_n)

  4. 표본 평균 Xˉ\bar X의 기대값

    E[Xˉ]=E[1n(x1+x2++xn)]=1n(E[x1]+E[x2]++E[xn])=1n(μ+μ++μ)=μE[\bar X] = E[\frac{1}{n} (x_1 + x_2 + \dots + x_n)] = \frac{1}{n}(E[x_1]+E[x_2]+ \dots +E[x_n]) = \frac{1}{n} (\mu + \mu + \dots + \mu)=\mu

  5. 표본 평균 Xˉ\bar X의 분산

    Var[Xˉ]=Var[1n(x1+x2++xn)]=1n2(Var[x1]+Var[x2]++Var[xn])=1n2(σ2+σ2++σ2)=σ2n\text{Var}[\bar X]= \text{Var}[\frac{1}{n} (x_1 + x_2 + \dots + x_n)]= \frac{1}{n^2}(\text{Var}[x_1] + \text{Var}[x_2] + \dots +\text{Var}[x_n])= \frac{1}{n^2}(\sigma^2 + \sigma^2 + \dots + \sigma^2) = \frac{\sigma^2}{n}

  6. 확률 표본
    모집단의 분포가 N(μ,σ2)N(\mu, \sigma^2) 이라고 할때
    확률 표본 X1,X2,X3,,XnX_1,X_2,X_3,\dots,X_niidN(μ,σ2)\sim iid N(\mu, \sigma^2), (independent and identically distribution)

    XˉN(μ,σ2n)\bar X \sim N(\mu, \frac{\sigma^2}{n}), ZN(0,1)Z \sim N(0,1)

  7. 중심극한 정리(central limit theorem)
    평균이 μ\mu 이고 σ2\sigma^2 인 임의의 모집단에서 랜덤 표본 X1,X2,X3,,XnX_1,X_2,X_3,\dots,X_n 을 추출할 때
    표본의 크기 n이 충분히 크면(n30n \geq30), 표본 평균 Xˉ\bar X는 근사적으로 정규분포 N(μ,σ2n)N(\mu, \frac{\sigma^2}{n}) 을 따른다

    Xˉμσ/nN(0,1)\frac{\bar X - \mu}{\sigma / \sqrt n } \sim N(0,1)

  1. 카이제곱 분포(Chi-square distribution)

    • 확률 변수 Z12,Z22,,Zn2Z_1^2, Z_2^2, \dots, Z_n^2 가 표준 정규 분포를 따른다면,
      확률 변수 Z는 Z12+Z22++Zn2Z_1^2 + Z_2^2 + \dots + Z_n^2

    • Zx2(v)Z \sim x^2(v), ZZ가 카이제곱 분포를 따를 때

      f(x;v)=xv21ex22v2Γ(v2),x>0f(x; v) = \frac{x^{\frac{v}{2} - 1} e^{-\frac{x}{2}}}{2^{\frac{v}{2}} \Gamma\left( \frac{v}{2} \right)}, x \gt0

      E[X]=vE[X]=v, Var[X]=2v\text{Var}[X]=2v

    • 카이제곱 분포는 감마 분포에서 a=v2,λ=2a=\frac{v}{2}, \lambda=2 와 같음

    • 카이제곱 분포는 범주형 자료 분석에서 활용함

    • 자유도(degree of freedom)

      • 표본수-제약조건의 수 또는 표본수-추정해야 하는 모수의 수를 의미하며 일반적으로 n-1을 사용함
      • 카이제곱 분포는 자유도 v의 크기에 따라 모양이 달라짐 자유도가 커질수록 분포가 좌우 대칭 형태로 됨
      • 카이제곱 분포는 자유도가 커지면서 표준정규 분포에 근사하며, m ≥ SH이면, 확률을 근사적으로 정규분포로 구할 수 있음
  2. T분포(t-distribution)

    • ZN(0,1)Z \sim N(0,1) 을 따르고 Yx2Y \sim x^2 일 때, γ=zY/v\gamma = \frac{z}{\sqrt{Y/v}} 따름

    • 만약 확률 변수 X가 정규분포를 따르고 모표준편차 σ\sigma 를 안다면,

      Z=Xμσ/nN(0,1)Z = \frac{X-\mu}{\sigma / n} \sim N(0,1)

    • 만약 모표준편차 σ\sigma 를 모른다면, σ\sigma 를 대신해서 표본표준편차 s를 이용하여 확률변수 Z를 정의함

      t=Xμσ/nt(v)t = \frac{X-\mu}{\sigma / n} \sim t(v) , 여기서 vv의 자유도는 n1n-1

    • 확률 변수 X1,X2,,Xniid N(μ,σ2)X_1, X_2, \dots, X_n \sim iid\ N(\mu, \sigma^2) 이면 z=Xμσ/nN(0,1)z=\frac{X-\mu}{\sigma / n} \sim N(0,1), Yz=(n1)S2σ2/nx2(n1)Y \sim z = \frac{(n-1)S^2}{\sigma^2 / n} \sim x^2(n-1)

      T=(Xμσ/n)(n1)S2(n1)σ2=XˉμS/nT = \frac{(\frac{X - \mu}{\sigma / n})}{\sqrt{\frac{(n-1)S^2}{(n-1) \sigma ^2}}} = \frac{\bar X - \mu}{S /\sqrt n } , t의 자유도는 n1n-1

  1. F분포(F distribution)
  • Y1x2(v2),Y2x2(v2)Y_1 \sim x^2(v_2), Y_2 \sim x^2(v_2) 이면 FY1/v1Y2/v2,F>0F \sim \frac{Y_1/v_1}{Y_2/v_2}, F \gt 0

  • 두개의 독립적인 모집단 (Y1,Y2)(Y_1,Y_2) 으로부터 각각 표본을 추출 했을 때

    Y1(n1)S12σ12x2(n11),Y2(n1)S22σ22x2(n21)Y_1 \sim \frac{(n-1)S_1^2}{\sigma_1^2} \sim x^2(n_1 -1), Y_2 \sim \frac{(n-1)S_2^2}{\sigma_2^2}\sim x^2(n_2-1)

    F=Y1/v1Y2/v2=(n1)S12(n11)σ12(n1)S22(n21)σ22=S12/σ12S22/σ22F(n11,n22)F= \frac{Y_1/v_1}{Y_2/v_2} = \frac{{\frac{(n-1)S_1^2}{(n_1 -1)\sigma_1^2}}}{{\frac{(n-1)S_2^2}{(n_2 -1)\sigma_2^2}}} = \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \sim F(n_1 -1, n_2 -2)

  • 서로 독립인 두 정규모집단의 분산 또는 표준편차들의 비율에 대한 통계적 추론, 분산분석 등에 활용됨

0개의 댓글