LGHV_3기_통계 분석_통계(2)

Pepzera·2025년 3월 19일

LGHV3기_공부정리

목록 보기
33/34
post-thumbnail

통계 사전 지식


1. 모집단과 표본

모집단 (Population)

  • 통계적 관찰 대상이 되는 개체의 전체 집합을 의미
  • 즉, 연구 대상이 되는 전체 집합을 의미

표본 (Sample)

  • 모집단에서 조사 대상으로 추출된 부분 집합을 의미
  • 즉, 모집단에서 추출한 일부 데이터를 의미

표본 추출 (Sampling)

  • 모집단에서 표본을 선택하는 과정

전수조사 vs. 표본조사

  • 전수조사
    • 모든 개체를 조사 (예 : 인구조사) → 비용과 시간이 많이 소요됨
  • 표본조사
    • 일부 표본을 이용하여 모집단 특성을 추정 (예 : 여론조사) → 모집단의 특성을 잘 반영해야 함!

모집단과 표본의 수치 표기 방법

구분모집단(모수)표본(통계량)
평균μ (모평균)𝑥̄ (표본평균)
표준편차σ (모표준편차)S (표본 표준편차)
분산σ² (모분산)S² (표본 분산)
대상 수N (전체 개체 수)n (표본 개수)


2. 통계적 추정

통계적 추정이란? 🧐

  • 모집단의 특성을 대표하는 표본을 추출하고, 이를 통해 모집단의 모수를 예측하는 방법

통계적 추정 방법

구분점추정구간 추정
방식모집단의 특성을 하나의 값으로 추정
(예: 모평균은 25)모집단의 특성을 적절한 구간을 이용하여 추정하는 방식
(예 : 모평균은 20~30 사이)
특징모수와 동일한 가능성이 가장 높은 하나의 값을 선택모수가 속하는 일정구간으로 추정 (일반적으로 많이 사용!)

주요 개념

  • 신뢰 수준 (Confidence Level)
    • 모집단의 실제 값이 포함될 확률 (일반적으로 90%, 95%, 99% 등으로 표현)
  • 신뢰 구간 (Confidence Interval)
    • 신뢰 수준 내에서 모수가 포함될 범위 (하한값 ~ 상한값 형식으로 표현)
  • 표본 오차 (Sampling Error)
    • 모집단에서 추출한 표본이 모집단을 완벽히 대표하지 못하는 확률적 차이
  • 예 )
    • 여론조사에서 특정 후보의 지지율이 95% 신뢰 수준, 표본오차 ±3% 오차 범위에서 32.4%로 조사되었다고 한다
    • 이는 신뢰 수준 95%, 표본 오차 ±3%, 신뢰 구간 29.4% ~ 35.4% 를 의미
    • 또한, 이는 모집단의 실제 지지율이 29.4% ~ 35.4% 사이에 있을 가능성이 95%라는 점을 의미한다

3. 가설 검정 (Hypothesis Testing)

가설 검정의 개념

  • 가설 검정 : 모집단의 특성에 대한 가설을 설정하고, 표본을 통해 이를 검증하는 과정
  • 연구자가 설정한 귀무가설(H0)과 대립가설(H1)을 비교하여 유의 수준 α를 기준으로 검정

가설의 유형

가설 유형설명
귀무가설 (H0)차이가 없다”, “효과가 없다” 등 기존 상태를 유지하는 가설
대립가설 (H1)차이가 있다”, “ 효과가 있다” 등 연구자가 증명하려는 가설

유의 수준과 임계값

  • 유의 수준 (α) : 귀무가설을 기각할 기준이 되는 확률
    • 일반적으로 α = 0.05 (5%) 또는 α = 0.01 (1%) 사용
    • α = 0.0595% 신뢰 수준
      • 5% 확률로 귀무가설을 기각할 수 있다는 것을 의미

임계값에 따른 기각역과 채택역

  • 임계값 (Critical value) : 귀무가설 채택 또는 기각 기준점을 의미!
  • 채택역 (Acceptance region) : 임계값 기준 채택 범위
  • 기각역 (Rejection region) : 임계값 기준 기각 범위
  • 신뢰 구간 95% 기준 예시
    • 신뢰 구간 95%의 임계값은 ±1.96 (z-값 기준)이다.
    • 즉, 검정 통계량이 -1.96 ~ 1.96 사이에 있다면 귀무 가설을 채택, 그보다 크거나 작으면 귀무 가설을 기각한다.
    • 만약, 신약의 효과를 검정한다고 가정할 때,
      • 귀무 가설 (H0) : “신약의 효과는 기존 약과 차이가 없다”
      • 대립 가설 (H1) : “신약의 효과는 기존 약과 차이가 있다”
    • 이 때, 실험 결과 검정 통계량이 -1.5 이면
      • 이는, 채택역에 위치하므로 귀무 가설을 채택함
      • 즉, 신약이 기존 약과 차이가 없다고 볼 수 있음

유의 수준과 임계값 (Z-값 기준)

유의 수준 α신뢰 수준Z - 임계값
α = 0.0199%±2.58
α = 0.0595%±1.96
α = 0.1090%±1.64

가설 검정의 오류

오류 유형설명결과
제 1종 오류귀무가설이 참인데 기각False Positive
제 2종 오류귀무가설이 거짓인데 채택False Negative
  • 가설 검정에서는 두 가지 오류가 발생
  • 제 1종 오류가 발생되는 것을 감안해서 유의 수준을 정함
  • 제 2종 오류를 범하지 않을 확률은 ‘1-β = 검정력’ 임

가설 검정의 유형

  • 양측 검정
    • 방향성을 정하지 않고, ‘차이가 있다’를 검정하는 방법
    • 즉,’신약이 기존 약과의 차이가 있을까?’ 를 검정하는 것
    • 기각역이 양쪽에 존재
      • Z값 ±1.96 (α=0.05 기준)
  • 단측 검정
    • 방향성을 정하고, ‘더 크다’ 혹은 ‘더 작다’를 검정하는 방법
    • 즉, ‘신약이 기존 약 보다 좋은 효과를 낼까?’ 또는 ‘신약이 기존 약 보다 나쁜 효과를 낼까?’ 를 검정
    • 기각역이 한쪽에 존재
      1. 기각역 오른쪽 존재
        • 효과가 더 좋아야만 유의미!
        • Z값이 +1.645 (α=0.05 기준)
      2. 기각역 왼쪽 존재
        • 효과가 더 나빠야지만 유의미!
        • Z값이 -1.645 (α=0.05 기준)

검정 통계량과 p-값

  • 검정 통계량 (Test Statistic)
    • 가설 검정을 위해 수집된 자료를 계산한 통계량
    • 가설 검정에서 기각역을 결정하는 기준이 되는 통계량
    • 즉, 가설 검정에서 표본을 기반으로 계산되는 값이다
  • p-값 (p-value)
    • 귀무 가설이 사실일 확률
    • p < α → 귀무가설 기각 (통계적으로 유의미함)
    • p ≥ α → 귀무가설 채택 (통계적으로 유의미하지 않음)

가설 검정 절차

(앞서 통계 분석 (1)에서 설명)

  1. 연구 문제 정의
  2. 가설 설정 (귀무가설, 대립가설)
  3. 유의 수준 설정 (예: α=0.05)
  4. 검정 방법 선택 (Z-검정, t-검정 등)
  5. 검정 통계량 계산
  6. p-값과 유의 수준 비교
  7. 귀무가설 기각 or 채택 결정
  8. 결과 해석 및 보고

4. 정규 분포 (Normal Distribution)

정규 분포

  • 도수분포곡선이 중앙으로 하여 좌우대칭인 종 모양
  • 평균과 표준편차에 의해서 정규분포 모양과 위치가 결정됨!

정규 분포 특징

  • 평균을 중심으로 좌우 대칭
  • 평균 μ 과 표준편차 σ 에 따라 형태 결정
  • 대부분 정규 분포를 이룬다고 가정하고, 통계 분석을 진행함
  • ‘중심 극한의 정리’에 의해서 데이터의 수가 많아질수록 정규 분포를 따름

    gpt한테 그림 부탁..

5. 모수 검정 vs. 비모수 검정

모수 검정 (Parametric Test)

  • 정규 분포를 가정하는 검정 방법
  • 모집단이 확률 분포(정규 분포, 이항 분포 등)를 따르는 경우
  • 표본 크기가 충분히 크면 사용 가능 (보통 30개 이상이면 중심극한정리에 의해 가정 가능)

대표적인 모수 검정 방법 📌

검정 방법설명
t-검정 (t-test)두 그룹의 평균 비교 (정규성 가정)
ANOVA (분산 분석)3개 이상의 그룹 평균 비교
회귀 분석 (Regression)변수 간 관계 분석
상관 분석 (Pearson Correlation)연속형 변수 간 상관관계 분석

비모수 검정 (Non-Parametric Test)

  • 정규 분포를 가정하지 않은 검정 방법
  • 모집단의 특정한 분포를 전제하지 않고 순위, 중위값, 범위 등을 활용
  • 작은 데이터셋, 이상치(Outlier)가 많은 데이터에서 유용

대표적인 비모수 검정 방법 📌

검정 방법설명
윌콕슨 순위합 검정 (Wilcoxon Rank Sum Test)t-검정의 비모수 버전 (두 그룹 비교)
만-휘트니 U 검정 (Mann-Whitney U Test)독립 표본 비교 (중앙값 차이 검정)
크루스칼-월리스 검정 (Kruskal-Wallis Test)ANOVA의 비모수 버전 (3개 이상 그룹 비교)
스피어만 상관 분석 (Spearman Correlation)Pearson 상관 분석의 비모수 버전

0개의 댓글