[ADsP] 3과목 정리(4)

전민정·2025년 5월 9일

ADsP 자격증

목록 보기
4/15

4장 통계 분석

2절 기초 통계분석

(1) 기술통계

기술통계(Descriptive Statistics)의 정의

  • 자료의 특성을 표, 그림, 통계량 등을 사용하여 쉽게 파악할 수 있도록 정리/요약하는 것
  • 자료를 요약하는 기초적 통계를 의미
  • 데이터 분석에 앞서 데이터의 대략적인 통계적 수치를 계산해 봄으로써 데이터에 대한 대략적인 이해와 앞으로 분석에 대한 통찰력을 얻기에 유리

통계량에 의한 자료 정리

  • 중심위치의 측도

    • 자료(데이터) :
      X1,X2,,XnX_1, X_2, \dots, X_n
    • 표준평균(Sample mean) :
      Xˉ=1n(X1+X2++Xn)=i=1nXin\bar{X} = \frac{1}{n} (X_1 + X_2 + \cdots + X_n) = \sum_{i=1}^{n} \frac{X_i}{n}
    • 중앙값(Median) : 자료를 크기순으로 나열할 때 중앙에 위치하는 자룟값(중앙값의 순위는 (n+1)/2)
      • n이 홀수인 경우 : (n+1)/2
      • n이 짝수인 경우 : n/2번째 값과 (n/2)+1번째 값의 평균
  • 산포의 측도(데이터가 얼마나 퍼져있는지 측정) : 대표적인 산포도(Dispersion)는 분산, 표준편차, 범위 및 사분위수 범위

    • 분산(Variance) : 데이터가 평균과 얼마나 떨어져있는지 확인, 값과 평균 사이의 거리 제곱하여 다 더하여 n-1로 나눔(모분산일 경우 n, 표본의 경우 n-1로 나눔)

      S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X})^2
    • 표준편차(Standard deviation) :

      s=s2=1n1i=1n(XiXˉ)2s = \sqrt{s^2} = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X})^2}
    • 사분위수 범위(Interquartile range) :

      IQR=Q3Q1IQR = Q_3 - Q_1
    • 사분위수 :
      제 1사분위수(Q1) = 25백분위수
      제 2사분위수(Q2) = 50백분위수
      제 3사분위수(Q3) = 75백분위수

    • 백분위수(Percentile) : {(n-1)p/100+1}번째 값

    • 변동계수(Coefficient of variation) : 표준편차를 산술평균으로 나누는 것, 측정단위가 서로 다른 자료를 비교하고자 할 때 쓰인다.

      V=sXˉV = \frac{s}{\bar{X}}
    • 평균의 표준오차 : 표본의 크기(n)이 커질수록 표준오차의 값은 작아진다.

      SE(X)=snSE(X) = \frac{s}{\sqrt{n}}
    • 분포의 형태에 관한 측도

      • 왜도(Skewness) : 분포의 비대칭 정도를 나타내는 측도
        - 왜도>0(왜도가 양수일 때) : 오른쪽으로 긴 꼬리를 갖는 분포
        - 왜도=0(왜도가 0일 때) : 좌우가 대칭인 분포
        - 왜도<0(왜도가 음수일 때) : 왼쪽으로 긴 꼬리를 갖는 분포

      • 첨도(Kurtosis) : 분포의 중심에서 뾰족한 정도를 나타내는 측도, 정규분포에서 0일 때, 첨도>0 : 긴 꼬리, 첨도<0 : 짧은 꼬리

        • 첨도>0(첨도가 양수일 때) : 표준정규분포보다 더 뾰족함
        • 첨도=0(첨도가 음수일 때) : 표준정규분포보다 덜 뾰족함
        • 첨도<0(첨도가 0일 때) : 표준정규분포와 유사한 뾰족함
      • 왜도에 따라서 최빈값, 중앙값, 평균 위치가 달라진다.

그래프를 이용한 자료 정리

  • 히스토그램, 줄기-잎 그림, 상자그림, 산점도, 원그래프, 꺾은선 그래프 등

  • 히스토그램(Histogram) : 표로 되어 있는 도수 분포를 그림으로 나타낸 것, 도수분포표를 그래프로 나타낸 것.

  • 막대그래프 vs 히스토그램

    • 막대그래프는 범주(Category)형으로 구분된 데이터(예:직업, 종교, 음식 등)를 표현하며 범주의 순서를 의도에 따라 바꿀 수 있음
    • 히스토그램은 연속(Continuous)형으로 표시된 데이터(예:몸무게, 성적, 연봉 등)를 표현하며 임의로 순서를 바꿀 수 없고 막대의 간격이 없음
  • 히스토그램(Histogram) : 데이터의 수를 활용해서 계급의 수와 계급간격을 계산하여 도수분포표를 만들고 히스토그램 생성

    • 계급의 수: 2^k >= n을 만족하는 최소의 정수 -> log_2n = k에서 최소의 정수(k는 계급 수, n은 데이터 수)
    • 계급의 간격 : (최댓값 - 최솟값)/계급의 수
    • 계급의 수와 간격이 변하면 히스토그램의 모양이 변함
    • R프로그램 : hist(변수,nclass=k,right=F)
  • 줄기-잎 그림(Stem-and leaf plot) : 데이터를 줄기와 잎의 모양으로 그린 그림

    • R프로그램 : stem(변수, scale=1) <- scale 1은 10개의 가지, 2는 20개의 가지, 0.5는 5개의 가지로 표현
  • 상자그림(Box plot):다섯숫자 요약을 통해 그림으로 표현(최솟값,Q1,Q2,Q3,최댓값)

    • 사분위수 범위(IQR) : Q3 - Q1
    • 안울타리(inner fence) : Q1 - 1.5 x IQR 또는 Q3 + 1.5 x IQR
    • 바깥울타리(outer fence) : Q1 - 3 x IQR 또는 Q3 + 3 x IQR
    • 보통이상점(mild outlier) : 안쪽 울타리와 바깥울타리 사이에 있는 자료
    • 극단이상점(extreme outlier) : 바깥울타리 밖의 자료
    • R프로그램 : boxplot(변수 ~ class) <- class는 특정 명목형 자료로 이루어진 변수명으로 명목형 자료별 상자그림을 만들 수 있음

(2) 추정과 가설 검정

확률표본(Random sample)

  • 확률 분포는 분포를 결정하는 평균, 분산 등의 모수(parameter)를 가지고 있음
  • 특정한 확률분포로부터 독립적으로 반복해 표본을 추출하는 것
  • 각 관찰값들은 서로 독립적이며 동일한 분포를 가짐

추정

  • 표본으로부터 미지의 모수를 추측하는 것(표본으로부터 모집단을 설명할 수 있는 미지의 값들을 추측하는 것)

  • 추정에는 점추정(Point estimation)과 구간추정(Interval estimation)으로 구분

  • 1)점추정(Point estimation) : '모수가 특정한 값일 것'이라고 추정하는 것

    • 표본의 평균, 중위수, 최빈값 등을 사용
    • 점추정량의 조건 :
      • 1.불편성(Unbiasedness) : 모든 가능한 표본에서 얻은 추정량의 기댓값이 변하지 않음
      • 2.효율성(Efficiency) : 추정량의 분산이 작을수록 좋음
      • 3.일치성(Consistency) : 표본의 크기가 아주 커지면, 추정값이 모수와 거의 같아짐
      • 4.충족성(Sufficient) : 추정량이 모수에 대하여 모든 정보를 제공
    • 표본평균(Sample mean) : 확률표본의 평균값으로 모집단의 평균값을 추정
      xˉ=1ni=1nXi\bar{x} = \frac{1}{n} \sum_{i=1}^{n}X_i
    • 표본분산(Sample variance) : 모집단의 분산(모분산)추정하기 위한 추정량
      S2=1n1i=1n(Xixˉ)2S^2 = \frac{1}{n-1} \sum_{i=1}^{n}(X_i - \bar{x})^2
      • 실제 X값이 표본평균값과의 차이들을 제곱하고 더해서 n-1으로 나눔
  • 2)구간추정(Interval estimation)

    • 점추정의 정확성을 보완하기 위해 확률로 표현된 믿음의 정도 하에서 모수가 특정한 구간에 있을 것이라고 선언하는 것
    • 항상 추정량의 분포에 대한 전제가 주어져야 하고, 구해진 구간 안에 모수가 있을 가능성의 크기(신뢰수준(Confidence interval))가 주어져야 한다.
    • 95% 신뢰수준 하에서 모평균의 신뢰구간
      ①. 모분산이 알려져 있는 경우(대표본의 경우) 확률표본(Random smaple)
      (xˉ1.96σn,xˉ+1.96σn)(\bar{x} - 1.96\frac{\sigma}{\sqrt{n}}, \bar{x} + 1.96\frac{\sigma}{\sqrt{n}})
      표본정규분포 N(0,1)를 따르는
      Z=xˉμσn통계량을이용Z = \frac{\bar{x}-\mu}{\sigma\sqrt{n}}통계량을 \quad이용
      • 모집단의 분산을 알고 있는 상태에서 모평균을 추정할 경우 확률표본을 표준정규분포값에서 가져와서 위의 식으로 구할 수 있다.
      • 표본정규분포을 활용하는 이유는 모분산을 알고있는 경우 평균만 구하면 되고 표준화된 정규분포로 값을 쉽게 찾을 수 있다.
      ①. 모분산이 알려져 있지 않은 경우(소표본의 경우) 모분산 대신 표본분산을 사용
      (xˉ2.26sn+2.26sn)(\bar{x} - 2.26\frac{s}{\sqrt{n}}+2.26\frac{s}{\sqrt{n}})
      ②. 자유도가 n-1인 t-분포를 따르는
      T=xˉμs/n통계량을이용T = \frac{\bar{x}-\mu}{s/\sqrt{n}}통계량을 \quad이용

가설검정

  • 가설검정

    • 모집단에 대한 어떤 가설을 설정한 뒤에 표본 관찰을 통해 그 가설의 채택 여부를 결정하는 분석 방법
    • 표본 관찰 또는 실험을 통해 귀무가설과 대립가설 중에서 하나를 선택하는 과정
    • 귀무가설이 옳다는 전제하에 검정통계량 값을 구한 후에 이 값이 나타날 가능성의 크기에 의해 귀무가설의 채택 여부를 결정
    • 귀무가설(Null hypothesis, H0) : '비교하는 값과 차이가 없다, 동일하다'를 기본개념으로 하는 가설
    • 대립가설(Alternative hypothesis, H1) : 뚜렷한 증거가 있을 때 주장하는 가설
    • 검정통계량(Test statistic, T(x)) : 관찰된 표본으로부터 구하는 통계량. 검정 시 가설의 진위를 찬단하는 기준
    • 유의수준(Sighificance level, α) : 귀무가설을 기각하게 되는 확률의 크기로 '귀무가설이 옳은데도 이를 기각하는 확률의 크기'
    • 기각역(Critical region, Rejection resion, C) : 귀무가설이 옳다는 전제하에 구한 검정통계량의 분포에서 확률이 유의수준인 부분(반대는 채택역(acceptance region))
  • 오류의 종류

    • 제 1종 오류(type 1 error) : 귀무가설이 옳은데도 귀무가설을 기각하게 되는 오류
    • 제 2종 오류(type 2 error) : 귀무가설이 옳지 않은데도 귀무가설을 채택하게 되는 오류
    • 두 가지 오류는 서로 상충관계 두 가지 오류는 서로 상충관계가 있어서 일반적으로 가설검정에서는 제 1종 오류 α의 크기를 0.1, 0.05, 0.01 등으로 고정시킨 뒤 제 2종 오류 β가 최소가 되도록 기각역을 설정

(3) 범주형 자료 분석

범주형 자료 분석 개요(표 중요)

  • 범주형 자료 분석은 분석에 사용되는 변수들이 범주형일 때 사용하는 분석 방법론임
  • 설명변수와 반응변수에 따른 범주형 자료 분석 방법론은 아래와 같이 분류할 수 있음
    • 설명변수는 독립변수로 x, 반응변수는 종속변수로 y를 많이 사용한다.

분할표(Contingency Table) 분석

1)개요

  • 여러 개의 범주형 변수를 기준으로 빈도를 표 형태로 나타낸 것을 분할표(또는 교차표)라 함

  • 아래의 표는 2개의 범주형 변수(학년, 성적 등급)별 빈도를 분할표로 나타낸 것임

  • 범주형 변수가 1일 때는 1원 분할표, 2개일 때는 2원 분할표, 3개 이상일 때는 다원 분할표로 표시함

  • 분할표의 행은 설명변수, 열은 반응변수를 입력하고 범주형 자료를 분석할 때는 이 분할표를 기반으로 여러 가지 검정을 수행할 수 있음

2)상대위험도(Relataive Risk, RR)

  • 상대위험도란 관심 집단의 위험률/비교 집단의 위험률을 의미하며, 여기서 위험률이란 특정 사건이 발생할 비율을 의미함
  • 예를 들어 위험인자에 노출된 암환자의 비율/위험인자에 노출되지 않은 암환자의 비율
  • 다음과 같은 분할표에서 상대위험도를 식으로 표현하면 아래의 식과 같음
    • a,b,c,d는 빈도수

3)오즈비(Odds Ratio) (중요)

  • 오즈(Odds)란 성공확률/실패확률로 성공할 확률이 실패할 확률의 몇 배인지를 나타냄
  • 오즈비(Odds Ratio)란 오즈의 각 범주별 비율로 정의
  • 예를 들어 2002년에 한국과 브라질이 월드컵 19강에 진출을 성공/실패할 확률과 각각의 오즈와 오즈비는 아래와 같이 계산됨
  • 오즈비가 36으로 계산되었으며, 이는 브라질의 16강 진출 확률이 한국의 16강 진출 확률보다 36배 높다고 해석할 수 있음

교차분석

1)카이제곱 검정이란?

  • 범주형 자료(명목/서열 수준)인 두 변수 간의 관계를 알아보기 위해 실시하는 분석 기법
  • 적합성 검정, 독립성 검정, 동질성 검정에 사용되며, 카이제곱 검정 통계량을 이용

2)교차표

  • 두 변수의 각 범주를 교차하여 데이터의 관측도(빈도)를 표 형태로 나타내면 아래와 같음
    • 'O'라고 되어 있는 것은 관찰빈도
  • 교차분석은 교차표에서 각 셀의 관찰빈도(자료로부터 얻은 빈도분포)와 기대빈도(두 변수가 독립일 때 이론적으로 기대할 수 있는 빈도분포)간의 차이를 검정함


(4) 분산분석

분산분석 개요

  • 분산분석(Analysis of Variance, ANOVA)는 2개 이상의 집단에서 그룹 평균 간 차이를 그룹 내 변동에 비교하여 살펴보는 통계 분석 방법
  • 즉, 두 개 이상 집단들의 평균 간 차이에 대한 통계적 유의성을 검증(두 개 이상 집단들의 평균을 비교)하는 방법

일원배치 분산분석

1)개념

  • 분산분석에서 반응 값에 대한 하나의 범주형 변수의 영향을 알아보기 위해 사용되는 검증 방법
  • 모집단의 수에는 제한이 없으며, 각 표본의 수는 같지 않아도 됨

2)가정

  • 각 집단의 측정치는 서로 독립적이며, 정규분포를 따르며, 각 집단 측정치의 분산은 같음(등분산 가정)

3)분산분석표

  • x1 데이터는 범주형 데이터(독립변수), y는 연속형 데이터(종속변수)이어야 함
  • 집단 내 변동은 작을수록 좋고, 집단 간 변동은 클수록 좋다.
  • SSB + SSW = SST, (k-1) + (N-k) = N-1

4)가설검정

  • 귀무가설 : k개의 집단 간 모평균에 차이가 없다.

    (H0:μ1=μ1==μk)(H_0:\mu_1 = \mu_1 = \cdots = \mu_k)
  • 대립가설 : k개의 집단 간 모평균이 모두 같다고 할 수 없다.

    (H1:notH0)(H_1:notH_0)

    (적어도 모평균이 같은 한쌍의 집단이 존재한다.)

  • 분산분석 표를 통해서 f검정을 하게 되고, 기술통계량을 뽑아낸다.

  • f값에 해당하는 확률값을 찾아내서 유의수준 0.05(신뢰수준 95%) 하에서 귀무가설을 기각시키고 대립가설을 채택하는 결과가 나온다면 집단 간의 평균 차이가 있다는 것이다.

  • 그 후에는 사후 검정을 해야 한다.

사후검정

  • 사후검정이란 분산분석의 결과 귀무가설이 기각되어 적어도 한 집단에서 평균의 차이가 있음이 통계적으로 증명되었을 경우, 어떤 집단들에 대해서 평균의 차이가 존재하는지를 알아보기 위해 실시하는 분석
  • 다중비교(Multiple Comparison)라고도 하며, 던칸(Duncan)의 MR(Multiple Range test)방법, 피셔(Fisher)의 최소유의차(LSD)방법, 튜키(Tukey)의 HSD방법, Scheffe의 방법 등이 있음

(5) 비모수 검정

비모수 검정 개요

  • 통계적 검정에서 모집단의 모수에 대한 검정은 모수적 검정과 비모수적 검정으로 구분

모수적 방법(Parametric method)

  • 검정하고자 하는 모집단의 분포에 대한 가정을 하고, 그 가정하에서 검정통계량과 검정통계량의 분포를 유도해 검정을 실시하는 방법

비모수적 방법(Nonparametric method)

  • 자료가 추출된 모집단의 분포에 대한 아무 제약을 가하지 않고 검정을 실시하는 검정 방법
  • 관측된 자료가 특정분포를 따른다고 가정할 수 없는 경우 이용
  • 관측된 자료의 수가 많지 않거나 자료가 개체간의 서열관계를 나타내는 경우

비모수 검정과 모수적 검정의 차이점

① 가설의 설정

  • 모수적 검정 : 가정된 분포의 모수에 대해 가설을 설정
  • 비모수 검정 : 가정된 분포가 없으므로 가설은 단치 '분포의 형태가 동일하다' 또는 '분포의 형태가 동일하지 않다'와 같이 분포의 형태에 대해 설정

② 검정 방법

  • 모수적 검정 : 관측된 자료를 이용해 구한 표본평균, 표본분산 등을 이용해 검정을 실시
  • 비모수적 검정 : 관측값의 절대적인 크기에 의존하지 않는 관측값들의 순위(rank)나 두 관측값 차이의 부호 등을 이용해 검정

비모수 검정의 종류(명목형 변수를 활용한 검정)

  • 부호검정(sign test)
  • 윌콕슨의 순위합 검정(rank sum test)
  • 윌콕슨의 부호 순위합 검정(Wilcoxon signed rank test)
  • 맨-휘트니의 U 검정
  • 런 검정(run test)
  • 스피어만의 순위상관계수

모수적 검정의 종류

  • 단일 표본 T-검정
  • 독립 표본 T-검정
  • 대응 표본 T-검정
  • ANOVA
  • 피어슨의 상관계수

(6) 상관분석

인과관계의 이해

  • 용어
    • 종속변수(반응변수, y) : 다른 변수의 영향을 받은 변수
    • 독립변수(설명변수, x) : 영향을 주는 변수
    • 산점도(scatter plot) : 좌표평면 위에 점들로 표현
      < 산점도에서 확인할 사항 >
    • 두 변수 사이의 선형관계(직선관계)가 성립하는가?
    • 두 변수 사이의 함수관계(직선관계 또는 곡선관계)가 성립하는가?
    • 이상값이 존재하는가?
    • 몇 개의 집단으로 구분(총별)되는가?
    • 공분산(covariance) : 선형관계 확인
      • 두 확률변수 X, Y의 방향의 조합(선형성)이다.
        Cov(X,Y)=E[(Xμx)(Yμy)]Cov(X,Y) = E[(X - \mu_x)(Y - \mu_y)]
      • 공분산의 특징
        X,Y서로독립이면,Cov(X,Y)=0Cov(X,Y)=σxy=E[XY]E(X)E(Y)X, Y가 \quad 서로 \quad 독립이면, \quad Cov(X,Y) = 0 \\ Cov(X,Y) = \sigma_xy = E[XY] - E(X)E(Y)

상관분석의 정의

  • 데이터 안의 두 변수 간의 관계를 알아보기 위한 분석 방법
  • 두 변수의 상관관계를 알아보기 위해 상관계수(Correlation coefficient)를 이용

상관계수의 정의

  • 피어슨 상관계수
    r=Cov(x,y)sx2sy21<r<1r = \frac{Cov(x,y)}{\sqrt{s^2_x}\sqrt{s^2_y}} \quad -1 < r < 1
    (공분산과 표준편차를 이용해 스케일링을 통해 r을 -1과 1 사이로 제한)
rXY=in(XiX)(YiY)in(XiX)2in(YiY)2r_{XY} = \frac{\sum_i^n (X_i - \overline{X})(Y_i - \overline{Y})}{\sqrt{\sum_i^n (X_i - \overline{X})^2} \, \sqrt{\sum_i^n (Y_i - \overline{Y})^2}}
  • 두 변수의 공분산을 각각의 표준편차의 곱으로 나눈 값
  • 구간척도, 비율척도 경우 활용
  • ex) 온도, 거리, 무게, 나이 등
  • 스피어만 상관계수
    • 순위 상관계수
    • 순서척도
    • ex) 만족도

상관계수의 특성

  • 상관계수가 1에 가까울수록 데이터가 강한 양의 상관관계를 갖는다.
  • 상관계수가 -1에 가까울수록 데이터가 강한 음의 상관관계를 갖는다.
  • 상관계수가 0인 경우 데이터 간의 상관관계가 없다.

0개의 댓글