Ch1_자료의 정리와 요약

Kamator0·2026년 4월 16일

자료의 구분

수치로 표현 가능

  • 양적자료 (Quantitaive Data)
    • 이산자료(discrete data)
      10년간 출생아 수와 같은 공백이 있고 산발적으로 측정되는 자료
    • 연속자료(continous data)
      오늘 하루동안의 기온변화와 같이 지정된 구간 안에서 관측값 사이에 공백 없이 측정되는 자료

수치로 표현 불가능

  • 질적자료 (Qualitative Data)
    • 명목자료 (nominal data)
      자료의 순서 또는 크기를 정의 할 수 없는 형태
      ex : 성별: 남, 여 | 혈액형: A, B, O, AB | 지역: 서울, 부산, 대구 | 혼인상태: 미혼, 기혼, 이혼
    • 순서자료 (ordinal data)
      자료의 순서는 정의 되나 크기가 정의 되지 않는 형태
      ex : 기업 규모에 따른 대기업 / 중기업 소기업, 학점의 등급, 강의 평가
  • 범주형자료 (Categorical Data)
    계절 : 봄 여름 겨울 가을

도수분포표

  • 자료를 자료의 특성을 기준으로 일정한 계급(class)로 나눈 다음, 각 계급에 속하는 자료의 도수(frequency)를 대응하여 작성한 표를 도수분포표(frequency distribution table)라고 한다.
  • 각 계급에 속하는 자료의 상대도수를 (relative frequency)를 대응하여 작성한 표를 상대도수분포표(relative freqeuncy distribution table)라고 한다.

범주형 도수분포표

  • 자료의 성격을 둘 이상의 범주로 나누어 정리한 도수분포표이다.
  • 모든 질적자료는 범주형 도수분포표로 작성가능하고 양적자료 중에서는 이산자료만 작성 가능하다. 이때 이산자료는 범주의 순서를 되도록 바꾸지 않아야 한다.

범주형 도수분포표의 작성 순서

  1. 자료가 집단으로 묶일 수 있도록 범주를 설정한다.
  2. 각 범주에 속하는 도수(f)와 상대도수(f/n)(f/n) 를 표로 정리한다.
  • 도수 : 각 범주에 속하는 자료의 수
  • 상대도수 : 전체 도수에 대하여 각 범주에 속한 도수의 비율로, 전체 도수를 n,i 번째 범주에 속한 도수를 fif_i 라고 할 때, 다음과 같이 계산한다.
    (상대도수) = fi/nf_i / n 또는 fi/n100(퍼센트)f_i / n * 100(퍼센트) (i = 1, 2,3,4 .. )

계급형 도수분포표

  • 관측값을 일정한 간격으로 묶어 구간을 나누고 각 구간에 속하는 자료의 수를 기록함으로써 의미 있는 도수분포표를 작성할 수 있다
  • 이와 같은 도수분포표를 계급형 도수분포표(또는 도수분포표)라고 하고 여기에 해당하는 자료는 양적자료이다.
  • 계급의 간격은 모두 일정해야하고 중복되는 부분은 없애야한다.
  • 계급의 양 끝 값이 복잡한 소수형태로 나온다면 계급의 간격을 분명하기 위해서 그 값에 가까운 자연수로 계급의 양 끝값을 근사하여 사용가능
  • 계급의 간격이 넓으면 자료가 가진 정보 손실, 계급의 간격이 좁으면 도수분포표 복잡

계급형 도수분포표 작성 순서

① 계급 설정

  • 범위: R=xmaxxminR = x_{\max} - x_{\min}
  • 계급 수: k=(1+log2n)k = (1 + \log_2 n)에 가장 가까운 자연수
  • 계급 간격: c=Rkc = \dfrac{R}{k}

② 계급값
xi=계급의 양 끝값의 합2x_i = \frac{\text{계급의 양 끝값의 합}}{2}

③ 도수 / 상대도수 / 누적도수 / 누적상대도수

  • 도수: 각 계급에 속하는 자료의 수

  • 상대도수:
    fin또는fin×100%\frac{f_i}{n} \quad \text{또는} \quad \frac{f_i}{n} \times 100\%

  • 누적도수:
    Fi=f1+f2++fi=v=1ifvF_i = f_1 + f_2 + \cdots + f_i = \sum_{v=1}^{i} f_v

  • 누적상대도수:
    Fin또는Fin×100%\frac{F_i}{n} \quad \text{또는} \quad \frac{F_i}{n} \times 100\%

그림을 이용한 자료 정리

막대 그래프 (bar chart)

  • 수직 막대그래프 (vertical bar chart)
    막대를 세로로 나타냄
  • 수평 막대그래프 (horizontal bar chart)
    막대를 가로로 나타냄

히스토그램

  • 양적자료의 도수분포표에서 계급의 간격을 밑변으로 하고 계급의 도수를 높이로 하는 직사각형을 좌표평면에 차례로 나타낸 그래프

도수분포다각형

  • 히스토그램에서 각 계급 구간에 대한 계급값의 빈도수를 직선으로 연결하여 나타낸 그림
    각 직사각형의 윗변의 중점, 즉 각 계급의 계급값에 해당하는 도수를 선분으로 연결하고, 양 끝은 도수가 0인 계급을 하나씩 추가하여 그 중점을 연결하여 그린 그래프

원그래프

  • 원을 계급의 수나 자료의 범주수만큼 부채꼴 모양의 여러 조각으로 나누어 표현 그림
    (부채꼴의 중심각) = 360 * (상대도수)

줄기-잎 그림

  • 도수분포표나 히스토그램에서는 자료의 분포를 쉽게 알 수 있지만, 각 자료의 관측값에 대한 정보는 알 수 없다. 자료의 분포 형태를 쉽게 파악하면서도 각 관측값을 알 수 있는 그림

꺽은선그래프

  • 시간의 경과에 따라 연속으로 관측한 데이터에 대하여 동일한 시간 간격으로 측정한 데이터를 시계열 데이터(time series data)
  • 변화 추이를 쉽게 파악할 수 있다.

번외

  • 퍼센트와 퍼센트 포인트
    • 퍼센트 (%)
      한 수치를 100으로 두고, 다른 수치를 100에 대한 비율로 나타내고 두 수치의 상대적인 크기를 바로 비교, 보통 퍼센트를 %로 표기하며 백분율이라고도 한다.
    • 퍼센트 포인트 (%p)
      퍼센트는 일반적인 수치처럼 서로 더하거나 뺄 수 없음 비교하는 수치의 기준이 동일한 경우에 가능
      두 퍼센트 차이를 퍼센트 포인트라 하며 %p로 표기
      ex 2% -> 1% 감소하였다 1%p 감소하였다로 표기

대푯값

산술평균

  • 평균(mean)에는 산술평균, 기하평균, 조화평균 등이 있다. 일반적으로 평균이라고 하면 산술평균(arithmetic mean)을 의미한다.

  • 변량 X에 대한 표본 n개의 자료가 주어질 때, 변량 X의 산술평균을 표본평균(sample mean)이라고 하고 xˉ\bar{x}로 나타낸다
    xˉ=1ni=1nxi=x1+x2++xnn\bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i = \frac{x_1 + x_2 + \cdots + x_n}{n}

  • 변량 X가 모집단에서 얻은 관측값으로 주어질 때 변량 X의 산술평균을 모평균(population mean)이라고 한다 μ\mu 로 나타낸다
    μ=1ni=1nxi=x1+x2++xnn\mu = \frac{1}{n} \sum_{i=1}^{n} x_i = \frac{x_1 + x_2 + \cdots + x_n}{n}

  • 변량 X의 자료가 범주형 도수분포표로 주어질 때는 가중산술평균(wegithed artimetic mean) 이라 하고 xˉ\bar{x}로 나타낸다
    xˉ=1ni=1kxifi=x1f1+x2+f2+xkfkn\bar{x} = \frac{1}{n} \sum_{i=1}^{k} x_i * f_i = \frac{x_1 * f_1 + x_2 + f_2\cdots + x_k * f_k}{n}
    k : 범주의수 , i=1kfi=n\sum_{i=1}^{k} f_i = n

산술평균의 성질

  • 산술평균에 대한 편차의 합은 0이다
  • 산술평균은 편차의 제곱의 합을 최소로 한다. 즉 산술평균에 대한 편차의 제곱의 합은 임의 수에 대한 제곱의 합보다 크지 않다
  • 산술평균은 주어진 자료를 모두 사용하므로 정보 손실 없음 특히 표본들의 평균인 표본 평균은 모집단을 추론할 때 유용하게 사용
  • 산술평균은 영적자료에 대해서만 구할 수 있으며 대다수의 자료와 멀리 떨어져 있는 극단값(outlier)에 민감하게 작용한다. (극단값은 이상점이라고도 한다)

중앙값

  • 변량 X의 n개의 자료를 작은 값부터 크기순으로 배열했을 때, 한가운데에 위치한 값을 중앙값(median)또는 중위수라 하고 MeMe 로 표기한다.

  • 중앙값은 양적자료의 중심을 나타내고 자료의 수가 홀수 인지 짝수인지에 따라 구분한다.

  • 중앙값은 다음과 같이 편차의 절댓값의 합을 최소로 한다는 성질을 갖는다
    1ni=1nxiMe\frac{1}{n} \sum_{i=1}^{n} |x_i-Me| <=<= 1ni=1nxia\frac{1}{n} \sum_{i=1}^{n} |x_i-a|
    (단, a는 상수)

최빈값

  • 변량 X의 자료중에서 가장 많이 나타나는 값을 최빈값(mode)라고 하고 MoMo로 표기한다.
  • 최빈값은 자료에 따라 두 개 이상일 수도 있다.

도수분포곡선 (frequency distribution curve)

  • 자료의 수를 늘리고 계급의 간격을 좁게 하여 계급 구간의 수를 늘리면 곡선 형태로 수렴

산술평균, 중앙값, 최빈값 사이의 관계

  • 도수분포곡선이 단봉형으로 나타내고 극히 비대칭이 아닌 자료 집단의 경우에는 피어슨(Pearson)의 실험 공식이 성립한다.
    xˉ\bar{x} - MoMo ≈ 3(xˉ\bar{x} -MeMe)

백분위수와 사분위수

  • 변량 X의 n개의 자료를 작은 값부터 크기순으로 배열했을 때, 0<= p <=1 인 p에 대하여 제 100p 백분위수(100pth percentile)라 한다.

백분위수 구하는 법

  • np가 정수 일때와 정수가 아닐때를 구분하여 구한다.

절사평균 (trimmed mean)

  • 절사평균은 평균의 장점과 중앙값의 장점을 모두 고려한 대표값으로 극단값을 제외하고 구한 평균이다.
  • 절사평균을 계산하려면 절사비율(%)을 결정해야하는데, 상위 몇 퍼센트의 data와 하위 몇 퍼센트의 data를 베제할 것인가를 결정해야한다.

구하는 방법

산포도 (measure of dispersion)

  • 자료의 분포 상태를 알기 위해서는 자료의 중심 위치뿐만 아니라 자료가 흩어진 정도를 함께 고려해야한다. 이와 같이 흩어진 정도를 산포도라고 한다
  • 대표값은 자료 전체의 특징을 나타내긴 하지만 자료가 흩어진 정도를 나타내기엔 충분하지 않음
  • 자료가 어느 정도 흩어져 있는지를 나타내는 산포도를 고려해야한다.

범위 (range)

  • 변량 X의 범위는 이들의 자료의 최대값과 최솟값의 차를 의미하며 보통 RR 로 표기한다
  • 가장 쉽게 구할 수 있으나, 극단값의 영향을 많이 받아서 매우 불안정한 산포도임

사분위수 범위 (interquartile range, IQR)

  • 범위는 자료의 두 극단값의 차이만을 나타내기 때문에 자료의 산포도를 나타내기에 불충분
  • 이러한 단점을 일부 보완환 산포도가 사분위수 범위이다
    IQR = Q3Q1Q_3 - Q_1

분산과 표준편차 (Variance, standard deviation)

  • 평균을 중심으로 각 변량이 흩어진 정도를 알기 위해 각 편차의 제곱의 합을 변량의 계수로 나눈값 -> 분산
    이때 분산의 양의 제곱근을 표준편차

분산

  • 변량 X의 자료가 N개의 원소로 이루어진 모집단일 때, 모집단의 분산이 모분산(population variance) σ2\sigma^2 로 표기하며 다음과 같이 정의한다. μ\mu 는 모평균
    σ2=1Ni=1N(xiμ)2\sigma^2 = \frac{1}{N}\sum_{i=1}^{N} (x_i - \mu)^2

  • 또한 변량 X의 자료가 n개의 원소 이루어진 모집단의 한 표본일 때 X의 표본분산(sample variance) s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{n} (x_i - \bar{x})^2

  • X의 자료가 도수분포표로 주어질 때의 표본분산은 다음과 같이 구한다
    s2=1n1i=1kfi(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{k} f_i*(x_i - \bar{x})^2 , i=1kfi=n\sum_{i=1}^{k} f_i = n
    (k : 계급의 수 , fif_i : ii 번째 계급에 속한 도수, xˉ=1ni=1kxifi\bar{x} = \frac{1}{n} \sum_{i=1}^{k} x_i * f_i : 표본 평균)

표준편차

  • 모분산의 양의 제곱근을 σ\sigma모표준편차(population standard deviation), 표본분산의 양의 제곱급인 S를 표본표준편차(sample standard deviaiton)라고 한다.
  • 분산의 단위는 자료의 측정 단위의 제곱인 반면에, 표준편차는 자료의 측정 단위와 같으므로 산포도를 측정할 때는 분산보다 표준편차를 주로 사용한다.

변동계수 (coeifficient of variation) CV

  • 평균을 중심으로 상대적으로 흩어진 정도를 측정하는 척도
    CV=σμ×100(%)CV = \frac{\sigma}{\mu} \times 100 (\%)
  • 변동계수가 크다는 것은 상대적으로 변동 폭이 크다는 사실을 의미한다 .
  • 변동계수의 제곱은 상대분산(relative variance) 라고 한다

자료의 5점 요약 표시 (5-number summary)

  • 주어진 자료를 자료의 중앙값 MeMe, 제1사분위수 Q1Q_1, 제3사분위수 Q3Q_3 , 최댓값 xmaxx_{max} , 최솟값 xminx_{min} 을 구한다
    [xminx_{min} , Q1Q_1 ,MeMe , Q3Q_3 , xmaxx_{max}]

왜도와 첨도

  • 변량 X의 산술평균이나 표준편차의 값 만으로는 X의 분포 형태를 완전하게 결정할 수 없다. 평균이 값고 표준편차가 같아도 분포형태가 전혀 다를 수 있기 때문

왜도

첨도

상자그림 (box plot)

  • 최댓값, 최솟값, 중앙값, 제1사분위수, 제2사분위수, 제3사분위수를 이용하여 그린다.

0개의 댓글