자료의 구분
수치로 표현 가능
- 양적자료 (Quantitaive Data)
- 이산자료(discrete data)
10년간 출생아 수와 같은 공백이 있고 산발적으로 측정되는 자료
- 연속자료(continous data)
오늘 하루동안의 기온변화와 같이 지정된 구간 안에서 관측값 사이에 공백 없이 측정되는 자료
수치로 표현 불가능
- 질적자료 (Qualitative Data)
- 명목자료 (nominal data)
자료의 순서 또는 크기를 정의 할 수 없는 형태
ex : 성별: 남, 여 | 혈액형: A, B, O, AB | 지역: 서울, 부산, 대구 | 혼인상태: 미혼, 기혼, 이혼
- 순서자료 (ordinal data)
자료의 순서는 정의 되나 크기가 정의 되지 않는 형태
ex : 기업 규모에 따른 대기업 / 중기업 소기업, 학점의 등급, 강의 평가
- 범주형자료 (Categorical Data)
계절 : 봄 여름 겨울 가을
도수분포표
- 자료를 자료의 특성을 기준으로 일정한 계급(class)로 나눈 다음, 각 계급에 속하는 자료의 도수(frequency)를 대응하여 작성한 표를 도수분포표(frequency distribution table)라고 한다.
- 각 계급에 속하는 자료의 상대도수를 (relative frequency)를 대응하여 작성한 표를 상대도수분포표(relative freqeuncy distribution table)라고 한다.
범주형 도수분포표
- 자료의 성격을 둘 이상의 범주로 나누어 정리한 도수분포표이다.
- 모든 질적자료는 범주형 도수분포표로 작성가능하고 양적자료 중에서는 이산자료만 작성 가능하다. 이때 이산자료는 범주의 순서를 되도록 바꾸지 않아야 한다.
범주형 도수분포표의 작성 순서
- 자료가 집단으로 묶일 수 있도록 범주를 설정한다.
- 각 범주에 속하는 도수(f)와 상대도수(f/n) 를 표로 정리한다.
- 도수 : 각 범주에 속하는 자료의 수
- 상대도수 : 전체 도수에 대하여 각 범주에 속한 도수의 비율로, 전체 도수를 n,i 번째 범주에 속한 도수를 fi 라고 할 때, 다음과 같이 계산한다.
(상대도수) = fi/n 또는 fi/n∗100(퍼센트) (i = 1, 2,3,4 .. )
계급형 도수분포표
- 관측값을 일정한 간격으로 묶어 구간을 나누고 각 구간에 속하는 자료의 수를 기록함으로써 의미 있는 도수분포표를 작성할 수 있다
- 이와 같은 도수분포표를 계급형 도수분포표(또는 도수분포표)라고 하고 여기에 해당하는 자료는 양적자료이다.
- 계급의 간격은 모두 일정해야하고 중복되는 부분은 없애야한다.
- 계급의 양 끝 값이 복잡한 소수형태로 나온다면 계급의 간격을 분명하기 위해서 그 값에 가까운 자연수로 계급의 양 끝값을 근사하여 사용가능
- 계급의 간격이 넓으면 자료가 가진 정보 손실, 계급의 간격이 좁으면 도수분포표 복잡
계급형 도수분포표 작성 순서
① 계급 설정
- 범위: R=xmax−xmin
- 계급 수: k=(1+log2n)에 가장 가까운 자연수
- 계급 간격: c=kR
② 계급값
xi=2계급의 양 끝값의 합
③ 도수 / 상대도수 / 누적도수 / 누적상대도수
-
도수: 각 계급에 속하는 자료의 수
-
상대도수:
nfi또는nfi×100%
-
누적도수:
Fi=f1+f2+⋯+fi=∑v=1ifv
-
누적상대도수:
nFi또는nFi×100%
그림을 이용한 자료 정리
막대 그래프 (bar chart)
- 수직 막대그래프 (vertical bar chart)
막대를 세로로 나타냄
- 수평 막대그래프 (horizontal bar chart)
막대를 가로로 나타냄
히스토그램
- 양적자료의 도수분포표에서 계급의 간격을 밑변으로 하고 계급의 도수를 높이로 하는 직사각형을 좌표평면에 차례로 나타낸 그래프
도수분포다각형
- 히스토그램에서 각 계급 구간에 대한 계급값의 빈도수를 직선으로 연결하여 나타낸 그림
각 직사각형의 윗변의 중점, 즉 각 계급의 계급값에 해당하는 도수를 선분으로 연결하고, 양 끝은 도수가 0인 계급을 하나씩 추가하여 그 중점을 연결하여 그린 그래프
원그래프
- 원을 계급의 수나 자료의 범주수만큼 부채꼴 모양의 여러 조각으로 나누어 표현 그림
(부채꼴의 중심각) = 360 * (상대도수)
줄기-잎 그림
- 도수분포표나 히스토그램에서는 자료의 분포를 쉽게 알 수 있지만, 각 자료의 관측값에 대한 정보는 알 수 없다. 자료의 분포 형태를 쉽게 파악하면서도 각 관측값을 알 수 있는 그림
꺽은선그래프
- 시간의 경과에 따라 연속으로 관측한 데이터에 대하여 동일한 시간 간격으로 측정한 데이터를 시계열 데이터(time series data)
- 변화 추이를 쉽게 파악할 수 있다.
번외
- 퍼센트와 퍼센트 포인트
- 퍼센트 (%)
한 수치를 100으로 두고, 다른 수치를 100에 대한 비율로 나타내고 두 수치의 상대적인 크기를 바로 비교, 보통 퍼센트를 %로 표기하며 백분율이라고도 한다.
- 퍼센트 포인트 (%p)
퍼센트는 일반적인 수치처럼 서로 더하거나 뺄 수 없음 비교하는 수치의 기준이 동일한 경우에 가능
두 퍼센트 차이를 퍼센트 포인트라 하며 %p로 표기
ex 2% -> 1% 감소하였다 1%p 감소하였다로 표기
대푯값
산술평균
-
평균(mean)에는 산술평균, 기하평균, 조화평균 등이 있다. 일반적으로 평균이라고 하면 산술평균(arithmetic mean)을 의미한다.
-
변량 X에 대한 표본 n개의 자료가 주어질 때, 변량 X의 산술평균을 표본평균(sample mean)이라고 하고 xˉ로 나타낸다
xˉ=n1∑i=1nxi=nx1+x2+⋯+xn
-
변량 X가 모집단에서 얻은 관측값으로 주어질 때 변량 X의 산술평균을 모평균(population mean)이라고 한다 μ 로 나타낸다
μ=n1∑i=1nxi=nx1+x2+⋯+xn
-
변량 X의 자료가 범주형 도수분포표로 주어질 때는 가중산술평균(wegithed artimetic mean) 이라 하고 xˉ로 나타낸다
xˉ=n1∑i=1kxi∗fi=nx1∗f1+x2+f2⋯+xk∗fk
k : 범주의수 , ∑i=1kfi=n
산술평균의 성질
- 산술평균에 대한 편차의 합은 0이다
- 산술평균은 편차의 제곱의 합을 최소로 한다. 즉 산술평균에 대한 편차의 제곱의 합은 임의 수에 대한 제곱의 합보다 크지 않다
- 산술평균은 주어진 자료를 모두 사용하므로 정보 손실 없음 특히 표본들의 평균인 표본 평균은 모집단을 추론할 때 유용하게 사용
- 산술평균은 영적자료에 대해서만 구할 수 있으며 대다수의 자료와 멀리 떨어져 있는 극단값(outlier)에 민감하게 작용한다. (극단값은 이상점이라고도 한다)
중앙값
-
변량 X의 n개의 자료를 작은 값부터 크기순으로 배열했을 때, 한가운데에 위치한 값을 중앙값(median)또는 중위수라 하고 Me 로 표기한다.
-
중앙값은 양적자료의 중심을 나타내고 자료의 수가 홀수 인지 짝수인지에 따라 구분한다.

-
중앙값은 다음과 같이 편차의 절댓값의 합을 최소로 한다는 성질을 갖는다
n1∑i=1n∣xi−Me∣ <= n1∑i=1n∣xi−a∣
(단, a는 상수)

최빈값
- 변량 X의 자료중에서 가장 많이 나타나는 값을 최빈값(mode)라고 하고 Mo로 표기한다.
- 최빈값은 자료에 따라 두 개 이상일 수도 있다.
도수분포곡선 (frequency distribution curve)

- 자료의 수를 늘리고 계급의 간격을 좁게 하여 계급 구간의 수를 늘리면 곡선 형태로 수렴
산술평균, 중앙값, 최빈값 사이의 관계
- 도수분포곡선이 단봉형으로 나타내고 극히 비대칭이 아닌 자료 집단의 경우에는 피어슨(Pearson)의 실험 공식이 성립한다.
xˉ - Mo ≈ 3(xˉ -Me)

백분위수와 사분위수
- 변량 X의 n개의 자료를 작은 값부터 크기순으로 배열했을 때, 0<= p <=1 인 p에 대하여 제 100p 백분위수(100pth percentile)라 한다.
백분위수 구하는 법

- np가 정수 일때와 정수가 아닐때를 구분하여 구한다.
절사평균 (trimmed mean)
- 절사평균은 평균의 장점과 중앙값의 장점을 모두 고려한 대표값으로 극단값을 제외하고 구한 평균이다.
- 절사평균을 계산하려면 절사비율(%)을 결정해야하는데, 상위 몇 퍼센트의 data와 하위 몇 퍼센트의 data를 베제할 것인가를 결정해야한다.
구하는 방법

산포도 (measure of dispersion)
- 자료의 분포 상태를 알기 위해서는 자료의 중심 위치뿐만 아니라 자료가 흩어진 정도를 함께 고려해야한다. 이와 같이 흩어진 정도를 산포도라고 한다
- 대표값은 자료 전체의 특징을 나타내긴 하지만 자료가 흩어진 정도를 나타내기엔 충분하지 않음
- 자료가 어느 정도 흩어져 있는지를 나타내는 산포도를 고려해야한다.
범위 (range)
- 변량 X의 범위는 이들의 자료의 최대값과 최솟값의 차를 의미하며 보통 R 로 표기한다
- 가장 쉽게 구할 수 있으나, 극단값의 영향을 많이 받아서 매우 불안정한 산포도임
사분위수 범위 (interquartile range, IQR)
- 범위는 자료의 두 극단값의 차이만을 나타내기 때문에 자료의 산포도를 나타내기에 불충분
- 이러한 단점을 일부 보완환 산포도가 사분위수 범위이다
IQR = Q3−Q1
분산과 표준편차 (Variance, standard deviation)
- 평균을 중심으로 각 변량이 흩어진 정도를 알기 위해 각 편차의 제곱의 합을 변량의 계수로 나눈값 -> 분산
이때 분산의 양의 제곱근을 표준편차
분산
-
변량 X의 자료가 N개의 원소로 이루어진 모집단일 때, 모집단의 분산이 모분산(population variance) σ2 로 표기하며 다음과 같이 정의한다. μ 는 모평균
σ2=N1∑i=1N(xi−μ)2
-
또한 변량 X의 자료가 n개의 원소 이루어진 모집단의 한 표본일 때 X의 표본분산(sample variance) s2=n−11∑i=1n(xi−xˉ)2
-
X의 자료가 도수분포표로 주어질 때의 표본분산은 다음과 같이 구한다
s2=n−11∑i=1kfi∗(xi−xˉ)2 , ∑i=1kfi=n
(k : 계급의 수 , fi : i 번째 계급에 속한 도수, xˉ=n1∑i=1kxi∗fi : 표본 평균)

표준편차
- 모분산의 양의 제곱근을 σ 를 모표준편차(population standard deviation), 표본분산의 양의 제곱급인 S를 표본표준편차(sample standard deviaiton)라고 한다.
- 분산의 단위는 자료의 측정 단위의 제곱인 반면에, 표준편차는 자료의 측정 단위와 같으므로 산포도를 측정할 때는 분산보다 표준편차를 주로 사용한다.

변동계수 (coeifficient of variation) CV
- 평균을 중심으로 상대적으로 흩어진 정도를 측정하는 척도
CV=μσ×100(%)
- 변동계수가 크다는 것은 상대적으로 변동 폭이 크다는 사실을 의미한다 .
- 변동계수의 제곱은 상대분산(relative variance) 라고 한다
자료의 5점 요약 표시 (5-number summary)
- 주어진 자료를 자료의 중앙값 Me, 제1사분위수 Q1, 제3사분위수 Q3 , 최댓값 xmax , 최솟값 xmin 을 구한다
[xmin , Q1 ,Me , Q3 , xmax]
왜도와 첨도
- 변량 X의 산술평균이나 표준편차의 값 만으로는 X의 분포 형태를 완전하게 결정할 수 없다. 평균이 값고 표준편차가 같아도 분포형태가 전혀 다를 수 있기 때문
왜도

첨도

상자그림 (box plot)
- 최댓값, 최솟값, 중앙값, 제1사분위수, 제2사분위수, 제3사분위수를 이용하여 그린다.
