중심위치의 측도
산포의 측도(데이터가 얼마나 퍼져있는지 측정) : 대표적인 산포도(Dispersion)는 분산, 표준편차, 범위 및 사분위수 범위
분산(Variance) : 데이터가 평균과 얼마나 떨어져있는지 확인, 값과 평균 사이의 거리 제곱하여 다 더하여 n-1로 나눔(모분산일 경우 n, 표본의 경우 n-1로 나눔)
표준편차(Standard deviation) :
사분위수 범위(Interquartile range) :
사분위수 :
제 1사분위수(Q1) = 25백분위수
제 2사분위수(Q2) = 50백분위수
제 3사분위수(Q3) = 75백분위수
백분위수(Percentile) : {(n-1)p/100+1}번째 값
변동계수(Coefficient of variation) : 표준편차를 산술평균으로 나누는 것, 측정단위가 서로 다른 자료를 비교하고자 할 때 쓰인다.
평균의 표준오차 : 표본의 크기(n)이 커질수록 표준오차의 값은 작아진다.
분포의 형태에 관한 측도
왜도(Skewness) : 분포의 비대칭 정도를 나타내는 측도
- 왜도>0(왜도가 양수일 때) : 오른쪽으로 긴 꼬리를 갖는 분포
- 왜도=0(왜도가 0일 때) : 좌우가 대칭인 분포
- 왜도<0(왜도가 음수일 때) : 왼쪽으로 긴 꼬리를 갖는 분포

첨도(Kurtosis) : 분포의 중심에서 뾰족한 정도를 나타내는 측도, 정규분포에서 0일 때, 첨도>0 : 긴 꼬리, 첨도<0 : 짧은 꼬리
왜도에 따라서 최빈값, 중앙값, 평균 위치가 달라진다.
히스토그램, 줄기-잎 그림, 상자그림, 산점도, 원그래프, 꺾은선 그래프 등
히스토그램(Histogram) : 표로 되어 있는 도수 분포를 그림으로 나타낸 것, 도수분포표를 그래프로 나타낸 것.
막대그래프 vs 히스토그램
히스토그램(Histogram) : 데이터의 수를 활용해서 계급의 수와 계급간격을 계산하여 도수분포표를 만들고 히스토그램 생성
줄기-잎 그림(Stem-and leaf plot) : 데이터를 줄기와 잎의 모양으로 그린 그림
상자그림(Box plot):다섯숫자 요약을 통해 그림으로 표현(최솟값,Q1,Q2,Q3,최댓값)

표본으로부터 미지의 모수를 추측하는 것(표본으로부터 모집단을 설명할 수 있는 미지의 값들을 추측하는 것)
추정에는 점추정(Point estimation)과 구간추정(Interval estimation)으로 구분
1)점추정(Point estimation) : '모수가 특정한 값일 것'이라고 추정하는 것
2)구간추정(Interval estimation)
가설검정
오류의 종류


1)개요
여러 개의 범주형 변수를 기준으로 빈도를 표 형태로 나타낸 것을 분할표(또는 교차표)라 함
아래의 표는 2개의 범주형 변수(학년, 성적 등급)별 빈도를 분할표로 나타낸 것임

범주형 변수가 1일 때는 1원 분할표, 2개일 때는 2원 분할표, 3개 이상일 때는 다원 분할표로 표시함
분할표의 행은 설명변수, 열은 반응변수를 입력하고 범주형 자료를 분석할 때는 이 분할표를 기반으로 여러 가지 검정을 수행할 수 있음
2)상대위험도(Relataive Risk, RR)

3)오즈비(Odds Ratio) (중요)

1)카이제곱 검정이란?
2)교차표



1)개념
2)가정
3)분산분석표

4)가설검정
귀무가설 : k개의 집단 간 모평균에 차이가 없다.
대립가설 : k개의 집단 간 모평균이 모두 같다고 할 수 없다.
(적어도 모평균이 같은 한쌍의 집단이 존재한다.)
분산분석 표를 통해서 f검정을 하게 되고, 기술통계량을 뽑아낸다.
f값에 해당하는 확률값을 찾아내서 유의수준 0.05(신뢰수준 95%) 하에서 귀무가설을 기각시키고 대립가설을 채택하는 결과가 나온다면 집단 간의 평균 차이가 있다는 것이다.
그 후에는 사후 검정을 해야 한다.
① 가설의 설정
② 검정 방법
