중심경향
- 관찰된 자료들의 중심이 어디에 있는가를 나타내 주는 것
- 중심경항을 나타내는 수치를 분포의 대푯값이라고 한다
중앙값 (median) : 자료를 크기 순서대로 나열할 때 가장 가운데에 위치하는 관찰값
사용 범위 : 양적자료
robustness : 극단적인 관찰값에 강건하다
수학적 연산 불가능 : 수학적 연산이 제한되어 있어, 다른 통계적 처리를 위한 기초자료로 사용하기 어렵다
번째 관찰값 (n이 홀수)
번째 관찰값 번째 관찰값의 평균 (n이 짝수)
산술평균 (arithmetic mean, mean) : 값들의 무게 중심이 어디인지를 나타내는 값으로, 중심경향을 나타내는 척도 중에서 가장 많이 사용되는 값이다
사용 범위 : 양적자료
이상치에 민감 : 모든 관찰값으로부터 영향을 받으므로 극단적인 관찰값에 민감하다
수학적 연산 가능 : 수학적 연산이 가능하다
신뢰성 : 모집단에서 여러개의 표본을 선정하여 중심경향값들을 비교해보면, 평균이 가장 비슷한 값들을 갖는다. 이는 모집단의 중심 위치를 추정할 때 산술평균이 모집단의 중심경향값을 나타내는 가장 신뢰할 만한 추정값이라는 것을 의미한다.
모집단 및 표본에서의 계산방식이 같다
가중산술평균 (weighted arithmetic mean) : 크기가 다른 여러 집단을 합친 전체 집단의 평균
분산도
- 관찰된 자료가 흩어져 있는 정도
범위 (range) : 관찰값들 중에서 가장 큰 수치와 가장 작은 수치의 차이
사분위수 범위 (IQR) : 가운데 50%의 데이터가 위치하는 범위
편차 (Deviation) : 관찰값에서 평균을 뺀 값
평균편차 (average deviation) : 편차 절댓값의 평균
의미 : 평균을 중심으로 하여 평균적으로 만큼 관찰값들이 떨어져 있다는 것을 의미한다.
robustness, 변동성 반영 부족 : 절대값을 사용하여 계산되기 때문에 이상치에 대해 상대적으로 덜 민감하지만, 분포의 실제 변동성을 충분하게 반영하지 못할 수 있다.
절대 기준 없음 : 두 집단 이상의 평균편차를 비교하면 상대적인 분산도를 확인할 수 있지만, 하나의 집단에 대해서는 절대적 의미에서 분산도의 크기를 알 수 없다.
분산 (Variance) : 편차 제곱의 평균
가중치 부여 : 제곱을 사용하여 큰 편차에 더 큰 가중치를 부여한다. 따라서 변동성이 큰 데이터를 분석할 때 중요한 정보를 놓지지 않게 해준다.
수학적 특성 : 제곱을 사용하여 미분이나 다른 수학적 조작이 용이하다(통계적 추론, 최소자승법, ...)
단위의 변화 : 분산은 관찰값의 단위에도 제곱을 하게 되어 직관적인 해석이 어렵다
표준편차 (Standard Deviation) : 분산에 제곱근을 취한 값
분산의 특성 유지 : 분산의 특성은 모두 유지하면서도 데이터의 변동성을 반영한다.
이상치의 영향 : 여전히 이상치에 민감하지만, 제곱근을 취함으로써 그 영향이 (분산에 비해) 줄어든다
단위 유지 : 표준편차는 관찰값과 동일한 단위로 사용하기 때문에 변동성을 직관적으로 파악할 수 있다
Bessel's Correction
- 가정 :
- 모집단에서 여러 번 독립적으로 표본을 추출하면, 표본 평균은 불편추정량이다.
- 하지만, 우리가 실제 사용하는 데이터는 단 하나의 표본이므로 표본 평균이 항상 불편하지 않다.
- 표본 분산()을 보정(로 나눠주기)해야 불편추정량이 된다.
1. 수학적 접근
모집단에서 표본을 크기 만큼 추출한 경우, 모집단의 편차 제곱의 기대값은 다음과 같다
모집단의 평균()을 모르는 경우, 표본평균()을 사용하여 모집단의 분산을 추정해야 한다.
이때, 표본평균이 불편할 수 있기 때문에 다음과 같은 관계가 성립한다
식 의 기댓값을 취하면 다음과 같다
식 과 모집단 분산의 성질()로 을 정리하면 다음과 같다.
표본 분산의 기대값은 모집단 분산의 만큼 과소추정된다
2. 자유도로 접근
자유도(degrees of freedom)란 추정할 때 자유롭게 변할 수 있는 독립적인 데이터 포인트의 개수를 의미한다.
표본 분산을 계산할 때, 모집단 평균을 모르기 때문에 표본 평균을 사용한다.
표본 평균을 계산하면 표본 내에서 변할 수 있는 독립적인 데이터 포인트의 개수가 하나 줄어든다.
결과적으로, 표본의 크기가 n일 때, 표본 분산을 계산하는 실제 자유도는 n−1이 되고, 표본 분산을 계산할 때 n-1로 나누어야 한다.
변동계수 (CV, Coefficient of Variation) : 평균에 대한 표준편차의 비율
표본 변동성 비교 : 단위가 다르거나, 평균의 차이가 큰 표본들의 변동성 비교에 사용한다
평균에 따른 제한 : 평균이 0이면 계산이 불가능하고, 일반적으로 양수 평균인 표본에서 사용한다.
비대칭도
대칭분포 (symmetric distribution) : 평균을 중심으로 관측값들이 대칭을 이루는 분포. 평균, 중앙값, 최빈값이 모두 같은 위치에 있다.
왜도(skewness) : 분포의 모양이 대칭분포에서 얼마나 벗어났는가를 수치로 나타낸 값. 분포의 비대칭성을 측정하며, 절댓값이 클수록 대칭에서 벗어난 정도가 크다.
피어슨 비대칭도 (Pearson's coefficient of skewness) : 왜도를 측정하는 가장 일반적인 방법으로, 산술평균과 중앙값의 차이가 표준편차에 비하여 얼마나 떨어져 있는가를 나타낸다.
왜도의 해석
