01 1차원 데이터

Sirius·2023년 6월 20일

1 평균, 중앙값, 최빈값

1 평균값

1 절사평균

ex> 10% 절사평균 -> 20개의 자료가 있다고 하면 2개를 제거(양쪽에서 하나씩) 한 18개의 평균을 구함

2 중앙값

중앙값은 이상값의 영향을 덜 받는다.
Q: 만약 데이터의 개수 n이 짝수라면? n/2 번째 데이터와 n/2+1번째 데이터의 평균이 중앙값임

3 최빈값

데이터에서 가장 많이 나타나는 값

2 분산, 표준편차, IQR

1 분산

편차의 평균은 항상 0이기에 편차를 제곱해서 평균한 값이 바로 분산이다.

분산을 면적으로도 이해해볼 수 있다. 각 정사각형의 한변의 길이가 편차라고 생각하면 정사각형의 넓이는 편차의 제곱이다.
그리고 이 편차의 제곱의 평균이 중앙에 있는 정사각형(분산)이다.

2 표준편차

분산에 제곱근을 씌우면 표준편차가 된다.

표준편차와 6 시그마
데이터가 정규분포를 따른다면,
평균 + 표준편차, 평균-표준편차 = 1시그마 구간 68%
...
평균 + 6표쥰편차, 평균-6표준편차 = 6시그마 구간 99.9996%

3 IQR

데이터 전체를 보는 것이 아니라 최대값과 최솟값만으로 산포도를 표현함

IQR = Q3(상위 75%) - Q1(하위25%)

미니멈: Q1-1.5IQR
맥시멈: Q3+1.5
IQR

이 미니멈과 맥시멈사이에 속하지 않는다면 이상치로 판단한다.

3 데이터의 표준화

1 표준점수

상대적 결과가 다르므로 통일된 지표로 변환하는 표준화

Z= (X-X_) / S

이 표준화된 데이터는 평균이 0이고 표준편차가 1이다.

2 편찻값

ex> 만약 평균이 50이고 표준편차가 10이 되도록 표준화한다.
Z = 50 + 10*{(X-X_)/S}

0개의 댓글