안녕하세요! 오늘은 통계 기초에 대해 말해보고자 합니다.^^
통계에도 평균, 표준편차, 분산 등등이 있으나 이번에는 z-score 정규화에 대해 말해보고자 해요! 가장 중요한거 같더라구요!
그럼 한번 알아봅시다.
1-1. 정의
z-score란 어떤 데이터 포인트가 그 데이터 집합의 평균으로부터 표준편차의 몇 배만큼 떨어져 있는지를 나타냅니다.
X: 관찰 값
μ: 전체 데이터의 평균
σ: 전체 데이터의 표준 편차
예시를 들어 분모 분자에 대해 알아볼게요!
우리가 한 반의 시험 점수에 대해 분석한다고 가정해봅시다.
1-1-1. z-score가 높다는 것은?
분자의 관점에서 내가 시험점수를 잘 맞으면 z-score가 높아지고 시험이 어려워서 평균이 낮아지는 것도 z-score가 높아진다고 볼 수 있습니다.
분모의 관점에서는 표준편차가 작을수록 z-score가 크겠죠?
그리고 z-score가 낮아진다는 것은 반대라고 볼 수 있습니다.
자 그러면 하나씩 알아볼게요!먼저 분자입니다. 분자는 (원점수 - 평균)으로 이뤄져 있습니다. 시험을 잘 보려면? 내 점수가 높거나 평균이 낮으면 z-score가 올라가겠죠?
그러면 이번에는 분모에 대해 보겠습니다. 분모는 '표준편차'입니다.
표준편차는 작아질수록 z-score가 커진다고 볼 수 있겠네요.표준편차란 내 점수가 우리 반 애들 평균으로 부터 얼마나 떨어져 있는지 보는 지표입니다. 작을수록 점수가 오밀조밀 붙어 있음을 알 수 있고 클수록 실력차이가 크다고 볼 수 있습니다.
1-2. 의미
- z-score = 0이면 평균과 동일하다.
- z-score > 0 해당 데이터는 평균보다 n만큼 크다.
- z-score < 0 해당 데이터는 평균보다 n만큼 작다.
즉, z-score는 데이터 포인트가 평균에 비해 얼마나 '표준적'이거나 '비표준적'인지 알려줍니다.
우리가 저번에 알아봤던 정규화는 normalization이고 이 정규화는 조금 성격이 다릅니다. 그럼 차이점에 대해 알아보겠습니다.
2-1-1. z-score
- 목적
z-score의 목적은 얼마나 데이터가 표준적인지 비표준적인지 나타내며, 데이터가 정규분포를 따를 때 더욱 유용하게 활용됩니다.- 언제 활용
이상치 탐지, 통계적 추론 등
- 목적
minmax scaling으로도 본 이것은 데이터를 0~1사이 값으로 스케일링을 맞춰준다는 개념으로 데이터를 균일하게 맞춰주는 역할을 합니다. 또한 이 정규화는 분포에 영향을 받지 않습니다.- 언제 활용
머신러닝 모델 학습, 여러 데이터를 하나로 쓰고 싶을 때
- 범위 : z-score의 경우 ±표준편차 만큼 벌어집니다. 반면, minmax scaler의 경우 0~1의 범위로 줄어듭니다.
- 분포특징 : z-score는 정규분포를 좋아하는 반면, minmax는 분포에 상관없이 활용가능합니다.
- 수식 : z-score는 평균과 표준편차를 활용하고 minmax는 데이터의 최대 최소 값을 활용합니다.
우리가 저번에 알아봤던 표준화와는 뭐가 다를까? 그럼 차이점에 대해 알아보겠습니다.
3-1-1. z-score
- 특징
z-score는 각각의 개별 데이터가 전체 평균으로 표준편차의 몇 배만큼 떨어져 있는지를 봅니다.- 언제 활용
이상치 탐지, 통계적 추론 등
- 특징
수식은 z-score와 같지만, 평균이 0, 표준편차를 1에 전체 데이터를 맞춥니다. 실제로 표준화 과정에서 각 데이터 포인트를 해당 데이터 집합의 Z-점수로 변환합니다.- 언제 활용
머신러닝 모델 학습, 여러 데이터를 하나로 쓰고 싶을 때
- 범위 : z-score의 경우 개별 데이터를 활용하는반면, 표준하는 평균 : 0, 표준편차 : 1에 전체 데이터를 맞춥니다.
- 활용특징 : z-score는 주로 이상치 탐지에 활용하고, 표준화는 스케일링에서 활용합니다.