데이터 스케일링
: 특성들의 범위를 정규화 해주는 작업
: 특성마다 다른 범위를 가지는 경우 머신러닝 모델들이 제대로 학습되지 않을 가능성이 있다.
장점
- 특성들을 비교 분석하기 쉽게 만들어준다.
- Linear Model, Neural network Model등에서 학습의 안정성과 속도를 개선시킨다.
단점
- 하지만 특성에 따라 원래 범위를 유지하게 좋을 경우가 있을 수 있다.
종류
StandardScaler
MinMaxScaler
RobustScaler
Normalizer
StandardScaler
- 변수의 평균, 분산을 이용해 정규분포 형태로 변환 (평군 0, 분산 1)
- 데이터가 정규분포인 경우에 사용
MinMaxScaler
- 변수의 최대값 1로, 최소값을 0으로 하여 변환 ( 0~ 1 사이 값으로 변환)
- 데이터가 비정규분포인 경우에 사용
- 이상치에 크게 영향을 받는다 -> 이상치가 있는 경우 사용하지 않음.
RobustScaler
- 변수의 1/4 지점을 0으로 3/4 지점을 1로 하여 변환
- 이상치가 있는 경우 사용
Normalizer
- 특성 벡터의 유클리디안 길이가 1이 되도록 조정( 지름이 1인 원에 투영)
- 특성 벡터의 길이는 상관 없고 데이터의 방향(각도)만 중요할 떄 사용한다.