데이터 스케일링 : 데이터 값의 범위를 조정하는 것
-특성들의 범위를 정규화 해주는 작업
-특성마다 다른 범위를 가지는 경우 머신러닝 모델들이 제대로 학습되지 않을 가능성이 있음 (KNN. SVM, Neural network, Clustering 등)
MinMaxScaler
데이터가 0과 1 사이에 위치하도록 스케일링
최소값 = 0, 최대값 = 1이 되도록 스케일링
min, max를 알 때 사용
MaxAbsScaler
데이터가 -1과 1 사이에 위치하도록 스케일링
절대값의 최소값 = 0, 최대값 = 1이 되도록 스케일링
데이터가 양수일 경우 MinMaxScaler와 유사하게 동작
StandardScaler
데이터의 평균 = 0, 분산 = 1이 되도록 스케일링, 즉 데이터가 표준정규분포를 따르도록 스케일링
데이터의 min, max를 모를 때 사용
모든 feature들이 같은 스케일을 갖게 됨
평균과 표준편차가 이상치로부터 영향을 많이 받는다는 점에서 이상치에 민감
RobustScaler
데이터의 중앙값 = 0, IQE = 1이 되도록 스케일링
모든 feature들이 같은 값을 갖게 됨
Normalizer
위 스케일링 방법은 열을 대상으로, Normalizer는 행마다 정규화 진행
한 행의 모든 특성들 사이의 유클리드 거리가 1이 되도록 스케일