[데이터 전처리] 스케일링 (Scaling)

HanSol Choi·2024년 6월 18일

스케일링 (Scaling)

데이터 스케일링 : 데이터 값의 범위를 조정하는 것
-특성들의 범위를 정규화 해주는 작업
-특성마다 다른 범위를 가지는 경우 머신러닝 모델들이 제대로 학습되지 않을 가능성이 있음 (KNN. SVM, Neural network, Clustering 등)

스케일링 종류

  • MinMaxScaler
    데이터가 0과 1 사이에 위치하도록 스케일링
    최소값 = 0, 최대값 = 1이 되도록 스케일링
    min, max를 알 때 사용

  • MaxAbsScaler
    데이터가 -1과 1 사이에 위치하도록 스케일링
    절대값의 최소값 = 0, 최대값 = 1이 되도록 스케일링
    데이터가 양수일 경우 MinMaxScaler와 유사하게 동작

  • StandardScaler
    데이터의 평균 = 0, 분산 = 1이 되도록 스케일링, 즉 데이터가 표준정규분포를 따르도록 스케일링
    데이터의 min, max를 모를 때 사용
    모든 feature들이 같은 스케일을 갖게 됨
    평균과 표준편차가 이상치로부터 영향을 많이 받는다는 점에서 이상치에 민감

  • RobustScaler
    데이터의 중앙값 = 0, IQE = 1이 되도록 스케일링
    모든 feature들이 같은 값을 갖게 됨

  • Normalizer
    위 스케일링 방법은 열을 대상으로, Normalizer는 행마다 정규화 진행
    한 행의 모든 특성들 사이의 유클리드 거리가 1이 되도록 스케일

profile
ML/DL Study,기록📝

0개의 댓글