
데이터 전처리는 모델 성능을 좌우하는 핵심 단계입니다. 그 중 가장 대표적인 세 가지가 바로 결측값, 중복값, 이상치 처리입니다.
데이터에 값이 비어 있는 상태를 의미하며, 이를 방치하면 연산 오류가 발생하거나 모델의 성능이 급격히 떨어집니다.
평균(Mean)이나 중앙값(Median)으로, 범주형 데이터는 최빈값(Mode)으로 채우는 것이 일반적입니다. 최근에는 회귀 분석이나 KNN 알고리즘을 활용해 주변 값을 토대로 예측하여 채우기도 합니다.동일한 데이터가 두 번 이상 기록된 경우로, 특정 데이터에 모델이 과도하게 가중치를 두는 편향(Bias) 문제를 일으킵니다.
다른 데이터들과 동떨어진 극단적으로 크거나 작은 값을 의미합니다. 단순 오류일 수도 있고, 매우 희귀한 현상일 수도 있습니다. 보통 Box Plot을 활용한 IQR(사분위수 범위) 방식이나, Z-Score(표준편차 기준)를 사용하여 정상 범위를 벗어난 값을 식별합니다.