위클리 페이퍼 #1-3 결측값, 중복값, 이상치 처리

문학소년·2026년 3월 4일

위클리 페이퍼

목록 보기
3/24

🇶 대표적인 데이터 전처리 방법인 결측값, 중복값, 이상치 처리에 대해 각각 설명해 주세요.

데이터 전처리는 모델 성능을 좌우하는 핵심 단계입니다. 그 중 가장 대표적인 세 가지가 바로 결측값, 중복값, 이상치 처리입니다.

1. 결측값 (Missing Value) 처리

데이터에 값이 비어 있는 상태를 의미하며, 이를 방치하면 연산 오류가 발생하거나 모델의 성능이 급격히 떨어집니다.

  • 제거 (Deletion): 결측치가 포함된 행이나 열을 삭제합니다. 데이터 양이 충분하고 결측치 비중이 낮을 때 사용합니다.
  • 대치 (Imputation): 비어 있는 값을 다른 값으로 채웁니다. 수치형 데이터는 평균(Mean)이나 중앙값(Median)으로, 범주형 데이터는 최빈값(Mode)으로 채우는 것이 일반적입니다. 최근에는 회귀 분석이나 KNN 알고리즘을 활용해 주변 값을 토대로 예측하여 채우기도 합니다.

2. 중복값 (Duplicate Value) 처리

동일한 데이터가 두 번 이상 기록된 경우로, 특정 데이터에 모델이 과도하게 가중치를 두는 편향(Bias) 문제를 일으킵니다.

  • 완전 중복 제거: 모든 칼럼의 값이 일치하는 행을 하나만 남기고 삭제합니다.
  • 부분 중복 확인: ID나 날짜 등 특정 핵심 칼럼이 중복되는지 확인하여 시스템 오류나 데이터 수집 과정의 중복을 제거합니다.

3. 이상치 (Outlier) 처리

다른 데이터들과 동떨어진 극단적으로 크거나 작은 값을 의미합니다. 단순 오류일 수도 있고, 매우 희귀한 현상일 수도 있습니다. 보통 Box Plot을 활용한 IQR(사분위수 범위) 방식이나, Z-Score(표준편차 기준)를 사용하여 정상 범위를 벗어난 값을 식별합니다.

  • 제거: 데이터 입력 오류임이 확실할 때 삭제합니다.
  • 변환: 로그 변환(Log Transform) 등을 통해 값의 격차를 줄입니다.
  • 대치: 이상치를 상한선이나 하한선 값으로 조정(Capping/Winsorizing)하여 분석에 포함합니다.

0개의 댓글