위클리 페이퍼 #1-2 EDA (Exploratory Data Analysis)

문학소년·2026년 3월 4일

위클리 페이퍼

목록 보기
2/24

🇶 EDA(Exploratory Data Analysis)란 무엇인가요?

EDA(탐색적 데이터 분석, Exploratory Data Analysis)란 수집한 데이터를 분석하기 전에, 그래프나 통계적 방법 등을 통해 데이터를 다양한 각도에서 관찰하고 이해하는 과정을 말합니다.

쉽게 말해, 본격적인 요리에 들어가기 전 재료의 상태(신선도, 양, 종류 등)를 꼼꼼히 살피는 과정과 같습니다. 통계학자 존 튜키(John Tukey)가 강조한 개념으로, 가설을 세우기 전 데이터 자체의 잠재적인 패턴이나 이상치를 찾아내는 것이 핵심입니다.

1. EDA의 주요 목적

  • 데이터의 구조 파악: 변수의 개수, 데이터 타입(숫자형, 범주형), 샘플의 수 등을 확인합니다.
  • 이상치(Outlier) 발견: 일반적인 범위에서 크게 벗어난 값을 찾아내어 제거하거나 수정할지 결정합니다.
  • 결측값(Missing Value) 처리: 비어 있는 데이터를 어떻게 채울지 혹은 버릴지 판단합니다.
  • 변수 간의 관계 분석: 어떤 변수가 서로 밀접하게 연관되어 있는지(상관관계) 파악하여 분석의 방향을 잡습니다.
  • 가설 설정 및 검정: 분석 목적에 맞는 가설을 세우고, 데이터가 그 가설을 뒷받침하는지 초기에 확인합니다.

2. EDA의 핵심 도구와 방법

EDA는 크게 시각화요약 통계라는 두 가지 강력한 도구를 사용합니다.

① 시각화 (Visualization)
숫자로만 된 표보다 텍스트그림으로 볼 때 데이터의 특성이 훨씬 잘 드러납니다.

  • 히스토그램(Histogram): 데이터의 분포와 왜도(기울어진 정도)를 확인합니다.
  • 박스 플롯(Box Plot): 중앙값, 사분위수 및 이상치를 한눈에 파악하기 좋습니다.
  • 산점도(Scatter Plot): 두 변수 사이의 상관관계나 클러스터(집단)를 확인합니다.
  • 히트맵(Heatmap): 여러 변수 간의 상관계수를 색상으로 표현하여 핵심 변수를 찾습니다.

② 요약 통계 (Summary Statistics)
데이터를 대표하는 숫자들을 확인합니다.

  • 평균(Mean), 중앙값(Median), 최빈값(Mode)
  • 분산(Variance), 표준편차(Standard Deviation)
  • 최댓값(Maximum), 최솟값(Minimum), 사분위수(Quartile)

3. EDA가 머신러닝에서 왜 중요한가요?

쓰레기를 넣으면 쓰레기가 나온다(Garbage In, Garbage Out)는 말처럼, 데이터에 대한 깊은 이해 없이 모델을 돌리면 성능이 나오지 않거나 잘못된 결과를 도출하게 됩니다.

  • 모델 성능 향상: 불필요한 변수(Noise)를 제거하고 중요한 특징(Feature)만 선택할 수 있습니다.
  • 데이터 왜곡 방지: 특정 값에 편향된 데이터를 미리 발견하여 샘플링 전략을 수정할 수 있습니다.
  • 비즈니스 인사이트: 분석 결과뿐만 아니라 분석 과정 자체에서 예상치 못한 비즈니스 기회나 문제를 발견하기도 합니다.

4. EDA의 일반적인 절차
① 전체 데이터 살펴보기: 데이터의 크기, 칼럼명, 상위 5행 등을 출력해 봅니다.
② 개별 변수 분석 (Univariate): 각 변수의 분포와 결측치를 확인합니다.
③ 변수 간 관계 분석 (Multivariate): 변수끼리 묶어서 어떤 패턴이 있는지 비교합니다.
④ 인사이트 도출: 발견한 특징들을 기록하고 다음 분석 단계(전처리, 모델링)의 전략을 세웁니다.

0개의 댓글