
데이터 분석 과정에서 가장 기본이 되는 것은 다루고 있는 데이터의 타입과 성격을 정확히 이해하는 것이다. 환자의 나이, 성별, 혈압, 진료과 등 각기 다른 특성을 가진 데이터들은 서로 다른 분석 방법이 필요하다.

Pandas는 Python의 데이터 분석 및 조작을 위한 핵심 라이브러리입니다. 엑셀의 스프레드시트와 테이블 형식의 데이터 (DataFrame)을 쉽고 직관적으로 다룰 수 있게 해주는 도구입니다.

EDA는 데이터를 단순히 살펴보는 과정이 아니라, 데이터를 이해하는 과정이다. 결측치와 이상치를 확인하고, 데이터의 분포와 변수 간 관계를 분석하면서 데이터가 가진 특성을 파악할 수 있다.

데이터 시각화는 단순히 그래프를 그리는 기술이 아니라 데이터를 이해하고 전달하는 과정이다. 같은 데이터라도 어떤 그래프를 선택하느냐에 따라 전달되는 정보가 달라질 수 있다. 따라서 데이터의 특성과 분석 목적에 맞는 그래프를 선택하는 것이 중요하다.

데이터 전처리는 머신러닝 프로젝트에서 가장 중요하면서도 가장 많은 시간이 소요되는 과정이다. 아무리 뛰어난 AI 모델을 사용하더라도 데이터 품질이 좋지 않으면 좋은 결과를 기대하기 어렵다.