
데이터 전처리에 python을 사용하자 python에서 데이터 전처리를 하려면 pandas를 사용할줄 알아야한다.먼저 데이터를 불러와야 한다.으로 pandas 라이브러리를 불러온후 pd로 약자로 불러주고 데이터 시각화를 위해 seaborn라이브러리도 함께 불러준다파이

.head()는 데이터 프레임의 상위 정보를 보여준다.ex) df.head(3)이면 df의 상위 3개의 행만 가져와서 보여준다..info()는 아래와 같이 데이터 프레임의 전체적인 정보를 가져온다.describe()는 숫자 타입을 가진 컬럼값들의 기초 통계량을 가져온다

먼저 df.info()로 전체적인 데이터프레임의 정보를 확인해보면 non-Null Count부분에서 price와 quantity 두 부분이 null값을 가지고 있음을 알수 있다.침착하게 데이터를 불러오고 null값을 확인하는 isna()와 sum()을 합쳐 null값을

저번주 금요일에 pandas 개인과제가 나왔다. 1~3번 밖에 풀지 못했지만 팀원들의 과제 리뷰와 함께 해설 강의를 함께 리뷰 해보자.타이타닉 데이터는 타이타닉호 생존자, 사망자에 관한 데이터입니다. survivied: 생존여부 (1: 생존, 0: 사망)pclass:

중심경향치범주형의 경우 최빈값(mode)을 많이 사용수치형의 경우 평균(mean), 중앙값(median) 사용 \- 평균 : 이상치에 민감함 \- 중앙값 : 이상값 존재해도 딥단의 대표성 설명 가능 산포도: 데이터의 퍼짐 정도를 나타내는 방법1\. 분산(Varia

모집단을 모두 조사하면 정확한 값을 얻을 수 있지만 비용이 많이 소모 되기 때문에 이 경우 대표성이 있는 샘플로 표본집단을 추출하여 추론하게된다.추론통계를 통해 표본으로 부터 모집단을 추정할때 분포라는 개념을 쓰게 된다.분포는 데이터가 특정값을 중심으로 흩어진 형태를