데이터마이닝 - EDA 실습

조쿨러·2024년 1월 22일

Python

목록 보기
8/12

서울시 따릉이 분석

성별 이용시간 박스플롯으로 시각화후 이상치 데이터 확인
sns.boxplot(x='성별',y='이용시간(분)', data = df)

성별 평균 이용시간

df_sex_mean = df.groupby('성별').mean()['이용시간(분)']
df_sex_mean.plot(kind='bar')

가장 이용횟수가 많은 대여소의 연령대별 평균 이용시간

sns.barplot(x=df_mean.index, y='평균이용시간', data=df_mean)

colab
EDA 서울시 따릉이 분석

https://colab.research.google.com/drive/1nDbwg9kY04S2s1C7zrkFVwxh5slbWKLp?usp=sharing

EDA 한국복지패널 데이터 분석

남성과 여성의 빈도 막대그래프

sns.countplot(data=data,x='sex')

수입 데이터 전처리 및 시각화

# income 히스토그램
sns.histplot(data=data,x='income')

결측치 제거 후 성별 평균소득 구함

data['income'].isna().sum()

sex_income = data.dropna(subset=['income']).groupby('sex')['income'].mean()
sex_income

sex_income.plot.bar(rot=0)

연령분포 히스토그램 확인

sns.histplot(data=data,x='birth')

가장 수입이 많은 나이

data_income = data.dropna(subset=['income']).groupby('age').mean()
data_income['income'].plot()

연령대 시각화

data['agetype'].value_counts()

sns.countplot(data=data,x='agetype')

연령대별 평균수입 시각화

#연령대별 평균수입
data.groupby('agetype')['income'].mean()

#연령대별 성별 평균수입
data.groupby(['agetype','sex'])['income'].mean()

agetype_sex_income = data.groupby(['agetype','sex'],as_index=False)['income'].mean()
agetype_sex_income

sns.barplot(data=agetype_sex_income,x='agetype',y='income',hue='sex',order=['초년','중년','노년'])

연령, 성별 평균 수입

age_sex = data.dropna(subset=['income']).groupby(['sex','age'],as_index=False)['income'].mean()
age_sex

sns.lineplot(data=age_sex,x='age',y='income',hue='sex')

EDA 한국복지패널 데이터 분석

https://colab.research.google.com/drive/1CeolbAH1Shq85qk3TQWg6KiroBdfXR1D?usp=sharing

profile
지지 않기

0개의 댓글