DataFrame 인덱싱 슬라이싱
인덱싱 : 데이터를 하나만 가져올때 사용한다
슬라이싱 : 여러개의 데이터를 범위로 잘라올때 사용한다
import pandas as pd
name = ['John','Jenny','Nate','Julia','Brian']
age = [20,30,30,40,45]
job = ['student','developer','teacher','dentist','manager']
dic = { 'name':name,'age':age,'job':job}
df = pd.DataFrame(dic)
df
df['name']
df.loc[0:,'name']
df.iloc[0:,0]
df[['age','job']]
df.loc[:,['age','job']]
df.iloc[:,[1,2]]
df.iloc[:,1:]
df[0:3]
df.loc['0':'2']
df.iloc[0:3]
import matplotlib.pyplot as plt
import pandas as pd
from sklearn.neighbors import KNeighborsClassifier as kn
from sklearn.metrics import accuracy_score as acs
목표
문제정의 500명의 키 몸무게 데이터를 활용하여 비만도를 판단해주는 모델 (머신러닝 과정 학습해보기)
bmi=pd.read_csv("data/bmi_500.csv",index_col='Label',encoding="utf-8")
X_train=bmi[['Height','Weight']]
bmi.shape
전처리
결측치, 이상치 처리
bmi.info()
탐색적 데이터 분석(EDA - Exploratory Data Analysis)
데이터 세트들의 특성을 확인 & 분석한다
기술통계 확인(통계량에 대해 적어준 데이터) => 평균, 최대, 최소, 4분위수
시각화를 통해서 데이터의 분포 현황을 알아본다
bmi.describe()
bmi.index.value_counts()
bmi['Gender'].value_counts()
eo=bmi.loc['Extreme Obesity']
plt.scatter(eo['Height'],eo['Weight'],color = 'purple', label='ext ob')
plt.legend()
plt.show()