데이터 전처리에 python을 사용하자
python에서 데이터 전처리를 하려면 pandas를 사용할줄 알아야한다.
먼저 데이터를 불러와야 한다.
import pandas as pd
import seaborn as sns
으로 pandas 라이브러리를 불러온후 pd로 약자로 불러주고 데이터 시각화를 위해 seaborn라이브러리도 함께 불러준다
data = sns.load_dataset('tips')
파이썬에 기본적으로 있는 tips 데이터셋을 불러온 다음 data로 불러주고 이 데이터를 csv파일로 변환시켜주면 해당 데이터 셋을 csv파일로 바꾼 파일이 생성된다.
data.to_csv("tips_data.csv", index = False) # index -> 인덱스 설정
to_csv대신 to_excel을 사용하고 파일 확장자를 xlsx으로 적어주면 엑셀파일로 저장할수 있다.
df = pd.read_csv("tips_data.csv") # index_col = 0 윗코드에서 index = False와 같게 동작
df
저장된 csv파일을 read_csv로 가져와 df 로 불러준다.
df.to_csv("temp/tips_data.csv", index=False)
파일명에 폴더명/을 써주면 해당 폴더에 파일을 저장한다.
df = pd.DataFrame({
'A': [1,2,3],
'B': ['a','b','c']
}, index = ['idx1','idx2','idx3'])
df
출력결과:

df.index df.index # 인덱스값이 어떻게 이루어진지 타입은 뭔지 불러와
.loc를 사용하면 해당 인덱스 행에 대한 정보를 전부 가져올수 있다.df.loc['idx2'] # loc :[index]행에 대한 정보 전부 가져와
출력결과:
A 2
B b
Name: idx2, dtype: object
.sort_index()df.sort_index() # sort_index : 정렬
.set_index('A')df.set_index('A') # set_index : ()를 인덱스로 쓰겠다.
df.index =[] df.index = ['가','나','다'] # 데이터 프레임의 인덱스를 []값으로 사용하겠다.
.reset_index()는 인덱스의 값을 재정렬하는 함수로 ()안에 level=None, *, drop=False, inplace=False, col_level=0, col_fill='', allow_duplicates=<no_default>, names=None을 써서 조정할수 있다.df.reset_index(drop=True)
data = {
'name': ['Alice','Bob','Charlie'],
'age': [25, 30, 35],
'gender': ['female','male','male']
}
df = pd.DataFrame(data)
df
위와 같은 데이터 프레임이 주어졌을때
df[] df['name'] #해당 컬럼의 정보 불러오기 가능
.columns 컬럼의 정보를 가져오거나 해당하는 컬럼의 내용만 표로 가져올수 있다df.columns
df.columns = ['이름','나이','성별']
.rename(columns={}) 컬럼의 이름을 변경할수 있다.df.rename(columns={'나이': 'age','성별':'남/여'})
df[] = ' ' 컬럼을 추가하고 그 컬럼에 해당하는 값으 추가할수 있다.df['스포츠']='축구'
del df[]del df['스포츠'] # 컬럼 삭제