1. Encoding 설정
주로 utf-8이 가장 호환성이 좋음. euc-kr은 지나간 포맷. cp-949 윈도우용
(utf-8이 작동하지 않는 윈도우는 cp)
encoding_errors='ignore'
💥'euc_kr' codec can't decode byte 0xd6 in position 136: illegal multibyte sequence
> df_target = pd.read_csv("./datas/Summer-Olympic-medals-1976-to-2008.csv", encoding = "euc-kr",encoding_errors='ignore')
check_01_01(df_target)
2. drop
https://velog.io/@dlskawns/Dataframe-내-Column-row-선택-제거-추가-변경하기pandas
1) 열(columns) 의 삭제:
df.drop(columns = ['A']) # 한 개 열을 삭제할 때.
df.drop(columns = ['A','B']) #여러개 열을 삭제할 때.
columns를 안쓰고 axis 설정을 통해 삭제도 가능하다
df.drop('A', axis = 1) #한 개 열을 삭제할 때.
df.drop(['A', 'B'], axis = 1) #여러개 열을 삭제할 때.코드를 입력하세요
2) 행(row)의 삭제:
df.drop(0) # index 중 0 행 삭제, axis의 default값이 axis = 0이기 때문에 안쳐도 된다.
df.drop([1,2]) # 여러 행 삭제 - 1, 2 행을 삭제했다. 0과 3행만 남음
3) iloc
index location : 번호로 사용. 마지막번호 포함 안함
4) loc
location : 이름으로 사용. 마지막번호 포함
2-1. dropna
df_target = df_target.dropna(axis =0)
3. 다중조건
df_archery = df_target[ (df_target['City'] == 'Beijing') &
(df_target['Sport'] == 'Archery') &
df.loc[df['Close']>=57000,'test']=1
df.loc[df['Close']<=57000,'test']=2
4. drop_duplicates
https://wikidocs.net/154060
df_target2=df_target2.drop_duplicates(['City', 'Year', 'Sport', 'Discipline', 'Event', 'Country_Code', 'Country', 'Event_gender', 'Medal'])
df_target3 = df_target2.pivot_table(index=["Year", "Medal"], values="City", aggfunc='count', sort=True)
df_target3
5. reindex
df_kor = df_kor.reindex(['Gold', 'Silver', 'Bronze'], level=1)
> b-s-g 였던 순서가 정렬됨
6. reset_index
df_rank = df_Atlanta2.pivot_table(index = 'Country', values='Athlete' , aggfunc = 'count').reset_index().copy()
df_rank

cf) 비교 : 없이

6-1. as_index
df_Atlanta2.groupby(['Country'], as_index =False)['Athlete'].count()
reset.index, pivot-group