빅분기 실기대비 함수 정리

사당동씩씩이·2023년 11월 23일
post-thumbnail

업데이트 중

빅분기 실기를 10일 남기고 시작한 벼락치기.
일단 함수를 잘 기억해두는게 시간단축에 좋을듯 하다.

데이터 확인

  • 읽기 : pandas.read_csv('path', encoding='euc-kr')
  • df확인 : pandas 함수로 data프레임의 매소드 사용
    - df.head(n) == df.iloc[:n].copy() == df[:n] 사실 같음
    • df.loc['column_name']
    • df.iloc[index]
    • df.dscribe() , df['column_name'].discribe()
    • df.info()
    • df.columns
  • 왜도 : df.skew()
  • 첨도 : df.kurtosis() or df.kurt()
  • IQR :
    Q1 = df['column_name'].describe()["25%"]
    Q3 = df['column_name'].describe()["75%"]

na값 대체

  • fillna(x) : x로 채우기
    - groupby, map으로
    # 도시별 데이터의 이름 딕셔너리 생성
    keys = data['city'].unique()
    medians = {}
    # 도시이름 : 값 저장
    for i in keys:
    	medians[i] = data.groupby(i).median()
        
    #value의 na를 도시별 중위수로 map을 활용하여 채우기
    df['value'].fillna(df['city'].map(medians))

변수변환

  • 로그 변환, 제곱근 변환

    # log 변환 
    df[`new_column_name`] = Numpy.log(df['column_name'])
    
    # 제곱근 변환
    df[`new_column_name`] = Numpy.sqrt(df['column_name'])
  • 소수점 올림, 내림, 버림

    #올림
    np.ceil(x)
    #내림
    np.floor(x)
    #버림
    np.trunc(x)

전치리

  • np.getdummies(df[column_name])

기타 꼭 봐두면 좋은 코드

  • apply만 알아도 일당 100
def brand_group(series):
	if series==1:
		return 1
	elif series==2:
		return 2

df['re_brand'] = df['brand'].apply(brand_groups)
profile
N잡러 대충 이것저것 해보며 대충 사는 중

0개의 댓글