[Basic] 데이터 정제 - 브로드캐스팅(연산), 정렬, 형변환

고보·2024년 2월 2일

1 브로드캐스팅

  • 브로드캐스팅: 데이터 집합 간의 연산 수행 시 발생하는 프로세스. 두 개 이상의 데이터 프레임이 서로 호환되지 않을 때.
  • (1) 숫자 시리즈(df) + 스칼라 연산
    • ages+100 ages*100: 각각의 값에 수행
  • (2) 같은 크기의 행렬 연산
    • ages + ages => 각각의 인덱스를 찾아서 연산
    • ages * ages => 각각의 인덱스를 찾아서 연산
      ex) 정렬을 다르게 해도 결국 각각 인덱스 찾아서 연산되기에 같다.
  • (3) 다른 크기의 시리즈 연산
    • ex) 8개짜리 시리즈 + 2개짜리 시리즈 => 2개는 인덱스대로 연산, 남은 값들은 모두 NaN
  • (4) 여러 종류의 데이터타입 df에 *2 연산
    • 문자열은 2번 출력
    • 숫자는 *2
  • (5) 날짜 끼리 연산
    • 'datetime - datetime' = 일수 출력

2 정렬

  • df.sort_values(by='기준', ascending=True): 기준으로 값 정렬. ascending=True면 오름차순(default), False면 내림차순.
  • df.sort_index(ascending = False): 인덱스 역순 정렬.
  • 무작위 정렬
    import random
    random.shuffle(df['열이름'])

3 형 변환

  • 문자열 => 시간
    pd.to_datetime(df['문자열column'], format = '%Y-%m-%d')
profile
일본에서 일하는 게임 기획자. 시시해서 죽어버리지 않게, 재밌고 의미 있는 컨텐츠에 관심 있습니다. 그 도구로 데이터, AI도 찝적댑니다.

0개의 댓글