DS 스터디 노트 - EDA CCTV

Syl·2024년 4월 7일

DS Journey

목록 보기
19/38

5주차
7. 4. Sun

수강한 분량: EDA CCTV 01-07, 조건문 06

학습한 핵심 내용:

-vscode로 데이터 읽기
-vscode 열기

확장자명 '.ipynb'로 주피터 노트북 환경 실행


ㄴmac은 cmd, window는 ctrl

-Pandas
ㄴPandas의 데이터형을 구성하는 기본은 Series이다.
ㄴ간단하게 데이터를 지정할 수 있다.

ㄴcolumn 한 줄 한 줄이 Series data

ㄴdate_range() 함수는 날짜, 시간을 다룬다.

ㄴ"np"는 NumPy 패키지. NumPy는 파이썬에서 수치 연산을 수행하는 데 사용되는 강력한 라이브러리로, 다차원 배열과 행렬 연산에 특화. 주로 데이터 과학 및 과학적 계산에서 사용.

-DataFrame 연습

ㄴstd 표준편차

-그 외

df["A"] - "A" 컬럼만 읽기(열을 읽을 때)
df[n:m] - 행 번호 지정 가능, n부터 m-1까지
ㄴ단, 인덱스나 컬럼의 이름으로 slice하는 경우는 끝 포함

location
df.loc[:, ["A", "B"]] Pandas의 보편적인 slice 옵션
ㄴ':'는 모든 행
df.loc["20240102", ["A","B"]]

iloc  번호로 지정
df.iloc[3] - 4번째 행만 읽기(행을 읽을 때)
df.iloc[3:5] - 3, 4번 행
df.iloc[3:5, 0:2] - 3, 4번 행, 0, 1번 컬럼
df.iloc[[1, 2, 4], [0, 2]]
df.iloc[:, 1:3] - 모든 행에 1, 2번 컬럼

ㄴ이름보단 기능을 아는 것이 중요.

df[df["A"]>0] - A에서 0보다 큰 핸들만 선택
df[df > 0] - 전체에서 0보다 작으면 NaN 처리
ㄴNaN: Not a Number

컬럼 추가
df["E"] = ["one", "two", "three", "four", "five"]

특정 요소 찾기
df["E"].isin(["two", "four"])
df[  df["E"].isin(["two", "four"]) ] - 특정 요소가 있는 행만 선택

특정 컬럼 제거
del df["E"]

각 컬럼 누적 합계
df.apply(np.cumsum)

-조건문(난수)

이 글은 제로 베이스 데이터 취업 스쿨 강의 자료 일부를 발췌하거나 참고하여 작성되었습니다.

0개의 댓글