| 메서드 | 설명 |
|---|---|
| df | dataframe 줄임말로 엑셀에서 행과 열같은 데이터 객체 |
| read_csv | csv 파일 가져오는 함수 |
| read_csv(객체,encoding = 'euc-kr') | 인코딩 - 한글로 활성화 |
| head(숫자) | 위에서부터 n열 반환하는 함수 / defualt : 5개 |
| tail(숫자) | 아래에서부터 n열 반환하는 함수 / defualt : 5개 |
| shape | 레이블 정보를 튜플의 형식으로 반환 |
| columns | 전체 컬럼 출력 |
| index | 데이터셋의 구성 확인 |
| iloc | dataFrame의 순서,위치 기반으로 인덱싱하는 기법 |
| loc | data의 값을 기준으로 인덱싱하는 기법 |
| dtype | 데이터 타입을 반환 하는 함수 |
| index | 데이터의 색인이나 목차를 나타내주는 숫자 |
| object | 문자열 형태의 데이터 |
| isnull | 결측치(Null 값) 행 확인 |
| sum | 합계 |
| describe() | 데이터의 컬럼별 통계량을 요약 |
| info() | 데이터에 대한 전반적인 정보 |
| quantile() | 행/열의 분위수의 해당하는 값을 반환 |
| IQR | 75% 위치 - 25% 위치 |
| nunique() | 선택된 축에 대해서 고유한 요소의 수 |
| unique() | 컬럼내에 유일한 값 |
import pandas as pd
DriverUrl : '링크'
df = pd.read_csv(DriveUrl)
# 결과 : pandas.core.frame.DataFrame
import pandas as pd : pandas를 불러와 별칭을 pd로 지칭한다
DriverUrl : 사전에 업로드한 데이터를 읽는다
df.head()
print(df.shape)
df.shape
df.columns
df.columns[5]
📌 파이썬은 0부터 시작
-> 고로 6번째 컬럼을 출력할 시 5를 넣어주어야 한다.
iloc : dataFrame의 순서,위치 기반으로 인덱싱하는 기법loc : data의 값을 기준으로 인덱싱하는 기법:은 모든 행df.iloc[행,열(컬럼)].dtype
#⚡ dataFrame에서 모든행을 접근하며 5번째 컬럼의 datatype을 출력할거다.
df.iloc[:,5].dtype
df.iloc[2,5]
index : 데이터의 색인이나 목차를 나타내주는 숫자df.index
RangeIndex(start=0, stop=300, step=1)start=0 : 시작은 0stop=300 : 끝은 300번 (인덱스는 299번까지)step=1 : 1씩 증가한다.DriverUrl : '링크'
df = pd.read_csv(DriveUrl, encoding = 'euc-kr')
tail(숫자) : 숫자를 안넣어주면 defualt는 5개df.tail()
df.tail(3)
exclude : 해당 type만 제외하고 반환df.select_dtypes(exclude=object).columns
include : 해당 type만 포함하고 반환df.select_dtypes(include=object).columns
결측치 : 데이터에 값이 존재하지 않음isnull : null 값이 있는지 없는지를 파악sum : 합친 값df.isnull().sum()
❗데이터 분석을 할때 이런 null 값들을 처리하는게 중요
null값이 있으면 실행이 안되는 명령어들이 많기 때문
df.info()
df.describe()
df['column_name']
df['거주인구']
quantile : 전체 자료를 특정 개수로 나눌때 기준이 되는 수IQR : 75% 위치 - 25% 위치df['평균 속도'].quantile(0.75) - df['평균 속도'].quantile(0.25)
nunique() : 유일값 갯수를 출력df['column_name'].nunique()
df['읍면동명'].nunique()
unique() : 유일값을 모두 출력df['column_name'].unique()
df['읍면동명'].unique()