[Python] 01. Getting & Knowing Data

hhyun·2024년 6월 18일

[Python]

목록 보기
1/11

📖 Getting & Knowing Data

메서드설명
dfdataframe 줄임말로 엑셀에서 행과 열같은 데이터 객체
read_csvcsv 파일 가져오는 함수
read_csv(객체,encoding = 'euc-kr')인코딩 - 한글로 활성화
head(숫자)위에서부터 n열 반환하는 함수 / defualt : 5개
tail(숫자)아래에서부터 n열 반환하는 함수 / defualt : 5개
shape레이블 정보를 튜플의 형식으로 반환
columns전체 컬럼 출력
index데이터셋의 구성 확인
ilocdataFrame의 순서,위치 기반으로 인덱싱하는 기법
locdata의 값을 기준으로 인덱싱하는 기법
dtype데이터 타입을 반환 하는 함수
index데이터의 색인이나 목차를 나타내주는 숫자
object문자열 형태의 데이터
isnull결측치(Null 값) 행 확인
sum합계
describe()데이터의 컬럼별 통계량을 요약
info()데이터에 대한 전반적인 정보
quantile()행/열의 분위수의 해당하는 값을 반환
IQR75% 위치 - 25% 위치
nunique()선택된 축에 대해서 고유한 요소의 수
unique()컬럼내에 유일한 값

🌟 Data Read

💭 Q1. Data Read

import pandas as pd 

DriverUrl : '링크'

df = pd.read_csv(DriveUrl)

# 결과 : pandas.core.frame.DataFrame

import pandas as pd : pandas를 불러와 별칭을 pd로 지칭한다
DriverUrl : 사전에 업로드한 데이터를 읽는다


🌟 head()

💭 Q2. 상위 5개의 행을 출력

  • 파이썬은 인덱스가 0부터 시작
df.head()

🌟 shape

💭 Q3. 데이터의 행과 열의 갯수를 파악

print(df.shape)
df.shape
  • 결과 : ( row , column ) 형식으로 출력
    🍀 print 없이도 출력 가능

🌟 columns[]

💭 Q4. 전체 컬럼 출력

df.columns

💭 Q5. 6번째 컬럼 출력

df.columns[5]

📌 파이썬은 0부터 시작
-> 고로 6번째 컬럼을 출력할 시 5를 넣어주어야 한다.


🌟 데이터 타입을 확인

  • iloc : dataFrame의 순서,위치 기반으로 인덱싱하는 기법
  • loc : data의 값을 기준으로 인덱싱하는 기법
  • :은 모든 행
df.iloc[,(컬럼)].dtype

💭 Q6. 6번째 컬럼의 데이터 타입을 확인

#⚡ dataFrame에서 모든행을 접근하며 5번째 컬럼의 datatype을 출력할거다.

df.iloc[:,5].dtype  

💭 Q8. 6번째 컬럼의 3번째 값은 무엇인가?

df.iloc[2,5]

🌟 index

💭 Q7. 데이터셋의 인덱스 구성을 확인

  • index : 데이터의 색인이나 목차를 나타내주는 숫자
df.index
  • 결과 : RangeIndex(start=0, stop=300, step=1)
    • start=0 : 시작은 0
    • stop=300 : 끝은 300번 (인덱스는 299번까지)
    • step=1 : 1씩 증가한다.

🌟 데이터를 로드할 때 컬럼이 한글일 경우

💭 Q9. Data Read. 컬럼이 한글이기에 적절한 처리

DriverUrl : '링크'
df = pd.read_csv(DriveUrl, encoding = 'euc-kr')

🌟 tail()

💭 Q10. 데이터 마지막 3개행을 출력하라

  • tail(숫자) : 숫자를 안넣어주면 defualt는 5개
df.tail()
df.tail(3)

🌟 select_dtypes()

💭 Q11. 수치형 변수를 가진 컬럼을 출력

  • 수치형 변수 : 숫자로 이루어진 변수
  • exclude : 해당 type만 제외하고 반환
df.select_dtypes(exclude=object).columns

💭 Q12. 범주형 변수를 가진 컬럼을 출력

  • 범주형 변수 : 문자열로 이루어진 변수
  • include : 해당 type만 포함하고 반환
df.select_dtypes(include=object).columns

🌟 isnull

💭 Q13. 각 컬럼의 결측치 숫자를 파악

  • 결측치 : 데이터에 값이 존재하지 않음
  • isnull : null 값이 있는지 없는지를 파악
  • sum : 합친 값
df.isnull().sum()

❗데이터 분석을 할때 이런 null 값들을 처리하는게 중요
null값이 있으면 실행이 안되는 명령어들이 많기 때문


🌟 info()

💭 Q14. 각 컬럼의 데이터수, 데이터타입을 한번에 확인

df.info()

🌟 describe()

💭 Q15. 각 수치형 변수의 분포를 확인

  • 사분위, 평균, 표준편차, 최대 , 최소
df.describe()

🌟 컬럼의 값들을 출력

df['column_name']

💭 Q16. 거주인구 컬럼의 값들을 출력

df['거주인구']

🌟 quantile()

  • quantile : 전체 자료를 특정 개수로 나눌때 기준이 되는 수

💭 Q17. 평균 속도 컬럼의 4분위 범위(IQR) 값을 구하

  • IQR : 75% 위치 - 25% 위치
df['평균 속도'].quantile(0.75) - df['평균 속도'].quantile(0.25)

🌟 nunique()

  • nunique() : 유일값 갯수를 출력
df['column_name'].nunique()

💭 Q18. 읍면동명 컬럼의 유일값 갯수를 출력

df['읍면동명'].nunique()

🌟 unique()

  • unique() : 유일값을 모두 출력
df['column_name'].unique()

💭 Q19. 읍면동명 컬럼의 유일값을 모두 출력

df['읍면동명'].unique()

0개의 댓글