
`Lieber zu spät als nie, doch lieber nie zu spät.
아예 안 하는 것보다 늦게라도 하는 게 낫지만, 안 늦는 게 가장 좋다.`
https://pandas.pydata.org/docs/getting_started/intro_tutorials/01_table_oriented.html
import pandas as pd
판다스는 파이썬의 수 많은 라이브러리 가운데 레이블 형태의 자료를 수집하고 정리하는데 매우 유용한 도구이다 판다스의 두 가지 대표적인 자료구조가 시리즈(series)와 데이터프레임(DataFrame)이다 시리즈와 데이터프레임은 numpy의 1차원과 2차원 array와 매우 유사하다
- 판다스의 시리즈는 1차원 배열로 아래의 특징을 가짐
- 데이터를 담는 **차원 배열 구조**를 가짐
- 인덱스(index) 사용 가능
- 데이터 타입을 가짐(dtype)
import numpy as np
import pandas as pd
obj = pd.Series([4, 7, -5, 3])
obj
output: 
출력값을 확인해보면 index와 values가 동시에 출력되는 것을 확인
리스트의 성분 갯수 = index 갯수
# series변수.values 호출 -> 값만 따로 array됨
obj.values
array([ 4, 7, -5, 3])
# .index -> index 범위값만 출력
obj.index
RangeIndex(start=0, stop=4, step=1)
# .dtypes -> 데이터형 확인
obj.dtypes
dtype('int64')
파이썬의 딕셔너리 형태로 데이터를 정의한 후, DataFrame을 정의
numpy의 array도 들어갈 수 있음
data = {
"제품이름": ["와퍼", "치즈와퍼", "더블치즈와퍼"],
"칼로리": [600, 800, 1000],
"단백질": [10, 20, 30]
}
pd.DataFrame(data)output: 
- 데이터를 표 형식으로 예쁘게 출력 🌻
- 세로: index(리스트 성분의 갯수), 가로: 키값(columns)들이 둘러싸고 있는 표 형태의 데이터
- 키값이 자동으로 columns의 이름, 키값의 갯수가 열의 갯수가 됨
- 밸류값인 리스트의 성분갯수가 행의 index를 결정
- `data` 변수를 python에서 출력해보면
```python
{'제품이름': ['와퍼', '치즈와퍼', '더블치즈와퍼'],
'칼로리': [600, 800, 1000],
'단백질': [10, 20, 30]}
위와 같이 날 것 그대로의 데이터가 출력되는 것을 확인한 수 있음 🥩
pd.read_csv("데이터가 있는 경로 붙여넣기")
ndim 메서드는 데이터의 차원(축의 수)를 반환shape 메서드는 DataFrame 객체의 차원의 형태(레이블 정보)를 튜플 형식으로 반환head 함수는 DataFrame 객체를 위에서부터 n열 반환하는 함수 (default: 5)tail 함수는 DataFrame 객체를 아래에서부터 n열 반환하는 함수 (default: 5)info 함수는 데이터의 전체 구조 요약을 출력describe 함수는 통계 요약 정보를 출력df[df["컬럼"] > 값]df[(조건1) & (조건2)], df[(조건1) | (조건2)]by Heidi J. 꼬꼬마 데분가💜