데이터를 처리하는 파이썬의 기본 패키지.
np.__version__
버전에 따라 코드가 안 돌아갈 수도 있음
수치연산을 위한 벡터연산 가능, 차원에 대한 정보를 가짐.
수식의 기반을 선형대수에 벡터/행렬/tensor etc로 추상화된 수식을 코드화 할 수 있다.
Data를 줄 단위(row, col)으로 무엇을 할지에 대한 "기능 중심"으로 생각하고 코드화
#2차원 DF 예시
test = [
[1,2,3],
[4,5,6]
]
-> [[1, 2, 3], [4, 5, 6]]
test_arr = np.array(test)
-> array([[1, 2, 3],
[4, 5, 6]])
len(test_arr) = 2 #row수
test_arr[0][1] = test_arr[0, 1] = 2
a[index]a[[ , , ]] index를 list 덩어리로 접근 가능a[가로][세로] = a[가로, 세로] = 값a[:,x] = x번째 cola[2::2,::2] = 가로 간격 2 씩, 세로 간격 2 씩인 값들의 모임a[x:,x:] = 네모array 자료형 인덱스 자리에 조건식이 들어갈 수 있다.
test_arr[test_arr < 5]
2차원의 경우 test_arr[가로 조건식, 세로 조건식]
arr.ndim
arr.shape
arr.dtype
dictionary 느낌.. dict : key - value => pandas : index - value
index 중심
import pandas as pd
p= pd.Series(dict, index= indexlist)
p[''] = p[] #index의 이름으로도 검색 가능, 번호로도 검색 가능
p[[ , , ]] index를 list 덩어리로 접근 가능
p[조건] 불리언 인덱싱 가능 - 조건 필터링
* (index) or틱하게 처리되므로 원하지 않는 row가 생성될 수 있음. Data 수 체크 필요!
.isnull() : T/F. 결측치면 T
ㄴ temp[temp.isnull()] -> 결측치만 추출
.isnotnull() : T/F
* 빈 문자열(공백) or None/NaN 이 있을 경우 결측 체크 불가. 실제 데이터 더블체크 필요
temp.shape
len(temp)
temp.dtype
2차원 자료형 -> 2중 for문이 기본 형태
vector 연산 기본, 기능을 줄 단위로 간결한 코드 표현 필요
.drop
df[" "] = [ , , , , ] #
.get_loc( )