데이터 불러오기
df1 = pd.read_excel("C:/Users/heeky/Downloads/관서별 5대범죄 발생 및 검거.xlsx")
shape 확인하기.
데이터분석할 때 데이터의 타입을 확인하는것이 중요
데이터 타입에 따라 시각화, 분석 방법이 달라짐
인덱스의 갯수 32개, 컬럼의 갯수 13개
df1.shape
(32, 13)
데이터 정보 확인하기
결측치가 있는지, 어떤 타입의 데이턴지 확인 가능
df1.info()
<class 'pandas.core.frame.DataFrame'>
RangeIndex: 32 entries, 0 to 31
Data columns (total 13 columns):
Column Non-Null Count Dtype
--- ------ -------------- -----
0 관서명 32 non-null object
1 소계(발생) 32 non-null int64
2 소계(검거) 32 non-null int64
3 살인(발생) 32 non-null int64
4 살인(검거) 32 non-null int64
5 강도(발생) 32 non-null int64
6 강도(검거) 32 non-null int64
7 강간(발생) 32 non-null int64
8 강간(검거) 32 non-null int64
9 절도(발생) 32 non-null int64
10 절도(검거) 32 non-null int64
11 폭력(발생) 32 non-null int64
12 폭력(검거) 32 non-null int64
dtypes: int64(12), object(1)
memory usage: 3.4+ KB
연속형데이터에 대해 five-number summary 제공
평균, 표준편차, 개수, 최소값, 최대값, 25%, 50%, 75%
데이터에 이상한게 있는지 없는지 확인.
df1.describe()

데이터 샘플 확인해보기
head()는 위에서 부터 5개 확인
tail()는 아래서부터 5개 확인
보통 둘 다 확인. 아랫부분이 깨져있거나, 결측치가 있는 경우가 많음
df1.head()
df1.tail()
missing data 확인
전체 결측치 확인. Ture면 결측치, False면 값이 있음.
df1.isnull()
결측치 개수 확인
df1.isnull().sum()
컬럼명 확인
df1.columns
인덱싱, 슬라이싱 가능
시리즈 형태로 관서명 컬럼만 추출
df1['관서명']
괄호를 두개 쓰면 데이터 프레임 형태로 여러개의 컬럼을 추출할 수 있음. 두개이상의 데이터를 가지고 올때는 꼭 데이터프레임형태로!
시리즈 : 대괄호 1개
데이터프레임 : 대괄호 2개
df1[['관서명','폭력(검거)']]
컬럼별 합계 계산
df1['폭력(검거)'].sum()
컬럼별 다섯수치요약도 시리즈 형태로 확인 가능
df1.['폭력(검거)'].describe()
가져온 데이터를 새로운 변수에 저장 가능
df2 = df1[['관서명','폭력(검거)']]