DS 스터디 노트 - EDA 범죄

Syl·2024년 4월 13일

DS Journey

목록 보기
24/38

6주차
Sat. 13. 4.
Sun. 14. 4. - EDA 테스트

수강한 분량: EDA 범죄 데이터 이론

학습한 핵심 내용:

-범죄 현황 데이터 분석(GoogleMaps, Folium, SEaborn, Pandas Pivot_table 익히기)

데이터: 공공데이터포털

ㄴ310개의 데이터/ 단순 나열된 데이터를 간단하게 필요한 데이터로 정렬해야 한다.

-Pivot table

ㄴName을 인덱스로 두고 재정렬. 간단한 명령!

ㄴ갯수도 적용 가능.

aggfunc=[np.mean, len]

ㄴNaN 없애기

-깔끔하게 정리하기

-데이터를 표로 정리

-모듈 설치

  • pip 명령

ㄴ 업데이트 상황 등에 따라 깨지는 등의 오류가 있을 수 있음 유의.

ㄴexport 할 때 느낌표 명령은 에러가 날 수 있으므로 느낌표 없이 사용하는 방법임.

  • conda 명령

ㄴ channel(-c)이 있다는 것이 pip 명령과의 차이점!

-Google Maps API

ㄴ오픈 소스 플랫폼 사용의 단점임.
ㄴ개발 공부 시 어렵다고 생각하는 부분이 있으면 오히려 좋다. 스트레스보단 약점을 찾았으니 공부할 기회.

-반복문

for i in [1, 2, 3, 4]:
	print("Number is", n)
    
for i in range(0, 10):
	print(n ** 2)

ㄴ one line command를 선호

-Google Maps를 이용한 데이터 정리

  • 주소와 위치 정보 얻기

ㄴ데이터가 리스트에 올라온다. 데이터에 접근하고 싶다면 대괄호를 열고 인덱스 번호를 적어야 한다.
ㄴ리스트 안에는 dict형으로 되어 있다.

  • Pandas DataFrame에서 반복문: iterrows()

ㄴ count는 반복문 잘 돌고 있는지 확인용

  • 표 정리

  • 저장

  • 구별 데이터로 변경

  • 검거율(컬럼을 다른 컬럼으로 나누기)

ㄴ num: numerator, den: denominator

  • 문제 발생

  • 범죄 데이터 정렬을 위한 데이터 정리

ㄴ Normalization, MinMaxScaler 사용
ㄴ (쉬운 비교를 위해) 최대값으로 나눠서 0과 1 사이의 값으로 스케일을 바꾼다.

-인구와 CCTV 데이터 추가

  • 지표 데이터 추가

이 글은 제로 베이스 데이터 취업 스쿨 강의 자료 일부를 발췌하거나 참고하여 작성되었습니다.

0개의 댓글