DS 스터디 노트 - EDA 데이터 합치기

Syl·2024년 4월 10일

DS Journey

목록 보기
21/38

6주차
Tue. 9. 4.

수강한 분량: EDA 데이터 이론 09, 12, 15

학습한 핵심 내용:

-Pandas 데이터 합치기

-merge() 명령

pd.merge(left, right, on="key") 

#how 옵션
pd.merge(left, right, how="left", on="key")
ㄴleft는 다 살아있음
pd.merge(left, right, how="outer", on="key)
ㄴleft, right 다 살림
pd.merge(left, right, how="inner", on="key)
ㄴ공통 분모(교집합)만 병합

ㄴ상관 관계(Correlation): 두 변량 사이에 한 쪽이 증가하면 다른 쪽도 변화(증가 또는 감소)하는 경향이 있을 때 두 변량 사이의 관계.

ㄴ관계 데이터를 찾을 때, 최소한의 근거가 있어야 해당 데이터를 비교하는 의미가 존재한다. c.f. 상관 계수를 조사해서 0.2 이상의 데이터를 비교하는 것은 의미가 있다.

0.2 이하 - 상관 관계가 없거나 무시해도 좋은 수준
0.4 이하 - 약한 상관 관계
0.6 이상 - 강한 상관 관계

-상관 관계 corr()

date_result.corr()

ㄴ자기 자신과의 상관 관계(대각선)은 1

-데이터 시각화(matplot library)

-2D Gragh(matplotlib.pyplot as plt)

ㄴ 새 창 띄우지 않고 문서에 포함시켜서 그래프 그릴 때: inline

ㄴfigure( -그림의 속성- )로 열어서 show()로 마무리한다.

ㄴnp.arrange(n, m, d): n부터 m까지 d의 간격으로,
ㄴnp array 데이터 타입.

ㄴ파이썬에서 함수는 들여쓰기
ㄴplot = 그리기
ㄴgrid = 그래프에 격자
ㄴlegend = 범례(label)를 표현해라
ㄴxlabel = x축에 제목을 달아라
ㄴtitle = 제목 달아라

ㄴ--: dashed
ㄴbs: bluesquare
ㄴg: green

ㄴxlim: x축 범위
ㄴylim: y축 범위

-drawGraph()

-colormap()

ㄴs는 마커 크기

-한글 대응(어떤 프로그램/환경이냐에 따라 알맞은 코드 가지고 있기)

이 글은 제로 베이스 데이터 취업 스쿨 강의 자료 일부를 발췌하거나 참고하여 작성되었습니다.

0개의 댓글