12/7~8 Data Study to do
- Pandas 피봇테이블 (Ch.3 서울시 범죄 현황, 3-4강)
- python의 for문 (Ch.3 서울시 범죄 현황, 10-11강)
- seaborn (Ch.3 서울시 범죄 현황, 18-21강)
- list 데이터형 (Ch.4 웹 데이터 분석, 12-13강)
- 자기소개서 필수문항
오늘 공부 요약짤...🥲

괄호 속에 들어가는 요소
- 데이터 프레임 : 자료형 데이터
- index = ['칼럼'] : 해당 칼럼을 인덱스로 설정 (여러개 지정 가능)
- values = ['칼럼'] : 숫자형 데이터 중 해당 칼럼만 출력
- aggfunc = np.계산기능 : 인덱스가 가지고 있는 숫자형 데이터에 함수 적용
- 여러개 사용 가능
- 합산(np.sum), 평균(np.mean), 개수(len) 등- columns = ['칼럼'] : 칼럼에 있던 항목들로 분류 가능 (아래 이미지 참고)
- 없는 데이터는 NaN으로 표기- fill_value = 대체 데이터 : NaN으로 표기된 데이터들을 어떻게 채울 것이다
- margins = True : Total 값을 표시 (디폴트 False)

seaborn 그래프 스타일(테마)
1. white 스타일
- 그래프 안 그리드가 없는 테마
- sns.despine() : 위, 오른쪽 그래프 선 삭제 명령어
→ 괄호 속에 offset 옵션 추가 가능
→ x와 y가 만나는 선이 떨어져 보이도록 하는 옵션 (ex. ③ whitegrid 스타일)
.
2. Dark 스타일
- 그래프의 배경이 파란색인 테마
.
3. whitegrid 스타일
- 흰색 배경에 그리드가 있는 테마
그래프 이미지 의미
- 상자 : 데이터의 사분위수
- 막대 : 전체 데이터의 범위
- 점(이상치) : 다른 데이터와는 극단적으로 다른 값 (아웃라이어라고 명명)
- 상자 속 선 : 메디안(median, 중앙값) ↔ 평균
과 다른 값
- hue = '칼럼' : 칼럼을 기준으로 분류해주는 옵션
- palette = '색상명' : seaborn이 가지고 있는 색상표에서 '색상명'을 선택

- 해석 : 해당 가게에서는 Total Bill이 증가할 수록 Tip이 줄어드는 상관관계를 보임
- 주황색 선의 흐린 영역이 좁아서 위와 같은 인사이트 도출 가능
- 인사이트
1. 해마다 전체 승객의 수가 커지고 있음
- 여름 승객이 특히 많음
- 해가 지날 수록 경울 철 승객이 증가하고 있음
pairplot 그래프 사용
- x,y 축 데이터로 칼럼이 자동 세팅되어 그래프 출력
- 원하는 칼럼만 셀렉하여 x,y축 데이터로 세팅 가능
- x_vars = '칼럼' : x 데이터로 칼럼 선언
- y_vars = '칼럼' : y 데이터로 칼럼 선언
- anscombe.query("칼럼 == 'I'") : 칼럼에서 I인 값만 호출해라
- query 명령어는 조건문처럼 쓰이기도 함- ci = None : 선 주변 흐린 영역(lmplot에서 참고)을 off 해라
- scatter_kws = {'s' : 80} : 마커 사이즈 설정
- order를 2로 선언하면 선이 점을 따라서 바뀜(???)
- robust = None : 평균적인 데이터 범위에서 벗어난 값을 없는 것으로 취급해라
- 벗어난 값을 없는 것처럼 해서 직선 완성
