질적(qualitative) = 비계량형(nonmetric) = 범주형(categorical)
1) 명목형(nominal) : 혈액형 등
2) 순서형(ordinal) : 학년, 학점
양적(quantitative) = 계량형(numerical)..?
1) 구간자료(interval) : 온도, iq, 성적
2) 비율자료(ratio) : 몸무게
숫자형 > 순서 > 명목 가능 (반대는 x)
시계열자료
횡단면 자료
패널자료(panel) 앞선 두개의 합
왜도
: 히스토그램의 기울어진 정도
1) 양의 왜도 (손바닥을 뒤집어서 오른쪽엄지)
2) 음의 외도
3) 왜도 = 0
모양
종모양, l모양, u, 단봉, 이봉..
누적도수곡선
도수룰 누적하여 꺾은 선 그래프 형태로 그린 것
크기순서로 배열한 후
최솟값, 일사분위수, 중앙값, 삼사분위수, 최댓값
특이값이 몰려있다면 최댓값 최솟값이 늘어날 수 있음.
그래서 상자의 치우친 정도만 보지 말고 특이값도 보기
: 두양의 상관관계 (키&몸무게, 수면시간 & 학업성취도)
cf) 여러개의 양 : 산점도 행렬
sns.pairplot(iris, diag_kind='hist')plt.show()
=
종류
다변량 자료를 이차원 평면에 나타내고, 직관적으로 파악할 수 있음
-산점도 등에서도 쓰이고
-이걸버릴건지 말건지
평균
population(모집단, N) : 모평균 (뮤) / 모수
sample space (표본공간, n) : 표본평균(smaple mean) (x바)/ 통계량(statistic)
산술평균 : 특이값에 영향을 많이 받음.
중앙값
n이 홀수개 : n+1 / 2
n이 짝수 : n/2과 n/2 + 1의 가운데
산술평균에 비해 특이값에 상대적으로 영향을 덜받음
3.최빈값(mode)
명목형자료을 대표수로 표시함(혈액형 a는 몇명..)
편향의 정도