통계학이란?
- 불확실한 상황에서 현명한 의사결정을 하기 위한 이론/방법의 체계(자료 수집-분류-분석-해석)
변수와 자료
양적 변수(quantitative variable) : 수치로 나타낼 수 있는 변수로 산술적 계산이 가능하다.
질적 변수(qualitative variable) : 성별, 지역과 같이 수치로 나타낼 수 없는 변수로 산술적 계산이 불가능하다.
변수의 수준 (level of variable)
명목변수 (nominal variable) : 특성을 분류하기 위한 단순한 구분기호로, 범주 간의 순서나 크기의 차이가 없다
서열(순위)변수 (ordinal variable) : 명목변수보다 한 단계 높은 수준으로, 범주 간의 순서가 있지만 그 차이가 일정하지 않다. 순서만 비교 가능하고, 사칙연산이 포함되는 분석은 불가능하다
등간(구간)변수 (interval variable) : 서열변수보다 한 단계 높은 수준으로, 순서가 있고 범주 간의 차이가 일정하다. 덧셈과 뺄셈이 가능하지만 기준이 상대적이기 때문에 비율은 큰 의미가 없다.
비율변수 (Ratio Variable) : 가장 높은 수준의 정보를 가지고 있는 변수로, 등간변수의 특성에 더해 절대적인 기준(즉, 절대 0점)이 존재하여 모든 사칙연산과 비율 계산이 가능하다.
변수의 수준은 분석 목적에 따라 변환하여 설정할 수 있다. 이때, 높은 수준에서 낮은 수준으로의 변화는 가능하지만, 반대는 불가능하다
변수의 수준에 따라 분석하는 방법이 다르다.
※ ML에서의 (Numeric variable, Categorical Variable)과의 차이
도수분포표
질적 자료의 정리
빈도수 (frequency) : 하나의 등급/범주의 분포상태

상대적 빈도 (relative frequency) : 전체 자료 중 각 범주의 빈도가 차지하는 비율. 한 집단에서 각 범주의 빈도를 비교하는 경우도 사용 가능하지만, 서로 다른 집단을 비교할 때 더욱 유용하다.

질적 자료의 경우 일반적으로 막대그래프(bar graph)로 시각화를 한다
양적 자료의 정리
frequency와 relative frequency는 기본적으로 사용 가능하다
이산형 자료


연속형 자료
histogram, 꺾은선 그래프(polygon)를 사용하여 [빈도수, 상대적 빈도, 누적 빈도수]를 시각화 가능하며 상대적 누적빈도의 경우 누적백분율곡선(ogive)을 사용하여 시각화가 가능하다