1) 전수조사(Census)
대상 집단 모두를 조사하는 것
비용과 시간이 많이 소요됨
2) 표본조사 (Sample)
모집단을 대표할 수 있는 표본을 추출하여 조사하는 것
표본의 대표성을 신뢰할 수 있어야 신뢰성 있는 결과가 된다.
- 표본: 조사하는 모집단의 일부
- 모수(Parameter): 모집단에 대해 알고자 하는 값 (모집단의 특성치)
- 통계량(Statistic): 모수를 추론하기 위해 구하는 표본의 값. 데이터 요약수치
단순 랜덤 추출법 (simple random sampling)
N개의 원소로 구성된 모집단에서 n개의 표본을 추출할 때에 임의로 선택하는 것
계통 추출법 (systematic sampling)
모집단의 모든 원소들을 순서대로 나열한 후, K개(전체 원소 수/구간 수)로 나눈다. 첫 구간에서 하나를 임의로 선택한 후 다음 구간에서 또 추출한다.
집락(군집)추출법 (cluster sampling)
모집단이 집락(cluster)로 결합된 형태로 구성되어 있고, 각 집락에서 원소들에게 일련번호를 부여하여 집락 랜덤 선택 후, 해당 집락에서 표본을 임의로 선택
층화 추출법 (stratified sampling)
이질적인 모집단의 원소를 유사한 것 끼리 층(stratum)으로 나눈 후, 각 층을 고루 대표할 수 있는 표본을 랜덤하게 추출하는 방식
- 비례 층화 추출법 : 전체 데이터 분포 반영하여, 집단의 비율과 동일하게 표본을 추출하는 방식
- 불비례 층화 추출법 : 비율을 반영하지 않고 원하는 개수의 데이터를 집단에서 원하는 표본의 개수를 추출하는 방식
명목척도: 어느 집단에 속하는지 분류할 때 사용 (ex. 성별, 출생지 등)순서척도(서열척도): 서열관계를 관측하는 척도(ex. 선호도, 신용도, 학년, 순위 등)구간척도(등간척도) : 속성의 양을 측정, 간격이 의미 있는 자료 (온도, 지수 등)비율척도 : 절대적 기준인 0값이 존재하고 모든 사칙연산이 가능 (무게, 나이, 연간소득 등)자료 (데이터)
평균 (기댓값)
일반적인 평균은 산술평균을 의미하여 데이터를 요약할 때 가장 대표적으로 사용
표본 평균 (Sample Mean)
중앙값
최빈값
분산
표준편차
첨도 (kurtosis)
왜도 (skewness)
상관분석
공분산 (Covariance)
상관계수 (Correlation)
확률의 정의
특정사건이 일어날 가능성의 척도
모든 결과들의 집합 = 표본 공간(sample space, 옴)
조건부 확률
특정 사건 A가 발생했을 때, B라는 사건이 발생할 확률
독립사건과 배반사건
독립사건: 두 사건이 영향을 미치지 않고 한 사건의 발생 여부가 다른 사건에 영향을 주지 않는 사건.
(ex. 주사위 두 번 던져서 첫번째에는 짝수, 두번째에는 홀수가 나오는 사건들)
배반사건: 두 사건 A와 B가 동시에 발생할 수 없는 경우
(ex. 주사위 한 번 던져서 짝수가 나오거나 홀수가 나오는 경우)