[TIL]_2025.03.04 본캠프 16일차 (3): ADsP 강의 7주차

JIYUU·2025년 3월 4일

01. 통계 분석의 이해

1. 통계 개요

  • 통계의 정의
    통계란 분석하고자 하는 특정 집단을 대상으로 얻은 자료 및 요약된 형태의 표현
  • 모집단
    모집단 구성 개체는 추출단위 혹은 원소
    유한 모집단: 유한 개의 개체로 이루어진 모집단
    무한 모집단: 무한 개의 개체로 이루어진 모집단으로 모통 개념적으로 상정된 모집단
  • 통계 자료 획득법

1) 전수조사(Census)
대상 집단 모두를 조사하는 것
비용과 시간이 많이 소요됨

2) 표본조사 (Sample)
모집단을 대표할 수 있는 표본을 추출하여 조사하는 것
표본의 대표성을 신뢰할 수 있어야 신뢰성 있는 결과가 된다.
- 표본: 조사하는 모집단의 일부
- 모수(Parameter): 모집단에 대해 알고자 하는 값 (모집단의 특성치)
- 통계량(Statistic): 모수를 추론하기 위해 구하는 표본의 값. 데이터 요약수치

2. 표본 추출방법

  • 단순 랜덤 추출법 (simple random sampling)
    N개의 원소로 구성된 모집단에서 n개의 표본을 추출할 때에 임의로 선택하는 것

  • 계통 추출법 (systematic sampling)
    모집단의 모든 원소들을 순서대로 나열한 후, K개(전체 원소 수/구간 수)로 나눈다. 첫 구간에서 하나를 임의로 선택한 후 다음 구간에서 또 추출한다.

  • 집락(군집)추출법 (cluster sampling)
    모집단이 집락(cluster)로 결합된 형태로 구성되어 있고, 각 집락에서 원소들에게 일련번호를 부여하여 집락 랜덤 선택 후, 해당 집락에서 표본을 임의로 선택

  • 층화 추출법 (stratified sampling)
    이질적인 모집단의 원소를 유사한 것 끼리 층(stratum)으로 나눈 후, 각 층을 고루 대표할 수 있는 표본을 랜덤하게 추출하는 방식
    - 비례 층화 추출법 : 전체 데이터 분포 반영하여, 집단의 비율과 동일하게 표본을 추출하는 방식
    - 불비례 층화 추출법 : 비율을 반영하지 않고 원하는 개수의 데이터를 집단에서 원하는 표본의 개수를 추출하는 방식

3. 측정과 척도

  • 측정 : 주어진 목적에 적합하도록 관측하여 자료를 얻는 것
  • 척도 : 관측 대상의 속상을 측정하여 숫자로 나타나도록 규칙을 정하여 바꾸는 도구
  • 측정방법
    • 질적척도
      명목척도: 어느 집단에 속하는지 분류할 때 사용 (ex. 성별, 출생지 등)
      순서척도(서열척도): 서열관계를 관측하는 척도(ex. 선호도, 신용도, 학년, 순위 등)

    • 양적척도
      구간척도(등간척도) : 속성의 양을 측정, 간격이 의미 있는 자료 (온도, 지수 등)
      비율척도 : 절대적 기준인 0값이 존재하고 모든 사칙연산이 가능 (무게, 나이, 연간소득 등)

4. 기술통계와 추리통계⭐

  • 기술통계 (Descriptive Statistic) : 데이터에서 특징을 뽑아내기 위한 기술
    • 평균, 표준편차, 중위수, 최빈값 등의 수치로 표현
    • 수집된 자료를 정리, 요약하기 위한 기초 통계
  • 추리통계/통계적 추론 (Inference Statistics)
    • 통계학과 확률이론의 혼합 (부분으로 전체를 추측)
    • 수집된 자료로 모집단에 대해 결정하는 것
    • 모수 추정 : 표본에서 얻은 통계치로 오차를 고려하여 모수를 확률적으로 측정하는 기법
    • 가설 검증 : 모집단의 특정을 추정하기 위해 가설 검증, 확률적 가능성 파악하는 것
    • 예측 : 불확실성을 해결하여 효율적인 의사 결정을 하기 위함
      회귀분석, 시계열분석 등의 방법이 있음

02. 기초 통계 용어

1. 기초 통계 용어

  • 자료 (데이터)

  • 평균 (기댓값)
    일반적인 평균은 산술평균을 의미하여 데이터를 요약할 때 가장 대표적으로 사용

  • 표본 평균 (Sample Mean)

  • 중앙값

    • 평균의 함정을 피하기 위한 척도
    • 자료를 순서대로 나열했을 때 가운데의 값
  • 최빈값

    • 평균의 함정을 피하기 위한 하나의 척도
    • 데이터 집합에서 가장 빈번하게 나타는 값
  • 분산

    • 데이터가 흩어진 정도를 나타내는 척도(평균에서 얼마나 떨어져 있는지)
    • 데이터의 관찰값이 평균으로부터 얼마나 떨어져 있는지를 측정하여 데이터 변동성 표현
    • 분산은 다 더하면 0이됨
  • 표준편차

    • 분산의 양의 제곱근
    • 데이터들이 평균으로부터 얼마나 떨어져 있는 평균적인 정도를 측정
  • 첨도 (kurtosis)

    • 평균에 얼마나 밀집되어 있는지 나타내는 척도
    • 데이터 분포 형태 설명에 사용
  • 왜도 (skewness)

    • 확률분포의 비대칭도를 측정하는 통계적 측도
    • 데이터의 분포가 얼마나 비대칭인지를 나타냄
  • 상관분석

    • 두 변수 간의 관계를 분석하는 것으로 공분산과 상관계수를 활용할 수 있음
    • 두 변수가 함께 움직이는 방향과 크기에 대한 것
    • 한 변수가 증가할 때 상대변수도 증가하면 양의 상관, 감소하면 음의 상관
  • 공분산 (Covariance)

    • 두 변수 간의 상관 관계를 나타내는 척도
    • 한 변수가 증가할 때 다른 변수가 어떻게 변하는지 측정
    • 양수면 양의 선형관계, 음이면 음의 선형관계
  • 상관계수 (Correlation)

    • 선형관계의 강도와 방향을 숫자로 나타냄

03. 확률과 확률분포

1. 확률

  • 확률의 정의
    특정사건이 일어날 가능성의 척도
    모든 결과들의 집합 = 표본 공간(sample space, 옴)

  • 조건부 확률
    특정 사건 A가 발생했을 때, B라는 사건이 발생할 확률

  • 독립사건과 배반사건
    독립사건: 두 사건이 영향을 미치지 않고 한 사건의 발생 여부가 다른 사건에 영향을 주지 않는 사건.
    (ex. 주사위 두 번 던져서 첫번째에는 짝수, 두번째에는 홀수가 나오는 사건들)
    배반사건: 두 사건 A와 B가 동시에 발생할 수 없는 경우
    (ex. 주사위 한 번 던져서 짝수가 나오거나 홀수가 나오는 경우)

0개의 댓글