통계(week3)

HanJu Han·2025년 7월 3일

좋습니다! 아래에 **표본 분산 (Sample Variance)**과 **표본 표준편차 (Sample Standard Deviation)**의 수식을 각각 정리해 드릴게요.


✅ 표본 분산 (Sample Variance)

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n - 1} \sum_{i=1}^{n} (x_i - \bar{x})^2
  • xix_i: i번째 관측값
  • xˉ\bar{x}: 표본 평균 (Sample Mean)
  • nn: 표본의 크기 (표본 개수)
  • s2s^2: 표본 분산

주의: 분모가 nn이 아니라 n1n - 1인 이유는 자유도 보정을 하기 위해서입니다. (편향되지 않은 분산 추정을 위해)


✅ 표본 표준편차 (Sample Standard Deviation)

s=s2=1n1i=1n(xixˉ)2s = \sqrt{s^2} = \sqrt{ \frac{1}{n - 1} \sum_{i=1}^{n} (x_i - \bar{x})^2 }
  • ss: 표본 표준편차
  • 위에서 구한 s2s^2 (표본 분산)의 제곱근

✅ 표본 분산 – 계산용 단축 공식 (Shortcut Formula)

s2=xi2(xi)2nn1s^2 = \frac{ \sum x_i^2 - \frac{(\sum x_i)^2}{n} }{n - 1}
  • xix_i: 각 관측값
  • xi2\sum x_i^2: 각 관측값의 제곱의 합
  • (xi)2(\sum x_i)^2: 관측값의 합을 제곱한 것
  • nn: 표본 크기
  • s2s^2: 표본 분산

✅ 요약: 두 가지 수식 비교

항목정의 기반 공식계산용 단축 공식
수식s2=1n1(xixˉ)2s^2 = \frac{1}{n-1} \sum (x_i - \bar{x})^2s2=xi2(xi)2nn1s^2 = \frac{\sum x_i^2 - \frac{(\sum x_i)^2}{n}}{n - 1}
특징평균을 먼저 계산해야 함평균 없이 계산 가능
장점개념적으로 직관적계산 효율이 좋고 오차가 적음

문제 풀이

이 문제는 '백분위수(Percentile)'를 구하는 문제입니다. 차근차근 따라오시면 쉽게 이해할 수 있습니다.

1단계: 백분위수(Percentile)란 무엇인가?

백분위수는 전체 데이터를 크기 순서대로 정렬했을 때, 가장 작은 값부터 가장 큰 값까지를 100등분 한 위치를 말합니다.
예를 들어,

  • 10번째 백분위수(10th percentile)는 전체 데이터 중 하위 10%에 해당하는 위치의 값입니다.
  • 50번째 백분위수(50th percentile)는 전체 데이터 중 하위 50%에 해당하는 위치의 값으로, 우리가 흔히 아는 중앙값(Median)과 같습니다.
  • 100번째 백분위수(100th percentile)는 전체 데이터 중 하위 100%에 해당하는 위치의 값으로, 데이터의 최댓값(Maximum)을 의미합니다.

2단계: 데이터 정렬하기 (가장 중요!)

백분위수를 계산하기 전, 가장 먼저 해야 할 일은 주어진 데이터들을 작은 값에서 큰 값 순서로 나열(정렬)하는 것입니다.

  • 주어진 데이터: 37, 26, 30, 29, 90, 71, 73, 88, 97, 75
  • 정렬된 데이터: 26, 29, 30, 37, 71, 73, 75, 88, 90, 97

이제 이 정렬된 데이터를 가지고 계산을 시작하겠습니다. 데이터는 총 10개(n=10)입니다.

3단계: 각 백분위수 계산하기

백분위수의 위치를 찾는 공식은 다음과 같습니다.

위치 = (P / 100) * n
(여기서 P는 구하려는 백분위수(예: 10, 50, 100), n은 전체 데이터의 개수입니다.)

1. 10번째 백분위수 (P₁₀) 계산

  • 위치 계산: (10 / 100) 10 = 0.1 10 = 1
  • 값 찾기:
    • 위치값이 이렇게 정수로 딱 떨어지면, 그 위치의 값과 바로 다음 위치 값의 평균을 구합니다.
    • 즉, 1번째 값과 2번째 값의 평균을 계산합니다.
    • 정렬된 데이터에서 1번째 값은 26, 2번째 값은 29입니다.
    • 계산: (26 + 29) / 2 = 55 / 2 = 27.5

2. 50번째 백분위수 (P₅₀, 중앙값) 계산

  • 위치 계산: (50 / 100) 10 = 0.5 10 = 5
  • 값 찾기:
    • 위치값이 또 정수로 나왔으므로, 5번째 값과 6번째 값의 평균을 구합니다.
    • 정렬된 데이터에서 5번째 값은 71, 6번째 값은 73입니다.
    • 계산: (71 + 73) / 2 = 144 / 2 = 72.0

3. 100번째 백분위수 (P₁₀₀, 최댓값) 계산

  • 위치 계산: (100 / 100) 10 = 1 10 = 10
  • 값 찾기:
    • 위치값이 10이라는 정수로 나왔습니다. 규칙대로라면 10번째 값과 11번째 값의 평균을 구해야 하지만, 데이터는 10개뿐이라 11번째 값이 없습니다.
    • 100번째 백분위수는 정의상 그 데이터 집합의 최댓값을 의미합니다.
    • 따라서 10번째 위치에 있는 값이 바로 100번째 백분위수가 됩니다.
    • 정렬된 데이터에서 10번째 값은 97입니다.

4단계: 최종 결과 및 정답 확인

계산 결과를 종합하면 다음과 같습니다.

  • 10번째 백분위수: 27.5
  • 50번째 백분위수: 72.0
  • 100번째 백분위수: 97

이 값들을 순서대로 나열하면 27.5, 72.0, 97 입니다.

이제 보기에서 정답을 찾아봅시다.

  • 27.5, 71.0, 97
  • ◉ 27.5, 72.0, 97
  • 27.5, 73.0, 97
  • 28.5, 73.0, 97

따라서 정답은 두 번째 선택지입니다.


정수가 아닌 소수점으로 나오는 경우를 예시

이전 문제의 데이터를 그대로 사용하겠습니다.

  • 정렬된 데이터: 26, 29, 30, 37, 71, 73, 75, 88, 90, 97
  • 데이터 개수 (n): 10개

예시: 35번째 백분위수 (P₃₅) 계산하기

35번째 백분위수를 구하는 과정을 단계별로 살펴보겠습니다.

1단계: 백분위수 위치 계산

위치 = (P / 100) * n

  • P = 35 (35번째 백분위수)

  • n = 10 (전체 데이터 개수)

  • 위치 계산: (35 / 100) 10 = 0.35 10 = 3.5

2단계: 위치에 해당하는 값 찾기 (소수점일 경우)

위치값이 3.5처럼 소수점으로 나왔습니다. 이럴 때 사용하는 규칙은 매우 간단합니다.

규칙: 계산된 위치값을 무조건 "올림"하여 다음 정수 위치를 찾는다.

  • 계산된 위치값 3.5를 올림하면 4가 됩니다.
  • 따라서 우리는 4번째 위치에 있는 값을 찾으면 됩니다.

이제 정렬된 데이터를 다시 확인해 봅시다.
26, 29, 30, 37, 71, 73, 75, 88, 90, 97
(1번째) (2번째) (3번째) (4번째)

  • 4번째 위치의 값은 37입니다.

결론

따라서 이 데이터의 35번째 백분위수(P₃₅)는 37입니다.


다른 예시: 78번째 백분위수 (P₇₈) 계산하기

한 번 더 연습해 보겠습니다.

1단계: 위치 계산

  • 위치 = (78 / 100) * 10 = 7.8

2단계: 값 찾기

  • 위치값 7.8은 소수점이므로 올림합니다.
  • 7.8을 올림하면 8이 됩니다.
  • 따라서 8번째 위치의 값을 찾습니다.

정렬된 데이터를 다시 봅시다.
26, 29, 30, 37, 71, 73, 75, 88, 90, 97
(1) (2) (3) (4) (5) (6) (7) (8)

  • 8번째 위치의 값은 88입니다.

따라서 78번째 백분위수(P₇₈)는 88입니다.

핵심 규칙 요약

백분위수를 계산할 때 가장 중요한 것은 위치값을 계산한 후, 그 값이 정수인지 소수인지에 따라 다른 규칙을 적용하는 것입니다.

  1. 위치값이 정수일 경우:
    • 그 위치의 값다음 위치 값평균을 구한다.
    • (예: 위치가 5이면, 5번째 값과 6번째 값의 평균)
  1. 위치값이 소수일 경우:
    • 위치값을 무조건 올림하여 다음 정수를 만든다.
    • 올림한 위치의 값을 그대로 사용한다.
    • (예: 위치가 3.5이면, 올림해서 4번째 위치의 값을 찾는다)

이 두 가지 규칙만 기억하시면 어떤 백분위수 문제든 쉽게 푸실 수 있습니다.


문제 풀이

이 문제는 데이터 집합에서 '이상치(Outlier)'를 찾아 그 개수를 세는 문제입니다.

1단계: 이상치(Outlier)란 무엇인가?

이상치란 데이터의 전반적인 분포에서 크게 벗어난 값을 말합니다. 통계학에서는 이 이상치를 수학적으로 정의하는 일반적인 방법이 있습니다. 바로 사분위수 범위(IQR)를 이용하는 것입니다.

이상치 판별 기준:
1. 하한선(Lower Fence)보다 작은 값
2. 상한선(Upper Fence)보다 큰 값

  • 하한선 계산 공식: Q1 - 1.5 * IQR
  • 상한선 계산 공식: Q3 + 1.5 * IQR

이 두 경계선(fence)을 벗어나는 모든 데이터 포인트를 이상치로 간주합니다.

2단계: 필요한 값들 가져오기 (이전 문제 활용)

이 문제는 바로 이전 문제와 완전히 동일한 데이터를 사용하고 있습니다. 따라서 이전 문제에서 계산했던 값들을 그대로 가져와서 사용하면 됩니다.

  • 정렬된 데이터: 24, 34, 37, 41, 99, 107, 113, 114, 119
  • 제1사분위수 (Q1): 37
  • 제3사분위수 (Q3): 113
  • 사분위수 범위 (IQR): 76

3단계: 하한선과 상한선 계산하기

이제 위에서 구한 값들을 공식에 대입하여 이상치를 판별할 경계선을 계산합니다.

  • 하한선 (Lower Fence) 계산:

    • Q1 - 1.5 * IQR
    • = 37 - 1.5 * 76
    • = 37 - 114
    • = -77
  • 상한선 (Upper Fence) 계산:

    • Q3 + 1.5 * IQR
    • = 113 + 1.5 * 76
    • = 113 + 114
    • = 227

따라서, 이 데이터에서 정상적인 값의 범위는 -77부터 227까지입니다. 이 범위를 벗어나는 값이 있다면 그것이 바로 이상치입니다.

4단계: 이상치 찾기 및 개수 세기

이제 정렬된 데이터를 보면서 하한선(-77)보다 작거나 상한선(227)보다 큰 값이 있는지 확인합니다.

  • 정렬된 데이터: 24, 34, 37, 41, 99, 107, 113, 114, 119
  1. 가장 작은 값인 24는 하한선 -77보다 큽니다. (24 > -77) → 이상치 아님.
  2. 가장 큰 값인 119는 상한선 227보다 작습니다. (119 < 227) → 이상치 아님.

데이터의 최솟값과 최댓값이 모두 정상 범위 안에 있으므로, 다른 모든 값들도 당연히 정상 범위 안에 있습니다.

결론적으로, 이 데이터에는 이상치가 하나도 없습니다.

5단계: 최종 정답 확인

이상치의 개수는 0개입니다.

이제 보기에서 정답을 찾아봅시다.

  • 2
  • 3
  • 1
  • ◉ 0

따라서 정답은 마지막 선택지인 0입니다.


네, 알겠습니다. 이 문제 역시 문장 해석, 단어/문법 분석, 그리고 아주 기초적인 풀이까지 상세하게 설명해 드리겠습니다.

영어 문장 해석 및 분석

1. 원문: In a deck, there are cards numbered 1 to 21 such that the number of cards of a particular number in the deck is same as the number on the card.
해석: 한 덱에 1부터 21까지 번호가 매겨진 카드들이 있습니다. 이때 특정 숫자가 적힌 카드의 개수는 그 카드에 적힌 숫자와 같습니다.

  • 단어 및 숙어:

    • In a deck: 카드 한 묶음(덱) 안에.
    • numbered 1 to 21: 1부터 21까지 번호가 매겨진.
    • such that: ...와 같은, 그 결과 ...가 되는. (앞선 내용을 구체적으로 설명하는 핵심적인 표현입니다.)
    • the number of cards: 카드의 개수.
    • of a particular number: 특정 숫자의.
    • is same as: ~와 같다.
    • the number on the card: 카드에 적힌 숫자.
  • 문법:

    • 이 문장의 핵심은 'such that' 절입니다. 이 부분이 데이터가 어떻게 구성되어 있는지를 설명합니다. "카드의 개수 = 카드에 적힌 숫자"라는 규칙을 알려주고 있습니다.

2. 원문: Which of the following statement(s) is/are true about the mean and mode of the numbers on this deck of card?
해석: 다음 진술 중 이 카드 덱에 있는 숫자들의 평균(mean)과 최빈값(mode)에 대해 사실인 것은 어느 것입니까?

  • 단어 및 숙어:

    • Which of the following: 다음 중 어느 것.
    • statement(s): 진술, 문장. (s)가 붙어 있어 정답이 하나 이상일 수 있음을 암시합니다.
    • is/are true: 사실이다. (주어인 statement(s)가 단수일 수도, 복수일 수도 있어 is/are를 함께 썼습니다.)
    • mean: 평균.
    • mode: 최빈값.
  • 문법:

    • 'Which'로 시작하는 의문문으로, 여러 선택지 중에서 맞는 것을 고르라는 의미입니다.

문제 풀이

이 문제는 '평균(Mean)'과 '최빈값(Mode)'을 구하는 문제입니다. 먼저 이 두 개념을 이해하고, 문제의 데이터가 어떻게 구성되는지 파악하는 것이 중요합니다.

1단계: 평균과 최빈값이란?

  • 최빈값 (Mode): 데이터 집합에서 가장 자주 나타나는 값입니다. 가장 빈도가 높은 값을 찾으면 됩니다.
  • 평균 (Mean): 모든 데이터 값을 더한 후, 데이터의 총 개수로 나눈 값입니다. (평균 = 모든 값의 총합 / 값의 총 개수)

2단계: 데이터 구성 이해하기

문제의 가장 중요한 부분은 데이터가 어떻게 이루어져 있는지를 파악하는 것입니다.
"특정 숫자가 적힌 카드의 개수는 그 카드에 적힌 숫자와 같다"는 규칙은 다음과 같습니다.

  • 숫자 1이 적힌 카드는 1장 있습니다.
  • 숫자 2가 적힌 카드는 2장 있습니다.
  • 숫자 3이 적힌 카드는 3장 있습니다.
  • ...
  • 숫자 20이 적힌 카드는 20장 있습니다.
  • 숫자 21이 적힌 카드는 21장 있습니다.

3단계: 최빈값(Mode) 계산하기

최빈값은 가장 자주 나타나는 값입니다. 위 데이터 구성을 보면 어떤 숫자가 가장 많이 있는지 바로 알 수 있습니다.

  • 숫자 1은 1번 나옵니다.
  • 숫자 2는 2번 나옵니다.
  • ...
  • 숫자 21은 21번 나옵니다.

가장 많이 나오는 숫자는 21이므로, 최빈값(Mode)은 21입니다.

4단계: 평균(Mean) 계산하기

평균을 구하려면 '모든 값의 총합'과 '값의 총 개수'를 알아야 합니다.

1. 값의 총 개수 (전체 카드의 수) 구하기
전체 카드의 수는 각 숫자의 카드 개수를 모두 더한 것입니다.

총 개수 = 1 + 2 + 3 + ... + 20 + 21

이것은 1부터 21까지의 자연수의 합입니다. 합계 공식 n(n+1)/2를 사용하면 편리합니다. (여기서 n=21)

총 개수 = 21 (21 + 1) / 2 = 21 22 / 2 = 21 * 11 = 231

2. 모든 값의 총합 구하기
각 숫자의 값과 그 개수를 곱해서 모두 더해야 합니다.

총합 = (1 × 1장) + (2 × 2장) + (3 × 3장) + ... + (21 × 21장)
총합 = 1² + 2² + 3² + ... + 21²

이것은 1부터 21까지 자연수의 제곱의 합입니다. 제곱의 합 공식 n(n+1)(2n+1)/6을 사용합니다. (여기서 n=21)

총합 = 21 (21+1) (221+1) / 6
총합 = 21
22 43 / 6
총합 = (21/3)
(22/2) 43
총합 = 7
11 43 = 77 43 = 3311

3. 평균 계산하기

평균 = (모든 값의 총합) / (값의 총 개수)
평균 = 3311 / 231

이 나눗셈을 계산하면:

3311 ÷ 231 ≈ 14.333...

반올림하면 14.33이 됩니다.

5단계: 최종 정답 확인

우리가 계산한 값은 다음과 같습니다.

  • 최빈값 (Mode) = 21
  • 평균 (Mean) ≈ 14.33

이제 보기의 진술들이 맞는지 하나씩 확인해 봅시다.

  • Mean is 11.0. (평균은 11.0이다) → 거짓
  • Mode is 21. (최빈값은 21이다) →
  • Mean is 14.33. (평균은 14.33이다) →
  • Mode is not defined for this data. (최빈값은 정의되지 않는다) → 거짓
  • Mode is 20. (최빈값은 20이다) → 거짓
  • Mean is 21. (평균은 21이다) → 거짓

따라서 참인 진술은 "Mode is 21.""Mean is 14.33." 두 개입니다.

profile
시리즈를 기반으로 작성하였습니다.

0개의 댓글