좋습니다! 아래에 **표본 분산 (Sample Variance)**과 **표본 표준편차 (Sample Standard Deviation)**의 수식을 각각 정리해 드릴게요.
주의: 분모가 이 아니라 인 이유는 자유도 보정을 하기 위해서입니다. (편향되지 않은 분산 추정을 위해)
| 항목 | 정의 기반 공식 | 계산용 단축 공식 |
|---|---|---|
| 수식 | ||
| 특징 | 평균을 먼저 계산해야 함 | 평균 없이 계산 가능 |
| 장점 | 개념적으로 직관적 | 계산 효율이 좋고 오차가 적음 |
이 문제는 '백분위수(Percentile)'를 구하는 문제입니다. 차근차근 따라오시면 쉽게 이해할 수 있습니다.
백분위수는 전체 데이터를 크기 순서대로 정렬했을 때, 가장 작은 값부터 가장 큰 값까지를 100등분 한 위치를 말합니다.
예를 들어,
백분위수를 계산하기 전, 가장 먼저 해야 할 일은 주어진 데이터들을 작은 값에서 큰 값 순서로 나열(정렬)하는 것입니다.
이제 이 정렬된 데이터를 가지고 계산을 시작하겠습니다. 데이터는 총 10개(n=10)입니다.
백분위수의 위치를 찾는 공식은 다음과 같습니다.
위치 = (P / 100) * n
(여기서 P는 구하려는 백분위수(예: 10, 50, 100), n은 전체 데이터의 개수입니다.)
1. 10번째 백분위수 (P₁₀) 계산
2. 50번째 백분위수 (P₅₀, 중앙값) 계산
3. 100번째 백분위수 (P₁₀₀, 최댓값) 계산
계산 결과를 종합하면 다음과 같습니다.
이 값들을 순서대로 나열하면 27.5, 72.0, 97 입니다.
이제 보기에서 정답을 찾아봅시다.
따라서 정답은 두 번째 선택지입니다.
정수가 아닌 소수점으로 나오는 경우를 예시
이전 문제의 데이터를 그대로 사용하겠습니다.
35번째 백분위수를 구하는 과정을 단계별로 살펴보겠습니다.
1단계: 백분위수 위치 계산
위치 = (P / 100) * n
P = 35 (35번째 백분위수)
n = 10 (전체 데이터 개수)
위치 계산: (35 / 100) 10 = 0.35 10 = 3.5
2단계: 위치에 해당하는 값 찾기 (소수점일 경우)
위치값이 3.5처럼 소수점으로 나왔습니다. 이럴 때 사용하는 규칙은 매우 간단합니다.
규칙: 계산된 위치값을 무조건 "올림"하여 다음 정수 위치를 찾는다.
이제 정렬된 데이터를 다시 확인해 봅시다.
26, 29, 30, 37, 71, 73, 75, 88, 90, 97
(1번째) (2번째) (3번째) (4번째)
따라서 이 데이터의 35번째 백분위수(P₃₅)는 37입니다.
한 번 더 연습해 보겠습니다.
1단계: 위치 계산
2단계: 값 찾기
정렬된 데이터를 다시 봅시다.
26, 29, 30, 37, 71, 73, 75, 88, 90, 97
(1) (2) (3) (4) (5) (6) (7) (8)
따라서 78번째 백분위수(P₇₈)는 88입니다.
백분위수를 계산할 때 가장 중요한 것은 위치값을 계산한 후, 그 값이 정수인지 소수인지에 따라 다른 규칙을 적용하는 것입니다.
- 위치값이 정수일 경우:
- 그 위치의 값과 다음 위치 값의 평균을 구한다.
- (예: 위치가 5이면, 5번째 값과 6번째 값의 평균)
- 위치값이 소수일 경우:
- 위치값을 무조건 올림하여 다음 정수를 만든다.
- 올림한 위치의 값을 그대로 사용한다.
- (예: 위치가 3.5이면, 올림해서 4번째 위치의 값을 찾는다)
이 두 가지 규칙만 기억하시면 어떤 백분위수 문제든 쉽게 푸실 수 있습니다.
이 문제는 데이터 집합에서 '이상치(Outlier)'를 찾아 그 개수를 세는 문제입니다.
이상치란 데이터의 전반적인 분포에서 크게 벗어난 값을 말합니다. 통계학에서는 이 이상치를 수학적으로 정의하는 일반적인 방법이 있습니다. 바로 사분위수 범위(IQR)를 이용하는 것입니다.
이상치 판별 기준:
1. 하한선(Lower Fence)보다 작은 값
2. 상한선(Upper Fence)보다 큰 값
이 두 경계선(fence)을 벗어나는 모든 데이터 포인트를 이상치로 간주합니다.
이 문제는 바로 이전 문제와 완전히 동일한 데이터를 사용하고 있습니다. 따라서 이전 문제에서 계산했던 값들을 그대로 가져와서 사용하면 됩니다.
이제 위에서 구한 값들을 공식에 대입하여 이상치를 판별할 경계선을 계산합니다.
하한선 (Lower Fence) 계산:
상한선 (Upper Fence) 계산:
따라서, 이 데이터에서 정상적인 값의 범위는 -77부터 227까지입니다. 이 범위를 벗어나는 값이 있다면 그것이 바로 이상치입니다.
이제 정렬된 데이터를 보면서 하한선(-77)보다 작거나 상한선(227)보다 큰 값이 있는지 확인합니다.
데이터의 최솟값과 최댓값이 모두 정상 범위 안에 있으므로, 다른 모든 값들도 당연히 정상 범위 안에 있습니다.
결론적으로, 이 데이터에는 이상치가 하나도 없습니다.
이상치의 개수는 0개입니다.
이제 보기에서 정답을 찾아봅시다.
따라서 정답은 마지막 선택지인 0입니다.
네, 알겠습니다. 이 문제 역시 문장 해석, 단어/문법 분석, 그리고 아주 기초적인 풀이까지 상세하게 설명해 드리겠습니다.
1. 원문: In a deck, there are cards numbered 1 to 21 such that the number of cards of a particular number in the deck is same as the number on the card.
해석: 한 덱에 1부터 21까지 번호가 매겨진 카드들이 있습니다. 이때 특정 숫자가 적힌 카드의 개수는 그 카드에 적힌 숫자와 같습니다.
단어 및 숙어:
In a deck: 카드 한 묶음(덱) 안에.numbered 1 to 21: 1부터 21까지 번호가 매겨진.such that: ...와 같은, 그 결과 ...가 되는. (앞선 내용을 구체적으로 설명하는 핵심적인 표현입니다.)the number of cards: 카드의 개수.of a particular number: 특정 숫자의.is same as: ~와 같다.the number on the card: 카드에 적힌 숫자.문법:
2. 원문: Which of the following statement(s) is/are true about the mean and mode of the numbers on this deck of card?
해석: 다음 진술 중 이 카드 덱에 있는 숫자들의 평균(mean)과 최빈값(mode)에 대해 사실인 것은 어느 것입니까?
단어 및 숙어:
Which of the following: 다음 중 어느 것.statement(s): 진술, 문장. (s)가 붙어 있어 정답이 하나 이상일 수 있음을 암시합니다.is/are true: 사실이다. (주어인 statement(s)가 단수일 수도, 복수일 수도 있어 is/are를 함께 썼습니다.)mean: 평균.mode: 최빈값.문법:
이 문제는 '평균(Mean)'과 '최빈값(Mode)'을 구하는 문제입니다. 먼저 이 두 개념을 이해하고, 문제의 데이터가 어떻게 구성되는지 파악하는 것이 중요합니다.
문제의 가장 중요한 부분은 데이터가 어떻게 이루어져 있는지를 파악하는 것입니다.
"특정 숫자가 적힌 카드의 개수는 그 카드에 적힌 숫자와 같다"는 규칙은 다음과 같습니다.
최빈값은 가장 자주 나타나는 값입니다. 위 데이터 구성을 보면 어떤 숫자가 가장 많이 있는지 바로 알 수 있습니다.
가장 많이 나오는 숫자는 21이므로, 최빈값(Mode)은 21입니다.
평균을 구하려면 '모든 값의 총합'과 '값의 총 개수'를 알아야 합니다.
1. 값의 총 개수 (전체 카드의 수) 구하기
전체 카드의 수는 각 숫자의 카드 개수를 모두 더한 것입니다.
총 개수 = 1 + 2 + 3 + ... + 20 + 21
이것은 1부터 21까지의 자연수의 합입니다. 합계 공식 n(n+1)/2를 사용하면 편리합니다. (여기서 n=21)
총 개수 = 21 (21 + 1) / 2 = 21 22 / 2 = 21 * 11 = 231
2. 모든 값의 총합 구하기
각 숫자의 값과 그 개수를 곱해서 모두 더해야 합니다.
총합 = (1 × 1장) + (2 × 2장) + (3 × 3장) + ... + (21 × 21장)
총합 = 1² + 2² + 3² + ... + 21²
이것은 1부터 21까지 자연수의 제곱의 합입니다. 제곱의 합 공식 n(n+1)(2n+1)/6을 사용합니다. (여기서 n=21)
총합 = 21 (21+1) (221+1) / 6
총합 = 21 22 43 / 6
총합 = (21/3) (22/2) 43
총합 = 7 11 43 = 77 43 = 3311
3. 평균 계산하기
평균 = (모든 값의 총합) / (값의 총 개수)
평균 = 3311 / 231
이 나눗셈을 계산하면:
3311 ÷ 231 ≈ 14.333...
반올림하면 14.33이 됩니다.
우리가 계산한 값은 다음과 같습니다.
이제 보기의 진술들이 맞는지 하나씩 확인해 봅시다.
Mean is 11.0. (평균은 11.0이다) → 거짓Mode is 21. (최빈값은 21이다) → 참Mean is 14.33. (평균은 14.33이다) → 참Mode is not defined for this data. (최빈값은 정의되지 않는다) → 거짓Mode is 20. (최빈값은 20이다) → 거짓Mean is 21. (평균은 21이다) → 거짓따라서 참인 진술은 "Mode is 21."과 "Mean is 14.33." 두 개입니다.