분산분석은 세 집단 이상의 평균을 비교할 때 사용합니다.
예를들어 A,B,C 반의 수학점수 차이가 있는지 비교할 때 사용합니다.
분산분석의 귀무가설은 아래와 같습니다.
귀무가설 : 모든 그룹의 평균은 같다.
대립가설 : 평균이 서로 다른 그룹이 존재한다.
귀무가설이 기각된다는 것은 세 집단의 평균이 전부 같지는 않다는 것입니다.
분산분석 만으로는 어느 집단 간에 차이가 있는지를 알 수는 없습니다.
이를 알기 위해 하는 분석이 '사후분석'입니다.
어느 농장에서 서식하고 있는 딱정투구벌레에 대한 연구를 하던 도중 벌레들이 선호하는 색상이 있는가를 알아보기 위해 다음과 같은 실험을 실시하였다. 재질과 크기가 같은 네 가지 색상의 판자를 각각 여섯 개씩 준비하여, 그 위에 끈끈이를 바르고 여섯 지점에 각 네 가지 판자를 일주일 동안 설치하여 잡힌 벌레의 수를 관측한다. 그 결과가 다음과 같을 때 벌레들이 선호하는 색상에 차이가 있는지 유의수준 5%에서 검정해 보자.
| 판자의 색 | 잡힌 벌레수 |
|---|---|
| 레몬색 | 45 59 48 46 38 47 |
| 흰 색 | 21 12 14 17 13 17 |
| 녹 색 | 37 32 15 25 39 41 |
| 파란색 | 16 11 20 21 14 7 |
이 예는 일원배치모형에서 k = 4, n = 6인 경우이며, 검정하고자 하는 가설은 다음과 같다.

/* WARM.SAS : 분산분석(일원배치법 : 반복수가 같은 경우) */
OPTIONS PS = 30 LS = 75 NODATE NONUMBER;
DATA INSECT;
INPUT COLOR $ COUNT @@;
CARDS;
L 45 L 59 L 48 L 46 L 38 L 47
W 21 W 12 W 14 W 17 W 13 W 17
G 37 G 32 G 15 G 25 G 39 G 41
B 16 B 11 B 20 B 21 B 14 B 7
;
PROC ANOVA DATA=INSECT; /* 분산분석 */
CLASS COLOR; /* 인자변수 지정 */
MODEL COUNT = COLOR; /* 모형 설정 */
TITLE 'Result of One-Way ANOVA';
RUN;
QUIT;

color_data <- read.table('/Users/jaeyeon/Desktop/데이터사이언스를 위한 통계분석/3ANOVA/bug.txt',header =T )
boxplot(color_data$number ~ color_data$color)
color_result <- aov(color_data$number ~ color_data$color )
summary(color_result)


귀무가설, 대립가설 설정
귀무가설(H0) : ====0 , 대립가설(H1) : 적어도 한쌍은 다르다
F값이 30.55 이다.
p-value < 0.0001 (유의 수준 5%) <0.05
H1 을 채택하고, H0 를 기각한다.
벌레들이 선호하는 색상에 차이가 있다는 결론을 유의수준 5%에서 내릴 수 있다.
어느 시장 조사기관은 여러 가지 대중매체가 주는 정보의 양을 비교하기 위하여 실험을 계획하였다. 40명의 성인을 랜덤하게 추출하여 철저한 면접을 통해 TV, 신문, 라디오, 잡지 중 어느 매체를 많이 접하는지에 따라 분류하였다. 다음 표는 최근에 일어난 사건들에 대한 조사 대상자들의 인지도를 측정한 실험에서 얻어진 값들을 나타내고, 값이 클수록 인지도가 높은 것을 의미한다. 이 자료를 이용하여 사람들의 인지도가 대중매체에 따라 다르다고 할 수 있는지 유의수준 5%에서 검정해 보자.
< 조사대상 대중매체 >
TV 16 19 25 22 21 15 16 22 21 18
신문 13 14 15 16 15 13 19 16 20 14 11
라디오 18 18 15 14 14 10 18 15 15
잡지 11 15 11 17 17 13 14 16 13 11
이 예는 k=4 , n1=10 , n2=11 , n3=9 , n4=10 인 일원배치법의 모형으로 반복수가 다른 경우이다. 가설은 다음과 같다.

/* QINFO.SAS 분산분석(일원배치법 : 반복수가 다른 경우) */
OPTIONS PS = 55 LS = 75 NODATE NONUMBER;
DATA MEDIA;
INPUT MEDIA $ SCORE @@;
CARDS;
T 16 N 13 R 18 P 11 T 19 N 14 R 18 P 15
T 25 N 15 R 15 P 11 T 22 N 16 R 14 P 17
T 21 N 15 R 14 P 17 T 15 N 13 R 10 P 13
T 16 N 19 R 18 P 14 T 22 N 16 R 15 P 16
T 21 N 20 R 15 P 13 T 18 N 14 N 11 P 11
;
RUN;
TITLE 'Result of One-Way ANOVA';
PROC GLM DATA=MEDIA; /* 분산분석 */
CLASS MEDIA; /* 인자변수 지정 */ ①
MODEL SCORE= MEDIA; /* 모형 설정 */
RUN;
QUIT;

media_data <- read.table("/Users/jaeyeon/Desktop/데이터사이언스를 위한 통계분석/3ANOVA/media.txt", header=T)
boxplot(media_data$value ~ media_data$media )
media_result <- aov(media_data$value ~ media_data$media )
summary(media_result)


귀무가설, 대립가설 설정
귀무가설(H0) : ====0 , 대립가설(H1) : 적어도 한쌍은 다르다
F값이 8.34 이다.
p-value = 0.0003 (유의 수준 5%) <0.05
H1 을 채택하고, H0 를 기각한다.
매체에 따라 인지도에 차이가 있다는 결론을 내릴 수 있다.