[통계 분석] ANOVA (analysis of variance)

jaeyeon_lee·2023년 6월 7일

통계분석

목록 보기
3/5

ANOVA(analysis of variance)

분산분석은 세 집단 이상의 평균을 비교할 때 사용합니다.

예를들어 A,B,C 반의 수학점수 차이가 있는지 비교할 때 사용합니다.

분산분석의 귀무가설은 아래와 같습니다.

귀무가설 : 모든 그룹의 평균은 같다.
대립가설 : 평균이 서로 다른 그룹이 존재한다.

귀무가설이 기각된다는 것은 세 집단의 평균이 전부 같지는 않다는 것입니다.
분산분석 만으로는 어느 집단 간에 차이가 있는지를 알 수는 없습니다.
이를 알기 위해 하는 분석이 '사후분석'입니다.


예제 9.1 (반복수가 같은 경우)

어느 농장에서 서식하고 있는 딱정투구벌레에 대한 연구를 하던 도중 벌레들이 선호하는 색상이 있는가를 알아보기 위해 다음과 같은 실험을 실시하였다. 재질과 크기가 같은 네 가지 색상의 판자를 각각 여섯 개씩 준비하여, 그 위에 끈끈이를 바르고 여섯 지점에 각 네 가지 판자를 일주일 동안 설치하여 잡힌 벌레의 수를 관측한다. 그 결과가 다음과 같을 때 벌레들이 선호하는 색상에 차이가 있는지 유의수준 5%에서 검정해 보자.

판자의 색잡힌 벌레수
레몬색45 59 48 46 38 47
흰 색21 12 14 17 13 17
녹 색37 32 15 25 39 41
파란색16 11 20 21 14 7

이 예는 일원배치모형에서 k = 4, n = 6인 경우이며, 검정하고자 하는 가설은 다음과 같다.

SAS 프로그램

/* WARM.SAS : 분산분석(일원배치법 : 반복수가 같은 경우) */
OPTIONS PS = 30 LS = 75 NODATE NONUMBER;
DATA INSECT;
   INPUT COLOR $ COUNT @@;
   CARDS;
   L 45  L 59  L 48  L 46  L 38  L 47
   W 21  W 12  W 14  W 17  W 13  W 17
   G 37  G 32  G 15  G 25  G 39  G 41
   B 16  B 11  B 20  B 21  B 14  B 7
   ;
PROC ANOVA DATA=INSECT;    /* 분산분석 */
   CLASS COLOR;       /* 인자변수 지정 */  
   MODEL COUNT = COLOR;   /* 모형 설정 */
   TITLE 'Result of One-Way ANOVA';
RUN;
QUIT;      

출력 결과

R 프로그램

color_data <- read.table('/Users/jaeyeon/Desktop/데이터사이언스를 위한 통계분석/3ANOVA/bug.txt',header =T )

boxplot(color_data$number ~ color_data$color)

color_result <- aov(color_data$number ~ color_data$color ) 

summary(color_result)

출력 결과


  1. 귀무가설, 대립가설 설정

    귀무가설(H0) : μ1\mu1=μ2\mu2=μ3\mu3=μ4\mu4=0 , 대립가설(H1) : 적어도 한쌍은 다르다

  2. F값이 30.55 이다.

  3. p-value < 0.0001 (유의 수준 5%) <0.05

  4. H1 을 채택하고, H0 를 기각한다.

벌레들이 선호하는 색상에 차이가 있다는 결론을 유의수준 5%에서 내릴 수 있다.


예 9.2 (반복수가 다른 경우)

어느 시장 조사기관은 여러 가지 대중매체가 주는 정보의 양을 비교하기 위하여 실험을 계획하였다. 40명의 성인을 랜덤하게 추출하여 철저한 면접을 통해 TV, 신문, 라디오, 잡지 중 어느 매체를 많이 접하는지에 따라 분류하였다. 다음 표는 최근에 일어난 사건들에 대한 조사 대상자들의 인지도를 측정한 실험에서 얻어진 값들을 나타내고, 값이 클수록 인지도가 높은 것을 의미한다. 이 자료를 이용하여 사람들의 인지도가 대중매체에 따라 다르다고 할 수 있는지 유의수준 5%에서 검정해 보자.

< 조사대상 대중매체 >

TV  16  19  25  22  21  15  16  22  21  18

신문  13  14  15  16  15  13  19  16  20  14  11

라디오  18  18  15  14  14  10  18  15  15

잡지  11  15  11  17  17  13  14  16  13  11

이 예는 k=4 , n1=10 , n2=11 , n3=9 , n4=10 인 일원배치법의 모형으로 반복수가 다른 경우이다. 가설은 다음과 같다.

SAS 프로그램

/* QINFO.SAS 분산분석(일원배치법 : 반복수가 다른 경우) */
OPTIONS PS = 55 LS = 75 NODATE NONUMBER;
DATA MEDIA; 
  INPUT MEDIA $ SCORE @@; 
  CARDS;
    T 16  N 13  R 18  P 11  T 19  N 14  R 18  P 15
    T 25  N 15  R 15  P 11  T 22  N 16  R 14  P 17
    T 21  N 15  R 14  P 17  T 15  N 13  R 10  P 13
    T 16  N 19  R 18  P 14  T 22  N 16  R 15  P 16
    T 21  N 20  R 15  P 13  T 18  N 14  N 11  P 11
  ;
RUN;
TITLE 'Result of One-Way ANOVA';
PROC GLM DATA=MEDIA;     /* 분산분석 */
  CLASS MEDIA;      /* 인자변수 지정 */  ①
  MODEL SCORE= MEDIA;   /* 모형 설정 */
RUN;
QUIT;

출력 결과

R 프로그램

media_data <- read.table("/Users/jaeyeon/Desktop/데이터사이언스를 위한 통계분석/3ANOVA/media.txt", header=T)

boxplot(media_data$value ~ media_data$media )

media_result <- aov(media_data$value ~ media_data$media ) 

summary(media_result)

출력 결과


  1. 귀무가설, 대립가설 설정

    귀무가설(H0) : μ1\mu1=μ2\mu2=μ3\mu3=μ4\mu4=0 , 대립가설(H1) : 적어도 한쌍은 다르다

  2. F값이 8.34 이다.

  3. p-value = 0.0003 (유의 수준 5%) <0.05

  4. H1 을 채택하고, H0 를 기각한다.

매체에 따라 인지도에 차이가 있다는 결론을 내릴 수 있다.

profile
🙋🏻‍♀️

0개의 댓글