3.4장 마케팅 계획

cmkkws·2025년 2월 6일

본 포스팅의 내용은 Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, Jonathan Taylor (2023), 「An Introduction to Statistical Learning with Applications in Python」, Springer 를 참고하였습니다.

이제 3.1장 - 단순선형회귀 파트에서 했던 질문들에 답을 하면서 앞의 내용을 정리해보자.

Q1. 광고 예산과 판매량 사이에 어떤 관계가 있을까?
A1. 예측변수 TV, Radio, Newspaper와 반응변수 sales에 대한 다중회귀모형에 적합하고,
가설 H0:β1=β2=β3=0H_0 : \beta_1 = \beta_2 = \beta_3 = 0을 검정함으로써 답할 수 있고, 귀무가설의 기각 여부를 결정하기 위해 F-통계량을 사용할 수 있다. F-통계량에 해당하는 p-value을 통해 변수 간의 유의성을 판단할 수 있다.

Q2. 관계의 강도는 얼마나 되나?
A2. 모형의 정확도에 대한 설명을 통해 답을할 수 있다.
첫 번째는 RSE로, 모집단 회귀선에서 반응변수의 표준편차를 추정한다. 해당 데이터의 RSE는 1.69이며, 반응변수의 평균값은 14.022로 12% 정도의 오차를 보인다.
두 번째는 R2R^2통계량은 예측변수로 설명된 반응변수 변동의 백분율을 알려준다. 여기서 예측변수는 sales 분산의 거의 90%를 설명한다.

Q3. 어떤 매체가 판매량과 연관이 있을까?
A3. 각 예측변수의 t-통계량에 해당하는 p-value를 확인하면 된다. 이 데이터에서는 예측변수 TV, radio만이 유의한 p-value를 가지고 있으므로, 두 예측 변수가 판매량과 연관이 있다.

Q4. 각 매체와 판매량 사이에는 얼마나 큰 연관성이 있을까?
A4. βj^\hat{\beta_j}의 표준오차는 βj{\beta_j}의 신뢰구간을 계산할 때 사용된다. 다음 세 변수를 다중회귀모형계수에 95%신뢰구간으로 계산했을 때 다음과 같다.
TV는 (0.043,0.049), radio는(0.172,0.206), newspaper(-0.013,0.011)으로 계산됐을 때 다음과 같은 해석을 할 수 있다

  • 신뢰구간이 좁은 TV와 radio, 신뢰구간이 넓은 newspaper을 통해 낮은 계수 추정폭을 가진 앞의 두 변수가 계수에 대한 높은 신뢰도를 가질 수 있다.
  • 신뢰구간 중 0이 포함된 newspaper은 계수가 반응변수에 전혀 관련이 없을 가능성이 포함되었다.

따라서 TV와 radio는 통계적으로 유의하며, newspaper은 통계적으로 유의하지 않다.

하지만 공선성(collinearity)으로 인해 매우 큰 표준오차를 초래할 수 있다.
즉, 높은 표준오차로 인해 넓은 신뢰구간을 가진 newspaper가 공선성으로 인해 넓어진 것이라고 생각할 수도 있다.
그러나 VIF 점수는 각각 1.005, 1.145, 1.145로 공선성의 증거는 찾을 수 없다.

각각의 매체에 대한 판매량의 연관성을 평가할 때는 개별적인 단순선형회귀모형을 통해 알 수 있고, 그 결과 newspaper과 sales 이외의 다른 예측변수와 반응변수 사이에 강한 연관성을 띈다는 것을 알 수 있었다.

Q5. 미래의 판매량을 얼마나 정확히 예측할 수 있을까?
A5. 추정값과 관련된 정확도는 Y=f(X)+ϵY = f(X) + \epsilon 또는 f(X)f(X) 중 어느 것을 예측하고 싶은 지에 따라 달라진다.
전자는 '예측구간', 후자는 '신뢰구간'으로 구간의 넓이는 전자가 축소불가능한 오차로 인해 넓다.

Q6. 선형 관계가 존재하는가?
A6. 잔차 그래프를 통해 비선형성을 확인할 수 있다.
선형관계일 경우, 잔차 그래프에는 어떠한 패턴을 확인할 수 없고, 비선형관계일 때는 패턴관계를 확인할 수 있다.

Q7. 광고 매체 사이에 시너지 효과가 있을까?
표준 선형회귀모형을 예측변수와 반응변수 간의 가법적 관계를 가정한다.
하지만 현실세계에서는 실제로 예측변수 간의 상호작용이 존재할 수 있고, 이를 계산하기 위해 회귀모형식에 상호작용 항을 추가해 p-value의 차이를 확인해본다.
해당 모형은 모형의 정확도를 측정하는R2R^2이 97%로 7%향상되었고, 시너지 효과가 존재함을 알 수 있었다.

0개의 댓글