Linear Models II

chelseey·2025년 4월 9일

Handling Categorical Input Variables

범주형 변수(Categorical Variables) : 숫자가 아닌 텍스트나 레이블로 표현되는 데이터

Binary Category (이진 변수) : 선택지가 두 가지

텍스트로 된 범주형 변수는 먼저 숫자로 변환
ex. 주차 공간(Parking space)

x1={0(Not available)1(Available)x_1 = \begin{cases} 0 & \text{(Not available)} \\ 1 & \text{(Available)} \end{cases}

선형 회귀식 : y=β0+β1x1+β2x2++βkxky = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \cdots + \beta_k x_k

β1β_1 : 주차 공간 여부에 따른 가격 변화량
x1x_1이 0이면 주차 공간이 없고,
1이면 주차 공간이 있어 β1β_1 만큼 가격이 상승하는 효과를 보여줌

• 다중 범주형 변수의 처리

x2={0(Town house)1(Studio)2(Apartment)x_2 = \begin{cases} 0 & \text{(Town house)} \\ 1 & \text{(Studio)} \\ 2 & \text{(Apartment)} \end{cases}

→ Label Encoding의 문제점
: 숫자 0, 1, 2를 그대로 사용하면 모델은
Town house와 Studio, Apartment 사이에 순서가 있다고 잘못 해석

ex. 만약 β2β_2가 음수라면,
Studio: β2β_2×1=−200M
Apartment: β2β_2×2=−400M
숫자가 커질수록 집값에 미치는 영향이 비례적으로 커지게 됨.

One-Hot Encoding

하나의 범주형 변수 x2x_2를 여러 개의 이진(binary) 변수로 바꿔줌

각 범주마다 별도의 변수를 만들어 해당 범주에 속하면 1, 아니면 0으로 표시

• 각 주택 유형에 해당하는 회귀 계수(집값 기여도)

모델은 주택 유형이 가격에 얼마나 기여하는지를 학습

Dummy Variable 방식

하나의 범주를 기준으로 설정하고,
그 범주에 해당하는 변수는 모델에 포함하지 않음

y=β0+β1x1+βstudioxstudio+βapartmentxapartment+y = \beta_0 + \beta_1 x_1 + \beta_{\text{studio}} x_{\text{studio}} + \beta_{\text{apartment}} x_{\text{apartment}} + \cdots

Town house : 기준 범주(baseline)이므로, xstudio=0,βapartmentx_{\text{studio}}=0, \beta_{\text{apartment}}일 때, 절편으로 나타남
Studio : xstudio=1x_{\text{studio}}=1일 때 추가적인 효과 βstudio\beta_{\text{studio}} 가 더해져 집값에 영향을 줌
Apartment : xapartment=1x_{\text{apartment}}=1일 때 추가적인 효과 βapartment\beta_{\text{apartment}}가 추가되어 영향을 나타냄

β2x2=β2,1x2,1+β2,2x2,2\beta_2 x_2 = \beta_{\text{2,1}} x_{\text{2,1}} + \beta_{\text{2,2}} x_{\text{2,2}}

0개의 댓글