회귀 모델 비교: Linear, Ridge, Lasso, ElasticNet 정리
데이터 분석과 머신러닝에서 가장 기본이 되는 회귀 모델 4가지를 비교 정리합니다. 과적합(Overfitting)을 방지하기 위한 규제(Regularization) 기법들의 차이점을 중심으로 살펴봅니다.
1. 기본 선형 회귀 (Ordinary Least Squares, OLS)
가장 기본적인 모델로, 실제값과 예측값의 차이인 잔차 제곱합(RSS)을 최소화하는 방향으로 학습합니다.
- 목적식: min∑i=1n(yi−y^i)2
- 특징:
- 규제가 없어 모델이 단순함.
- 훈련 데이터에 너무 민감하게 반응하여 과적합(Overfitting)이 발생하기 쉬움.
- 피처 간 상관관계가 높을 때(다중공선성) 모델이 매우 불안정해짐.
2. 릿지 회귀 (Ridge Regression) - L2 규제
기본 회귀 모델에 가중치들의 제곱합(L2 Norm)을 페널티로 추가한 모델입니다.
- 목적식: min[∑i=1n(yi−y^i)2+α∑j=1pwj2]
- 특징:
- 가중치 축소: 가중치(w)의 크기를 전체적으로 줄여 모델의 복잡도를 낮춤.
- 안정성: 가중치를 0에 가깝게 만들지만, 완전히 0으로 만들지는 않아 모든 피처를 유지함.
- 다중공선성 완화: 상관관계가 높은 변수들 사이에서 가중치를 균등하게 배분함.

Gauss-Markov Theorem 정의 와 같이 OLS가 Best Linear Unbiased Elstimater(BLUE)이지만, traid off 로 varince가 높아지게 됩니다. (위 그림의βLS 지점.
이를 방지하기 위해 β에 대한 규제를 통해 ∣β∣2<=t 내부에서 b가 설정되도록 하여 varince를 완화시키도록 하는 동작입니다.
그럼으로 예측 관점에서는 일반화가 더 잘되어 성능이 향상될 수 있습니다.
(수식상으로 t가 사라져 있지만 t를 정의 하지 않아도 λ에 의해 도달하고자 하는 지점은 동일합니다. 미분하게되면 t는 사라짐)
3. 라쏘 회귀 (Lasso Regression) - L1 규제
기본 회귀 모델에 가중치들의 절대값 합(L1 Norm)을 페널티로 추가한 모델입니다.
- 목적식: min[∑i=1n(yi−y^i)2+α∑j=1p∣wj∣]
- 특징:
- 변수 선택(Feature Selection): 중요도가 낮은 피처의 가중치를 완전히 0으로 만듦.
- 희소 모델(Sparse Model): 중요한 피처만 남기기 때문에 모델 해석이 매우 용이함.
- 단점: 상관관계가 높은 변수들 중 하나만 무작위로 선택하고 나머지는 0으로 만드는 경향이 있음.

4. 엘라스틱넷 (ElasticNet)
L1 규제(Lasso)와 L2 규제(Ridge)를 결합한 형태입니다.
- 목적식: min[RSS+α1∑j=1p∣wj∣+α2∑j=1pwj2]
- 특징:
- 라쏘의 변수 선택 기능과 릿지의 다중공선성 완화 기능을 동시에 가짐.
- 상관관계가 높은 변수들을 그룹으로 묶어 함께 선택하는 경향이 있음.
- 데이터셋의 특성에 맞춰 두 규제의 비중을 조절해야 함.
📊 핵심 비교 요약
| 구분 | 선형 회귀 (OLS) | 릿지 (Ridge) | 라쏘 (Lasso) | 엘라스틱넷 (ElasticNet) |
|---|
| 규제 종류 | 없음 | L2 규제 | L1 규제 | L1 + L2 규제 |
| 페널티 항 | 없음 | 가중치 제곱합 (w2) | 가중치 절대값 합 ($ | w |
| 변수 선택 | 불가능 | 불가능 | 가능 (0으로 만듦) | 가능 |
| 주요 장점 | 단순함 | 다중공선성 해결 | 중요한 변수 추출 | 높은 안정성 |

💡 어떤 모델을 선택해야 할까?
- Ridge: 모든 피처가 결과에 영향을 미칠 것 같고, 변수 간 상관관계가 높을 때.
- Lasso: 피처 수가 너무 많고, 그중 일부만 유의미할 것으로 판단될 때(변수 선택 필요 시).
- ElasticNet: 피처 수가 많고 변수 간의 상관관계가 복잡하게 얽혀 있을 때 가장 권장됨.