
: 대형모델 (CNN, Transformer, VLM..)을 task별로 fine-tuning하게 되면
→ 전체 파라미터 재학습 (GPU 메모리 폭발)
→ task가 늘수록 모델 복사본 증가
→ backbone이 깨짐
백본은 그대로 두고, 필요한 부분만 아주 적게 추가하자
: 기존 가중치를 직접 바꾸지 않고, 저랭크(low-rank) 행렬 두 개로 변화량만 학습하는 방식
→ backbone : ❄️ freeze
→ LoRA: ✍️ 아주 작은 추가 파라미터만 학습
(기존 Linear layer) :
(LoRA 적용 후) :
ΔW=BA
큰 행렬 를 직접 학습하지 않고, 작은 행렬 A, B로 분해해서 학습

x → [W] → y
x → [ W ] ──┐
├─ (+) → y
x → [ B @ A ] ─┘
🔹 Attention
* Query (Q)
* Key (K)
* Value (V)
* Output projection
🔹 FFN
* 첫 번째 Linear
* 두 번째 Linear
Q = xWq → x(Wq + BqAq)
V = xWv → x(Wv + BvAv)