ViT는 CNN 없이 Transformer만으로 이미지를 처리할 수 있음을 보인 최초의 비전 모델로, 이미지 패치를 토큰처럼 취급하여 대규모 사전학습 시 CNN을 능가하는 성능을 달성했다.
비전 분야에서는 오랫동안 CNN이 사실상의 표준 아키텍처였다.
CNN은 다음과 같은 강한 inductive bias를 내장한다:
반면 NLP에서는 Transformer가 CNN/RNN을 대체하며 범용 모델로 자리 잡았다.
ViT의 핵심 질문은 다음과 같다:
“이러한 이미지 특화 inductive bias 없이도
Transformer가 이미지 인식을 잘할 수 있을까?”
ViT는 이 질문에 대해:


ViT는 표준 Transformer Encoder를 거의 그대로 사용한다.
Image → Patch Embedding → [CLS] Token + Position Embedding
→ Transformer Encoder (L layers)
→ MLP Head → Classification
CNN backbone ❌
Attention 기반 글로벌 처리 ⭕
이미지를 고정 크기 패치로 분할한다.
각 패치는:
📌 논문의 핵심 통찰:
이미지는 2D 신호가 아니라
“패치들의 시퀀스”로 볼 수 있다
Transformer는 순서 개념이 없으므로:
👉 ViT는 공간 구조를 거의 강제하지 않음
[CLS] 토큰과 동일ViT를 처음 접하면 다음과 같은 근본적인 의문이 든다:
“이미지를 그냥 패치로 쪼개서
Transformer에 넣었을 뿐인데,
이게 정말 ‘이해’라고 부를 수 있는가?”
ViT는 객체, 엣지, 코너와 같은 시각적 개념을 명시적으로 모델링하지 않는다.
CNN처럼 계층적으로 feature를 쌓지도 않는다.
대신 ViT가 수행하는 것은 다음에 가깝다:
즉 ViT에서의 “이해”란:
시각적 구조를 해석하는 것이 아니라,
패치 임베딩들이 downstream task에
유용한 관계를 맺도록 표현되는 것
이다.
이 관점에서 ViT는
로 이해하는 것이 정확하다.
| 항목 | CNN | ViT |
|---|---|---|
| Locality | 강함 | 약함 |
| Translation equivariance | 내장 | 없음 |
| Global context | 제한적 | 기본 |
| Spatial bias | 강함 | 최소 |
논문에서 직접 언급:
ViT는 CNN보다 훨씬 적은 image-specific inductive bias를 가진다
ViT에서 2D 이미지 구조가 수동으로 주입되는 유일한 지점은:
👉 그 외에는 모든 공간 관계를 데이터로부터 학습
ViT는 CNN과 달리
2D grid 구조를 모델 내부에 거의 반영하지 않는다.
논문에서 명시하듯,
ViT에서 이미지의 2D 구조가 수동으로 주입되는 지점은 오직:
뿐이다.
그 외 모든 공간적 관계는
attention을 통해 데이터로부터 학습된다.
이는 ViT가 다음 가설을 전제로 한다는 뜻이다:
“공간 관계는
하드코딩하지 않아도
충분한 데이터로 학습 가능하다.”
단, 이 가설은:
이라는 조건 하에서만 성립하며,
이 한계가 이후 Swin, Conv-ViT 계열이 등장한 이유이기도 하다.
ViT는 소규모 데이터에서는 CNN보다 성능이 낮음
하지만:
같은 대규모 데이터에서 사전학습 시:
CNN을 명확히 능가
📌 핵심 결론:
Inductive bias ↓ → Data requirement ↑
사전학습 후 downstream task에서는:
이때:
ViT를 둘러싼 가장 솔직한 질문은 이것이다:
“이게 구조가 뛰어나서라기보단
그냥 데이터랑 연산량 덕분에 되는 거 아닌가?”
놀랍게도 ViT 논문은 이 질문을 부정하지 않는다.
오히려 논문은 매우 명확히 다음을 인정한다:
즉 ViT가 선택한 전략은:
| 선택 | 결과 |
|---|---|
| 구조적 bias 최소화 | 표현 자유도 증가 |
| 표현 자유도 증가 | 데이터 요구량 증가 |
논문의 핵심 메시지는 다음 한 문장으로 요약된다:
“이 정도의 inductive bias는
구조가 아니라 데이터로 대체할 수 있다.”
이 사고방식은 이후
CLIP → LLaVA → GPT-4V로 그대로 이어진다.
ViT-L/16, ViT-H/14 모델은
특히:

ViT는:
등 다양한 태스크로 잘 전이됨 → 범용 백본 가능성

아키텍처 단순성
글로벌 컨텍스트 처리 능력
확장성 (scaling law 친화적)
NLP–Vision 아키텍처 통합 가능성 제시
데이터 의존성 매우 큼
학습 비용 큼
공간적 inductive bias 부족
→ detection / segmentation 초기 성능 저조
👉 이후 연구들이 이 한계를 보완:
ViT는 이미지를 패치 시퀀스로 처리하는 Transformer 기반 비전 모델로,
이미지를 Transformer 친화적인 의미 표현으로 변환하는 인코더 역할을 수행하며,
강한 CNN inductive bias 없이도 대규모 사전학습을 통해
이미지 인식에서 SOTA 성능을 달성할 수 있음을 입증한 기념비적 연구다.
ViT의 가장 큰 공헌은
“Transformer를 비전에 썼다”는 사실이 아니다.
진짜 유산은 다음 사고 방식이다:
“이미지는 적절한 인코더를 통해
Transformer가 다룰 수 있는
의미적 시퀀스로 변환될 수 있다.”
이 전제 위에서:
이라는 구조가 가능해졌다.
즉 ViT는:
을 제시한 논문이다.