
데이터의 일부를 지우고, 지워진 내용을 예측하도록 모델을 학습하는 것이 목표
자연어 처리에서는 GPT, BERT
자연어처리 vs 컴퓨터비전
기존의 autoencoder - decoder 와 다르게, MAE는 asymmetric structure를 가짐
masking

- 중복되지 않게 이미지를 패치 단위로 나눔
- random sampling을 통해 일부 패치 선택, 나머지 마스킹 (*uniform distribution*)
- 75% 마스킹 → 인접한 패치로부터 단순 추론하지 않도록 학습
→ 적은 영역의 input이 주어짐으로써, 적은 연산으로 정보를 처리할 수 있는 효율적인 인코더 사용이 가능

MAE encoder
MAE decoder
Reconstruction targets
최적의 masking ratio


모델 설계




