[논문리뷰] Masked Autoencoders Are Scalable Vision Learners

Minjung Kim·2025년 3월 26일

논문리뷰

목록 보기
3/6
post-thumbnail

Introduction

  • 데이터의 일부를 지우고, 지워진 내용을 예측하도록 모델을 학습하는 것이 목표

  • 자연어 처리에서는 GPT, BERT

  • 자연어처리 vs 컴퓨터비전

    • CNN → 자연어처리에서와 같은 mask token, positional embedding 같은 indicator가 존재하지 않음
    • information density
      • 자연어처리 : 굉장히 의미적 (semantic)
      • 컴퓨터비전 : spatial redundancy
  • masked language modeling
    • 자연어처리 모델인 BERT는 문장의 일부 단어를 마스킹하고, 이를 예측하는 방식으로 학습 → 이러한 개념을 적용함 (MAE)
  • autoencoders
    • input → latent representation 압축 → 복원 → 입력 이미지의 일부를 마스킹하고 재구성하는 방식으로 학습 → DAE와 유사하다
  • masked image encoding
    • ViT, BEiT → 패치 단위의 처리 방식 → ViT의 패치 처리 방식 + 마스킹 기반 학습 → BEiT는 이미지 패치를 discrete 토큰화 하여 마스킹하지만, MAE는 토큰화하지 않고 픽셀 값으로 복원
  • self-supervised learning
    • contrastive learning : 입력 데이터의 여러 변형된 형태(다른 view) 간의 유사성, 차이점 학습 → 변형된 이미지를 비교하는 것이 핵심
    • masking patch reconstruction : 입력 이미지의 일부 패치를 마스킹하고, 마스킹되지 않은 패치를 통해 마스킹된 패치를 reconstruct → 마스킹된 부분을 복원하는 것이 핵심

MAE

  • 기존의 autoencoder - decoder 와 다르게, MAE는 asymmetric structure를 가짐

    • masking

      ![](https://velog.velcdn.com/images/koallako/post/debaf22f-1100-4ab2-8624-df3099e93c19/image.png)
      
      
      - 중복되지 않게 이미지를 패치 단위로 나눔
      - random sampling을 통해 일부 패치 선택, 나머지 마스킹 (*uniform distribution*)
      - 75% 마스킹 → 인접한 패치로부터 단순 추론하지 않도록 학습

      → 적은 영역의 input이 주어짐으로써, 적은 연산으로 정보를 처리할 수 있는 효율적인 인코더 사용이 가능

    • MAE encoder

      • ViT의 구조를 따르지만, 일부 패치에 대해서만 처리 → 계산, 메모리 사용량 감소 ⇒ large model 사용 가능
    • MAE decoder

      • full set of tokens를 입력으로 받음 (encoded patches + masked tokens)
      • positional embedding → 예측해야 하는 패치의 위치를 알기 위함
      • decoder는 마스킹된 패치를 복원하는 pre-training에만 사용되기 때문에, encoder와 독립적으로 설계될 수 있음 → encoder보다 작은 크기 ⇒ pre-training time 감소
    • Reconstruction targets

      • decoder → masking된 패치의 픽셀값 예측
      • loss function → MSE : masking 패치만 계산함으로써, 해당 부분을 예측하는데에 집중하도록 함 (BERT)
      • 패치 normalize → 데이터 분포를 균일하게 만들어주면서 모델이 모든 데이터에 고르게 학습할 수 있음 → 실험에서도 더 좋은 품질의 결과가 반환

ImageNet Experiments

  • 최적의 masking ratio

  • 모델 설계

Transfer Learning Experiments

  • semantic segmentation
  • classification
  • pixel vs. tokens

0개의 댓글