[Multimodal/Knowledge Distillation] Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation

서유리·2023년 5월 1일

AI_Study

목록 보기
26/33

🔴 논문

🟠 Introduction

  • CLIP/ALIGN large-scale dual-stream Vision Language Pre-training (VLP) 모델은 다양한 downstream multimodal 정렬 tasks에서 놀라운 성능을 보임
    : ex. image-text 검색, 이미지 분류
    : 이러한 모델은 image-text 쌍에 대한 cross-modal contrastive learning을 사용하여 pre-trained/multi-modal representations을 학습함
  • text encoder : multi-modal pre-training objective만 가지고 있기에 image captioning/openended visual question answering (VQA)와 같은 생성적 multimodal tasks에 무능함
  • GPT와 같은 Transformer 기반 자동 회귀 large-scale pre-trained language models (PLMs)이 natural language generation (NLG) tasks
  • 이러한 모델은 self-attention으로 훈련되며, 모델이 생성적 특성을 충족하기 위해 past outputs (unidirectional)에만 주의를 기울 일 수 있음
  • 최근에, BART/T5는 입력의 양방향 정보를 추가로 캡처하기 위해 양방향 트랜스포머 인코더로 자동회귀 디코더를 보강할 것을 제안함
  • encoder-decoder architectures는 NLG/NLU tasks에서도 탁월함
  • dual-stream VLP models의 한계점을 해결하고, PLM을 최대한 활용하기 위해 CLIP이 지식증류를 통해 생성적 multimodal tasks를 수행할 수 있는 효과적인 방법인 Vision-Language Knowledge Distillation (VLKD) 제안
  • 구체적으로 BART 인코더를 CLIP의 공동 multimodal embedding space에 정렬하여 BART encoder/decoder를 결합하기 위한 이미지 조건 language modeling loss와 함께 multimodal knowledge에 대한 이해
  • 학습하는 동안, CLIP의 가중치를 고정하여 학습된 multimodal space 유지
  • downstream tasks의 finetuning/inference를 위해 원본 CLIP text encoder는 폐기되며, 증류된 BART로 대체되는 것으로 해석할 수 있음
  • 따라서, 본 연구는 각 강점을 사용함
    : CLIP의 expressive multimodal representation space
    : BART의 strong text generation capability
    🔸 그림 1
  • VLKD pre-training 후 모델은 open-ended VQA 및 이미지 캡션을 포함하여 생성적 multimodal tasks에서 strong zero-shot performance를 보여줌
  • fine-tuning 없이 pre-trained BART에 내장된 질문, visual information/textual knowledge을 추론하여 답변을 생성하는 기능이 있음
  • 또한, 이미지가 주어지면, 캡션을 직접 생성 할 수 있음

(1) Vision-language Pre-training

  • VLP models 2가지 범주
    (a) single-stream
    : patch별 또는 regional visual features/textual embeddings 연결하여 single model에 공급
    (b) dual-stream models
    : image/text에 대해 별도의 인코더를 사용하여 image/text features을 offline에서 미리 계산하여 image-text 검색과 같은 downstream multimodal 정렬 tasks을 효율적으로 추론할 수 있음
    : 그러나, 이러한 모델은 multimodal 생성 tasks에 직접 사용할 수 없음
  • dual-stream VLP model CLIP의 multimodal embedding space을 powerful PLM BART와 정렬하여 multimodal 생성 능력을 얻는 효율적인 방법을 제안함
  • image-conditioned autoregressive language modeling을 목표로 비용이 많이 드는 pre-training을 통해 multimodal generation tasks를 수행할 수 있는 VLP models도 있음
  • 그러나, 이러한 모델의 pre-training에는 많은 수의 image-text 쌍과 수 많은 계산 리소스 필요
  • 다른 모델은 레이블이 지정된 bounding-box 데이터가 있는 Faster-RCNN과 같은 추가 pre-trained된 object detector에 의존하여 offline에서 image regional features 추출하고 확장성 저하
    (2) Knowledge Distillation
  • Knowledge distillation (KD)는 Hinton et al에 의해 처음 제안됨
  • 교사모델에서 학습한 logits에 포함된 지식을 학생모델에게 transfers 함
  • logits 외에도, intermediate representations and attentions와 같은 다른 형태의 지식도 transfer 기반 모델에 내장된 지식을 전달하는데 사용되었음
  • 최근, contrastive representation distillation은 두 네트워크 간의 상호 정보를 최대화하여 교사 네트워크에서 학생 네트워크로 지식을 증류하고, 최근에는 zero-shot detection/multilingual setting을 위해 pre-trained multimodal model CLIP에서 지식을 전달하도록 확장함
  • 본 논문에서는 pre-trained CLIP에서 BART로 지식을 전달하기 위해 기존 KD (conventional KD)와 contrastive KD를 적용함
  • 또한, cross-attention을 통해 CLIP image encoder의 지식을 BART decoder로 transfer 하는 것을 제안함
    🔸 그림 2
  • CLIP에서 BART로 multimodal 지식을 추출하기 위해 제안된 VLKD 방법의 아키텍처
  • (a) dual-stream CLIP encoders와 BART encoder 간의 TTDM/ITCL losses을 보여줌
  • (b) image-conditioned language modeling에 대한 ICTI loss을 보여줌. SG는 stop gradient operation을 의미, gradients가 model parameters의 해당 부분을 통해 back-propagated(역전파) 되지 않음을 의미
profile
best of best

0개의 댓글