🔴 논문
- 제목 : Enabling Multimodal Generation on CLIP via Vision-Language
Knowledge Distillation- 년도 : arXiv/2022 (https://arxiv.org/pdf/2203.06386.pdf)
🟠 Introduction
- CLIP/ALIGN large-scale dual-stream
Vision Language Pre-training (VLP)모델은 다양한 downstream multimodal 정렬 tasks에서 놀라운 성능을 보임
: ex. image-text 검색, 이미지 분류
: 이러한 모델은 image-text 쌍에 대한 cross-modal contrastive learning을 사용하여 pre-trained/multi-modal representations을 학습함- text encoder : multi-modal pre-training objective만 가지고 있기에 image captioning/openended visual question answering (VQA)와 같은 생성적 multimodal tasks에 무능함
- GPT와 같은 Transformer 기반 자동 회귀 large-scale pre-trained language models (PLMs)이 natural language generation (NLG) tasks
- 이러한 모델은 self-attention으로 훈련되며, 모델이 생성적 특성을 충족하기 위해 past outputs (unidirectional)에만 주의를 기울 일 수 있음
- 최근에, BART/T5는 입력의 양방향 정보를 추가로 캡처하기 위해 양방향 트랜스포머 인코더로 자동회귀 디코더를 보강할 것을 제안함
- encoder-decoder architectures는 NLG/NLU tasks에서도 탁월함
- dual-stream VLP models의 한계점을 해결하고, PLM을 최대한 활용하기 위해 CLIP이 지식증류를 통해 생성적 multimodal tasks를 수행할 수 있는 효과적인 방법인
Vision-Language Knowledge Distillation (VLKD)제안- 구체적으로 BART 인코더를 CLIP의 공동 multimodal embedding space에 정렬하여 BART encoder/decoder를 결합하기 위한 이미지 조건 language modeling loss와 함께 multimodal knowledge에 대한 이해
- 학습하는 동안, CLIP의 가중치를 고정하여 학습된 multimodal space 유지
- downstream tasks의 finetuning/inference를 위해 원본 CLIP text encoder는 폐기되며, 증류된 BART로 대체되는 것으로 해석할 수 있음
- 따라서, 본 연구는 각 강점을 사용함
: CLIP의 expressive multimodal representation space
: BART의 strong text generation capability
🔸 그림 1- VLKD pre-training 후 모델은 open-ended VQA 및 이미지 캡션을 포함하여 생성적 multimodal tasks에서 strong zero-shot performance를 보여줌
- fine-tuning 없이 pre-trained BART에 내장된 질문, visual information/textual knowledge을 추론하여 답변을 생성하는 기능이 있음
- 또한, 이미지가 주어지면, 캡션을 직접 생성 할 수 있음
🟡 Related Work
(1) Vision-language Pre-training
- VLP models 2가지 범주
(a) single-stream
: patch별 또는 regional visual features/textual embeddings 연결하여 single model에 공급
(b) dual-stream models
: image/text에 대해 별도의 인코더를 사용하여 image/text features을 offline에서 미리 계산하여 image-text 검색과 같은 downstream multimodal 정렬 tasks을 효율적으로 추론할 수 있음
: 그러나, 이러한 모델은 multimodal 생성 tasks에 직접 사용할 수 없음- dual-stream VLP model CLIP의 multimodal embedding space을 powerful PLM BART와 정렬하여 multimodal 생성 능력을 얻는 효율적인 방법을 제안함
- image-conditioned autoregressive language modeling을 목표로 비용이 많이 드는 pre-training을 통해 multimodal generation tasks를 수행할 수 있는 VLP models도 있음
- 그러나, 이러한 모델의 pre-training에는 많은 수의 image-text 쌍과 수 많은 계산 리소스 필요
- 다른 모델은 레이블이 지정된 bounding-box 데이터가 있는 Faster-RCNN과 같은 추가 pre-trained된 object detector에 의존하여 offline에서 image regional features 추출하고 확장성 저하
(2) Knowledge Distillation- Knowledge distillation (KD)는 Hinton et al에 의해 처음 제안됨
- 교사모델에서 학습한 logits에 포함된 지식을 학생모델에게 transfers 함
- logits 외에도, intermediate representations and attentions와 같은 다른 형태의 지식도 transfer 기반 모델에 내장된 지식을 전달하는데 사용되었음
- 최근,
contrastive representation distillation은 두 네트워크 간의 상호 정보를 최대화하여 교사 네트워크에서 학생 네트워크로 지식을 증류하고, 최근에는 zero-shot detection/multilingual setting을 위해 pre-trained multimodal model CLIP에서 지식을 전달하도록 확장함- 본 논문에서는
pre-trained CLIP에서 BART로 지식을 전달하기 위해 기존 KD (conventional KD)와 contrastive KD를 적용함- 또한,
cross-attention을 통해 CLIP image encoder의 지식을 BART decoder로 transfer 하는 것을 제안함
🔸 그림 2- CLIP에서 BART로 multimodal 지식을 추출하기 위해 제안된 VLKD 방법의 아키텍처
- (a) dual-stream CLIP encoders와 BART encoder 간의 TTDM/ITCL losses을 보여줌
- (b) image-conditioned language modeling에 대한 ICTI loss을 보여줌. SG는 stop gradient operation을 의미, gradients가 model parameters의 해당 부분을 통해 back-propagated(역전파) 되지 않음을 의미