BLIP은 왜 Few-shot class 성능이 떨어질까?

a9umon·2026년 1월 5일

보충자료

목록 보기
7/9

BLIP은 LLM과 Vision Encoder를 따로 학습시키지 않고도 둘 사이를 연결하는 모듈을 잘 학습시켜 VLM task에서 좋은 성능을 낸다.
하지만 few-shot class의 classification 문제에서 성능이 떨어진다.

BLIP의 목적 함수의 한계

  • ITC, ITM, MLM
  • ITC는 이미지와 text의 '전반적인 의미'를 파악하는데 집중한다.
  • 또한 MLM은 이미지를 captioning 하는데 특화되어 있다.
  • 결론적으로, 이미지를 설명하거나 텍스트와 매칭하는데 특화되어 있어 이미지와 이미지 간의 특징을 비교하는 task에서는 약점을 보인다.

CapFilt

  • 필터링 과정에서 희귀한 class에 대한 정보를 noise 처럼 취급할 수 있다.

또한, 이 두 문제와 별개로 이미지 인코더로 쓰이는 ViT에서 Global encoding을 거치면서 Local patch를 충분히 반영하지 못한다.

profile
이것저것 다 합니다.

0개의 댓글