Abstract
우리는 visual textualization을 도입한 새로운 image prompted object detection 방법인 VisTex-OVLM을 제안한다. Visual textualization은 소수의 visual exemplar를 text feature space로 projection하는 과정이다. 이를 통해 사전학습된 object-text alignment를 보존하면서, 텍스트로 설명하기 어렵고 pre-training data에 거의 포함되지 않은 희귀 category를 탐지하는 Object-level Vision-Language Model (OVLM)의 능력을 향상시킨다.
구체적으로 VisTex-OVLM은 multi-scale textualizing blocks와 multi-stage fusion strategy를 활용하여 visual exemplar로부터 얻은 visual information을 통합하고, text prompt와 함께 OVLM을 효과적으로 안내하는 textualized visual token을 생성한다.
기존 방법과 달리, 제안 방법은 OVLM의 기존 architecture를 그대로 유지함으로써 generalization capability를 보존하는 동시에 few-shot setting에서의 성능을 향상시킨다. VisTex-OVLM은 OVLM의 pre-training data와 중복이 거의 없는 open-set dataset 전반에서 우수한 성능을 보이며, few-shot benchmark인 PASCAL VOC와 MSCOCO에서 state-of-the-art 성능을 달성한다. 코드는 VisTex-OVLM에서 공개될 예정이다.
Introduction
최근 vision-language model(VLM)은 대규모 image-text pair를 이용한 pre-training을 통해 computer vision 분야에서 뛰어난 generalization 성능을 보였다. 이를 통해 natural language prompt를 활용한 zero-shot transfer가 가능해졌으며, object detection을 위한 새로운 접근법들이 제안되었다. VLM 중에서도 GLIP으로 대표되는 object-level VLM(OVLM)은 더욱 우수한 object-text alignment를 달성한다. OVLM은 대규모 object detection 및 phrase grounding data로 pre-training되며, 일반적인 VLM보다 object-text alignment를 향상시키기 위해 multi-stage 및 multi-scale encoder를 사용한다. 또한 OVLM은 일반적으로 cross-attention 기반의 multi-stage encoding structure를 사용하며, 이를 통해 text prompt가 object feature representation과 location regression을 능동적으로 안내할 수 있다. 이러한 특징 덕분에 OVLM은 downstream object detection task의 zero-shot transfer에서 CLIP과 같은 기존 VLM보다 뛰어난 성능을 보인다.
그러나 OVLM의 zero-shot object detection(ZSOD)에는 본질적인 한계가 존재한다. 첫째, downstream task의 많은 object가 pre-training data에서 충분히 표현되지 않아 zero-shot transfer 성능이 최적에 미치지 못한다. 둘째, text prompt는 충분히 세부적인 description을 제공하지 못하는 경우가 많아 semantic bias와 정보 누락이 발생한다. 셋째, fine-grained object들은 text space에서 유사한 description을 공유하므로 text만으로 이들을 구별하기 어렵다. 따라서 OVLM의 transfer ability를 향상시키기 위해서는 downstream task로부터 새로운 visual information을 도입하는 것이 필수적이다. 한 가지 해결책은 visual exemplar를 활용해 fine-tuning하는 것으로, 이는 few-shot object detection(FSOD)에 해당한다. 예를 들어 일부 VLM 기반 object detection 방법은 기존 weight를 fine-tuning하거나 새로운 processing structure를 추가하여 few-shot visual exemplar의 정보를 활용한다. 그러나 이러한 접근법은 OVLM의 기존 object-text alignment를 훼손하고 generalization capability를 저하시킬 위험이 있다.
이를 설명하기 위해, 일반성을 잃지 않는 범위에서 Object365로 pre-training된 GLIP을 여러 일반적인 transfer method를 사용하여 MSCOCO로 transfer하는 empirical analysis를 수행하였다. Transfer 이후 Object365의 서로 대응하는 text feature와 object feature 간 cosine similarity를 계산하였다. 실험 결과, 제한된 transfer data를 사용해 model structure나 weight를 변경한 모든 방법은 source domain의 object-text similarity distribution을 왜곡하여 alignment를 부분적으로 저하시켰다. 이 결과는 다음과 같은 질문으로 이어진다. 소수의 visual exemplar가 가진 semantics를 도입하면서도, 제한된 target training data가 OVLM의 object-text alignment를 훼손하지 않도록 할 수 있는가?

Image를 prompt로 사용하는 image prompting을 통해 text prompt와 함께 semantic guidance를 제공하면 앞의 문제를 해결할 수 있다. 그러나 대부분의 OVLM은 text prompt만을 지원하도록 설계되어 있으며, architecture의 비호환성으로 인해 image prompting을 기본적으로 지원하지 않는다. MQ-Det은 text encoder 내부에 추가적인 trainable cross-attention module을 삽입하여 visual exemplar를 OVLM의 prompting process에 통합한 최초의 방법이다. 이를 통해 exemplar image가 token-wise 방식으로 text prompt를 조절하고, inference 과정에서 novel class의 visual information을 도입할 수 있다. 그러나 MQ-Det은 새로운 visual information을 직접 추가하지 않고 기존 text prompt의 token을 re-weighting하기만 하므로, 핵심적인 visual clue가 손실될 수 있다. 또한 새롭게 추가된 cross-attention structure 역시 OVLM의 pre-trained object-text alignment에 bias를 발생시킨다. Text-prompt-exclusive OVLM의 pre-trained object-text alignment를 훼손하지 않으면서 image prompting을 지원하는 방법은 아직 충분히 연구되지 않았다.
본 논문에서는 OVLM의 detection capacity를 pre-training된 category를 넘어 확장하기 위한 새로운 image prompting 방법인 VisTex-OVLM을 제안한다. OVLM의 object-text alignment를 보존하기 위해, support object를 text feature space로 projection하는 visual textualization을 도입한다. 이 과정을 통해 novel category의 제한된 exemplar가 prompting에 참여할 수 있으며, semantic text prompt와 함께 OVLM이 open-set detection을 수행하도록 안내한다. Visual textualization이 적용된 support image는 text prompt와 결합된 뒤, 구조가 변경되지 않은 pre-trained OVLM에 직접 입력되므로 기존의 object-text alignment가 유지된다.
구체적으로 먼저 OVLM의 visual encoder를 활용해 visual exemplar의 representation을 추출하고, 이를 projection하기 위한 경량 multi-scale textualizing blocks (MSTBs)를 설계한다. MSTB는 OVLM visual encoder의 각 layer에서 생성된 visual exemplar의 multi-scale intermediate visual feature를 처리하고, 이를 OVLM의 text feature space로 동일하게 projection하여 textualized visual feature를 생성한다. 또한 추가적인 parameter를 도입하지 않으면서 OVLM의 multi-stage object-text alignment를 활용하기 위해, visual encoder의 서로 다른 stage에서 생성된 textualized visual feature를 결합하는 non-parametric multi-stage fusion(MSF) strategy를 사용한다. 각 visual exemplar는 하나의 textualized visual token으로 projection되며, text prompt와 함께 OVLM이 target image를 추론하도록 안내한다. MSTB와 MSF는 OVLM의 기존 structure, 강력한 object-text alignment, object-level feature extraction capability를 충분히 활용하여 textualized visual token이 최적의 semantic representation을 갖도록 한다.
Training 과정에서는 MSTB만이 trainable structure이다. MSTB는 novel class에 대해 fine-tuning하지 않고도 novel category의 visual exemplar를 semantic information이 풍부한 textualized visual token으로 직접 projection할 수 있다. 따라서 image prompt를 활용하여 개인용 mobile device에서 open-vocabulary detection을 수행하는 것과 같은 실제 application에 적합하다. 기존 방법들은 image prompt를 도입하는 과정에서 OVLM의 pre-trained object-text alignment를 훼손한다. VisTex-OVLM의 novelty는 model의 pre-trained alignment를 변경하지 않으면서 기존 OVLM structure를 효과적으로 활용하여, text prompt에서 충분히 표현되지 못한 semantics를 보완하는 visual information을 통합한다는 점에 있다.
Text feature를 조절하는 MQ-Det과 달리, VisTex-OVLM은 visual information을 직접 통합하여 OVLM의 inference structure와 object-text alignment를 최대한 보존한다. VisTex-OVLM을 GLIP에 적용한 VisTex-GLIP과 GroundingDINO에 적용한 VisTex-DINO는 LVIS와 OVLM의 pre-training data와 중복이 거의 없는 16개 dataset을 포함한 open-set scenario에서 우수한 성능을 보였다. 또한 PASCAL VOC와 MSCOCO를 포함한 표준 few-shot benchmark에서 state-of-the-art(SOTA) 성능을 달성하여 폭넓은 적용 가능성을 보여준다. 광범위한 ablation study를 통해 image를 text prompt의 semantic complement로 사용하는 것이 효과적임을 추가로 검증하였다. 본 논문의 contribution은 다음과 같다.
① Visual exemplar를 text feature space로 projection하는 visual textualization을 도입한 VisTex-OVLM을 제안한다. 이를 통해 object-text alignment를 훼손하지 않으면서 pre-training data에 존재하지 않는 category를 탐지할 수 있도록 OVLM의 실제 적용 가능성을 확장한다.
② OVLM의 기존 structure와 강력한 alignment를 보존하면서 pre-trained knowledge를 효율적으로 활용할 수 있도록 multi-scale textualizing blocks(MSTBs)와 multi-stage fusion(MSF) strategy를 설계한다.
③ VisTex-OVLM은 제한된 visual exemplar만으로 open-set scenario에서 뛰어난 성능을 보이며, 표준 FSOD benchmark에서 SOTA 성능을 달성한다.
Related works
ⓐ Few-shot object detection
Few-shot object detection은 novel class에서 소수의 annotation instance만을 활용하여 novel object를 탐지하는 것을 목표로 한다. 기존의 주류 방법들은 대부분 복잡한 episode-based meta-learning training paradigm이나 정교한 inter-class relationship modeling에 의존한다. 많은 발전이 이루어졌음에도 FSOD는 여전히 어려운 task이다. 최근 VLM은 뛰어난 generalization capability를 보였으며, 이에 따라 FSOD에 VLM을 적용하는 연구가 증가하고 있다. 그러나 대부분의 접근법은 제한적인 성능을 보인다. 현재 SOTA model인 MTL-FSOD는 knowledge distillation을 통해 FSOD의 classification 성능을 향상시키는 데에만 VLM을 활용하며, FSOD에서 VLM의 잠재력을 충분히 활용하지 못한다. 본 논문의 VisTex-OVLM은 이를 더 깊이 탐구하며, FSOD에서 VLM의 잠재력을 최대한 활용하는 것을 목표로 한다.
ⓑ VLM-based detection and grounding
VLM은 인터넷에서 수집한 대규모 text-image pair를 활용하여 contrastive learning 방식으로 text encoder와 image encoder를 학습하며, 이를 통해 높은 generalization capability를 가진 feature를 학습한다. 그중 CLIP은 image-level alignment를 학습하는 대표적인 모델로 널리 알려져 있으며, image classification과 text-image retrieval task로 효과적으로 transfer될 수 있다. 그러나 CLIP은 object-level knowledge가 부족하기 때문에 detection 및 grounding task에 적용하려면 fine-tuning하거나 detector module을 추가해야 한다. 이로 인해 model complexity와 training cost가 증가한다. 이러한 문제를 해결하기 위해 detection task를 위해 설계된 Object-level VLM(OVLM)이 등장하였다. 대표적인 연구인 GLIP은 object detection data와 phrase grounding data를 결합하고, grounded pre-training과 multi-scale·multi-stage cross-attention architecture를 활용하여 강력한 object-text alignment를 구축한다. 이에 따라 regionCLIP과 같은 image-level open-vocabulary detector보다 downstream detection 및 grounding task에서 우수한 성능을 보인다. 따라서 본 논문의 VisTex-OVLM은 본질적으로 detection과 grounding task에 적합한 OVLM을 기반으로 하며, FSOD에서 VLM의 잠재력을 더욱 깊이 탐구한다.
ⓒ Prompting methods
Prompting은 large pre-trained model을 안내하기 위한 task-specific hint를 제공하여 모델의 이해도와 결과를 향상시키는 방법이다. Prompting은 NLP에서 시작되었으며, 현재는 VLM으로도 확장되었다.
Design and tuning
Prompt design은 prompt를 수동으로 구성하는 것을 의미한다. 그러나 이 과정은 복잡하고 많은 시간이 소요되며, 주관적인 bias가 개입될 수 있다. Prompt tuning은 VLM에 learnable token을 추가하고 이를 fine-tuning하는 방식이다. 그러나 이러한 tuning은 VLM의 cross-modal alignment를 훼손하여 generalization capability를 저하시킬 수 있다.
Image prompting
Image prompting은 image를 prompt로 간주하여 text prompt와 함께 semantic guidance를 제공하는 새로운 방법이다. CLIPSeg는 이를 one-shot segmentation에 적용하지만, 추가적인 segmentation module이 필요하며 이로 인해 cross-modal alignment가 훼손될 수 있다. Detection task에서 OWL-ViT는 image prompting을 지원하지만, image-object pre-training과 사전에 정의된 architecture에 의존하기 때문에 다른 OVLM으로 일반화하기 어렵다. MQ-Det은 OVLM의 text encoder 내부에 trainable cross-attention module을 통합한다. 이를 통해 image prompt가 token-wise 방식으로 text prompt를 조절하며, prompt image의 정보를 도입할 수 있다. 그러나 MQ-Det은 새로운 visual information을 완전히 통합하지 않고 기존 token을 re-weighting하는 데 그친다. 또한 추가된 cross-attention structure는 OVLM의 object-text alignment와 generalization capability를 저하시킬 수 있다. 앞서 언급한 접근법들과 달리, 본 논문의 VisTex-OVLM은 visual textualization을 통해 few-shot support image를 prompt로 활용하고, support image의 semantics를 OVLM의 text feature에 직접 삽입한다. 이를 통해 image prompt의 visual information을 text prompt에 직접 통합할 수 있다. 더 중요한 점은 제안 방법이 OVLM의 기존 structure를 변경하지 않는다는 것이다. 따라서 OVLM의 뛰어난 object-text alignment를 온전히 유지할 수 있으며, 이를 통해 우수한 generalization capability와 성능을 달성한다.
Method
일반성을 잃지 않는 범위에서, few-shot object detection(FSOD)의 notation을 사용하여 제안 방법을 설명한다.
ⓐ Task definition
고전적인 few-shot object detection(FSOD) setting에는 서로 구분되는 두 dataset이 존재한다. 하나는 category set 를 갖는 base set 이고, 다른 하나는 category set 을 갖는 novel set 이며, 두 category set은 다음과 같이 서로 겹치지 않는다.
Base set 에는 FSOD system의 training에 활용할 수 있는 많은 annotated object가 포함되어 있다. 반면 novel set 에서는 각 category 가 K-shot object detection learning을 위해 최대 K개의 bounding box annotation만을 갖는다. 여기서 K는 예를 들어 1,2,3,…,10이 될 수 있다. Inference 단계에서 K-shot annotation을 제공하는 image를 support image라고 하며, prediction 대상이 되는 image를 query image라고 한다. Query image는 novel category set 에 속한다. 보다 실용적인 generalized few-shot object detection(GFSOD) setting에서는 inference 시 target category set이 다음과 같이 base class와 novel class의 합집합으로 확장된다.
따라서 model은 novel class뿐만 아니라 base class에 대해서도 안정적인 성능을 유지해야 한다.
ⓑ Preliminaries and notations for OVLMs
일반적으로 OVLM은 object-level visual task를 위한 특수한 설계를 도입하여 기존 VLM을 확장한다. 첫째, hierarchical visual encoder를 사용하여 multi-scale encoding을 수행하고, 서로 다른 크기의 object를 포착하기 위해 text feature와 alignment된 다양한 spatial scale의 region feature를 생성한다. 둘째, 웹에서 수집한 phrase grounding data를 사용하여 text encoder의 vocabulary를 확장한다. 셋째, region-text alignment를 향상시키기 위해 cross-modal attention을 포함하는 multi-stage architecture를 사용한다. 이러한 특수 설계를 통해 OVLM은 뛰어난 object-text alignment를 달성하며, 특히 object detection task에 적합하다. 이후의 설명을 위해 OVLM의 encoding process에 사용되는 notation을 정의한다. OVLM의 intermediate visual feature와 text feature를 각각 와 로 나타낸다. 여기서 이며, 은 전체 stage의 수이다. 는 pre-trained visual tokenizer가 출력한 visual token을 나타내며, 일반적으로 Swin이 사용된다. 는 pre-trained text tokenizer가 tokenization한 text prompt token을 나타내며, 일반적으로 BERT가 사용된다. Target object를 위한 text prompt 가 개의 class를 포함한다고 하자. 설명의 편의를 위해 각 class가 개의 word로 표현된다고 가정한다. Class name만 prompt로 사용하는 경우에는 이다. 전체 encoding process에서 text feature 의 형태는 다음과 같다.
여기서 는 text feature space의 dimension이다. Multi-scale encoding으로 인해 visual feature 는 다음과 같이 표현된다.
각 scale의 visual feature는 다음과 같다.
여기서 와 는 가장 큰 scale에 해당하는 visual feature의 height와 width이고, 은 전체 scale의 수이며, 는 visual feature space의 dimension이다. 표기 는 concatenation을 의미한다.
ⓒ VisTex-OVLM
Introduction의 empirical analysis에서 확인한 것처럼, weight를 fine-tuning하거나 추가적인 processing structure를 도입하면 OVLM에 이미 구축된 object-text alignment가 손상되는 경향이 있으며, 이는 generalization에 부정적인 영향을 미친다.

이러한 문제를 해결하기 위해 본 논문에서는 inference 단계에서 support image를 prompt 형태로 textualization하여, fine-tuning되지 않은 pre-trained OVLM이 novel object를 탐지하도록 안내하는 새로운 접근법인 VisTex-OVLM을 제안한다. VisTex-OVLM은 support image의 visual textualization을 수행하기 위해 multi-scale textualizing blocks (MSTB)와 multi-stage fusion strategy를 도입한다. MSTB는 support image의 visual feature를 text feature space로 mapping한다. 이를 통해 OVLM의 우수한 pre-trained object-text alignment를 보존하면서, 기존 structure를 변경하지 않은 OVLM에 support image를 직접 prompt로 입력할 수 있다.
① Visual textualization
VLM의 weight와 architecture를 변경하지 않으면서 prediction preference를 조정하는 효과적인 방법은 language branch의 text prompt를 조정하는 것이다. 따라서 본 논문에서는 OVLM의 object-text alignment를 보존하면서 novel class에 대한 정보를 통합하기 위해 support image를 text feature space로 mapping하는 visual textualization을 제안한다.
Image prompt engineering Object detection은 dense prediction task이므로 support image에서 target object를 관련 없는 object 및 background와 구분하기 위해 few-shot annotation을 최대한 활용하는 것이 중요하다. Semantic segmentation의 image prompting에 관한 Luddecke et al.의 경험을 따라, support image와 target bounding box를 결합하는 image prompt engineering을 수행한다. 구체적으로 target bounding box 외부 영역에 background blur를 적용한다.
Multi-scale textualizing Prompt engineering이 적용된 one-shot support image를 라고 하자. OVLM의 frozen visual encoder를 활용하여 서로 다른 크기의 object에 대한 정보를 포함하는 multi-scale feature를 추출한다. Stage 에서 로부터 추출한 visual feature를 다음과 같이 나타낸다.
여기서 이다. 모든 scale의 visual feature를 동일한 방식으로 처리하고 text feature space로 mapping하기 위한 multi-scale textualizing block(MSTB)을 설계한다. 구체적으로 stride가 인 convolution을 사용하여 larger-scale feature를 점진적으로 downsampling하고 가장 효과적인 visual information을 추출한다. 이후 MLP를 사용하여 visual feature를 text feature dimension 로 mapping한다.
Base set 에서 MSTB를 training하는 비용을 줄이고 서로 다른 scale의 feature가 공유하는 knowledge를 효과적으로 활용하기 위해 parameter-sharing strategy를 사용한다. 구체적으로 가장 작은 scale의 feature를 제외한 모든 feature를 shared convolution set으로 처리한 후, MLP mapping을 적용하여 textualized visual feature 를 얻는다.
이 strategy는 서로 다른 scale의 feature를 하나의 통합된 text feature space로 projection하는 mapping function의 학습을 용이하게 한다. FSOD에서 multi-scale textualizing은 서로 다른 scale의 support sample로부터 feature를 종합적으로 추출할 수 있게 하며, fine-grained local detail과 global contextual relationship을 모두 포착한다. 이러한 multi-scale approach는 query image의 target object를 표현하는 의 representation capability를 크게 향상시킨다.
Multi-stage fusion Support image의 서로 다른 visual encoder stage에서 생성된 textualized visual feature 를 통합하기 위해 multi-stage fusion (MSF) strategy를 추가로 적용한다. 이 fusion process는 각 support image를 하나의 textualized visual token 로 통합한다.
이 fusion process는 non-parametric operation으로 구현할 수 있으므로 computational resource를 절약하면서도 효과적인 결과를 얻을 수 있다. 실제로 multi-stage fusion과 multi-scale textualizing의 synergistic effect는 OVLM에 이미 구축된 object-text alignment와 object-level visual feature extraction capability를 충분히 활용한다. 이를 통해 textualized visual token 이 최적의 semantic representation을 갖도록 한다.
② Direct support image prompting
기존의 image prompting 방법은 추가 component를 도입하여 OVLM의 object-text alignment를 훼손할 위험이 있거나, visual information을 직접 통합하지 않은 채 text feature만 조절한다. 이와 달리 VisTex-OVLM은 visual textualization을 통해 support image의 visual information을 직접 통합한다.
VisTex-OVLM에서는 textualized visual token 를 pre-trained BERT로 처리한 text prompt token과 concatenation한 뒤, structure가 변경되지 않은 pre-trained OVLM에 직접 입력한다.
-shot task에서는 서로 다른 support image로부터 생성된 textualized token을 직접 concatenation한다. 이를 통해 information loss가 발생할 수 있는 fusion을 피하면서 각 shot의 독립성을 유지한다. 각 shot의 독립성을 유지하는 것은 OVLM이 query prediction에 필요한 support sample distribution을 파악하는 데 중요하다.
개의 class가 존재하는 setting에서 의 형태는 다음과 같다.
Training 단계에서는 base set 의 class label을 사용하여 이에 대응하는 text prompt 를 구성한다. 기존 FSOD 연구를 따라 각 base class에서 -shot sample을 무작위로 선택하여 support image로 사용하고, 나머지 data는 query로 활용한다. 이후 OVLM의 pre-training loss function을 사용하여 MSTB를 end-to-end로 training한다. Training이 끝난 MSTB는 novel class data에 대해서도 직접 textualization을 수행할 수 있다.
기존 image prompting 방법과 달리, 제안 방법은 few-shot support image의 semantics를 textualized visual token 형태로 OVLM의 text prompt 에 직접 embedding한다. 이를 통해 visual information을 직접 통합할 수 있다.
또한 제안 방법은 OVLM의 기존 architecture를 그대로 유지하므로, 우수한 pre-trained object-text alignment를 온전히 보존한다. VisTex-OVLM을 GLIP과 GroundingDINO에 각각 적용한 VisTex-GLIP과 VisTex-DINO는 뛰어난 generalization capability와 성능을 보여준다.
Conclusion
본 논문에서는 visual exemplar를 text feature space로 projection하는 visual textualization을 활용하여, pre-trained object-text alignment를 훼손하지 않고 OVLM을 prompting하는 새로운 object detection 접근법인 VisTex-OVLM을 제안한다. Visual textualization을 구현하기 위해 OVLM의 강력한 object-text alignment와 object-level feature extraction capability를 충분히 활용하는 MSTB와 MSF strategy를 설계하였다. 이를 통해 textualized visual token이 효과적인 semantic representation을 갖도록 한다. VisTex-OVLM은 open-set detection benchmark인 LVIS와 16개의 unseen dataset뿐만 아니라, few-shot benchmark인 PASCAL VOC와 MSCOCO에서도 state-of-the-art 성능을 달성한다. 또한 VisTex-OVLM은 GLIP과 GroundingDINO를 포함한 일반적인 OVLM에 적용할 수 있다. 이러한 결과는 image prompt를 사용해 text prompt를 보완하는 것의 장점을 보여주며, zero-shot object detection의 한계를 해결하는 데 제안 방법이 효과적임을 검증한다.