Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection 논문 리뷰

김준형·2026년 6월 21일

딥러닝 논문 리뷰

목록 보기
28/33

Abstract
Cross-Domain Few-Shot Object Detection (CD-FSOD)은 이전에 보지 못한 도메인에서 얻은 소수의 라벨링된 샘플만을 사용하여 새로운 객체를 탐지하는 것을 목표로 한다. 데이터 증강 및 생성 기반 방법들은 few-shot learning에서 가능성을 보여주었지만, CD-FSOD에서는 시각적 사실성과 도메인 정렬이 모두 요구되기 때문에 그 효과가 아직 명확하지 않다. Copy-paste 증강이나 text-to-image 생성과 같은 기존 전략들은 올바른 객체 카테고리를 보존하지 못하거나 target domain과 일관된 배경을 생성하지 못하는 경우가 많아, CD-FSOD에 직접 적용하기가 쉽지 않다. 이러한 문제를 해결하기 위해 본 논문에서는 CD-FSOD에 맞춰 설계된 training-free, retrieval-guided compositional image generation framework인 Domain-RAG를 제안한다. Domain-RAG는 세 단계로 구성된다: domain-aware background retrieval, domain-guided background generation, 그리고 foreground-background composition. 구체적으로, 입력 이미지는 먼저 foreground 영역과 background 영역으로 분해된다. 이후 의미적으로 그리고 스타일적으로 유사한 이미지를 검색하여, 원본 context와 검색된 context를 모두 조건으로 사용하는 생성 모델이 새로운 배경을 합성하도록 유도한다. 마지막으로, 보존된 foreground를 새롭게 생성된 domain-aligned background와 합성하여 최종 생성 이미지를 만든다. 추가적인 supervision이나 training 없이도 Domain-RAG는 CD-FSOD, remote sensing FSOD, camouflaged FSOD를 포함한 다양한 task에서 고품질의 domain-consistent 샘플을 생성한다. 광범위한 실험 결과, Domain-RAG는 강력한 baseline들에 비해 일관된 성능 향상을 보였으며 새로운 state-of-the-art 결과를 달성하였다.

Introduction
Cross-Domain Few-Shot Object Detection (CD-FSOD)은 cross-domain few-shot learning (CD-FSL)에서 파생된 새롭게 부상하는 과제로, 서로 다른 도메인 간의 few-shot object detection (FSOD) 문제를 해결하는 것을 목표로 한다. Source data와 target data가 유사한 분포를 공유한다고 가정하는 기존 FSOD와 달리, CD-FSOD는 자연 이미지에서 산업 이상 이미지, 원격탐사 이미지, 또는 수중 환경으로 전이하는 경우와 같이 큰 domain shift가 존재하는 보다 현실적인 상황을 고려한다. Few-shot learning의 어려움과 domain shift의 어려움을 동시에 포함하기 때문에, CD-FSOD는 기존 detector들에게 상당한 도전 과제를 제기한다.

카테고리당 1개 또는 5개 정도의 annotated sample만 주어지는 것처럼 labeled data가 극도로 부족하기 때문에, data bottleneck을 완화하기 위한 자연스럽고 직관적인 해결책은 data augmentation을 활용하는 것이다. Image augmentation 및 generation 기법들은 다른 few-shot learning task에서 광범위하게 연구되었고 효과적임이 입증되었지만, 이들이 CD-FSOD를 위한 고품질 training sample을 생성할 수 있는지는 아직 명확하지 않다. Few-shot classification이나 in-domain FSOD와 달리, 이 설정에서는 정확한 object annotation뿐만 아니라 강한 domain consistency도 요구된다. 이는 기존 data augmentation 기반 few-shot learning 방법들에서 다루어지지 않았던 문제이다.

CD-FSOD를 위한 training image를 생성하는 가장 직접적인 접근법은 copy-paste이다. 구현은 쉽지만, 이러한 이미지는 종종 realism과 domain coherence가 부족하다. 더 발전된 전략은 SDXL, FLUX와 같은 최근 generative model, 특히 현재 주목받는 text-to-image generation을 활용하는 것이다. 이 분야의 기존 방법 대부분은 “a photo of category”와 같은 text prompt를 통해 foreground object를 합성하는 데 집중한다. 그러나 이러한 방법들은 novel category와 domain에 적용될 때 object semantics를 보존하지 못할 수 있다. 이러한 category shift는 fine-grained object와 domain gap을 함께 다루어야 하는 CD-FSOD에서 문제가 된다. 다른 접근법들은 이미지의 text description을 바탕으로 다양한 background를 생성한다. 이 방식은 foreground를 더 잘 보존하지만, 순수한 text description만으로는 정확한 domain characteristic을 포착하기 어렵고, foreground와 background 사이의 semantic 및 visual consistency를 보장하는 데 한계가 있다. 이러한 한계는 CD-FSOD를 위해 시각적으로 일관되고 domain-aligned된 training sample을 합성할 수 있는 새로운 image generation framework를 개발하도록 동기를 부여한다. 구체적으로 본 논문의 목표는 다음과 같다: ① 원본 foreground object를 보존하고, ② query image 및 그 domain과 semantic 및 style 측면에서 모두 정렬된 다양한 background를 생성하며, ③ downstream detection training에 적합한 valid annotation을 가진 시각적으로 사실적인 이미지를 생성하는 것이다.

이를 위해 본 논문은 fix the foreground, adapt the background라는 원칙에 기반한 retrieval-guided compositional image generation framework인 Domain-RAG를 제안한다. Object detection의 특성을 활용하여, Domain-RAG는 먼저 target image를 foreground object와 background로 분해한다. 이때 background는 object가 mask 처리된 영역에 inpainting model을 적용하여 복원된다. 원리는 단순하지만, 이 단계는 원본 object와 그 annotation을 보존하는 데 중요하며, controllable compositional generation을 위한 기반을 마련한다. 이후 핵심 과제는 foreground와 semantic 및 style 측면에서 호환되는 새로운 background를 생성하는 것이다. Retrieval-augmented generation (RAG) 패러다임에서 영감을 받아, 본 방법은 structured visual prior를 generation process에 주입하여 background synthesis를 유도한다. Domain-RAG는 다음 세 단계로 구성된다.

① Domain-Aware Background Retrieval
다양한 natural scene을 포함하는 image database, 예를 들어 COCO, 를 도입하고, target image의 inpainted background와 semantic 및 style 측면에서 유사한 candidate background를 검색한다. Semantic similarity는 high-level visual feature를 사용하여 계산하고, style similarity는 style-based descriptor를 통해 측정한다.

② Domain-Guided Background Generation
검색된 background를 직접 사용하는 대신, 이를 target의 inpainted background와 함께 generative model에 입력하여 target domain의 시각적 특성을 더 잘 반영하는 새로운 background를 합성한다. Modern diffusion model과의 호환성을 보장하기 위해 Redux를 적용하여 visual image cue를 descriptive text prompt로 변환하고, 이를 통해 text-to-image generation model을 직접 사용할 수 있게 한다.

③ Foreground-Background Composition
마지막으로, 보존된 foreground를 mask-guided generative model을 사용하여 합성된 domain-aligned background 위에 자연스럽게 합성한다. 그 결과 생성된 이미지는 원본 object를 유지하면서도, 이를 realistic하고 domain-consistent한 context 안에 배치한다. Domain-RAG pipeline 전체는 training-free 방식이며, 추가적인 supervision이나 retraining 없이 기존 detector에 직접 통합될 수 있다. 따라서 1-shot CD-FSOD와 같은 low-shot scenario에 특히 적합하다.

본 논문은 domain shift를 포함하는 few-shot object detection을 다루는 세 가지 task, 즉 CD-FSOD, remote sensing FSOD (RS-FSOD), 그리고 camouflaged FSOD에서 Domain-RAG를 검증한다. 모든 task에서 본 방법은 가장 낮은 shot 설정에서 강력한 baseline을 평균적으로 각각 +7.3, +1.1, +2.1 mAP 향상시키며, 새로운 state-of-the-art (SOTA) 성능을 달성하였다. 이러한 결과는 Domain-RAG가 다양한 도메인에 폭넓게 적용 가능하며 효과적임을 보여준다.

본 논문의 주요 contribution은 다음과 같다.

① Cross-domain few-shot object detection의 성능을 향상시키기 위한 training-free, model-agnostic, retrieval-guided compositional image generation framework인 Domain-RAG를 제안한다.

② Domain-RAG는 semantic 및 style 측면에서 유사한 retrieved example의 guidance를 바탕으로, 원본 foreground를 보존하면서 domain-aligned background를 합성하는 image generation을 가능하게 한다.

③ CD-FSOD, remote sensing FSOD, camouflaged FSOD를 포함하는 폭넓은 task에서 일관된 성능 향상과 새로운 state-of-the-art 결과를 달성하였다.

Related Works
ⓐ Cross-Domain Few-Shot Tasks
도메인을 넘나드는 few-shot learning은 널리 연구되어 왔지만, 대부분의 연구는 classification에만 초점을 맞추고 있다. 객체를 인식하는 것뿐만 아니라 위치까지 찾아야 하는 더 현실적인 과제인 cross-domain few-shot object detection (CD-FSOD)은 아직 충분히 탐구되지 않았다. 최근에는 CD-ViTO와 ETS 같은 방법들이 CD-FSOD를 다루고 있다. CD-ViTO는 COCO를 유일한 source로 사용하는 closed-source setting에서 이 과제를 도입한 반면, ETS는 더 실용적인 open-source setting을 사용하며 pretrained GroundingDINO를 통한 data augmentation을 활용한다. 본 논문에서는 open-source setting을 채택하고, retrieval-guided compositional generation을 사용하여 augmentation을 추가적으로 개선한다.

ⓑ FSOD Beyond Domains
전통적인 CD-FSOD task를 넘어서, 명시적으로 cross-domain이라고 불리지 않더라도 많은 FSOD 또는 detection 문제들은 domain shift를 포함한다. 대표적인 두 예시는 Remote Sensing FSOD (RS-FSOD)와 Camouflaged FSOD이다. RS-FSOD는 remote sensing image를 사용하는데, 이는 색상, 시점, 해상도 측면에서 자연 이미지와 달라 명확한 domain gap을 만든다. Camouflaged FSOD는 수중의 물고기나 야생의 동물처럼 배경에 섞여 있는 객체를 탐지해야 하므로, 일반화 측면에서 어려움을 제기한다. 본 논문은 다양하고 어려운 cross-domain scenario에서 제안 방법을 평가하기 위해 두 task를 모두 포함한다.

ⓒ Data Augmentation
Data augmentation은 vision community에서 핵심적인 기법이다. Object detection을 위한 전통적인 방법들, 예를 들어 copy-paste , cropping, color jittering은 단순하지만 semantic diversity가 제한적이다. 최근에는 ControlNet, SDXL, FLUX, FLUX-Fill과 같은 generative model, 특히 text-to-image model이 더 발전된 augmentation을 가능하게 했다. X-Paste, Lin et al., Zhang et al.과 같은 방법들은 다양한 background 위에 붙일 새로운 foreground를 생성하는 반면, 다른 방법들은 text prompt를 사용하여 foreground와 background를 함께 생성한다. 그러나 이러한 방법들은 일반적으로 training을 위해 많은 양의 in-domain data에 의존하며, 이는 novel category나 unseen domain에 대한 적응성을 제한한다. 반면 본 논문의 Domain-RAG는 training-free 방식이며, 검색된 real-world image를 visual prior로 활용하여 domain-consistent sample을 생성하므로 CD-FSOD에 적합하다.

ⓓ Retrieval-Augmented Generation in Vision
Retrieval-augmented generation (RAG)은 처음 NLP에서 도입되었으며, 관련 있는 검색 결과를 external knowledge로 통합함으로써 output을 향상시킨다. RAG의 강력한 성능은 image captioning, visual question answering, image generation, pose estimation과 같은 vision task로의 적용으로 이어졌다. 그러나 현재의 RAG 기반 image generation 방법들은 open-ended synthesis를 목표로 하며, object detection에는 적합하지 않다. 특히 domain alignment와 object fidelity가 모두 중요한 cross-domain few-shot setting에서는 더욱 그렇다. 저자들이 아는 한, 본 논문은 CD-FSOD를 위해 특별히 설계된 RAG-inspired, training-free image generation framework를 처음으로 제안한다.

Proposed Method

Problem Setup.
CD-FSOD task는 source domain DSD_S의 object detector를 target domain DTD_T에 적응시키는 것을 목표로 하며, 이때 두 도메인의 데이터 분포 PSP_SPTP_T는 서로 다르다. 본 논문은 few-shot setting, 즉 NN-way KK-shot protocol을 사용하여 DTD_T에서의 detection 결과를 평가한다. 구체적으로, support set SN×KDTS^{N \times K} \subset D_T는 novel class마다 KK개의 labeled example을 제공하며, query set QQ는 평가에 사용된다. 본 논문은 1st CD-FSOD Challenge에서 도입된 open-source setting을 사용한다. 이 setting은 대규모 데이터로 pretrained된 foundation model의 사용을 허용하며, 이를 통해 CD-FSOD에서 foundation model의 가능성을 탐구한다. 특히 DSD_S에서 pretraining을 수행하는 대신, pretrained detector, 예를 들어 GroundingDINO, 를 support set SS에 직접 finetuning하고 query set QQ에서 결과를 평가한다. SS의 제한적인 크기를 완화하기 위해, 각 support instance에 대해 nn개의 synthetic image를 추가로 생성하여 증강한다. 결과적으로 각 class의 example 수는 KK개에서 K×(n+1)K \times (n + 1)개로 확장된다.

Overview.
본 논문은 Domain-RAG를 제안한다. Domain-RAG는 domain-aligned sample을 생성하여 support diversity를 향상시키는 새로운 training-free, retrieval-guided compositional generation framework이다. Retrieval을 가능하게 하기 위해, COCO를 database DbaseD_{base}로 사용하며, 이는 candidate background들의 gallery 역할을 한다. “fix the foreground, adapt the background”라는 핵심 원칙에 따라, Domain-RAG는 각 support image xSx \in S를 먼저 foreground object와 background로 분해한다. 이후 framework는 세 가지 핵심 단계로 진행된다.

① domain-aware background retrieval은 먼저 xx로부터 inpainted background binitb_{init}를 얻고, 그다음 DbaseD_{base}에서 semantic 및 style 측면에서 유사한 GG개의 candidate background breb_{re}를 검색한다.

② domain-guided background generation은 각 binit,bre{b_{init}, b_{re}} 쌍을 generative model에 입력하여 새로운 domain-aligned background bdomb_{dom}을 합성한다.

③ foreground-background composition은 마지막으로 보존된 foreground를 각 bdomb_{dom} 위에 mask-guided generative model을 사용해 합성함으로써 nn개의 새로운 이미지 x+x^+를 생성한다.

ⓐ Domain-Aware Background Retrieval
본 논문은 기존 image database를 검색하기 위해 CLIP의 high-level semantic feature와 ResNet의 low-level style descriptor를 결합하는 two-stage retrieval strategy를 제안한다. 이 방법은 target domain과 semantic 및 appearance 측면에서 가장 유사한 이미지를 검색하여, target-domain distribution에 더 잘 맞는 background candidate를 제공하고, 이를 통해 support set SS를 풍부하게 만든다.

실제로, support image xx가 주어지면 LaMa inpainting을 사용하여 ground-truth bounding box 영역을 제거하고, foreground가 없는 background binitb_{init}를 얻는다. 이후 CLIP encoder를 사용하여 initial background binitb_{init}와 database DbaseD_{base}로부터 embedding을 추출하며, 이를 각각 FbgF_{bg}FbaseF_{base}라고 한다. 현재 background query의 visual feature FbgF_{bg}와 database 내 각 sample의 CLIP embedding 사이의 cosine similarity를 계산한다. 이 similarity ranking을 기반으로 가장 유사한 상위 mm개의 이미지를 선택하여 candidate set Bclip,mB_{\langle clip,m\rangle}을 구성한다. 이 집합은 bclipb_{clip} 형태의 이미지 mm개를 포함한다. 아래첨자 표기는 해당 집합이 CLIP vision encoder를 사용하여 구성되었고, mm개의 element를 포함한다는 것을 의미한다.

이 단계를 바탕으로, shallow-layer ResNet feature를 사용하여 low-level style descriptor를 추출함으로써 bclipb_{clip}들을 다시 ranking한다. CLIP으로 검색된 각 background image bclipb_{clip}에 대해, ResNet encoder의 early layer를 사용하여 low-level feature map FF를 추출한다. 또한 feature map FF의 spatial dimension에 대해 평균을 내어 channel별 mean μc\mu_c와 standard deviation σc\sigma_c를 계산한다. 모든 channel에 대한 mean과 standard deviation을 concatenate하면 다음과 같은 128-D style vector를 얻는다.

s(bclip)=[μ1,,μC,σ1,,σC]R2C.s(b_{clip}) = [\mu_1, \ldots, \mu_C, \sigma_1, \ldots, \sigma_C] \in \mathbb{R}^{2C}.

집합 Bclip,mB_{\langle clip,m\rangle}에 포함된 각 retrieval candidate bclipb_{clip}에 대해, 원본 이미지 binitb_{init}의 style feature와 candidate의 style feature 사이의 L2 norm을 style distance로 계산한다.

d=s(binit)s(bclip)2.d = |s(b_{init}) - s(b_{clip})|_2.

여기서 각 ddBclip,mB_{\langle clip,m\rangle}에 포함된 하나의 candidate에 대응하며, 이 distance를 사용하여 style 측면에서 가장 유사한 background를 ranking하고 선택한다. 그런 다음 CLIP으로 검색된 mm개의 candidate를 style distance에 기반하여 다시 ranking하고, style이 가장 유사한 상위 nn개의 이미지를 유지한다. 이렇게 선택된 이미지들의 최종 집합을 Bre,nB_{\langle re,n\rangle}라고 표기한다. Bre,nB_{\langle re,n\rangle}에 의해 index된 이미지들은 이후 background generation stage에서 style-matched reference로 사용된다.

ⓑ Domain-Guided Background Generation
검색된 이미지를 충분히 활용하면서도 generation process를 training-free로 유지하기 위해, 본 논문은 Flux-Redux model을 사용하여 각 이미지를 prompt embedding으로 encode한다. Domain-aware retrieval 결과 Bre,nB_{\langle re,n\rangle}가 주어졌을 때, redux()redux(\cdot)는 FLUX-Redux encoder를 의미하고, FLUX()FLUX(\cdot)는 FLUX generator를 의미한다고 하자. 각 support image에 대해, clean background embedding Fbg=redux(binit)F_{bg} = redux(b_{init})를 추출하고, top retrieved image breBre,nb_{re} \in B_{\langle re,n\rangle}의 embedding을 Fre=redux(bre)F_{re} = redux(b_{re})로 추출한다. 그런 다음 이 둘을 Fdom=λ1Fbg+λ2FreF_{dom} = \lambda_1 F_{bg} + \lambda_2 F_{re}와 같이 fusion한다. 여기서 λ1\lambda_1λ2\lambda_2는 hyperparameter이다.

마지막으로, FLUX generator는 domain embedding FdomF_{dom}에 generative function FLUXFLUX를 적용하여 1024×10241024 \times 1024 해상도의 다양한 background image를 생성한다. 즉, bdom=FLUX(Fdom)b_{dom} = FLUX(F_{dom})이다. 본 논문은 이 과정을 nn번 sampling하여 다양한 이미지 집합 b(1),b(2),,b(n){b^{(1)}, b^{(2)}, \ldots, b^{(n)}}을 생성한다.

ⓒ Foreground-Background Composition
이전 단계에서 생성된 다양한 background를 바탕으로, 본 논문은 foreground pixel을 보존하고 target-domain distribution을 유지하면서 새로운 background를 원본 이미지에 자연스럽게 통합하는 것을 목표로 한다. 이를 위해 outpainting에 Flux-Fill을 사용한다. 구체적으로, 각 support image xx에 대해 binary mask M0,1H×WM \in {0, 1}^{H \times W}를 구성한다. 이 mask는 ground-truth bounding box bbox(x)bbox(x)를 기반으로 다음과 같이 계산된다.

M(p)={0,if pbbox(x), 1,otherwise.for each pΩx.M(p) = \begin{cases} 0, & \text{if } p \in bbox(x), \ 1, & \text{otherwise}. \end{cases} \quad \text{for each } p \in \Omega_x.

여기서 Ωx\Omega_x는 image xx의 spatial domain을 의미하고, pp는 pixel location을 나타낸다. 이후 Fgen=redux(bdom)F_{gen} = redux(b_{dom})를 통해 prompt embedding FgenF_{gen}을 추출하고, x,M,Fgen{x, M, F_{gen}}을 Flux-Fill에 입력한다. Foreground detail을 보존하기 위해, Flux-Fill은 VAE를 사용하여 input xx를 encode하고, encode된 latent feature를 initial noise와 blending한다. 그러나 VAE 기반 downsampling으로 인해 작은 객체와 같은 fine-grained structure를 유지하는 데 어려움이 있다. 이 문제를 완화하기 위해, generation 이전에 각 image에 대한 up-sampling method sups_{up}을 다음과 같이 정의한다.

sup(x)={0,if width(x)>1024 and height(x)>1024, 1,otherwise.s_{up}(x) = \begin{cases}0, & \text{if } width(x) > 1024 \text{ and } height(x) > 1024, \ 1, & \text{otherwise}. \end{cases}

Generation 이후에는 이에 대응하는 down-sampling method sdowns_{down}을 다음과 같이 정의한다.

sdown(x)={0,if sup(x)=0, 1,otherwise.s_{down}(x) = \begin{cases} 0, & \text{if } s_{up}(x) = 0, \ 1, & \text{otherwise}. \end{cases}

그 다음 모델은 masked region만 다시 그리며, foreground object의 appearance와 position은 그대로 유지한 채 bdomb_{dom}의 style을 반영한다. Domain-RAG의 최종 output은 x+x^+로 표기되며, 다음과 같이 주어진다.

x+=sdown(Flux-Fill(sup(x),sup(M),Fgen)).x^+ = s_{down}(\text{Flux-Fill}(s_{up}(x), s_{up}(M), F_{gen})).

이로써 foreground-background composition이 완료되며, domain-aligned background를 가지면서 foreground object는 변하지 않은 augmented support image가 생성된다.

ⓓ Applying Domain-RAG to CD-FSOD
원칙적으로, 본 논문에서 제안하는 Domain-RAG framework는 cross-domain scenario에서 성능을 향상시키기 위해 기존의 어떤 detector에도 자연스럽게 통합될 수 있다. Domain-RAG는 training-free, plug-and-play data augmentation module이므로 detection architecture나 training pipeline을 수정할 필요가 없다. Augmented support image가 생성되면, 모델은 원본 support set SS와 생성된 sample을 결합한 데이터로 fine-tuning된다. Inference 시점에는 Domain-RAG가 사용되지 않으며, detector는 원본 query set QQ에서 직접 평가된다.

Conclusion
본 논문에서는 기존 FSOD보다 더 현실적이지만 훨씬 더 어려운 시나리오인, 도메인을 넘나드는 few-shot object detection (FSOD)을 연구하였다. 본 논문은 세 가지 대표적인 task에 초점을 맞춘다: cross-domain FSOD (CD-FSOD), remote sensing FSOD (RS-FSOD), 그리고 camouflaged FSOD. 이러한 설정에서 성능을 향상시키기 위해, 본 논문은 domain-aligned 및 detection-friendly sample을 생성하도록 설계된 training-free compositional image generation framework인 Domain-RAG를 제안한다. Textual prompt에만 의존하는 기존 text-to-image generation 접근법과 달리, Domain-RAG는 semantic 및 style 측면에서 유사한 이미지를 structured prior로 검색하여 generation process를 유도한다. 저자들이 아는 한, 이는 cross-domain object detection에 retrieval-augmented generation을 적용한 첫 번째 사례이며, 특히 low-shot scenario에 적합한 training-free 방식이라는 점에서 의미가 있다. Domain-RAG는 세 가지 task 전반에서 새로운 state-of-the-art 결과를 달성하였으며, 이를 통해 일반화 능력을 입증하고 training-free data synthesis의 새로운 방향을 제시한다.

profile
김준형

0개의 댓글