OMGM:Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval 논문 리뷰

김준형·2026년 8월 10일

딥러닝 논문 리뷰

목록 보기
33/33

Abstract
비전-언어 RAG(Retrieval-Augmented Generation)은 이미지에 제시된 시각적 내용을 넘어서는 외부 지식을 요구하는 Knowledge-Based Visual Question Answering (KB-VQA) 문제를 해결하기 위한 효과적인 접근법으로 자리 잡았다. 비전-언어 RAG 시스템의 효과는 multimodal retrieval에 크게 의존하지만, 질의와 지식 베이스 모두에 다양한 modality와 지식의 세분성이 존재하기 때문에 멀티모달 검색은 본질적으로 어려운 문제이다. 기존 방법들은 이러한 요소들 사이의 상호작용이 지닌 잠재력을 충분히 활용하지 못했다.

본 연구에서는 여러 세분성과 모달리티를 조화롭게 활용하여 검색 효과를 향상시키는 coarse-to-fine multi-step retrieval 기반의 멀티모달 RAG 시스템을 제안한다. 제안 시스템은 먼저 cross-modal retrieval을 위해 지식의 세분성을 정렬하는 광범위한 초기 검색을 수행하고, 이후 세밀한 멀티모달 정보를 포착하여 상위 엔티티를 선택하기 위한 multimodal fusion reranking을 수행한다. 마지막으로 text reranker를 사용하여 가장 관련성이 높은 세부 섹션을 필터링하고, 이를 증강 생성에 활용한다.

InfoSeek와 Encyclopedic-VQA 벤치마크에 대한 광범위한 실험 결과, 제안 방법은 state-of-the-art의 검색 성능과 매우 경쟁력 있는 질의응답 성능을 달성하였으며, 이는 KB-VQA 시스템을 발전시키는 데 있어 본 방법의 효과성을 보여준다.

Introduction
Visual Question Answering (VQA)은 주어진 query image의 semantic content를 종합적으로 이해하여 질문에 답하는 task로, visual understanding과 textual understanding 모두에 대한 능력을 요구한다. Large Language Models (LLMs)는 text-based task에서 뛰어난 generalization 및 reasoning capability를 보여주었다. Visual encoder를 LLM과 통합함으로써, Multimodal Large Language Models (MLLMs)는 image와 text representation을 함께 modeling하여 향상된 comprehension과 reasoning을 수행할 수 있기 때문에 VQA task를 처리하는 효과적인 접근법으로 부상하였다.

Knowledge-Based Visual Question Answering (KB-VQA)은 image에 보이는 content를 넘어서는 external world knowledge를 통합해야 한다는 점에서 이러한 challenge를 확장한다. KB-VQA에서 question은 image의 subject matter와 관련된 정보를 묻도록 설계되지만, 그 답을 얻기 위해서는 image 자체에 직접적으로 존재하지 않는 information이 필요하다.

Retrieval-Augmented Generation (RAG)은 knowledge base에서 query-relevant knowledge를 retrieve하고 이를 response generation을 위한 contextual information으로 통합함으로써 KB-VQA의 challenge를 해결하기 위한 cost-effective하고 efficient한 solution을 제공한다. 이러한 접근법의 effectiveness는 large-scale heterogeneous knowledge base에서 가장 relevant한 information을 식별할 수 있는 efficient retrieval mechanism에 달려 있다. 그러나 KB-VQA에서의 multimodal retrieval은 대부분의 RAG system에서 사용되는 standard text-based retrieval보다 더 복잡하다. 이러한 complexity는 다음의 두 가지 핵심 요인에서 비롯된다.

① Multiple Modalities
Query와 knowledge base 모두 image와 text와 같은 multiple modalities로 구성되므로, single-modal, cross-modal, 또는 multi-modal approach를 포함할 수 있는 다양한 relevance assessment strategy가 필요하다. Retrieval schema의 선택은 retrieval model의 capability와 특정 task의 requirement에 의해 결정된다.

② Hybrid Granularities
Query와 knowledge base는 종종 서로 다른 level의 granularity를 갖는 information을 포함한다. 예를 들어, 하나의 query는 특정 subject를 식별하는 coarse-grained knowledge를 포함한 query image와, 해당 subject에 대한 fine-grained detail을 묻는 question으로 구성될 수 있다. 마찬가지로 knowledge base는 coarse-grained overview를 제공하는 reference image와 title을 포함한 article뿐만 아니라, in-depth information을 담고 있는 fine-grained detailed section으로 구성될 수 있다.

최근 연구에서는 retrieval effectiveness를 향상시키고 궁극적으로 answer generation을 개선하기 위해 single-step 및 multi-step multimodal retrieval strategy를 모두 탐구해왔다. Single-step approach는 multimodal query를 사용하여 passage를 직접 retrieve한다. 이러한 방법들은 효과적이지만, 종종 비용이 큰 task-specific pretraining을 필요로 하며 exhaustive full-range search로 인해 inference 과정에서 높은 computational cost가 발생한다.

반면 multi-step retrieval method는 search space를 점진적으로 좁혀가는 hierarchical retrieval strategy를 사용하여 search efficiency를 향상시킨다. 이러한 방법들은 각 step에서 서로 다른 retrieval modality를 사용하는 경우가 많으며, 이를 통해 여러 관점에서 knowledge relevance를 평가할 수 있다. 그럼에도 multi-step retrieval의 potential은 아직 충분히 탐구되지 않았다. 현재의 approach는 retrieval modality, granularity, 그리고 retrieval step의 sequencing 사이에 존재하는 복잡한 interplay를 자주 간과하며, 이는 overall effectiveness와 adaptability를 제한한다.

우리는 query와 knowledge base 전반에 걸쳐 Multiple Granularities and Modalities를 효과적으로 Orchestrate함으로써 multimodal retrieval을 향상시키는 coarse-to-fine, multi-step retrieval strategy 기반의 multimodal RAG system인 OMGM을 제안한다.

제안 system은 세 단계로 동작한다. 먼저 coarse-grained cross-modal retrieval을 수행하여 초기 entity article candidate pool을 식별한다. 이어서 coarse-grained knowledge와 fine-grained knowledge를 모두 활용하는 hybrid-grained multimodal reranker를 통해 candidate를 rerank하고 가장 relevant한 entity를 선택한다. 마지막으로 fine-grained text reranker가 선택된 entity의 section들을 filtering하여 augmented response generation에 사용할 가장 relevant한 section을 추출한다.

전체 과정에서 query와 candidate는 각자의 granularity를 기반으로 alignment되며, 효과적인 multimodal representation을 보장하기 위해 embedding model이 신중하게 선택된다. 더 중요한 점은 이러한 retrieval step들이 sequential하게 상호작용한다는 것이다. Earlier stage에서 얻은 similarity score가 이후 stage로 propagation되고 subsequent step에서 fusion됨으로써 cohesive하고 context-aware한 retrieval process를 가능하게 한다.

우리는 두 개의 KB-VQA dataset에서 광범위한 retrieval 및 VQA experiment를 수행하였으며, 제안 방법은 기존 multi-step retrieval method들과 비교하여 state-of-the-art retrieval performance와 competitive question-answering result를 달성하였다.

요약하면, 본 연구의 주요 contribution은 다음과 같다.

① 우리는 multimodal retrieval이 KB-VQA의 특성, 특히 data modality와 knowledge granularity에 맞게 설계되어야 한다고 제안한다. 이를 위해 서로 다른 modality와 granularity를 갖는 retrieval step을 활용하여 retrieval quality를 점진적으로 향상시키는 coarse-to-fine multi-step retrieval strategy를 제시한다.

② Full-modal information의 활용을 최대화하는 동시에 reranking scope를 제한하여 inference cost를 최소화함으로써 effectiveness와 efficiency를 모두 확보할 수 있는 trainable multimodal reranker를 제안한다.

③ InfoSeek와 Encyclopedic-VQA (E-VQA) benchmark에서 광범위한 experiment를 수행하여 제안 방법의 effectiveness를 입증하였다. 또한 comprehensive ablation study를 통해 각 retrieval step의 contribution을 검증하였으며, KB-VQA task를 위한 multimodal retrieval system을 설계하는 데 유용한 insight를 제공한다.

Related Work

ⓐ KB-VQA
Traditional VQA task는 주로 image 내의 visual content에 초점을 맞추어 관련 textual question에 답한다. 그러나 KB-VQA는 image만으로는 답할 수 없는 question을 해결하기 위해 external knowledge base를 활용한다. OK-VQA와 A-OKVQA와 같은 dataset은 outside knowledge를 필요로 하는 visual question answering을 다루며, 여기서 사용되는 knowledge는 주로 뚜렷한 특수성이 부족한 general commonsense knowledge로 구성된다.

E-VQA와 InfoSeek dataset의 등장은 다양한 granularity의 encyclopedic knowledge와 광범위한 multimodal information을 포함함으로써 end-to-end LLM/MLLM에 더 큰 challenge를 제시한다. 이러한 KB-VQA task의 특성에 대응하여, 본 연구에서는 multi-step, granularity-aligned retrieval framework를 사용하며, 이를 통해 기존 multimodal RAG system과 비교하여 향상된 retrieval 및 VQA performance를 달성한다.

ⓑ Vision-language RAG
Retrieval-Augmented Generation (RAG)은 input query와 관련된 external document를 retrieve하고, 이를 prompt의 guiding context로 사용함으로써 LLM의 generation performance를 향상시킨다. Text augmentation뿐만 아니라, 최근 연구는 복잡한 real-world scenario에 보다 밀접하게 연관된 vision-language task를 위해 generation enhancement를 수행하는 데 초점을 맞추고 있다.

Vision-language retrieval-augmented generation은 일반적으로 multimodal document와 query를 처리해야 하며, 따라서 이러한 modality들 사이에서 retrieval을 수행해야 한다. 예를 들어, PreFLMR와 MuKA에서 제안된 approach는 다양한 modality와 dimension에 걸쳐 feature를 encoding하고, query와 candidate의 retrieval matrix를 각각 concatenate함으로써 fine-grained knowledge search를 가능하게 한다.

Wiki-LLaVA와 EchoSight는 hierarchical retrieval strategy를 사용하여 효율적인 cross-step multimodal retrieval을 수행한다. LLM-RA와 RoRA-VLM은 각각 LLM-based approach와 similarity-based approach를 이용해 query와 knowledge에 대해 fine-grained denoising을 수행하며, 이를 통해 retrieval과 question answering의 accuracy를 향상시킨다.

또한 mR2AG와 ReflectiVA는 reflective processing을 강조한다. Large model을 fine-tuning함으로써 token output을 활용해 retrieval process를 유도하고, 이후 retrieved content와 generated answer 모두에 대해 relevance-based re-screening 및 modification을 수행한다.

기존 방법들과 달리, 본 연구의 system은 granularity alignment와 cross-step joint retrieval을 통합한 multi-step retrieval process를 구성한다. 각 step에서는 summary extraction, multimodal fusion, question-based section denoising과 같은 technique을 사용하여 query와 corpus를 alignment한 뒤, similarity fusion을 통해 결과를 결합한다. 이를 통해 recall을 향상시키고 downstream MLLM/LLM의 KB-VQA performance를 개선한다.

Methodology
KB-VQA의 challenge를 해결하기 위해, 우리는 efficient한 coarse-to-fine, multi-step multimodal retrieval을 특징으로 하는 multimodal RAG system을 제안한다. 이 system은 수백만 개의 entry를 포함하는 대규모 multimodal knowledge base로부터 query와 관련된 information을 추출할 수 있으며, retrieved data는 이후 generator의 response를 향상시키는 데 사용된다. 제안 framework의 전체 구조는 다음의 세 가지 핵심 component로 구성된다.

① coarse-grained cross-modal entity searching
② hybrid-grained multimodal-fused reranking
③ fine-grained section-augmented generation

ⓐ Coarse-Grained Cross-Modal Entity Searching
Large corpus로부터 query와 관련된 wiki entity information을 우선적으로 filtering하기 위해, 우리는 coarse-grained entity retrieval method를 설계한다. 이 step에서는 하나의 subject를 나타내는 query image가 coarse-grained query의 역할을 하고, entity summary가 coarse-grained candidate의 역할을 함으로써 적절한 information granularity alignment를 보장한다.

① Summary Generation
Complete wiki entity article은 effective retrieval indexing을 위한 entity information으로 사용하기에는 지나치게 redundant하기 때문에, 우리는 이를 query image가 나타내는 macro-level entity information과 align한다.

구체적으로 wiki entity의 retrieval index로 article summary를 사용한다. 이러한 concise abstract는 entity information의 핵심적인 측면을 밀도 있게 담고 있다. Real-time retrieval efficiency를 유지하기 위해 knowledge base에 존재하는 모든 entity article의 summary를 offline으로 생성한다.

Entity article aia_i가 주어졌을 때, pre-trained language model MsM_s와 instruction prompt template PP를 사용하여 summary sis_i를 생성한다. 이를 통해 summary가 informative하면서 retrieval task와 잘 aligned되도록 한다.

si=Ms(P,ai)s_i = M_s(P, a_i)

② Image-to-Summary Entity Searching
Wiki entity summary를 얻은 후, target entity를 고유하게 나타내는 VQA triplet의 query image를 entity searching을 위한 query object로 사용한다.

구체적으로 query image와 candidate entity summary를 각각 feature vector로 변환하고, 이 feature vector들을 similarity-based matching에 사용하여 entity searching을 수행한다.

Entk=F(Ev(Iq),Et(S),k)Ent_k = F(E_v(I_q), E_t(S), k)

여기서 IqI_q는 query image를 나타내며, S=s1,s2,,snS = s_1, s_2, \ldots, s_n은 knowledge base에 존재하는 모든 entity summary를 의미한다.

이들은 각각 CLIP의 visual encoder EvE_v와 textual encoder EtE_t를 통해 encoding된다. Faiss library FF를 사용하여 entity summary의 feature vector를 indexing하고, inner product를 기반으로 embedding matching을 수행한다.

마지막으로 가장 relevant한 top-kk entity summary와 이에 대응하는 entity information EntkEnt_k를 유지한다.

ⓑ Hybrid-Grained Multimodal-Fused Reranking
Initial search 이후, query subject와 가장 유사한 top-kk entity candidate를 얻는다. 이 candidate set 내에서 query와 candidate knowledge가 제공하는 coarse-grained image와 fine-grained text로부터 hybrid-grained multimodal fusion feature matrix를 추출한다. 이후 late-interaction mechanism을 사용하여 fine-grained section similarity를 얻는다.

그리고 이전 step에서 얻은 entity similarity를 통합함으로써 coarse-grained reranking similarity를 계산하고, 이를 통해 relevant entity를 더욱 정확하게 ordering한다.

① Multimodal Fusion Feature Matching
구체적으로 query와 candidate 모두에서 multimodal fusion feature를 추출하기 위해 Q-Former architecture를 사용한다. Fusion feature extraction의 pipeline은 다음과 같다.

Q=Em(q),Cesech=Em(deh)Q = E_m(q), \qquad C_e^{sec_h} = E_m(d_e^h)

Q-Former multimodal encoder EmE_m의 input으로, query side에서는 query image IqI_q와 textual question TqT_q를 사용하여 input pair q=(Iq,Tq)q = (I_q, T_q)를 구성한다.

Candidate side에서는 input을 deh=(Ie,seceh)d_e^h = (I_e, sec_e^h)로 구성한다. 여기서 IeI_e는 entity의 main image이고, secehsec_e^h는 entity article ae={sece1,sece2,,secep}a_e = \{sec_e^1, sec_e^2, \ldots, sec_e^p\}hh-th section이다.

Fusion feature matrix QQCesechC_e^{sec_h}는 encoder EmE_m의 query token에 대응하는 output vector이다.

Query qq와 candidate dehd_e^h 사이의 fine-grained multimodal similarity simmsecehsim_m^{sec_e^h}는 late-interaction을 사용하여 계산한다. Late-interaction은 feature matrix 내의 각 token vector 사이의 correlation을 충분히 활용하고, 이를 Max-Sum operation을 통해 하나의 similarity score로 통합한다.

lQl_QlCl_C는 각각 QQCesechC_e^{sec_h}에 포함된 전체 token의 수를 나타낸다.

simmseceh=simm(q,deh)=i=1lQmaxj=1lCQi(Csecehj)sim_m^{sec_e^h} = sim_m(q,d_e^h) = \sum_{i=1}^{l_Q} \max_{j=1}^{l_C} Q_i \left(C_{sec_e^h}^{j}\right)^{\top}

마지막으로 entity article aea_e에 존재하는 모든 section의 simmsim_m 중 maximum을 취하여 coarse-grained entity similarity를 얻는다. 이때 article의 section 수는 lael_{a_e}이다.

이후 이전 cross-modal retrieval step에서 얻은 initial entity similarity simcesim_c^e와 weighted summation을 수행하여 top-kk entities EntkEnt_k의 final reranking similarity score를 계산한다.

가장 높은 reranking score를 가지는 entity etop1e_{top1}이 가장 relevant한 entity로 선택된다.

etop1=argmaxeEntk(αsimce+(1α)maxh=1laesimmseceh)(5)e_{top1} = \underset{e \in Ent_k}{\arg\max} \left( \alpha \cdot sim_c^e + (1-\alpha) \cdot \max_{h=1}^{l_{a_e}} sim_m^{sec_e^h} \right) \tag{5}

Weighting factor α\alpha는 두 similarity measure의 contribution을 balance하여 reranking performance를 optimize한다.

② Multimodal Reranker Training
Multimodal fusion encoder를 training하기 위해, 이전 retrieval step에서 얻은 hard negative sample을 활용한 contrastive learning을 사용한다.

구체적으로 앞선 step의 coarse-grained retrieval은 각 training sample에 대해 top-kk candidate entity set을 생성한다. 이러한 entity의 대부분은 유사한 coarse-grained characteristic을 공유하지만, fine-grained detail에서는 차이를 가진다.

Training pair를 구성하기 위해 candidate entity의 main image와 해당 article의 non-evidentiary section을 pairing하여 negative pair를 random하게 선택한다. 반면 positive pair는 correct entity의 main image와 evidence section으로 구성된다.

L=logexp(simm(q,d+)/T)j=1Nexp(simm(q,dj)/T)L = -\log \frac{ \exp(sim_m(q,d^+)/T) }{ \sum_{j=1}^{N} \exp(sim_m(q,d_j)/T) }

각 training sample이 NN개의 contrastive pair dd를 포함하도록 구성하고, hybrid-grained multimodal information을 기반으로 query와 positive candidate pair d+d^+를 matching하도록 reranker를 training한다. Adaptive temperature TT는 softmax distribution의 smoothness를 조절한다.

이 multimodal-fused retrieval approach는 step 1의 coarse-grained entity retrieval을 보완할 뿐만 아니라, 이후 수행되는 fine-grained refinement를 위한 기반을 마련한다.

ⓒ Fine-Grained Section-Augmented Generation
앞선 두 step의 entity ranking을 완료한 후, query와 가장 relevant한 entity로 etop1e_{top1}을 식별한다.

이 step에서는 entity information에 대해 fine-grained knowledge filtering을 수행하고, filtering된 knowledge를 auxiliary context로 사용하여 downstream generator의 generation을 향상시킨다.

구체적으로 pre-trained textual reranker RtR_t를 사용하여 entity article의 section과 question 사이의 textual similarity simtsec=Rt(Tq,sec)sim_t^{sec} = R_t(T_q, sec)를 계산한다.

이러한 textual similarity를 이전 step에서 얻은 fine-grained multimodal-fused similarity simmsecsim_m^{sec}와 weighted summation을 통해 결합한다. 이를 통해 query에 가장 relevant한 entity section secetop1bestsec_{e_{top1}}^{best}를 추출한다.

secetop1best=argmaxsecetop1(βsimmsec+(1β)simtsec)sec_{e_{top1}}^{best} = \underset{sec \in e_{top1}}{\arg\max} \left( \beta \cdot sim_m^{sec} + (1-\beta)\cdot sim_t^{sec} \right)

여기서 β\beta는 서로 다른 retrieval step에서 얻어진 similarity에 weight를 부여하기 위한 balancing factor이다.

마지막으로 가장 relevant한 section을 query와 함께 input context로 generator에 제공하여 question-answering을 수행한다.

Experiments

ⓐ Datasets
우리는 training과 testing을 위해 두 개의 challenging KB-VQA dataset인 InfoSeek와 E-VQA를 사용한다. Retrieval과 VQA evaluation 모두에서 fair한 comparison을 보장하기 위해, 많은 previous work에서 사용한 것과 동일한 setup을 채택하며, 구체적인 configuration은 다음과 같다.

Knowledge base의 entity article과 연관된 image의 경우, 각 entity에 해당하는 Wikipedia page에서 main image를 포함한 multiple image를 crawl하여 knowledge base의 image set을 구성하였다.

실험은 주로 retrieval performance와 question-answering performance를 모두 평가하는 데 초점을 둔다. Retrieval은 Recall@K를 사용하여 평가하고, VQA performance는 각 dataset의 official metric을 사용하여 평가한다. 예를 들어 E-VQA에서는 BEM score를 사용하며, InfoSeek에서는 VQA accuracy와 relaxed accuracy를 사용한다.

ⓑ Implementation Details
이 section에서는 framework의 각 step에 대한 implementation detail을 간략히 설명한다.

① Initial Entity Searching
High-quality entity article summary를 생성하기 위해 LangGPT를 활용하여 "Wiki Summary Generator Assistant" prompt를 개발하였다.

FAISS library를 이용한 efficient entity search를 위해 encoder의 last layer에서 얻은 pooled embedding을 사용하여 image-text similarity를 계산하였다.

kk는 20으로 설정하여 가장 relevant한 top-20 entity만 retrieve하였다. 이는 subsequent retrieval과 question-answering task의 speed와 effectiveness 사이의 balance를 맞추기 위한 것으로, experiment를 통해 검증하였다.

② Multimodal-Fused Encoder Training and Inference
Encoder model은 LAVIS Library를 사용하여 pre-trained Q-Former weight로 initialize한다.

Model output 중 정의된 query token의 position과 number에 해당하는 top-32 embedding을 선택하여 multimodal fusion feature matrix로 사용한다.

InfoSeek training sample에는 evidence section에 대한 label이 포함되어 있지 않기 때문에, encoder는 E-VQA training set에서 training한 뒤 두 dataset 모두에서 test한다. 이러한 setting은 dataset의 training requirement와 characteristic에 부합하는 동시에 model의 generalization ability도 평가할 수 있게 한다.

또한 training sample의 각 question-answer pair에는 multiple query image가 대응하기 때문에, 실제 training sample을 구성할 때는 첫 번째 query image만 사용하여 question-answer pair와 함께 triplet을 구성한다. 이러한 strategy는 training quality를 유지하면서 efficiency를 향상시킨다.

③ Generator Training and Inference
Ablation study와 대부분의 main experiment에서는 주로 pre-trained LLM/MLLM model을 사용한다. 또한 제안 retrieval system 아래에서 fine-tuning된 generator의 performance를 평가하기 위해 LLaVA-1.5-7B에 lightweight하고 efficient한 fine-tuning을 수행하고 VQA performance를 평가한다.

ⓒ Main Results

제안 method와 다른 work를 비교한 결과는 Table 2와 Table 3에 제시되어 있으며, 주로 entity retrieval과 VQA performance를 평가한다.

① Retrieval Result

두 dataset에서 여러 multimodal RAG approach의 retrieval performance를 보여준다. "CLIP I-T"는 CLIP을 이용한 naive approach를 의미하며, embedding을 이용해 query image와 wiki article 사이의 cross-modal similarity search를 수행한다.

Recall@1 result를 살펴보면, reranking을 적용한 제안 method가 다른 method들을 크게 outperform하며, 이는 제안 retrieval method의 강력한 retrieval capability를 보여준다.

또한 step 2의 reranking을 적용하면 step 1만 사용했을 때와 비교하여 Recall@1이 E-VQA에서 23.7%p, InfoSeek에서 11.4%p 향상된다. 이는 multimodal retrieval과 cross-step similarity propagation이 reranking performance를 향상시키는 데 효과적임을 보여준다.

더 나아가 reranking을 사용하지 않은 경우에도 제안 method는 모든 retrieval range에서 다른 work에서 일반적으로 사용되는 full-scale retrieval strategy를 outperform한다. 이는 step 1에서 summary와 query image 사이의 granularity alignment가 제공하는 significant advantage를 보여준다.

② VQA Result

제안 method의 VQA result를 state-of-the-art method들과 비교한다.

RoRA-VLM은 token-level embedding similarity를 기반으로 irrelevant information을 제거하고, noise-resilient retrieval-augmented training을 사용하는 retrieval-augmented VLM system이다.

mR2AG와 ReflectiVA는 reflection을 중심으로 설계된다. Large model을 fine-tuning하여 token output을 통해 retrieval process를 제어하고, retrieved content와 generated answer 모두에 대해 re-screening 및 modification을 수행한다.

제안 method는 두 dataset 모두에서 기존 approach보다 우수한 VQA result를 달성하며, 이는 retrieval capability의 향상이 downstream model의 generation performance를 개선한다는 것을 보여준다.

특히 retriever만 fine-tuning한 제안 method가 downstream generator를 fine-tuning하는 대부분의 approach를 outperform하며, 이는 method의 efficiency를 보여준다.

또한 두 dataset에서 mainstream LLM과 MLLM을 zero-shot setting 및 제안 framework와 함께 평가하였다. 제안 method는 MLLM과 LLM 모두에서 우수한 VQA result를 보여주며, retrieval optimization이 서로 다른 종류의 downstream generator에서도 generation을 향상시킬 수 있음을 보여준다.

Conclusion
본 논문에서는 multi-step multimodal retrieval을 사용하는 RAG system을 제안한다. 각 step에서 적절한 modality의 query와 candidate를 사용함으로써, 더 나은 retrieval을 위해 information granularity를 align한다.

제안 system은 cross-step similarity propagation을 활용하여 retrieval step 간 interaction을 강화하고, multimodal-fused design을 통해 query와 candidate에 포함된 풍부한 multimodal information을 충분히 활용한다.

Mainstream KB-VQA dataset에서의 experimental result는 제안 approach가 기존 method보다 높은 retrieval performance를 달성한다는 것을 보여준다.

또한 comprehensive retrieval pipeline을 통해 pre-trained model과 lightly fine-tuned model이 extensive fine-tuning에 크게 의존하는 system보다 더 높은 performance를 달성할 수 있음을 확인하였다. Ablation study를 통해 이러한 design의 rationality와 effectiveness 역시 검증하였다.

이러한 findings는 KB-VQA task에 적합한 effective multimodal retrieval system을 설계하는 데 유용한 insight를 제공한다.

profile
김준형

0개의 댓글