원제: A-RAG: Scaling Agentic Retrieval-Augmented Generation via
Hierarchical Retrieval Interfaces
1. Introduction
기존의 RAG
- 알고리즘을 설계하여 여러 문서를 한 번에 검색하고 이를 모델 입력에 결합하는 방식
- 사전에 정의된 workflow를 바탕으로 모델이 여러 단계에 걸쳐서 수행하도록 유도하는 방식
A-RAG
- corpus 내의 정보가 본질적으로 서로 다른 수준의 단위로 구성되어 있음
- 에어전트가 다양한 수준의 정보에 접근할 수 있도록 검색 도구 집합 설계
Basic RAG
- retrieval이 모델이 외부 지식을 활용해 질문에 더 정확하게 답하도록 도와줌
- query rewriting, adaptive routing strategy, retrieval quality evaluation, reranking
Graph RAG
- Corpus로부터 entity-relation graph를 구성
- 대규모 지식 기반을 전체적으로 이해할 수 있도록 도움
- 실제 예시
- RAPTOR: 재귀적 요약 + 계층적 트리 구조
- LightRAG: 지식 그래프 + vector retrieval
- HippoRAG: 해마의 기억 인덱싱 방식 모방
- 한계
- 사전에 정의된 검색 알고리즘에 의존
- 초기 검색 결과가 충분하지 않은 경우 추론 바탕의 추가 정보 수집이 불가능함
Workflow RAG
- RAG + Agent: 사전에 정의된 agent workflow에 의존함
- Non-learning
- FLARE: 생성 신뢰도가 낮아질 떄 retrieval을 수행
- IRCoT: CoT와 retrieval을 교차 수행
- RA-ISF: self-feedback을 통해 복잡한 query를 분해
- MA-RAG: 전문화된 에이전트들이 협력적으로 CoT 수행
- RAGentA: 하이브리드 검색 + 인용 추적
- Learning
- 작은 모델도 효과적인 검색 전략 학습 가능
- 설계 시점의 워크플로우가 고정 -> 작업의 특성에 따라 전략을 바꾸는것이 불가능함
3. Methodology
3.1 Hierarchical Index Construction
- corpus 정보를 서로 다른 추상화 수준에서 조직
chunking
- LinearRAG의 설정에 따라 corpus를 100 token 크기의 청크로 분할
(영단어 기준 700~800단어)
- semantic 일관성: 청크의 경계와 문장 경계가 일치하도록 설정
- 청크별로 독립적인 의미 단위로 작동
Emedding
- 각 청크 ci를 문장 단위로 분해: {si,1,si,2,⋯,si,ni}
- 사전 학습된 sentence encoder femb로 dense vector 계산
- vi,j=femb(si,j)
- semantic 기반 매칭을 가능하게 함 + 문장이 속한 원래 청크와의 연결 유지
Keyword-Level
- 사전 인덱스 없음
- 오프라인: inverted index, knowledge graph 구축
- 질의 시점: 텍스트 매칭을 수행
3.2 Hierarchical Retrieval Interfaces
keyword Search
Semantic Search
- dense search를 통해 의미적으로 유사한 문장을 찾아냄
- query q에 대해 임베딩: vq=femb(q)
- 모든 문장 임베딩과 코사인 유사도 계산: Scoreemb(Si,j,q)=∣∣vi,j∣∣∣∣vq∣∣vi,jTvq
- 상위 점수를 가진 문장들을 선택하고 이를 해당 문장이 속한 청크 단위로 묶음
- 상위 k개의 청크 ID와 청크에서 매칭된 문장들을 snippet으로 반환
- 관련성 점수는 가장 높은 점수를 가진 문장에 의해 결정
Chunk Read
- keyword search와 semantic search에서 반환된 snippet기반, 에이전트가 어떤 청크를 전체적으로 읽어야 하는지를 판단하도록 함
- 에이전트: 선택한 청크의 전체 내용 확인, 필요에 따라 인접한 청크를 함께 읽음
- 에이전트가 자신의 판단에 따라 다른 수준에서 코퍼스 정보에 접근할 수 있도록 함
3.3 Agent Loop
Agent Loop
- ReAct와 유사한 프레임워크: 추론과 도구 호출을 번갈아 수행
- 반복마다 하나의 도구를 선택하여 호출 → 결과를 관찰한 뒤 다음 행동 결정
- 기타 복잡한 설계를 제외: 서로 다른 인터페이스 구성이 에이전트의 행동에 미치는 영향 관찰
- 최대 반복 횟수: 지금까지 수집한 정보를 바탕으로 최종 답변을 생성하도록 유도
Context Tracker
- 이미 읽은 청크를 기록: 중복된 정보 검색 + 불필요한 토큰 사용 방지
- Cread={ci1,ci2,⋯,cik}
- 이미 읽은 청크를 다시 읽으려고 할 경우 읽은 적 있다는 알림 메시지 반환
4. Experiments

- 평가 지표
- LLM-Acc: 의미적으로 정답인가(LLM 기반 평가)
- Contain-Acc: 정답이 텍스트에 포함되는가
- A-RAG
- Naive: embedding 하나만 적용
- Full: hierarchical tools
- 결과
- 대부분 벤치마크에서 최고 성능
- GPT-5-mini에서 더 크게 향상
Ablation Study

5. Analysis and Discussion
Test-Time Scaling

- step 수가 증가하면 성능이 일관되게 증가함
- reasoning effor(한번에 사용하는 추론 연산량)가 증가하면 성능이 일관되게 증가함
- 강한 모델일수록 성능이 증가함
Context Efficient

- 비슷하거나 더 적은 토큰으로 더 높은 성능 달성
Failure Mode Analysis

- 기존 RAG: 문서 자체를 못찾음
- A-RAG: reasoning 문제나 entity confusion
6. Conclusion
- 향후 연구가 복잡한 검색 알고리즘 설계보다는 모델이 활용하기 쉬운 인터페이스 설계에 더 집중해야 함을 시사함
- LM과 외부 지식 간 새로운 상호작용 패러다임 탐구가 중요함