최근 RAG(Retrieval-Augmented Generation) 연구가 활발하게 진행되고 있습니다.
하지만 텍스트나 이미지 데이터에 집중하고 있어, 그래프 구조 데이터를 다루는 경우는 상대적으로 적습니다. 이 논문 “Retrieval-Augmented Generation with Graphs”은 바로 이 공백을 메우기 위해 GraphRAG를 정리한 서베이 논문입니다.
1. GraphRAG 개념 및 배경
- GraphRAG는 기존 RAG가 주로 의미론적/어휘적 유사성 검색에 의존하는 것과 달리, 그래프 기반 머신러닝 및 그래프 분석 기술을 활용하여 관계형 지식을 포착하는 데 독특한 장점을 제공
- RAG는 외부 지식을 검색해 LLM 답변 품질을 높여주는 기술이지만 단순 벡터 검색만으로는 부족
- 그래프는 노드와 엣지 관계를 표현하므로 이를 활용하면 더 정교한 검색과 추론이 가능
figure 1(3P). 기존 RAG와 GraphRAG의 차이
- 기존 RAG는 텍스트(1차원 시퀀스)나 이미지(2차원 그리드)처럼 독립적이고 단순한 데이터 구조를 처리합니다. 데이터 간 관계성은 고려하지 않고, 각 청크(Chunk)나 토큰을 개별적으로 벡터화하여 검색·생성 과정에 활용합니다.
- GraphRAG는 데이터가 노드(Node)와 엣지(Edge)로 연결된 그래프 구조라는 점을 강조합니다. 즉, 단순히 데이터 조각을 나열하는 것이 아니라, 데이터 간 관계적 구조(Relational Structure)를 그대로 활용하여 검색과 추론을 진행합니다.
- 정리하자면 "텍스트·이미지 기반 RAG는 데이터의 표면적 정보에 의존하지만, GraphRAG는 연결 관계 자체를 지식 자원으로 활용한다."" 라는 점이다. 즉, GraphRAG는 단순히 정보 검색을 넘어 멀티홉 추론(여러 노드를 거쳐 답을 도출)이나 관계성 기반 추론이 가능하다는 장점이 있다.
2. GraphRAG의 전체 프레임워크 및 5가지 핵심 구성 요소
- Query Processor
- 사용자의 질문을 그래프 데이터와 연결 가능한 형태로 바꿔줌
- 엔티티 인식, 관계 추출, 질의 확장 등을 수행해 단순 텍스트 쿼리를 그래프 친화적인 쿼리로 변환
(예시 : “서울에서 태어난 과학자는?” → “노드: 과학자, 속성: 출생지=서울”)
- Retriever
- 그래프에서 관련 노드·엣지를 찾는 단계
- 기존 RAG의 벡터 유사도 검색과 달리, 그래프 순회(BFS, DFS 등), 엔티티 링크, GNN 임베딩을 활용해 더 정교한 검색을 수행
- 관계 기반 탐색이 가능해, 멀티홉 추론을 지원
- Organizer
- Retriever가 가져온 결과를 다듬고 구조화
- 불필요한 노드 제거(프루닝), 중요도 재조정(재랭킹), 부족한 맥락 보강(증강)하는 과정
- 최종적으로 LLM이 이해하기 좋은 형태로 가공
- Generator
- 정리된 데이터를 바탕으로 최종 답변을 만듬
- 텍스트 생성은 물론, 필요 시 그래프 자체를 결과로 제시
(예시 : “분자의 구조 설명” 요청 시, 텍스트와 함께 그래프 형태로도 반환 가능)
- Graph Data Source
GraphRAG의 근간이 되는 지식 저장소
지식 그래프(위키데이터 등), 문서 그래프(논문 간 인용 관계), 과학 그래프(분자, 단백질), 사회 그래프(사람 간 관계), 인프라 그래프(교통망) 등 도메인별 특화된 그래프가 활용됩니다.
figure 3(4P). GraphRAG의 Holistic Framework제시 및 각 컴포넌트 연결 도식화
3. GraphRAG의 응용 분야
- 본 논문은 GraphRAG가 특정 분야에 국한되지 않고 매우 넓은 범위에서 활용될 수 있음을 보여줌.
figure 2(3P). 각 도메인별 GraphRAG 논문 수와 연구 동향을 정리
지식 그래프와 문서 그래프 분야에서 가장 활발하게 연구.
그 외에도 소셜그래프, 과학그래프(분자구조 등), 추천시스템 등등...
4. 향후 과제
• 구성 요소 간 통합: 그래프 구축, 검색, 정리, 생성 구성 요소 간의 원활한 상호 작용 및 전체 시스템 최적화가 필요합니다.
• 확장성: 데이터 볼륨이 증가함에 따라 그래프 저장, 쿼리 최적화, 효율적인 학습 및 서빙을 위한 정교한 엔지니어링이 요구됩니다.
신뢰성 확보
• 신뢰성 : GraphRAG의 다중 홉(multi-hop) 특성으로 인해 단계별 오류가 누적될 수 있습니다. 다단계 불확실성 정량화 및 전역적 오류 보정 메커니즘 개발이 필요합니다.
• 견고성 : 검색된 콘텐츠에 노이즈나 관련 없는 정보가 포함될 때 LLM 성능이 저하되는 문제가 있습니다. 특히, 그래프 구조적 관점에서의 견고성 (예: 추론 그래프가 교란될 때의 성능 변화) 연구가 부족합니다.
• 개인 정보 보호 : 그래프의 관계적 특성 때문에 민감한 노드가 이웃을 통해 간접적으로 검색되거나, GNN의 메시지 전달 메커니즘을 통해 정보가 유출될 위험이 있어, 종속성을 고려한 개인 정보 보호 기술이 필요합니다.
• 설명 가능성 : GraphRAG는 노드 간의 명시적 관계를 통해 기존 RAG보다 향상된 설명 가능성을 제공하지만, QA의 추론 경로 생성이나 분자 속성 예측에서의 기능 그룹 설명 등 합리적이고 상황에 맞는 서브그래프를 검색하여 설명의 신뢰성을 확보하는 것이 과제
5. 결론
- 이 논문은 GraphRAG를 처음부터 끝까지 체계적으로 정리한 교과서 같은 서베이
- 기존 RAG의 한계를 명확히 지적하고, GraphRAG를 활용하여 기존RAG의 한계를 극복하는 체계적인 프레임워크를 제시
- GraphRAG의 다양성과 도메인별(지식,문서,과학,소셜 등) 특화된 GraphRAG 설계
도메인별 이야기 나올 때 제대로 안읽음..