MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents

daegeon kim·2026년 5월 31일

Paper Review

목록 보기
39/47

긴 인더스트리 문서에 대한 RAG 시스템의 성능을 향상시키기 위한 MultiDocFusion이라는 다중 모드 chunking 파이프라인을 제안한다. 기존의 텍스트 중심 청킹 방식은 복잡한 인더스트리 문서의 구조(시각적 레이아웃, 계층적 섹션)를 무시하여 정보 손실과 답변 품질 저하를 야기하는 문제를 해결하고자 한다. MultiDocFusion은 시각적 레이아웃 분석과 문서의 계층적 구조를 명시적으로 통합하여, 구조적으로 충실하고 의미론적으로 일관된 청크를 생성한다.

서론

RAG은 긴 문서를 처리하는 LLM의 역량을 크게 발전시켰다. RAG 파이프라인의 핵심은 원본 문서를 관리 가능하고 의미적으로 일관된 단위로 분할하는 문서 청킹 전략이다. 그러나 기존의 청킹 방식은 고정 길이 분할이나 얕은 의미론적 단서에 의존하며, 실제 문서에 내재된 풍부한 시각적, 구조적 특성을 고려하지 못한다. 특히 산업 및 학술 문서에서는 스캔된 이미지, 다중 페이지 PDF, 또는 복잡한 시각적 및 계층적 레이아웃을 가진 보고서 형태를 띠는 경우가 많다. 예를 들어, 표, 그림, 섹션 헤더와 같은 시각적 요소는 여러 페이지에 걸쳐 있을 수 있으며, 계층적 섹션 구조는 순진한 청킹 방식에서 손실될 수 있는 중요한 의미론적 관계를 인코딩한다. OCR 아티팩트는 추출된 텍스트에 노이즈와 Misalignment를 유발하여 검색 및 QA 성능을 더욱 저하시킨다. 시각 기반 문서 파싱 및 OCR 기술의 발전으로 표, 텍스트 블록과 같은 시각적으로 일관된 영역을 추출할 수 있게 되었지만, 이러한 접근 방식은 논리적 구조, 특히 계층적 섹션에 내장된 parent-child 관계를 명시적으로 표현하는 데 부족하다. MultiDocFusion은 시각적 레이아웃과 문서의 구조적 계층을 청킹 프로세스에 명시적으로 통합하여 이러한 간극을 해소한다.

관련 연구

  • Chunking for QA on Long Industrial Documents: 긴 문서를 효과적으로 처리하기 위한 필수 전략으로 청킹이 부상했다. 전통적으로 Length chunking 또는 Semantic chunking이 사용되었으나, 섹션 간의 계층적 관계나 표, 그림과 같은 시각적 레이아웃 요소를 적절히 반영하지 못하는 한계가 있었다. LumberChunker 및 Perplexity chunking과 같은 최신 LLM 활용 접근 방식도 문서 계층에 대한 명시적 모델링이 부족하여 contextual fragmentation 문제를 겪는다. StyleDFS는 폰트 크기와 스타일을 사용하여 계층적 트리를 구성하지만, 텍스트 레이어가 없는 스캔 문서나 불규칙한 레이아웃에서는 어려움을 겪는다.
  • Document Parsing and Hierarchical Parsing: Visual Question Answering (VQA) 분야의 최근 연구는 문서 파싱(DP)에 중점을 두어 PDF 및 이미지 기반 문서를 표, 그림, 텍스트 블록과 같은 시각적 구성 요소로 분할한다. 그러나 이러한 object-detection-centric 접근 방식은 "1.2"와 "1.2.1" 섹션 간의 관계와 같은 Semantic hierarchical 관계를 완전히 재구성하는 능력이 부족하다. Document hierarchical parsing (DHP) 방법들이 제안되었지만, 스캔되거나 불규칙하게 포맷된 문서에는 적용하기 어렵다. LLM은 고급 텍스트 이해 및 long-context 처리 능력 덕분에 DHP 작업에 유망한 후보로 부상했지만, 섹션 간의 계층적 의미 연결을 추론하는 데 여전히 어려움을 겪어 추가적인 fine-tuning 또는 specialized instruction-tuning 방법이 필요하다. MultiDocFusion 파이프라인은 시각적 영역 감지, OCR, LLM 기반 계층 파싱을 체계적으로 결합하여 이러한 간극을 해결한다.

방법론

MultiDocFusion 은 긴 산업 문서의 시각적 레이아웃과 계층적 Semantic structure를 효과적으로 통합하여 청킹 및 검색 성능을 향상시키는 파이프라인이다. 이 파이프라인은 네 가지 단계로 구성된다.

  1. DP (Document Parsing)

    • 프로세스: DP는 긴 산업 문서의 각 페이지를 검사하여 Layout Structure를 식별하고 추출한다. 고급 비전 모델은 Title, Section Header, text block, table, figure 등을 감지한다. 각 감지된 세그먼트에는 bounding-box 좌표와 segment type이 할당된다. 파이프라인은 모든 세그먼트의 공간적 배열을 캡처하는 page-by-page Layout Structure를 구성한다.
    • 출력: 각 페이지에 대해 DP는 page number, segment ID, segment type, bounding box 좌표를 포함하는 metadata를 생성한다. 이 Layout Structure는 다음 OCR 단계로 전달된다.
  2. OCR

    • 프로세스: OCR은 DP에서 생성된 Layout Structure를 처리하여 각 bounding box에서 텍스트를 추출하며, Annotated Layout을 생성한다. 각 세그먼트 이미지는 문서의 언어 및 폰트에 맞춘 OCR 엔진으로 전송된다. 인식된 텍스트는 해당 bounding box에 다시 연결된다.
    • 출력: Annotated Layout은 bounding box, segment type, 인식된 텍스트를 구조화된 metadata로 병합하여 다음 처리 단계에 필요한 입력을 준비한다.
  3. DSHP-LLM (Document Section Hierarchical Parsing with LLM)

    • 모델 설정: DSHP-LLM은 LLM backbone을 기반으로 하며, 문서 계층 구조의 공개 데이터셋에 instruction-tuned되었다. 훈련 효율성을 높이기 위해 LoRA 기반 parameter-efficient fine-tuning (PEFT)을 사용한다.
    • 입력: DSHP-LLM은 Annotated Layout에서 DP 및 OCR 단계 중에 추출된 후보 섹션 헤더로 구성된 Header List를 받는다.
    • 프로세스: DSHP-LLM은 먼저 Header List를 분석하여 Header Tree construction을 수행하고 각 헤더에 고유 식별자와 parent reference (예: ID:3 Parent:2)를 할당하여 초기 계층 구조를 생성한다 (예: Root → Title → Section 1 → Section 1.1). 다음으로, DP 단계에서 유지되는 All Segments list (table, figure, text block 및 기타 문서 요소 포함)를 활용하여 일반 노드를 연결한다. 이 목록은 page number 및 bounding box position과 같은 공간 좌표로 정렬된다. DSHP-LLM은 Header Tree를 탐색하면서 All Segments list를 순차적으로 스캔한다. Header List에서 다음 헤더에 도달하기 전에 발견된 일반 세그먼트는 현재 헤더 노드의 자식 노드로 연결된다. 이는 표, 그림 및 텍스트 블록의 정확한 그룹화를 보장하여 논리적 및 공간적 문서 구조를 모두 보존한다.
    • 출력: 출력은 섹션 헤더 및 관련 일반 노드의 계층적 배치를 명시적으로 상세히 설명하는 Document Hierarchical Tree이다 (예: Root → Title → Section 1 → Section 1.1 → Text). LLM이 식별한 헤더와 공간적으로 정렬된 자식 노드를 통합함으로써 파이프라인은 일관된 논리적 및 시각적 관계를 유지한다.
  4. DFS-based Grouping

    • 프로세스: DFS-based Grouping은 Document Hierarchical Tree를 깊이 우선 탐색(Depth-First Search)하여 일관된 Hierarchical Chunks를 구성한다 (예: Chunk1, Chunk2, Chunk3, ...). 이 단계에서는 각 청크의 깊이가 heading level에 직접적으로 일치하도록 Markdown 헤더를 사용하여 계층적 구조가 각 청크 내에 명시적으로 반영된다. FAKE_ROOT라는 가상 노드를 생성하여 실제 루트 노드를 직접 가리키게 한다. 이 알고리즘은 부모 노드의 텍스트 내용과 자식 노드를 함께 집계하여 contextual information을 보존하면서 깊이 우선 방식으로 노드를 재귀적으로 탐색한다. 집계된 텍스트 길이가 미리 정의된 max_len을 초과하면 알고리즘은 해당 지점에서 청크를 분할한다.
    • 출력: 전체 섹션 또는 하위 섹션을 캡슐화하는 Hierarchical Chunks 목록으로, 토큰 낭비를 최소화한다. 결과 청크는 각 노드의 깊이에 해당하는 Markdown 헤더를 통해 문서의 계층적 구조를 명시적으로 표현한다.

실험 설정

  • 데이터셋:

    • DSHP-LLM 훈련 및 평가: DocHieNet (다양한 도메인, 복잡한 레이아웃, 스캔 이미지 포함) 및 HRDH (arXiv에서 수집된 학술 논문, 복잡한 레이아웃) 데이터셋을 사용한다.
    • Multi-page RAG-based VQA 평가: DUDE (금융 보고서, 사용자 매뉴얼 등 다양한 도메인), MPVQA (다중 페이지 문서, 다양한 레이아웃), CUAD (법률 계약 문서), MOAMOB (고도로 복잡한 산업 기술 문서, 제한된 데이터셋)의 네 가지 데이터셋을 사용한다. 각 데이터셋에 대해 모든 테스트 문서를 공동으로 색인하고 전체 corpus에서 top-k (기본 k=4) 청크를 검색한다.
  • 모델:

    • DP: DETR, VGT와 같은 object detection 모델을 DocLayNet 데이터셋에 fine-tuned하여 사용한다.
    • OCR: Tesseract, EasyOCR, TrOCR를 텍스트 추출에 사용한다.
    • DSHP-LLM: Llama-3.2-3B, Qwen-2.5-3B, Mistral-8B, Qwen-2.5-7B와 같은 LLM을 DocHieNet 및 HRDH 데이터셋의 계층적 섹션 구조(JSON 표현)에 instruction-tuning한다. LoRA와 4-bit quantization (QLoRA)을 사용한다.
    • Embedding: chunk embedding 생성에는 BGE, E5, BM25를 사용한다.
    • QA Generation: Llama-based 모델을 사용하여 최종 답변을 생성한다.
  • 평가 지표:

    • DSHP-LLM: accuracy, F1, TEDS (Tree Edit Distance Similarity)를 사용하여 평가한다.
    • 검색: Precision, Recall, nDCG를 사용하여 검색 품질을 측정한다.
    • QA: ANLS (Answer No-answer Logit Score), ROUGE-L, METEOR를 사용하여 생성된 VQA 답변을 정량적으로 평가한다.
  • 기준선 청킹 방법:

    • Length chunking: 고정된 토큰 길이 제한을 기반으로 문서를 청크로 나눈다.
    • Semantic chunking: LLM을 사용하여 문장 간의 의미론적 유사성 점수를 기반으로 문장을 그룹화하여 의미론적 일관성을 유지한다.
    • LumberChunker: LLM을 사용하여 문장 또는 단락 간의 topical shift를 식별하여 문서를 동적으로 분할한다.
    • Perplexity chunking: Perplexity distribution을 분석하여 최적의 청크 경계를 식별한다.
    • Structure-based Chunking (W/O DSHP-LLM): 섹션 헤더, 표, 그림과 같은 구조적 레이아웃만을 기반으로 문서를 분할하며, DSHP-LLM에 의해 식별되는 계층적 parent-child 관계는 명시적으로 고려하지 않는다.

실험 결과

  • DSHP-LLM 성능:
    Table 1은 DocHieNet과 HRDH 데이터셋에서 섹션 계층 파싱 성능을 요약한다. fine-tuning되지 않은 GPT-4는 두 데이터셋에서 제한된 성능을 보였으며, 일반 목적 LLM의 한계를 시사한다.
    MultiDocFusion의 DSHP-LLM 접근 방식은 두 데이터셋 모두에서 성능(TEDS)을 크게 향상시켰다. DocHieNet에서는 Mistral-8B (+16.71%)와 Llama-3.2-3B (+20.85%)가 상당한 개선을 보였고, HRDH에서는 Mistral-8B (+52.25%)와 Qwen-2.5-3B (+49.24%)가 가장 큰 향상을 달성했다.
    * 이 결과는 일반 목적 LLM이 섹션 계층 파싱 작업에서 본질적인 한계를 가지며, 데이터셋별 fine-tuning의 필요성을 강조한다. fine-tuned Mistral-8B 모델이 DSHP-LLM의 backbone으로 선택되었다.

  • 다양한 청킹 방법에서의 검색 성능:
    Table 2는 DUDE, MPVQA, CUAD, MOAMOB의 네 가지 다중 페이지 VQA 데이터셋에서 top-k=1~4 검색 결과의 평균 Recall, Precision, nDCG 값을 비교한다.
    MultiDocFusion은 대부분의 데이터셋에서 일관되게 최고의 검색 성능을 달성했다. 특히 DUDE와 MPVQA에서 Recall, Precision, nDCG에서 상당한 이점을 보였다. CUAD에서는 LumberChunker가 가장 높은 Recall을 달성했지만, MultiDocFusion은 우수한 Precision (0.8651)과 nDCG (0.8819)를 보여주었다. MOAMOB과 같은 고도로 복잡한 시나리오에서도 MultiDocFusion은 모든 평가 지표에서 다른 접근 방식을 현저히 능가하는 강력하고 우수한 성능을 보여주었다.
    * LLM 기반 청킹 방법(LumberChunker, Perplexity chunking)과 비교하여 MultiDocFusion은 문서의 계층적 구조를 명시적으로 캡처하고 활용함으로써 검색 성능을 크게 향상시켰다. Structure-based Chunking과 비교해서도 MultiDocFusion은 DSHP-LLM을 통합하여 DUDE 데이터셋에서 Recall을 7.08%, Precision을 5.51% 향상시켰다.

  • 청킹 방법의 QA 성능에 미치는 영향:
    Table 3은 DUDE, MPVQA, CUAD, MOAMOB의 네 가지 다중 페이지 VQA 데이터셋에서 다양한 청킹 방법을 사용한 QA 성능(ANLS, ROUGE-L, METEOR)을 비교 분석한다.
    MultiDocFusion은 대부분의 데이터셋에서 일관되게 최고의 QA 성능을 달성했다. 특히 MPVQA (ANLS 0.1615, ROUGE-L 0.1316, METEOR 0.1850) 및 DUDE (ANLS 0.1859, ROUGE-L 0.1692, METEOR 0.2285)에서 상당한 이점을 보여주었다. CUAD에서는 MultiDocFusion이 가장 높은 ANLS (0.2738)와 ROUGE-L (0.1762)을 달성했다. MOAMOB에서도 ANLS (0.2596) 및 METEOR (0.1257)에서 가장 높은 점수를 기록했다.
    * 기존 LLM 기반 청킹 방법뿐만 아니라 단순 Length chunking 및 Semantic chunking과 비교하여 MultiDocFusion은 문서의 구조적 context를 보다 포괄적으로 캡처하여 검색 Precision을 크게 향상시키고 QA 답변의 정확성과 일관성을 향상시켰다. Structure-based Chunking과 비교하여 DSHP-LLM의 추가 통합이 RAG 기반 QA 성능을 실질적으로 향상시켰다.

  • 파이프라인 구성 요소(DP/OCR/Embeddings)에 대한 강건성:

    • 이 섹션은 DP, OCR, embedding 모델을 변경할 때 다양한 청킹 방법의 검색 성능 강건성을 분석하며, top-k=1~4 검색 결과의 평균 nDCG를 기준으로 비교한다.

    • DP 모델 비교: Table 4는 DETR, DiT, VGT의 세 가지 DP 모델 환경에서 평균 nDCG 성능을 보여준다. MultiDocFusion은 모든 개별 DP 모델에서 일관되게 우수한 결과를 제공했으며, 가장 낮은 성능을 보인 Semantic chunking 방법보다 최대 27.64% 향상된 성능을 보였다.

    • OCR 모델 비교: Table 5는 EasyOCR, Tesseract, TrOCR의 OCR 모델에 따른 평균 nDCG 점수를 비교한다. MultiDocFusion은 EasyOCR (평균 0.5681) 및 Tesseract (평균 0.5068) 설정에서 특히 다른 방법들을 능가하며 가장 높은 성능(평균 0.4949)을 달성했다.

    • Embedding 모델 비교: Table 6은 BGE, E5, BM25의 embedding 모델에 따른 평균 nDCG 성능을 보여준다. MultiDocFusion은 모든 embedding 환경에서 다른 청킹 방법을 일관되게 능가하며 가장 높은 전반적인 성능(0.5061)을 달성했다. BGE 환경에서는 0.5213로 최고의 성능을 기록했다.

결론

이 논문은 긴 산업 문서에 대한 RAG의 핵심 병목인 시각적 레이아웃과 명시적 섹션 계층을 무시하는 텍스트 전용 청킹으로 인한 context fragmentation 문제를 다룬다. MultiDocFusion은 (i) 페이지 수준 레이아웃 영역을 파싱하고 (ii) OCR로 텍스트를 추출하며 (iii) DSHP-LLM으로 명시적 섹션 계층을 재구성하고 (iv) DFS를 통해 계층적 청크를 조립하여 공간적 및 의미론적 context를 보존하는 구조화된 다중 모드 파이프라인을 제안한다. 4개의 다중 페이지 VQA 벤치마크에 대한 corpus-level 평가에서 MultiDocFusion은 검색 및 QA에서 기준선 청킹 방법을 일관되게 능가하는 성능을 보였다. 계층적 파싱을 위해 fine-tuned된 DSHP-LLM은 복잡한 섹션 구조를 정확하게 재구성하고 DHP 데이터셋에서 일반 목적 LLM (예: GPT-4)을 능가한다. 이러한 성능 향상은 다양한 도메인과 레이아웃에서 유지되며, 다양한 DP, OCR, embedding 선택에서도 안정적으로 유지되어 파이프라인의 실용적 신뢰성을 강조한다. 이러한 결과는 계층 인식적(hierarchy-aware)이고 시각적으로 기반을 둔 청킹이 길고 복잡하며 스캔된 산업 문서에 대한 RAG의 일등 설계 원칙이 되어야 함을 지지한다.

한계

  • DSHP-LLM의 제한된 시각적 접지(visual grounding): DSHP-LLM은 DHP 데이터셋으로 훈련되었으며, 폰트 크기/스타일, 색상, 공백, 정렬/선, Column 구조와 같은 미세한 레이아웃 신호를 제공하지 않는다. 모델이 본질적으로 LLM 중심이고 주로 OCR 텍스트와 coarse bounding box에 조건화되어 있으므로, 스캔되거나 시각적으로 복잡한 페이지에서 신뢰할 수 있는 계층 재구성에 결정적인 시각적 단서를 충분히 활용하지 못한다. 향후 연구에서는 상세한 레이아웃 특징을 통합하고, 다중 모드 문서 인코더 또는 VLM backbone을 통해 DSHP-LLM을 시각적으로 접지하여 보다 정확한 구조 분석을 가능하게 해야 한다.
  • Graph-structured retrieval 미평가: MultiDocFusion은 명시적인 계층적 문서 그래프(headers → subheaders → content blocks)를 생성하며, 유형화된 관계(예: parent–child, reading order)를 가진다. 이는 GraphRAG 파이프라인으로 자연스럽게 구현되어 노드와 경로를 검색하고 추론할 수 있다. 이러한 형태는 multi-hop 및 기타 추론 집약적인 작업을 더 잘 지원할 가능성이 있다. 그러나 본 연구는 표준 RAG 설정에서 다중 모드 계층적 청킹의 검증에 초점을 맞추었기 때문에 이 방향을 체계적으로 검증하지 않았다.
  • 오류 전파 및 End-to-End 대안: 연속적인 다중 모듈 파이프라인은 실용적이고 산업 환경에서 익숙하지만, 이러한 설계는 본질적으로 오류 전파에 취약하다. 초기 단계 구성 요소(DP/OCR)의 오류가 DSHP-LLM, DFS 기반 청킹, 검색, 궁극적으로 QA로 이어질 수 있다. 이러한 위험을 완화하기 위해 향후 연구에서는 VLM 기반 end-to-end 모델의 대체 가능성 또는 시각적 파싱, 계층적 구조화, 청킹, 검색/답변을 공동으로 최적화하는 하이브리드 구성 요소를 탐구해야 한다.
  • 계산 오버헤드: 계층적 청킹은 응집력을 보존하기 위해 여러 자식에 걸쳐 부모 context를 복제하는데, 이는 색인 크기, 검색 지연 시간, 저장 비용을 증가시킬 수 있다. Budget-aware chunking, graph pruning, node-level caching/deduplication은 실용적인 완화 방안이다.
profile
AI Engineer

0개의 댓글