260914

u·2026년 9월 14일

TIL

목록 보기
21/30

새롭게 트리플 추출

새로운 문서 -> 청킹 -> 스키마 정의 -> LLM 새로운 트리플 추출 -> 추출 결과 검증 (허용된 노드 유형/ 관계? S,R,O 조합? 근거 유무/원문존재?)

새롭게 추출한 트리플 중복 없이 저장

(1) 새롭게 추출한 트리플의 노드들에 기존에 저장된 표준 ID 부여

  • 표준 ID가 없는 새로운 노드 --> 표준 ID 새롭게 부여를 해야함

(2) 문서와 청크 저장

  • 청크 저장 : 청크의 고유 ID도 같이 저장

(3) 새롭게 추출한 노드들 적재

  • 이미 존재하는 노드는 중복 생성하지 않음

(4) 새로운 관계 적재

  • 기존에 없는 관계만 추가

(5) (필요시) 계층 노드에 대해서 계층 관계 생성


증분 적재 : 기존 그래프가 구축된 상황에서
새로운 관계가 추가되거나 (스키마 업데이트)
새로운 문서가 추가가 되거나
=>> 새로운 노드 및 트리플 적재

(1) 추출이 완료
(2) 추출된 노드와 기존 표준 ID와 연결

  • 어휘 그래프(Document Chunk) + 개체 그래프 (실제 개체)
  • Chunk의 표준 ID: 문서의 id + 청크 인덱스 + 청크 텍스트의 해시값
  • 새롭게 추출한 일반 노드들의 표준 id를 검색하기 위해서
    이름과 별칭으로 표준 ID 검색 —> 표준 id 1만 검색이 되면 가장 좋음
    -> 여러개 검색이 되면 사람이 판단, 어떤 ID가 실제 id
  • 새롭게 추출한 개체 -> 표준 ID에 없으면 새로운 표준 ID 생성
    -> 새로운 표준 ID 생성 방법 (엔티티 정규 실습)
    -> 같은 개체의 출현을 그룹으로 묶어서 -> “Entity 그룹 내 개체 1개의 이름”

(3) MERGE 활용 적재

관계를 적재 시 claim_id 부여
claim_id : (문서 ID + 주어 ID + 관계 이름 + 목적어 ID)의 해시값
같은 문서의 같은 트리플인지 판단

V 한글자만 틀려도 다른 걸로 인식 (별칭 이슈) -> 도메인 지식도 필요할수도

0개의 댓글