260911

u·2026년 9월 11일

TIL

목록 보기
20/30

지식 그래프 자동화

  1. 원문과 추출할 관계 정하기

    • 어떤 텍스트에서 무엇을 추출할지 결정
    • 허용할 노드(Entity) 타입과 관계(Relation) 타입 정의
    • 시작 노드 → 관계 → 도착 노드의 허용 방향을 정해서 Schema 구성
  2. 원문 청킹, 벡터 확인

  3. KG Builder로 그래프 생성

    • LLM이 지켜야 할 추출 프롬프트 작성
    • SimpleKGPipeline 구성
    • Pipeline 실행
    • 텍스트 → Entity/Relation 추출 → Neo4j KG 생성
  4. 평가 자료 저장

    • 추출된 결과와 원문/근거 등을 저장
  5. 현재 실행의 중복 노드 통합

    • 같은 개체가 여러 노드로 생성됐는지 확인
    • 동일 개체를 식별해서 중복 노드 병합

설계 → 원문 준비 → 자동 추출·KG 생성 → 평가 → 중복 개체 정리


자동 생성 그래프의 근거와 품질 검증

  1. 평가할 실행과 문서 확인

    • 어떤 실행의 어떤 문서와 추출 관계를 평가할지 정함
  2. 스키마와 근거 각각 검사

    • schema_ok: 허용한 노드 타입-관계-노드 타입 구조인지 확인
    • evidence_ok: 제시한 근거가 실제 원문에 존재하는지 확인
      (근거가 원문에 있다고 해서 관계의 의미까지 맞는 것은 아님)
  3. 같은 문서의 골드로 Precision / Recall / F1 평가

    • 추출 결과와 사람이 만든 정답(Gold)을 비교
    • TP: 맞게 추출 / FP: 잘못 추출 / FN: 놓친 관계
  4. 조건을 하나 바꿔 같은 기준으로 비교
    → chunk_size 300 → 1000

    • 나머지 원문·모델·스키마·프롬프트·골드는 동일하게 유지
    • 청크 변화가 FP/FN, Precision, Recall, F1에 미치는 영향 비교

⇒ 최종 확인:
자동 KG 생성에서 끝 X
스키마 → 근거 → 골드 → 조건 변경 비교를 통해 그래프의 품질 검증

0개의 댓글