지식 그래프 자동화
-
원문과 추출할 관계 정하기
- 어떤 텍스트에서 무엇을 추출할지 결정
- 허용할 노드(Entity) 타입과 관계(Relation) 타입 정의
- 시작 노드 → 관계 → 도착 노드의 허용 방향을 정해서 Schema 구성
-
원문 청킹, 벡터 확인
-
KG Builder로 그래프 생성
- LLM이 지켜야 할 추출 프롬프트 작성
- SimpleKGPipeline 구성
- Pipeline 실행
- 텍스트 → Entity/Relation 추출 → Neo4j KG 생성
-
평가 자료 저장
-
현재 실행의 중복 노드 통합
- 같은 개체가 여러 노드로 생성됐는지 확인
- 동일 개체를 식별해서 중복 노드 병합
설계 → 원문 준비 → 자동 추출·KG 생성 → 평가 → 중복 개체 정리
자동 생성 그래프의 근거와 품질 검증
-
평가할 실행과 문서 확인
- 어떤 실행의 어떤 문서와 추출 관계를 평가할지 정함
-
스키마와 근거 각각 검사
- schema_ok: 허용한 노드 타입-관계-노드 타입 구조인지 확인
- evidence_ok: 제시한 근거가 실제 원문에 존재하는지 확인
(근거가 원문에 있다고 해서 관계의 의미까지 맞는 것은 아님)
-
같은 문서의 골드로 Precision / Recall / F1 평가
- 추출 결과와 사람이 만든 정답(Gold)을 비교
- TP: 맞게 추출 / FP: 잘못 추출 / FN: 놓친 관계
-
조건을 하나 바꿔 같은 기준으로 비교
→ chunk_size 300 → 1000
- 나머지 원문·모델·스키마·프롬프트·골드는 동일하게 유지
- 청크 변화가 FP/FN, Precision, Recall, F1에 미치는 영향 비교
⇒ 최종 확인:
자동 KG 생성에서 끝 X
스키마 → 근거 → 골드 → 조건 변경 비교를 통해 그래프의 품질 검증