260909

u·2026년 9월 10일

TIL

목록 보기
18/29

기준과 진단

  • 스키마 준수율
    => 낮으면 LLM 출력 제약 보완

  • 근거 원문 일치율 -> 인용문을 검사
    => 낮으면 LLM의 인용 방식과 출처 연결 보완

  • 샘플 정밀도

  • 골드셋 (있어야 할 관계의 목록)

  • 정밀도, 재현율, F1
    정밀도 (precision) : TP / (TP + FP)
    재현율 (recall) : TP / (TP + FN)
    F1 : 2 × TP / (2 × TP + FP + FN)

정밀도 낮으면:
LLM이 원문에 없거나 제외 대상인 관계를 추출함
-> 잘못 뽑은 사례를 보여 주고, 어떤 관계를 제외할지 프롬프트에 명시

재현율 낮으면:
LLM이 나열된 대상이나 앞뒤 문맥의 관계를 놓침
-> 대상마다 관계를 확인하도록 지시하고, 필요한 앞뒤 문장을 함께 입력
맞는 관계를 뽑았지만 인용이나 타입 오류로 기각됨
-> 기각 사유에 따라 해당 오류를 고친 뒤 같은 검사에 다시 통과시키기

F1 낮으면:
정밀도 또는 재현율이 낮음
-> 위 오류를 교정하고 두 지표를 다시 계산. 기존 정답이 사라졌는지도 확인

  • 골드셋 만들기
    (1) 온톨로지 설계
    (2) 골드셋 구축할 문서 선정 --> 논문 예시 논문 5페이지 정도 -> 최소 트리플 30개 이상
  • 5개의 논문 문서에 대해서 모든 트리플을 올바르게 추출 (빠짐없이 추출)
    (3) 골드셋 구축 자동화
  • 온톨로지 기반으로 LLM을 이용해서 트리플 추출
  • (3-1) 트리플 추출한 게 맞는지 검수 (사람, LLM --> 최종 사람)
  • (3-2) 논문을 직접 봐서 LLM이 추출하지 못한 트리플을 사람이 직접 추출

해당 골드셋 기준으로 프롬프트 변경, 모델 변경으로 최적의 시스템 설계

최적의 시스템을 설계한 이후에
-> 모든 문서에 대해서 트리플 추출!

모든 문서에 대한 추출된 트리플에 대한 평가
-> 스키마 준수율, 원문 일치율 (자동화)
-> 랜덤하게 트리플 후보 생성 -> 샘플 정밀도 (최종 점수)

개선과 재평가

  • 개선 방법
  • 수정과 재평가
  • 채택 판단

0개의 댓글