IE 4단계
NER
ㄴ 학습형 모델의 표기는 BIO 태깅
BIO 태깅: B-, I-, O로 개체의 시작/내부/비개체를 표시하는 방식
일반 NER 모델 => 유형이 고정됨
규칙 기반 NER => 표준 사전 매칭. 미등록어,경계,대소문자,약어충돌 문제
머신러닝 기반 NER => 사전없이 문맥. 유형 목록이 학습할 때 고정됨
LLM 기반 => 프롬프트로 개체를 뽑아 한계 보완
- 뽑은 개체 다듬기: 유형 검증, 원문 등장 확인, 중복 제거
- 허용 유형 필터링: 추출 결과 중 필요한 type만 남겨 잘못된 유형을 제거.
- 원문 검증: 추출된 name이 실제 원문에 존재하는지 확인해 LLM 환각을 줄임.
- 중복 제거: (name, type) 같은 기준으로 set을 사용해 같은 개체를 한 번만 남김.
- 정해진 NER 모델보다 유연하지만 출력 형식 불일치, 누락, 환각 가능성이 있어서 후처리 검증이 중요함.
- 문서별 집계: 정제된 개체의 doc_id를 Counter로 세어 논문별 개체 수를 구함.