자연어처리(NLP)에서 정보 추출(Information Extraction, IE)

김동준·2025년 9월 23일

LLM

목록 보기
28/50

자연어처리(NLP)에서 정보 추출(Information Extraction, IE)은 비정형 텍스트나 문서에서 의미 있는 구조화된 정보를 자동으로 식별하고 추출하는 과정을 말한다. 쉽게 말해, 글이나 문장에서 중요한 사람 이름, 장소, 날짜, 사건, 관계 등의 정보를 컴퓨터가 알아서 찾아내어 표 형식이나 데이터베이스처럼 정리하는 것이다.


정보 추출의 주요 내용

  • 비정형 텍스트(예: 뉴스 기사, 이메일, SNS 게시글 등)에서 사람 이름, 조직 명칭, 날짜 같은 엔티티(entity)를 식별
  • 엔티티 간의 관계(예: “서울대학교”는 “서울”에 있다)를 찾아내고 구조화
  • 텍스트에서 사건, 감정, 속성 등 다양한 정보도 추출 가능

정보 추출의 주요 하위 작업 예시 3가지

  1. 개체명 인식 (Named Entity Recognition, NER)

    • 텍스트에서 ‘사람’, ‘장소’, ‘기관’ 등의 고유명사를 찾아내고 태깅
    • 예: “김철수는 서울대학교에 다닌다” → 김철수(B-PER), 서울대학교(B-ORG)
  2. 관계 추출 (Relation Extraction)

    • 추출된 개체명 간의 의미 있는 관계를 파악해 표현
    • 예: (김철수, 다닌다, 서울대학교)
  3. 상호 참조 해결 (Coreference Resolution)

    • 텍스트 내에서 서로 다른 표현으로 된 같은 대상(대명사 등)을 연결
    • 예: “김철수가 학교에 갔다. 그는 공부를 열심히 한다.” 여기서 ‘그는’=‘김철수’

정보 추출의 활용

  • 문서 요약, 자동 답변, 추천 시스템, 법률 및 의료 문서 분석, 고객 서비스 개선 등
  • 비정형 데이터에서 유의미한 정보를 체계화해 데이터베이스에 저장, 검색과 분석에 활용

정보 추출은 자연어처리의 핵심 분야 중 하나이며, 내부적으로 다양한 머신러닝과 딥러닝 기법들이 활용된다[2][5][6].

출처
[1] 자연어 처리(NLP) 기본 완벽 가이드: 핵심 개념부터 활용까지 https://dataschool.co.kr/%EC%9E%90%EC%97%B0%EC%96%B4-%EC%B2%98%EB%A6%ACnlp-%EA%B8%B0%EB%B3%B8-%EC%99%84%EB%B2%BD-%EA%B0%80%EC%9D%B4%EB%93%9C-%ED%95%B5%EC%8B%AC-%EA%B0%9C%EB%85%90%EB%B6%80%ED%84%B0-%ED%99%9C%EC%9A%A9
[2][자연어처리] 10. 정보 추출 - YZ ZONE https://yz-zone.tistory.com/47
[3] 자연어 처리(NLP)란 무엇인가요? https://aws.amazon.com/ko/what-is/nlp/
[4][NLP] 9. 정보 추출 - observe_db - 티스토리 https://npc-db.tistory.com/140
[5] 정보 추출이란 무엇인가요? https://www.ibm.com/kr-ko/think/topics/information-extraction
[6][NLP] Information Extraction - 데이터와 인공지능 훑어보기 https://yumdata.tistory.com/161
[7] 자연어처리(NLP)란? 정의, LLM, 데이터 활용 방법 - 에펜 https://kr.appen.com/blog/what-is-nlp/
[8][IT Trends] 자연어 처리 기술(Natural Language Processing)의 ... https://soyeonh.tistory.com/14
[9] 자연어처리 이론 한번에 정리하기 - 나의 배움터 https://learningsungjun.tistory.com/261
[10] 자연어 처리(NLP)란 무엇인가? https://www.elastic.co/kr/what-is/natural-language-processing

profile
Story Engineer

0개의 댓글