[개념] 텍스트 전처리

고근호·2023년 10월 11일

텍스트 전처리

  1. [중요] 토큰화 (Tokenization)
  2. 정제 (Cleaning) and 정규화 (Normalization)
  3. 어간 추출 (Stemming) and 원형 복원 (Lemmatization)
  4. 불용어 (Stopword)

1. 토큰화

  • 가장 작은 의미 단위로 분리
  • 개념을 이해가 중요. 적당한 라이브러리 선택.
  • 하나의 표준화된 분리 기준이 없음
  • 한글이 영어보다 어렵다.


2. 정제 및 정규화

  • 정제(cleaning): 불필요한 구두점 및 공백 제거
  • 정규화(normalization): 다르게 표현된 토큰을 같은 토큰으로 조정.
  • 모든 단어를 소문자로 변환
  • 어간 추출, 원형 복원


3. 어간 추출과 원형 복원

  1. 어간 추출(Stemming): 의미를 담고 있는 단어의 핵심
  2. 원형 복원(Lemmatization): 단어를 원형으로 통일


4. 불용어 제거

  • 불용어(stopword): 큰 의미가 없는 토큰. 자주 등장하지만 분석을 하는 것에 별 도움이 되지 않는 토큰

profile
rootgo 매일, 꾸준히 성장하는 사람🌱

0개의 댓글