텍스트 전처리

- [중요] 토큰화 (Tokenization)
- 정제 (Cleaning) and 정규화 (Normalization)
- 어간 추출 (Stemming) and 원형 복원 (Lemmatization)
- 불용어 (Stopword)
1. 토큰화
- 가장 작은 의미 단위로 분리
- 개념을 이해가 중요. 적당한 라이브러리 선택.
- 하나의 표준화된 분리 기준이 없음
- 한글이 영어보다 어렵다.


2. 정제 및 정규화
- 정제(cleaning): 불필요한 구두점 및 공백 제거
- 정규화(normalization): 다르게 표현된 토큰을 같은 토큰으로 조정.
- 모든 단어를 소문자로 변환
- 어간 추출, 원형 복원

3. 어간 추출과 원형 복원
- 어간 추출(Stemming): 의미를 담고 있는 단어의 핵심
- 원형 복원(Lemmatization): 단어를 원형으로 통일

4. 불용어 제거
- 불용어(stopword): 큰 의미가 없는 토큰. 자주 등장하지만 분석을 하는 것에 별 도움이 되지 않는 토큰
