말뭉치 류(Corpus)
사전/데이터베이스 류
언어 모델 평가를 위해 등장
대표적인 BenchMark 데이터셋
벤치마크의 구성
텍스트(Text)
Corpus(말뭉치, Plural Corpora)
Data
주석(Tag, Label, Anntation)
왜 형태소에 Labeling을 붙이는 과정을 "형태소 분석기"라고 할까?
사실, Labeling을 붙이는 과정이므로 형태소 주석기라고 말하는 것이 더 적절할 수 있다.
하지만, 형태소에 주석을 다는 것은 결국 언어 사이의 관계를 분석한다고 생각하여 형태소 분석기라고 명명했다.
영어에서 또한 Pos Tagger로 명시한다.
이 부분은 중요한 부분은 아니므로, 언어 단위에 따라 연구 분야의 이름이 다르다 정도로만 알고 있으면 될 것 같다.

영어 : 단어 기반
한국어 : 어절 기반
한국어는 9품사로 분석된다(명사, 수사, 대명사, 동사, 형용사, 관형사, 부사, 조사, 감탄사)
여기서 한국어의 특이한 점은 "조사"이다. 조사는 체언(명사, 수사, 대명사)와 붙어서 사용되기 때문에 영어와 달리 띄어쓰기 = 단어의 구분을 의미하지는 않는다.
I am sleeping이라는 영어 문장은 띄어쓰기 단위로 단어를 구별해도 큰 관계가 없지만, "나는 자고 있다"라는 문장에서 "자고"라는 것이 1 문장이 아닌 "자다" + "-고"의 결합어이기 때문에, 한국어가 분석하는데 더 어려워지며 띄어쓰기 단위로 분석할 수 없게 되는 것이다
Token : 언어를 다루는 가장 작은 기본 단위
Type : 토큰의 대표 형태
토큰화(Tokenization) > 표제어 추출(Lemmatization) / 품사 주석(POS tagging)
예시 : "이 사람은 내가 알던 사람이 아니다"
N-gram
표상(Representation)
HTML
XML
JSON
CSV, TSV