Text Embedding은 텍스트의 의미를 보존한 채 벡터(숫자 배열)로 변환하는 것으로, 단어의 의미를 압축해서 특정 차원(Semantic Space: 의미 공간)의 좌표로 나타내는 것이다. 텍스트를 벡터로 나타냄으로써, 의미가 비슷하면 벡터도 비슷하게 위치하기 때문에 모델이 텍스트의 의미를 수치화된 임베딩 벡터를 통해 이해할 수 있다. 임베딩 벡터로 단어를 나타내면
king - man + woman = queen
처럼 의미를 수학적으로 연산하는 것이 가능하다.
장점 : 해석이 쉽고, 작은 데이터셋에서 잘 먹힘.
단점 : 의미 반영이 약함. 문맥 정보가 없음.
장점 : 학습 속도 빠름. 단어 간 관계를 벡터 공간에 반영하여 의미 관계를 잘 포착.
단점 : 문맥이 바뀌어도 같은 단어면 같은 벡터로 처리. OOV(Out Of Vocab) 처리 약함.
장점 : 전역 통계를 잘 반영. 의미 관계가 잘 잡힘.
단점 : 문맥 별 의미 구분 못함. OOV 문제 해결 불가.
장점 : OOV 처리에 강함. 오탈자나 희귀 단어 많을 때 유리.
단점 : 문맥 별 의미 구분 못함.