| 목적 | 지표 | 이유 |
|---|
| 전체 등장량 파악 | 빈도수 | 빠르고 직관적, 문서 분포 평가에 적합 |
| 의미 있는 단어 조합 탐지 | PMI | 연관성 높은 collocation (함께 자주 사용되는 단어들의 조합) 포착에 효과적 |
- PMI는 확률론에 기초한 방법으로 두 확률 변수의 특정한 값의 연관성을 표현하는 지표이다.
PMI(x,y)=log(P(x)∗P(y))P(x,y)
- P(x, y): 단어 x와 y가 함께 등장할 확률
- P(x), P(y): 각 단어가 독립적으로 등장할 확률
- 의미 극성이 비슷한 단어들은 같은 문서 안에 나타날 확률이 높다고 가정하면, PMI를 이용해서 두 어휘의 연관성을 측정할 수 있다.
- 만약 PMI값이 양수이면 두 어휘가 같은 문서 안에 나타날 확률이 높아 비슷한 의미 극성을 가진다는 것을 의미할 것이고, PMI 값이 음수라는 것은 두 단어가 같은 문서에 나타날 확률이 낮아 다른 의미 극성을 가진다는 것을 의미할 것이다.
"따라서, 비슷한 성질의 어휘는 가까운 위치에서 함께 나타나는 빈도가 높을 것이라는 가정에 근거하여 단어 사이의 관계를 해석할 수 있으며, 이에 따라 PMI 값이 클수록 두 단어의 연관성이 높다는 것을 의미한다."
- PMI에서는 빈도수가 낮은 사건들이 높은 점수를 받는다. 거의 등장하지 않지만 한 번이라도 두 단어가 공동 등장할 경우, 분모가 매우 작아지면서 PMI 값이 커지기 때문이다.
- 빈도가 작지만 강하게 연결된 고유명사 결합(예, 전문용어, 고유어)을 더 잘 추출하는 경향이 있다.
빈도수가 높은데 PMI가 작을 경우는, 두 단어는 자주 등장하지만 각각이 다른 단어와도 많이 붙기 때문에 그 조합이 고유하지는 않다는 것과 같다.
ref)
- 송상일, 이동주, and 이상구. "PMI 를 이용한 우리말 어휘의 의미 극성 판단." 한국정보과학회 학술발표논문집 37.1C (2010): 26-0-265.
- Turney, Peter D., and Michael L. Littman. "Measuring praise and criticism: Inference of semantic orientation from association." acm Transactions on Information Systems (tois) 21.4 (2003): 315-346.
- Kherwa, Pooja, and Poonam Bansal. "Semantic N-Gram Topic Modeling." EAI Endorsed Transactions on Scalable Information Systems 7.26 (2020).
- Role, François, and Mohamed Nadif. "Handling the impact of low frequency events on co-occurrence based measures of word similarity-a case study of pointwise mutual information." International conference on knowledge discovery and information retrieval. Vol. 2. Scitepress, 2011.