PMI(Pointwise Mutual Information) vs Frequency

Euro·2025년 6월 18일
목적지표이유
전체 등장량 파악빈도수빠르고 직관적, 문서 분포 평가에 적합
의미 있는 단어 조합 탐지PMI연관성 높은 collocation (함께 자주 사용되는 단어들의 조합) 포착에 효과적

  • PMI는 확률론에 기초한 방법으로 두 확률 변수의 특정한 값의 연관성을 표현하는 지표이다.
PMI(x,y)=logP(x,y)(P(x)P(y))PMI(x, y) = \log \frac {P(x, y)}{(P(x) * P(y))}
- P(x, y): 단어 x와 y가 함께 등장할 확률
- P(x), P(y): 각 단어가 독립적으로 등장할 확률
  • 의미 극성이 비슷한 단어들은 같은 문서 안에 나타날 확률이 높다고 가정하면, PMI를 이용해서 두 어휘의 연관성을 측정할 수 있다.
  • 만약 PMI값이 양수이면 두 어휘가 같은 문서 안에 나타날 확률이 높아 비슷한 의미 극성을 가진다는 것을 의미할 것이고, PMI 값이 음수라는 것은 두 단어가 같은 문서에 나타날 확률이 낮아 다른 의미 극성을 가진다는 것을 의미할 것이다.

    "따라서, 비슷한 성질의 어휘는 가까운 위치에서 함께 나타나는 빈도가 높을 것이라는 가정에 근거하여 단어 사이의 관계를 해석할 수 있으며, 이에 따라 PMI 값이 클수록 두 단어의 연관성이 높다는 것을 의미한다."


  • PMI에서는 빈도수가 낮은 사건들이 높은 점수를 받는다. 거의 등장하지 않지만 한 번이라도 두 단어가 공동 등장할 경우, 분모가 매우 작아지면서 PMI 값이 커지기 때문이다.
  • 빈도가 작지만 강하게 연결된 고유명사 결합(예, 전문용어, 고유어)을 더 잘 추출하는 경향이 있다.

    빈도수가 높은데 PMI가 작을 경우는, 두 단어는 자주 등장하지만 각각이 다른 단어와도 많이 붙기 때문에 그 조합이 고유하지는 않다는 것과 같다.



ref)

  • 송상일, 이동주, and 이상구. "PMI 를 이용한 우리말 어휘의 의미 극성 판단." 한국정보과학회 학술발표논문집 37.1C (2010): 26-0-265.
  • Turney, Peter D., and Michael L. Littman. "Measuring praise and criticism: Inference of semantic orientation from association." acm Transactions on Information Systems (tois) 21.4 (2003): 315-346.
  • Kherwa, Pooja, and Poonam Bansal. "Semantic N-Gram Topic Modeling." EAI Endorsed Transactions on Scalable Information Systems 7.26 (2020).
  • Role, François, and Mohamed Nadif. "Handling the impact of low frequency events on co-occurrence based measures of word similarity-a case study of pointwise mutual information." International conference on knowledge discovery and information retrieval. Vol. 2. Scitepress, 2011.

0개의 댓글