Cross-Entropy, KL-Divergence

이정훈·2026년 2월 7일

Entropy?

  • 정보를 표현하는데 필요한 최소한의 정보량
  • xx축이 확률값을 가지는 log2P-log_2P 분포
  • 확률변수 XX에 대한 확률이 PP 일 때 정보량의 기대값
    E[X]=P(x)logP(x)E[X] = -P(x) \log P(x)

Cross-Entropy

  • 실제 결과( PP )와 예측( QQ )결과의 확률 분포의 유사도를 나타내는 정도
  • 두 확률 번수가 같다면 확률변수 XX애 대한 기대값이고 최소한의 정보량을 가짐
H(P,Q)=xP(x)logQ(x)H(P, Q) = - \sum_{x} P(x) \log Q(x)
$P(x)$: 실제 분포 (Ground Truth). 우리가 원하는 정답
$Q(x)$: 예측 분포 (Predicted). 모델이 추정한 

KL-Divergence

  • 실제분포 (PP)를 예측한 예측분포(QQ) 간에 발생하는 낭비된 정보의 양
  • 두 확률 분포의 차이(정보 손실량)을 잴떄 씀
  • 일반적인 학습에서는 Cross-Entropy와 결과는 동일 (학습 변수는 Q, P는 상수)
  • DKL(PQ)D_{KL}(P || Q)DKL(QP)D_{KL}(Q || P)는 동일하지 않음(비대칭성).
  • Supervised Learning에서 DKL(PQ)D_{KL}(P || Q) (Forward KL) 를 사용.
DKL(PQ)=H(P,Q)H(P)D_{KL}(P || Q) = H(P, Q) - H(P)
$H(P, Q)$ (Cross Entropy): 가짜 분포 $Q$로 설명했을 때 필요한 총 정보량 (비효율적)
$H(P)$ (Entropy): 진짜 분포 $P$로 설명했을 때 필요한 최소 정보량 (최적)$D_{KL}(P || Q)$: 정보 손실량 (낭비된 비트 수)
profile
AngDDo

0개의 댓글