Entropy?
- 정보를 표현하는데 필요한 최소한의 정보량
- x축이 확률값을 가지는 −log2P 분포

- 확률변수 X에 대한 확률이 P 일 때 정보량의 기대값
E[X]=−P(x)logP(x)
Cross-Entropy
- 실제 결과( P )와 예측( Q )결과의 확률 분포의 유사도를 나타내는 정도
- 두 확률 번수가 같다면 확률변수 X애 대한 기대값이고 최소한의 정보량을 가짐
H(P,Q)=−x∑P(x)logQ(x)
$P(x)$: 실제 분포 (Ground Truth). 우리가 원하는 정답
$Q(x)$: 예측 분포 (Predicted). 모델이 추정한
KL-Divergence
- 실제분포 (P)를 예측한 예측분포(Q) 간에 발생하는 낭비된 정보의 양
- 두 확률 분포의 차이(정보 손실량)을 잴떄 씀
- 일반적인 학습에서는 Cross-Entropy와 결과는 동일 (학습 변수는 Q, P는 상수)
- DKL(P∣∣Q)와 DKL(Q∣∣P)는 동일하지 않음(비대칭성).
- Supervised Learning에서 DKL(P∣∣Q) (Forward KL) 를 사용.
DKL(P∣∣Q)=H(P,Q)−H(P)
$H(P, Q)$ (Cross Entropy): 가짜 분포 $Q$로 설명했을 때 필요한 총 정보량 (비효율적)
$H(P)$ (Entropy): 진짜 분포 $P$로 설명했을 때 필요한 최소 정보량 (최적)$D_{KL}(P || Q)$: 정보 손실량 (낭비된 비트 수)