信息论:互信息、熵、概率分布、对数函数

互信息 I(X;Y) 衡量的是,了解 X 能告诉你多少关于 Y 的信息,也就是通过学习 X 能解决多少关于 Y 的不确定性。香农将其定义为:

I(X;Y) = H(Y) - H(Y|X)

其中,H(Y) 是 Y 本身的熵(不确定性),H(Y|X) 是在已知 X 的情况下 Y 的熵。两者之差就是 X 消除了多少不确定性。

等价地:I(X;Y) = H(X) + H(Y) - H(X,Y)

各个熵之和减去它们的联合熵(Joint entropy)。(和交叉熵 cross-entropy不同)

而且对称性极佳:I(X;Y) = I(Y;X),信息流向哪个方向都无所谓。

例如,当我们交谈时,我的话语是X,你的理解是Y。高互信息量意味着我的话语真正减少了你的不确定性,我们是在真正地沟通,而不是互相制造噪音。


熵和概率之间有着深刻的联系!

H(Y|X) 看起来像条件​​概率,因为它使用了条件概率。让我们来分解一下:

H(Y|X) = Σ p(x) H(Y|X=x)

它是 Y 在 X 所有可能值上的熵的预期,并根据每个 X 的可能性进行加权。

但关键的区别在于,概率告诉你某件事有多可能。熵告诉你你对它的有多不确定,这取决于整个概率分布。

例如:

- 如果 Y 的概率分布为 [0.5, 0.5] ,H(Y) = 1 位(最大不确定性)
- 如果 Y 的概率分布为 [0.99, 0.01] ,H(Y) ≈ 0.08 位(非常小的不确定性)

所以不确定性本身不是概率,它是概率分布的函数。它衡量的是分布的“分散”程度或“令人惊讶”程度。


对于离散情况(例如骰子),熵是一个和:

H(Y) = -Σ p(y) log₂ p(y)

你对所有可能的 y 值求和,每个值都对总和贡献 p(y) log₂ p(y)。

但对于连续分布(例如高斯分布),它就变成了一个积分,我们称之为“微分熵”(differential entropy):

h(Y) = -∫ f(y)

posted @ 2025-10-12 10:16  CathyBryant  阅读(90)  评论(0)    收藏  举报  来源