信息论:互信息、熵、概率分布、对数函数
互信息 I(X;Y) 衡量的是,了解 X 能告诉你多少关于 Y 的信息,也就是通过学习 X 能解决多少关于 Y 的不确定性。香农将其定义为:
I(X;Y) = H(Y) - H(Y|X)
其中,H(Y) 是 Y 本身的熵(不确定性),H(Y|X) 是在已知 X 的情况下 Y 的熵。两者之差就是 X 消除了多少不确定性。
等价地:I(X;Y) = H(X) + H(Y) - H(X,Y)
各个熵之和减去它们的联合熵(Joint entropy)。(和交叉熵 cross-entropy不同)
而且对称性极佳:I(X;Y) = I(Y;X),信息流向哪个方向都无所谓。
例如,当我们交谈时,我的话语是X,你的理解是Y。高互信息量意味着我的话语真正减少了你的不确定性,我们是在真正地沟通,而不是互相制造噪音。
熵和概率之间有着深刻的联系!
H(Y|X) 看起来像条件概率,因为它使用了条件概率。让我们来分解一下:
H(Y|X) = Σ p(x) H(Y|X=x)
它是 Y 在 X 所有可能值上的熵的预期,并根据每个 X 的可能性进行加权。
但关键的区别在于,概率告诉你某件事有多可能。熵告诉你你对它的有多不确定,这取决于整个概率分布。
例如:
- 如果 Y 的概率分布为 [0.5, 0.5] ,H(Y) = 1 位(最大不确定性)
- 如果 Y 的概率分布为 [0.99, 0.01] ,H(Y) ≈ 0.08 位(非常小的不确定性)
所以不确定性本身不是概率,它是概率分布的函数。它衡量的是分布的“分散”程度或“令人惊讶”程度。
对于离散情况(例如骰子),熵是一个和:
H(Y) = -Σ p(y) log₂ p(y)
你对所有可能的 y 值求和,每个值都对总和贡献 p(y) log₂ p(y)。
但对于连续分布(例如高斯分布),它就变成了一个积分,我们称之为“微分熵”(differential entropy):
h(Y) = -∫ f(y)

浙公网安备 33010602011771号