信息熵
维基百科:熵的概念最早起源于物理学,用于度量一个热力学系统的无序程度。在信息论里面,熵是对不确定性的测量。但是在信息世界,熵越高,则能传输越多的信息,熵越低,则意味着传输的信息越少。
简单来说,信息熵 = 一件事的「不确定程度」。
越猜不准、越没谱、结果越乱,熵就越高;板上钉钉、完全没悬念的事,熵就是 0。
我们获取信息的过程,本质就是降低熵、消除不确定性的过程。
例子:抛硬币
均匀硬币,正反概率各 50%:猜结果,完全没把握,猜对猜错全靠蒙,不确定性拉满。这时候它的信息熵就是1 比特(信息的最小单位)。
两面都是正面的硬币,100% 出正面:结果完全没有任何悬念,没有一丁点不确定性。这时候它的信息熵就是 0。
例子:废话
废话“明天要么下雨要么不下雨”:这句话没有消除任何不确定性,所以它的信息量为0,听完和没听一样,熵还是原来那么高。
计算公式
信息熵是香农提出来的,公式长这样:
\[H(X) = -\sum_{i=1}^n p(x_i) \log_2 p(x_i)
\]
其中:
-
\(H(X)\):就是X这件事的信息熵,我们要算的数
-
\(p(x_i)\):第i个结果发生的概率(比如抛硬币正面的概率0.5)
我们用均匀硬币算一遍,验证一下:
正反概率都是0.5,代入公式:
\[H = - (0.5 \times \log_2 0.5 + 0.5 \times \log_2 0.5) = - (0.5\times(-1) + 0.5\times(-1)) = 1
\]
这个东西到底有啥用?
- 文件压缩:手机里的照片、视频、微信发的文件,还有zip压缩包,核心原理就是信息熵。
比如一个文档全是“aaaaaaaaaa”,每个字符出现的概率100%,熵极低,就能压缩得特别小;如果是完全随机的乱码,每个字符概率都差不多,熵极高,就很难压缩,甚至压完还变大。 - 猜谜/决策:玩“我想一个东西,你用是/否问题来猜”,高手为什么问的问题少?因为他每次问的问题,都能最大程度降低信息熵,比如先问“是不是活的?”,直接把范围砍一半,而不是一上来就问“是不是猫?”。
- AI/机器学习:现在的大模型、推荐算法,核心就是靠信息熵来判断“哪些信息能消除不确定性”,比如给你推视频,就是找能最大程度降低“你会不会看完”这个不确定性的内容。
信息熵,就是事情的不确定程度。越乱、越猜不准,熵越高;越确定、越没悬念,熵越低。我们学知识、找信息,本质就是在给这个世界的各种事“降熵”。

浙公网安备 33010602011771号