信息熵——不确定性的量化描述
熵定义:
信息熵 (Information Entropy)用于度量信息不确定性的单位量。
信息“不确定性”的度量?
信息熵衡量的是一个事件发生前,你对其结果的不确定性用数学描述——信息熵是所有可能结果所含“信息量”的平均值。
类比来理解的话,就类似去求一堆数的平均值一样,这个平均值就是这群数的一个特征值。
与概率的区别:
信息熵不是概率,但它是概率的“平均不确定性”总结。
| 概率 | 信息熵 | |
|---|---|---|
| 研究对象 | 某一个结果 | 整体的不确定性 |
| 问的问题 | “它发生的可能性多大?” | “我到底有多不确定?” |
| 例子 | 正面 50% | 这个硬币的不确定性 |
| 数量 | 每个结果一个概率 | 整体一个熵 |
| 单位 | 通常无单位/百分比 | bit 等 |

例子辅助理解:
-
情况 A(熵极低): 你抛一枚两面都是“人头”的硬币。结果一定是人头,没有任何悬念。此时熵为 0,因为这件事没提供任何新信息。
-
情况 B(熵较高): 你抛一枚正常的硬币。正反概率各占 50%,你有一半的不确定性。
-
情况 C(熵更高): 你掷一个 6 面的骰子。结果有 6 种可能,比硬币更难猜中,不确定性更大,因此熵更高。
结论: 事情越随机、可能性越多、越均匀,信息熵就越大。在数据科学中,熵常被用来衡量数据的“纯度”。
bit位复习
一个 bit 只有两种状态:
- 0
- 1

怎么用bit来描述事物?
一个硬币,有正反两面,那么可以这样映射:
- 0——正面
- 1——反面
那么它有1个bit的信息量,也叫信息单位。
一个硬币如果正面,反面都是一样,那么你怎么抛,它都是正面,它没有任何额外的信息出现,都是0,0,0,0......。所以它的的信息熵是0;
怎么求出一件事的信息熵?
我们换一个稍微复杂一些的案例来求信息熵,
题目:
我们有一个袋子,袋子里有10个水果,其中7个是苹果,2个雪梨,1个是桃子,现在随机那一个水果出来,这个事情怎么求信息熵?
先看看 苹果、雪梨、桃子 的信息量:
- 00 —— 苹果;
- 01 —— 雪梨;
- 10 —— 桃子;
需要用2 bit 来描述信息量;
求信息熵,套公式:
求单个:
P(苹果)=0.7
\(
I(苹果)=−log_2(0.7) = 0.515 bit
\)
| 水果 | 概率 | 这一项的贡献 |
|---|---|---|
| 苹果 | 70% | 0.515 bit |
| 雪梨 | 20% | 2.322 bit |
| 桃子 | 10% | 3.322 bit |
| 总熵 | 1.157 bit |
公式流程图:
袋子
│
┌───────────┼───────────┐
↓ ↓ ↓
苹果 雪梨 桃子
70% 20% 10%
│ │ │
↓ ↓ ↓
0.515 bit 2.322 bit 3.322 bit
│ │ │
└────────────┼────────────┘
↓
加权平均
↓
1.157 bit
↓
信息熵
1.157 bit 所表示的含义?
按照苹果70%、雪梨20%、桃子10%的概率,反复随机取水果,那么每次确定水果结果所需要的信息量,长期平均约为 1.157 bit。
大约只需要观测2次就能猜到下次是什么。所以猜测袋子里下一次出现什么,不具备很高的不确定性。低信息熵。
信息熵,不要把它理解成:“这个东西有多少信息。”
更准确的是:“在我定义的概率模型下,这个随机变量有多难预测。”
总结:
- bit 是信息的单位;
- 单个结果的信息量衡量“这次结果有多意外”;
- 信息熵则是把所有可能结果的信息量按照概率做平均,衡量整个随机系统平均有多不确定。
规律:
结果越常见
↓
越容易猜到
↓
信息量越少
--------------
结果越罕见
↓
越难猜到
↓
信息量越多
练习
一个袋子里有 100 个水果:
- 苹果:50 个
- 香蕉:25 个
- 桃子:25 个
现在随机拿出一个水果。
请你计算这个随机事件的信息熵 (H(X))。
已知公式:
也就是:
第一步:先计算概率
你先自己算:
第二步:代入公式
算:
浙公网安备 33010602011771号