信息论
瞎写一通
1.熵
1.1定义与基本性质
给定一个离散型的随机变量\(X\),定义其熵(entropy)为\(\sum_{x\in \mathcal{X}}^n-p_x\log_2p_x\),其中\(p_x\)是\(X\)取到\(x\)的概率,\(\mathcal{X}\)为其支撑集。
熵有如下性质:
1.1.1\(H(X)\geq 0\)
证明:因为\(p\)是概率质量,显然有\(\log_2p_x\geq 0\),所以\(\sum_{x\in \mathcal{X}}^n-p_x\log_2p_x\geq 0\)
1.1.2.\(H(X)=0\)当且仅当\(X\)退化
证明:\(p_x\log_2p_x=0\)当且仅当\(p_x=1\),而\(\forall_{x\in\mathcal{X}},p_x\leq 1\),得证。
1.1.3.\(H(X)\)取到最大当且仅当\(X\)是均匀分布
证明:考虑另一个随机变量\(Y\), \(Y\)的支撑集是\(X\)中所有元素的倒数(比如假设\(X\)的支撑集是\(1,2,3\),那么\(Y\)是\(1,\dfrac{1}{2},\dfrac{1}{3}\)
取到\(\dfrac{1}{a}\)的概率为\(p_a\)
\(H(X)=E(\log_2Y)\)
\(\leq \log_2E(Y)\)(根据Jensen不等式)
\(=\log_2(\sum_{x\in \mathcal{X}}^np_x\dfrac{1}{p_x})=\log_2(|\mathcal{X}|)\).
1.1.4.\(H(X)\geq H(f(X))\)
证明略
定义二元熵函数\(h(p)=-p\log_2p-(1-p)\log_2(1-p),0\leq p\leq 1\)
定义\(h(0)=h(1)=0\),这样定义的原因是\(\lim_{p\to 0}-p\log_2p-(1-p)\log_2(1-p)=\lim_{p\to 1}-p\log_2p-(1-p)\log_2(1-p)=0\)
假如\(X\)服从两点分布,那么\(H(X)=h(p)\),其中\(p\)是\(X\)在其支撑集的某个元素的取值
定理1.1.4:\(h\)在\((0,\dfrac{1}{2})\)上递增,在\((\dfrac{1}{2},1)\)上递减,并且是凸的
证明:微积分,略过
1.2条件/联合熵
定义\(H(Y|X)=\sum_{a\in \mathcal{X}}p_aH(Y|X=a)\)为变量\(Y\)关于\(X\)的条件熵(conditional entropy)
\(H(Y|X=a)\)为给定\(X=a\)的情况下,\(p_{Y|x=a}\)的熵
定义\(H(X,Y)=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}-\Pr(X=x,Y=y)\log_2(\Pr(X=x,Y=y))\)为变量\(X,Y\)的联合熵
我们也可以简写为\(H(XY)\)
同理我们也可以定义若干个变量的联合熵\(H(X_1,...,X_n)\)
联合/条件熵有如下性质:
定理1.2.1:次可加性:\(H(X)+H(Y)\geq H(X,Y)\),当且仅当在\(X,Y\)独立时取等
证明:此处只证明次可加性
\(H(X,Y)-H(X)-H(Y)=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}-p_{xy}\log_2p_{xy}+\sum_{x\in \mathcal{X}}q_x\log_2q_x+\sum_{x\in \mathcal{X}}r_x\log_2r_x\),其中\(p\)是\(X,Y\)的联合分布,\(q,r\)分别是\(X,Y\)的边缘分布
\(=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}-p_{xy}\log_2p_{xy}+\sum_{x\in \mathcal{X},y\in \mathcal{Y}}p_{xy}\log_2q_x+\sum_{x\in \mathcal{X},y\in \mathcal{Y}}p_{xy}\log_2r_x\)
\(=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}p_{xy}(\dfrac{q_xr_x}{p_{xy}})\)
\(\leq \log_2(\sum_{x\in \mathcal{X},y\in \mathcal{Y}}(\dfrac{q_xr_x}{p_{xy}}p_{xy}))=\log_2(1)=0\)
推论1.2.2:\(H(X_1,...,X_n)\)\leq \sum_{i=1}^nH(X_i)
定理1.2.3(链式法则):\(H(X,Y)=H(X)+H(Y|X)\)
证明:\(H(X)+H(Y|X)=\sum_{x\in \mathcal{X}}-q_x\log_2q_x-\sum_{x\in \mathcal{X},y\in \mathcal{X}}-q_x\dfrac{p_{xy}}{q_x}\log_2q_x\)
\(=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}-p_{xy}\log_2q_x-\sum_{x\in \mathcal{X},y\in \mathcal{X}}-p_{xy}\log_2\dfrac{p_{xy}}{q_x}\)
\(=\sum_{x\in \mathcal{X},y\in \mathcal{Y}}-p_{xy}(\log_2p_{xy})=H(X,Y)\)
推论1.2.4:\(H(X_1,...,X_n)=\sum_{i=1}^nH(X_i|X_1,...,X_{i-1})\)
以上所有定理在式子两侧给定相同的(可能是多个)随机变量条件的情况下也成立:
这么说读者可能不太能理解,此处举例子:根据次可加性,\(H(X_1,X_2|Y_1,Y_2)\leq H(X_1|Y_1,Y_2)+H(X_2|Y_1,Y_2)\)
根据链式法则,\(H(X_1,X_2|Y_1,Y_2)=H(X_1|Y_1,Y_2)+H(X_2|X_1,Y_1,Y_2)\)
推论1.2.5:\(H(X)\geq H(X|Y)\)
对于下面2个定理假设\(\epsilon n\)是整数
定理1.2.6 \(\sum_{i\leq \epsilon n}\dbinom{n}{i}\leq 2^{nh(\epsilon)}\)
证明:考虑\(n\)个取值为\(0,1\)随机变量\(X_1,...,X_n\),他们的联合分布满足\(\Pr(X_1+...+X_n\leq n\epsilon)=\dfrac{1}{\sum_{i\leq \epsilon n}\dbinom{n}{i}\leq 2^{nh(\epsilon)}}\),\(\Pr(X_1+...+X_n>n\epsilon)=0\)
\(X_i\)服从参数为\(\epsilon\)的两点分布
所以根据次可加性,\(H(X_1,...,X_n)=\log_2(\sum_{i\leq \epsilon n}\dbinom{n}{i})\leq \sum_{i=1}^nH(X_i)=nh(\epsilon)\)
所以\(\sum_{i\leq \epsilon n}\dbinom{n}{i}\leq 2^{nh(\epsilon)}\)。
1.3 Bregman对于\(01\)矩阵永久式的估计
定义一个矩阵\(A\)的永久式:\(per(A)=\sum_p\prod_{i=1}^nA_{i,p_i}\)
对于一个给定的矩阵,求出永久式是#P-complete问题(FKT算法允许我们对于平面图快速计算完美匹配数,而完美匹配数可以转化为永久式,在此处略过不讲)。但是Bregman定理允许我们估计\(01\)矩阵永久式的上界:
定理1.3.1 (Bregman,1974)设第\(i\)行有\(r_i\)个\(1\),那么\(per(A)\leq \prod_{i=1}^n(r_i!)^{\frac{1}{r_i}}\)
证明:令\(S=\{p:\forall A_{i,p_i}=1\}\)(\(p\)是\(1,...,n\)的排列),随机变量\(X\)为支撑集为\(S\)的均匀分布的随机变量。
那么\(\log_2 per(A)=H(X)\)。
考虑使用链式法则展开\(H(X)\)。此处直接按照顺序\(1,...,n\)展开会很难做,因为\(H(X_i|X_1,...,X_{i-1})\)和矩阵的前\(i-1\)行的所有元素都相关,这会很难算。
所以考虑引入一个新的在\(1,...,n\)均匀随机的排列\(q\),并且按照\(q_1,...,q_n\)的顺序展开:\(H(X)=H(X|q)=\sum_{i=1}^nH(X_{q_i}|X_{q_1},...,X_{q_{i-1}},q)\)(因为\(X,q\)独立)
考虑估计\(H(X_i|I,q)\),其中\(I\)是\(q\)中出现在\(i\)之前的随机变量(比如排列\(2314\)中出现在\(X_1\)之前的是\(X_2,X_3\))。
如果第\(i\)行的\(1\)有\(Y_i\)个出现在\(X_i\)前,那么\(H(X_i|I,q)\)的上界是\(\log_2(Y_i)\)
而由于\(q\)均匀随机,所以\(Y_i\)在\(0,1,...,r_i-1\)均匀分布。所以\(H(X_i|I,q)\leq \dfrac{\log_2(r_i!)}{r_i}\)
所以\(\log_2 H(X)\leq \prod_{i=1}^n\dfrac{\log_2(r_i!)}{r_i}\),得证。
2.Frankl猜想
这可能是组合数学中,最不需要前置知识就能理解的猜想。
猜想2.1(Frankl,1979):给定一个全集\([n]\),\(S\)是一个由\([n]\)的某些子集所构成的集合,如果一个集合\(S\)满足对于所有\(A,B\in S\),那么\(A\cup B\in S\),那么我们说它是是Union-closed(并闭合的)。如果\(S\)是Union-closed的,那么存在\(i\),使得至少有\(\dfrac{|S|}{2}\)个元素包含\(i\)。
这个猜想虽然描述起来很简单,但是求解起来却很困难,也很容易给出伪证(至少平均值原理不太能用)
2022年,谷歌研究员Gilmer对于此猜想做出了突破性的贡献:他证明了存在\(i\),使得至少有\(\Omega(|S|)\)个元素包含\(i\)。
在其原论文中取了\(0.01|S|\)以方便计算。
Gilmer还在原论文中提到一个可能可以证明至少有\(\dfrac{3-\sqrt{5}}{2}|S|\)个元素包含\(i\)的路线。
在该paper发布的不到一周,就有至少\(3\)个组独立研究并改进了该方法。(其实用AI应该也可以做出同样的改进)
Gilmer使用的是信息论方法。
我们在此处直接证明Gilmer结果的改进版:(令\(c=\dfrac{3-\sqrt{5}}{2}\))
定理2.2:如果\(S\)是Union-closed的,那么存在\(i\),使得至少有\(c|S|\)个元素包含\(i\)。
证明:考虑其逆否命题:对于所有\(i\in [n]\),如果所有元素\(i\in [n]\)处于小于\(c|S|\)个集合中,那么\(S\)不是union-closed的
随机选取均匀独立的\(A,B\in S\),证明\(A\cap B\notin S\)
我们记\(A_{<i}\)为\(A_1,...,A_{i-1}\).
引理2.3:如果存在\(i\)使得\(\Pr(i\in A)\leq c\),那么\(H(A\cap B)>H(A)\)
在假设引理2.3的情况下,因为\(A\)是均匀随机选择的,\(H(A\cap B)>H(A)=\log_2(|S|)\)
因为\(A\cap B\)是union-closed的,\(A\cap B\in S\),所以\(H(A\cap B)\leq \log_2(|S|)\),矛盾
引理2.3的证明:设\(C=A\cap B\)(此处令\(A,B,C\)为集合\(A,B,C\)的特征向量\(\{i:i\in A\}\))
那么\(C_i,A_i,B_i\)都是随机变量
\(H(C)=\sum_{i=1}^nH(C_i|C_{<i})\)(链式法则)
\(\geq \sum_{i=1}^nH(C_i|A_{<i},B_{<i},C_{<i})\)
\(=H(C_i|A_{<i},B_{<i})\)(已知\(A,B\),我们可以求得\(C\),所以\(C_{<i}\)是多余的)
\(H(A)=\sum_{i=1}^nH(A_i|A_{<i})\)(链式法则)
所以我们只需证明\(H(C_i|A_{<i},B_{<i})\geq \sum_{i=1}^nH(A_i|A_{<i})\),并且对于某个\(i\),\(H(C_i|A_{<i},B_{<i})> \sum_{i=1}^nH(A_i|A_{<i})\)
令\(p_i=\Pr(A_i=1|A_{<i}),q_i=\Pr(B_i=1|B_{<i})\),那么根据全期望公式,\(E(p_i)=E(q_i)=\Pr(A_i=1)=E(A_i)\)
\(p_i,q_i\)都是随机变量(分别由\(A_{<i},B_{<i}\)决定)。因为\(A,B\)独立同分布,所以\(p_i,q_i\)也独立同分布。
\(\Pr(C_i=0|A_{<i},B_{<i})=\Pr(A_i=B_i=0|A_{<i},B_{<i})=\Pr(A_i=0|A_{<i},B_{<i})\Pr(B_i=0|A_{<i},B_{<i})\)
\(=(1-p_i)(1-q_i)\)
\(\Pr(C_i=0|A_{<i},B_{<i})=1-(1-p_i)(1-q_i)\),所以\(H(C_i|A_{<i},B_{<i})=E(h((1-p_i)(1-q_i))\)
\(H(A_i|A_{<i})=E(h(p_i))=E(h(1-p_i))\)
所以我们只需要证明\(E(h(XY))>E(h(X))\)对于一切期望小于\(c\)的i.i.d的\(X,Y\)成立(换元\(X=1-p_i,Y=1-q_i\))
也就是\(2E(h(XY))>2E(h(X))=E(h(X))+E(h(Y))\)
引理2.4:设原来的\(E(X)=\lambda\),我们只需要考虑\(X,Y\)都为两点分布,且期望为\(\lambda\)的情况
根据逆否命题的假设,\(E(p_i)<c,E(X)=E(1-p_i)=\lambda>1-c\)
所以\(\dfrac{\lambda}{1-c}>1\)
证明略过。
应用引理2.4,设\(\Pr(X=\gamma)=\alpha\),那么\(E(X)=\gamma\alpha=\lambda\)
因为\(X,Y\)都服从两点分布,\(2E(h(XY))-E(h(X))-E(h(Y))=2\alpha^2h(\gamma^2)-2\alpha h(\gamma)\)
即证\(\alpha h(\gamma^2)-h(\gamma)>0\)
引理2.5:对于任何\(x\in [0,1],h(x^2)\geq \phi xh(x)\),其中\(\phi=\dfrac{1+\sqrt{5}}{2}=\dfrac{1}{1-c}\)
证明:略过,基本微积分
将引理2.5带入(令\(x=\gamma\)),可得\(\alpha h(\gamma^2)-\alpha h(\gamma)\geq \dfrac{\alpha\gamma}{1-c} h(\gamma)-h(\gamma)\)
\(=h(\gamma)(\dfrac{\alpha\gamma}{1-c}-1)=h(\gamma)(\dfrac{\lambda}{1-c}-1)>0\),得证。
此处\(\phi\)越大,\(\dfrac{1}{1-c}\)越大,\(c\)也会越大,但是引理2.5的不等式会在\(x=\frac{1}{\phi}\)处取等,所以\(c\)其实就是Gilmer方法的上限了。
3.信息压缩
假如我们有\(n\)个词\(w_1,...,w_n\),每个出现概率为\(p_i\),我们想将它们压缩成\(n\)个\(01\)串,使得这些串的期望长度\(\sum_{i=1}^nl_ip_i\)最小。
判断这些串是否是prefix-free(即每个串都不能是另一个串的前缀),我们可以用Kraft不等式:
定理1.2.1:(Kraft):假如这些串必须是prefix-free,那么\(\sum_{i=1}^n\frac{1}{2^{l_i}}\leq 1\)
而且假如\(\sum_{i=1}^n\frac{1}{2^{l_i}}\leq 1\),那么存在01串序列\(a_1,...,a_n\),使得\(|a_i|=l_i\)并且\(a\)是prefix-free的
证明:第一部分可以考虑使用概率方法:设事件\(A_i\)表示在随机生成的无限长度的\(01\)串中,\(w_i\)是该串的前缀的概率。
显然有\(P(A_i)=\frac{1}{2^{l_i}}\)
并且\(A_i\)之间为互斥事件(否则
4.互信息与KL散度
5.Shearer引理与其运用
5.1 Shearer引理及其变种
考虑随机变量\(X_1,...,X_n\),设\(X_S\)表示以\(S\)中元素为下标的\(X\)中的随机变量
我们想要估计\(X\)的熵。
定理5.1.1:(J.B Shearer,1978,未发表)令\(S\)是\([n]\)的随机子集,且与\(X\)独立,如果对于所有\(i\in [n]\)都有\(\Pr(i\in S)\geq\alpha a\),那么\(H(X_S|S)\geq \alpha H(S)\)
证明:设\(S\)的支撑集是\(T\)
假设\(Y\)包含元素\(y_1,...,y_k\),并且\(y\)单调递增,根据链式法则\(H(X_Y)=\sum_{i=1}^k H(X_{y_i}|X_{y_1},...X_{y_{i-1}})\)
\(\geq \sum_{i=1}^k H(X_{y_i}|X_{<y_i})=\sum_{i\in Y}H(X_i|X_{<i})\)(推论1.2.5)
所以\(H(X_S|S)=\sum_{Y\in T}\Pr(S=Y)\sum_{i\in Y}H(X_i|X_{<i})\)
\(=\sum_{i=1}^nH(X_i|X_{<i})\sum_{Y\in Y,i\in Y}\Pr(S=Y)\geq \alpha \sum_{i=1}^nH(X_i|X_{<i})=H(X)\)(链式法则)
此外Shearer引理还有以下变种,略去证明:定理5.1.2:Shearer引理的子集形式:考虑\([n]\)的子集\(S_1,...,S_k\),如果所有\(i\in [n]\)都处于至少\(l\)个\(S\)内,那么\(H(X_S|S)\geq \dfrac{l}{k} H(S)\)
5.2 应用
第一个应用是估计给定边数\(m\),点数\(n\)的图中的大小为\(k\)的团数的上界
设\(X_1,...,X_n\)表示从
定理

浙公网安备 33010602011771号