概率论导论 —— 矩
矩
-
“矩(Moment)”在数学和物理中用来描述物体的形状和质量分布(例如转动惯量)。
-
在统计学中,矩被用来描述随机变量概率分布的特征,矩的种类:
设\(X\)是均值为\(\mu\),方差为\(\sigma^2\)的随机变量。则对于任何正整数\(n\),\(X\)的\(n\)阶原点矩是\(E(X^n)\),\(n\)阶中心矩是\(E[(X-\mu)^n]\),\(n\)阶标准矩\(E[({X-\mu\over \sigma})^n]\)。前面的所有定义均隐含“如果存在”这一条件。特别地,均值是\(1\)阶原点矩,方差是\(2\)阶中心矩。
-
定义1(随机变量的对称性):如果\(X-\mu\)和\(\mu-X\)具有相同的分布,那就说明随机变量\(X\)是一个对称分布。也可以说是\(X\)是对称的或\(X\)的分布是对称的。
-
命题1:设\(X\)是概率密度函数为\(f\)的连续型随机变量,则\(X\)关于\(\mu\)对称当且仅当\(f(x)=f(2\mu-x)\)对支撑中的所有\(x\)都成立。
-
命题2:设\(X\)是关于均值\(\mu\)的对称的随机变量,那么对于任意奇数\(m\),都有如果\(E[(X-\mu)^m]\)存在,则\(E[(X-\mu)^m]=0\)。
-
定义2(偏度):对于均值为\(\mu\),方差为\(\sigma^2\)的随机变量\(X\),其偏度为\(3\)阶标准矩,即:
\[Skew(X)=E[({X-\mu\over\sigma})^3] \]由命题2可以进一步推导,对称分布的偏度一定为\(0\),但是其逆命题为假,因为存在奇数阶标准矩均为\(0\)的非对称分布。但我们可以根据\(Skew(X)≠0\)的情况下确定分布的部分特征:当\(Skew(X)>0\)时表示相对于左尾而言右尾更长,反之则表示相对于右尾而言左尾更长。
-
定义3(峰度):对于均值为\(\mu\),方差为\(\sigma^2\)的随机变量\(X\),其峰度为\(4\)阶标准矩的变形,即:
\[Kurt(X)=E[({X-\mu\over\sigma})^4] - 3 \]\(-3\)的出现是为了使得任何正态分布的峰度均为\(0\),其中\(X\)的\(4\)阶标准矩也被称为超值峰度。大致地说,把以均值为中心的一个标准差之间的区域、两个标准差之间的区域以及两个标准差以外的区别分别称为中心、肩部、尾部。那么,峰度越大的分布在中心就具有尖峰、低肩、厚尾的概率密度函数。
![[Figure_1 4.png]]
如图所示,\(Expo(1)\)分布和\(Pois(4)\)的偏度和峰度均为正,这表明它们都是右偏的,并且其尾部比正态分布更厚。\(Unif(0,1)\)的偏度为\(0\),峰度为负,偏度为\(0\)是因为分布关于均值对称,峰度为负是因为它没有尾部。
\(Expo(1)\)的偏度为\(2\),峰度为\(6\);\(Pois(4)\)的偏度为\(0.5\),峰度为\(0.25\);\(Unif(0,1)\)的偏度为\(0\),峰度为\(-1.2\)
矩母函数
母函数
母函数就是一根晾衣绳,我们把一个数列的各项挂在上面,以便于展示和研究。 —— \(Herbert Wilf\)
- 母函数(Generating Function),又称生成函数。在本质上是离散数学与连续微积分之间的一座桥梁。它将一个离散的数列映射为一个连续的“形式幂级数”(Formal Power Series),从而允许我们利用代数和微积分的强大工具(如多项式乘法、求导、泰勒展开等)来解决复杂的离散组合、递推和序列分析问题。
- 母函数具有两大核心类型:
对于任意一个数列\(a_0,a_1,a_2,\cdots\),我们主要使用两种母函数进行封装。- 普通母函数(Ordinary Generating Function, OGF)
普通母函数主要用于解决组合问题(无序选取)。其定义为:\[G(x)=\sum_{n=0}^∞a_nx^n=a_0+a_1x+a_2x^2+\cdots \]在这里,\(x\)本身没有实际的数值意义,它仅仅是一个“占位符”(Placeholder)。\(x^n\)的作用就hi标记\(x_n\)这个系数的位置。 - 指数母函数(Exponential Generating Function, EGF)
指数母函数主要用于解决排列问题(有序选取)。其定义为附加了阶乘分母的级数:\[E(x)=\sum_{n=0}^∞a_n{x^n\over n!}=a_0+a_1x+a_2{x^2\over 2!}+\cdots \]引入\(n!\)是为了抵消在排列问题中由于元素顺序不同而产生的重复计算。
- 普通母函数(Ordinary Generating Function, OGF)
- 母函数的作用:
母函数之所以强大,在于其乘法(卷积) 操作完美契合了组合数学中的“分配”和“组合”逻辑。
假设有两个数列\(A\)和\(B\),它们的普通母函数分别是\(F(x)\)和\(G(x)\)。如果将这两个函数相乘,设结果为\(H(x)=F(x)G(x)\),那么\(H(x)\)中\(x^n\)的系数\(c_n\)会是什么?
依据多项式乘法法则:\[c_n=\sum_{k=0}^na_kb_{n-k} \]这个公式正是离散卷积。在实际以一种,它代表了“将总量\(n\)分成两部分,一部分大小为\(k\)(从\(A\)中取),另一部分为\(n-k\)(从\(B\)中取)”的所有可能方案数之和。 - 母函数求解组合问题的实例:
给你\(1\)克、\(2\)克、\(3\)克、\(4\)克的砝码各一枚,问称出\(1\sim 10\)克的方案分别有多少种?
母函数的解决思路是,称出\(n\)克的方案数设为普通母函数中的\(x^n\)所对应的系数,即:\[M(x)=c_0+c_1x+c_2x^2+\cdots \]那么对于\(1\)克砝码而言,其对应的\(OGF\)为:\(M_1(x)=1+x\);对于\(2\)克砝码而言,其对应的\(OGF\)为:\(M_2(x)=1+x^2\);以此类推,那么我们该怎么对这四种砝码进行组合呢,答案就是上面提到的离散卷积:\[M(x)=(1+x)(1+x^2)(1+x^3)(1+x^4)=1+x+x^2+2x^3+2x^4+2x^5+2x^5+2x^7+\cdots + x^{10} \]进而我们可以得到结论,我们得到\(7\)克重量的砝码搭配方案就是\(c_7=2\)种,分别是\(3+4,1+2+4\),这里的数学原理就来自于离散卷积。 - 母函数最经典的纯数学应用是求解递推数列的通项公式,它可以将无穷递推过程转化为简单的代数方程。以斐波那契数列为例:
已知:\(f_0=0,f_1=1\),且对于\(n\ge2\),有\(f_n=f_{n-1}+f{n-2}\)。
推导通项公式的证明:- 构造普通母函数:设\(F(x)=\sum_{n=0}^∞f_nx^n\)。
- 利用错位相减法构造方程:\[F(x)=f_0+f_1x+f_2x^2+f_3x^3+\cdots\tag{1} \]\[xF(x)=f_0x+f_1x^2+f_2x^3+\cdots\tag{2} \]\[x^2F(x)=f_0x^2+f_1x^3+f_2x^4+\cdots\tag{3} \]
- 将\((1)\)减去\((2)\)和\((3)\):\[F(x)-xF(x)-x^2F(x)=f_0+(f_1-f_0)x+\sum_{n=2}^∞(f_n-f_{n-1}-f{n-2})x^n \]
- 代入初始条件\(f_0=0,f_1=1\),且由于\(n\ge2\)时递推式等于\(0\),无穷项全部消去:\[F(x)(1-x-x^2)=0+(1-0)x+0=x \]
- 得到母函数的闭式:\[F(x)={x\over 1-x-x^2} \]
- 此时,利用偏分式分解(Partial Fraction Decomposition)将分布分解为\((1-\alpha x)(1-\beta x)\),再利用等比数列展开,即可直接提取出\(x^n\)的系数,最后得到\(Binet\)公式(即斐波那契数列的无理数通项):\[f_n={1\over\sqrt{5}}(({1+\sqrt{5}\over2})^n-({1-\sqrt{5}\over2})^n) \]
- 除了纯数学,母函数再现代系统底层工程的“线性反馈移位寄存器(LFSR)”的分析中存在应用:
在特征为\(2\)的有限域\(GF(2)\)下,流密码的伪随机序列发生器通常依赖于\(LFSR\)。一个长度为\(L\)的\(LFSR\)产生的序列\(s_0,s_1,s_2,\cdots\)满足线性递推:\[s_n=\sum_{i=1}^Lc_is_{n-i}\pmod{2}\quad (n\ge L) \]其中\(c_i\in\{0,1\}\)是反馈抽头。
利用母函数分析\(LFSR\):- 设生成序列的母函数为\(S(x)=\sum_{n=0}^∞s_nx^n\)
- 定义该\(LFSR\)的反馈多项式(Connection Polynomial)为:\[C(x)=1+c_1x+c_2x^2+\cdots+c_Lx^L \]
- 考察乘积\(S(x)C(x)\)中的\(x^n\)的系数。当\(n\ge L\)时,其系数为:\[s_n+c_1s_{n-1}+c_2s_{n-2}+\cdots+c_Ln_{n-L} \]根据\(LFSR\)的递推规则,在\(GF(2)\)中这个和恒等于\(0\)。
- 这意味着\(S(x)C(x)\)中所有次数大于等于\(L\)的项全部消失了,它变成了一个次数最多为\(L-1\)的有限多项式,记为\(P(x)\)(由寄存器的初始状态决定)
- 最终,得出结论:\[S(x)={P(x)\over C(x)} \]它证明了任何\(LFSR\)产生的无限长伪随机比特流,都可以被压缩为一个有理分式。
在密码学分析中,如果我们截获了一段密文流,我们实际上只是看到了\(S(x)\)展开式的前几项,著名的Berlekamp-Massey(BM)算法,其底层逻辑正式利用已知的\(S(x)\)序列项,去逆向推导出一个度数最小的\(C(x)\),从而直接还原出\(LFSR\)的物理结构并恢复状态,完成流密码的破解。
矩母函数
-
矩母函数是对分布的矩进行编码的母函数。如果说母函数是“挂着数列的晾衣绳”,那么矩母函数就是一根“挂着随机变量所有特征(矩)的晾衣绳”。
-
定义(矩母函数):对于\(t\)的函数\(M(t)=E(e^{tX})\),如果它在含\(0\)点的开区间\((-a,a)\)内是有限的,那么它就是随机变量\(X\)的矩母函数(moment generating function, MGF)。否则,就说\(X\)的矩母函数不存在。
这里的有限就是,当随机变量\(X\)的取值很大的时候,\(t≠0\)的情况下,很容易导致其中的\(e^{tX}\)趋近于无穷,看下面的推导过程就能明白,这个时候就需要保证其对应的概率趋近于\(0\)才能保证整个积分/求和时存在的。因此定义中所说的有限,本质就是\(M(t)\)在\(0\)的邻域内是可计算的,不是无穷大。
如果我们将数列\(a_n\)替换为随机变量的各阶矩\(E(X^n)\),挂到指数母函数上:
\[M_X(t)=\sum_{n=0}^∞E(X^n){t^n\over n!} \]利用期望的线性性质,我们可以把期望符号\(E\)提到外面:
\[M_X(t)=E[\sum_{n=0}^∞{(tX)^n\over n!}] \]观察方括号内的无穷级数,根据微积分中的麦克劳林展开,可知\(\sum_{n=0}^∞{z^n\over n!}=e^z\),因此,方括号内的部分恰好是\(e^{tX}\)。
因此,矩母函数的定义即为\[M_X(t)=E(e^{tX}) \]对于任何有效的矩母函数,都有\(M(0)=1\)。
-
矩母函数怎么求解?
我们可以将\(Y=e^{tX}\)视作是随机变量\(X\)的一个函数,由\(LOTUS\)进行求解期望:- 离散型随机变量:\[M_X(t)=\sum_{x}e^{tx}P(X=x) \]
- 连续型随机变量:\[M_X(t)=\int_{-∞}^{+∞}e^{tx}f(x)dx \]
- 离散型随机变量:
-
注:不是所有的随机变量序列都有矩母函数,一些随机变量序列\(X\)甚至不存在\(E(X)\),或对于某些\(n>1\),\(E(X^n)\)不存在。在这种情况下,矩母函数显然也不会存在。但是即使\(X\)的所有阶矩都存在,如果矩的阶数增长太快,那么矩母函数也有可能不存在。幸运的是,有一种方法可以弥补这一缺陷,即键入虚数\(i\)。统计学家把函数\(\psi(t)=E(e^{itX}\)称为特征函数,而其他人则把它称为傅里叶变换。这样,特征函数总是存在的。
这里所说的矩的阶数增长的太快的意义是在\(M(t)\)的计算公式中分子中含有\(E(X^n)\)具有较大的增长速度,为了保证这个无穷级数收敛,分母\(n!\)的增长速度必须能“压制”住分子\(E(X^n)\)的增长速度。
-
矩母函数的应用基于它的三个定理:
- 通过对矩母函数求导可得到\(X\)的各阶矩:给定\(X\)的矩母函数,通过对矩母函数求\(n\)阶导,并计算其在\(t=0\)点的值就可以得到\(X\)的\(n\)阶矩,即\(E(X^n)=M^{(n)}(0)\)。
证明:
注意\(M(t)\)在\(0\)点的泰勒展开式为:\[M(t)=\sum_{n=0}^∞M^{(n)}(0){t^n\over n!} \]另一方面,又有\[M(t)=E(e^{tX})=E(\sum_{n=0}^∞X^n{t^n\over n!}) \]因为在满足某些条件(即\(E(e^{tX})\)在\(0\)附近是有限的)的情况下,允许期望与无穷级数进行互换,因此有:\[M(t)=\sum_{n=0}^∞E(X^n){t^n\over n!} \]比较两个表达式的系数,可得\(E(X^n)=M^{(n)}(0)\)。 - 用矩母函数确定分布:随机变量的矩母函数确定其分布:如果两个随机变量序列具有相同的矩母函数,那么它们一定具有相同的分布。事实上,如果即使存在一个包含\(0\)的微小区间\((-a,a)\),且在这个区间内矩母函数相等,那么随机变量序列也一定具有相同的分布。
- 独立随机变量序列和的矩母函数:如果\(X\)和\(Y\)相互独立,那么\(X+Y\)的矩母函数是:\[M_{X+Y}(t)=M_X(t)M_Y(t) \]这是因为如果\(X\)和\(Y\)相互独立,那么\(E(e^{t(X+Y)})=E(e^{tX})E(e^{tY})\)。
- 通过对矩母函数求导可得到\(X\)的各阶矩:给定\(X\)的矩母函数,通过对矩母函数求\(n\)阶导,并计算其在\(t=0\)点的值就可以得到\(X\)的\(n\)阶矩,即\(E(X^n)=M^{(n)}(0)\)。
-
随机变量位置-尺度变换后的矩母函数:若\(X\)的矩母函数是\(M(t)\),那么\(a+bX\)的矩母函数是:
\[M_{a+bX}(t)=E(e^{t(a+bX)})=e^{at}E(e^{btX})=e^{at}M(bt) \]
常见标准分布的矩母函数
伯努利分布的矩母函数
伯努利分布的矩母函数:对于\(X\sim Bern(p)\),\(e^{tX}\)在\(X\)以概率\(p\)取\(1\)时取值为\(e^t\);在\(X\)以概率\(q(q=1-p)\)取\(0\)时,取值为\(1\)。因此\(M(t)=E(e^{tX})=\sum_{x}e^{tx}P(X=x)=pe^t+q\),又因为对于所有的\(t\)而言,\(M(t)\)都是有限的,从而矩母函数在整个实数轴上都有定义。
几何分布的矩母函数
几何分布的矩母函数:对于\(X\sim Geom(p)\),
即,\(t\in (-∞, ln{1\over q})\),这是一个含\(0\)点的开区间。
均匀分布的矩母函数
设\(U\sim Unif(a,b)\),那么\(U\)的矩母函数是:
二项分布的矩母函数
二项分布的随机变量可以等价为一系列独立同分布的伯努利分布的随机变量的和,设\(X\sim Bin(n,p)\),由定理1以及伯努利分布的矩母函数为\(pe^t+q\):
负二项分布的矩母函数
前面介绍过\(X\sim NBin(r, p)\),是独立同分布的\(Geom(p)\)的随机变量的和,因此\(X\)的矩母函数:
正态分布的矩母函数
标准正态分布随机变量\(Z\)的矩母函数是:
最后一步是因为\(N(t,1)\)的概率密度函数在整个支撑上的积分为\(1\),由位置-尺度变换后的矩母函数的命题可知\(X=\mu+\sigma Z\sim N(\mu,\sigma^2)\)的矩母函数为:
指数分布的矩母函数
因为\(X\sim Expo(1)\)的矩母函数为:
所以\(Y={X\over\lambda}\sim Expo(\lambda)\)的矩母函数是:

矩、母函数(生成函数)、矩母函数(定义、定理)
浙公网安备 33010602011771号