特殊的分布
矩母函数(MGF)
不一定存在,不像特征函数。
对随机变量\(X\),定义矩母函数:
\[M_{X}(t)=E\left[e^{t X}\right]\quad(\text{Note. }M_{X}(0)=1)
\]
若 \(M_{X}(t)\) 在包含原点的某邻域内存在,即存在 \(\delta>0\),使 \(M_{X}(t)\) 在 \((-\delta,+\delta)\) 上存在,则 \(M_{X}(t)\) 对应唯一分布函数 \(F_X(x)\)。
\[\left.\frac{d M_X(t)}{d t}\right|_{t=0}=E\left[X e^{t X}\right]=E(X)\\
\left.\frac{d M_X^k(t)}{d t^k}\right|_{t=0}=E\left[X^k e^{t X}\right]=E(X^k)
\]
若随机变量 \(\eta\) 的矩母函数为 \(M_\eta(t)\) ,且 \(\xi\) 与 \(\eta\) 相互独立。则 \(\xi+\eta\) 的矩母函数:
\[M_{\xi+\eta}(t)=M_{\xi}(t) \cdot M_\eta(t)
\]
矩母函数的意义:唯一地确定分布,且将分布的卷积化为乘积。
离散分布
Bernoulli 伯努利分布
参数为 \(p~~(0<p<1)\)。
\[\begin{aligned}
& P(x=1)=p, P(x=0)=1-p\\
& E(x)=p\\
& \operatorname{Var}(x)=p(1-p)
\end{aligned}
\]
Binomial 二项分布
参数为 \(n,p\) 相当于多个独立同分布的Bernoulli分布。
\[\begin{aligned}
& P(x=k)=C_{n}^{k} p^{k}(1-p)^{n-k} \quad k=0,1, \cdots n \\
& E(x)=\sum_{i=1}^{n} E\left[x_{i}\right]=n p\\
& \operatorname{Var}(x)=\sum_{i=1}^{n} \operatorname{Var}\left(x_{i}\right)=n p(1-p) .
\end{aligned}
\]
Geometric 几何分布
要几次才能成功
\[\begin{aligned}
&P(x=k)=(1-p)^{k-1} p \quad k=1,2 \ldots\\
&E(x)=\frac{1}{p}\\
&Var(x)=\frac{1-p}{p^2}
\end{aligned}
\]
几何分布还有无记忆性:若 \(k_{2}>k_{1}>0\). 则 \(P\left(x>k_{2} \mid x>k_{1}\right)=P\left(x>k_{2}-k_{1}\right)\)。
Poisson 泊松分布
参数为\(\lambda\)。
\[P(x=k)=\frac{e^{-\lambda} \cdot \lambda^{k}}{k !}
\]
期望为 \(\lambda\) ,方差也为 \(\lambda\)
连续分布
参数为 \(a, b \quad(a<b)\)
\[f_X(x)=\left\{ \begin{aligned}
&\frac{1}{b-a}&,x \in (a,b)\\
&0&,x \notin (a,b)
\end{aligned}\right.
\]
均匀分布具有以下性质:
-
若连续严格单调递增的函数\(F:(-\infty,+\infty) \rightarrow(0,1)\) 具有反函数 \(F^{-1}:(0,1) \rightarrow(-\infty,+\infty)\) ,则\(X=F^{-1}(U)\) 的分布函数为\(F\),其中 \(U \sim \text{Uniform} [0,1]\)。
-
对一般的分布函数 \(F\) ,若\(F^{-1}(u)=\inf \{x \mid F(x) \geqslant u\} , \forall u(-0,1)\),则$ x=F^{-1}(u)\(具有分布函数\)F$。
-
如果有机制产生 \((0,1)\) 的均匀分布随机变量,可以通过算法生成 \(P\left(X=x_{i}\right)=p_i,i=1,2, \cdots\) ,且 \(x_{1}<x_{2}<\cdots\) 。
Gamma分布
首先定义Gamma函数如下:
\[\tau(\alpha)=\int_{0}^{+\infty} t^{\alpha-1}e^{-t} d t \quad (d>0)
\]
Gamma函数具有以下性质:
\[\begin{aligned}
&\tau(n)=(n-1)!\\
&\tau\left(\frac{n}{2}\right)=\left(\frac{n}{2}-1\right)\left(\frac{n}{2}-2\right) \cdots \frac{3}{2} \cdot \frac{1}{2} \cdot \sqrt{\pi}\\
\end{aligned}
\]
定义Gamma分布如下:
- \(X \sim \operatorname{Gamma}(\alpha, 1)\):
\[f_X(x)= \left\{ \begin{aligned}&\frac{x^{\alpha-1} e^{-x}}{\tau(\alpha)}\\
&0 \end{aligned}\right.
\]
- \(Y \sim \operatorname{Gamma}(\alpha, \beta)\):
\[f_{Y}(y)=\left\{\begin{aligned}
&\frac{y^{\alpha-1} e^{-\frac{y}{\beta}}}{\tau(\alpha) \beta^{\alpha}}, & x>0 . \\
&0 & , x \leq 0 .
\end{aligned}\right.
\]
性质:
- 矩母函数:\(Y \sim \operatorname{Gamma}(\alpha, \beta) \Rightarrow M_{Y}(t)=\left(\frac{1}{1-\beta t}\right)^{\alpha} \quad,t<\frac{1}{\beta}\);
- \(E[Y]=\alpha \beta,Var(Y)=\alpha \beta^2\)。
特殊的Gamma分布:Exponential 指数分布
\(x \sim \text{Exponential}(\lambda) ,\lambda>0\):
\[f_{X}(x)=\left\{\begin{aligned}&\lambda e^{-\lambda x}&, x>0
\\& 0&, x \leq 0\end{aligned}\right.\\F_{X}(x)=1-e^{-\lambda x}
\]
性质:
-
无记忆性:对 \(t>s>0 ,P(X>t \mid X>s)=P(X>t-s)\)
-
\(X_{1}, \cdots X_{n}\stackrel{iid}{\sim}\text{Exponential}(\lambda)\),则 \(X_{1}+\cdots+X_{n} \sim \operatorname{Gamma}\left(n, \frac{1}{\lambda}\right)\)
-
期望为 \(\frac{1}{\lambda}\) ,方差为 \(\frac{1}{\lambda^2}\)
指数分布卷积:
\(X_{1}, \ldots, X_{n}\) 独立, \(X_{i} \sim \operatorname{Exp}\left(\lambda_{i}\right)\):
若 \(\lambda_1=\cdots=\lambda_n=\lambda\) ,则 \(Y=X_{1}+\cdots+X_{n}\sim \operatorname{Gamma}(n)\) 。
若对\(i\neq j,\lambda_i \neq \lambda_j\),则:
\[f_{Y}(x)=\left\{\begin{aligned}
&\sum_{i=1}^{n}\left[ \prod_{i \neq j}\left(\frac{\lambda_{j}}{\lambda_{j}-\lambda_{i}}\right) \lambda_{i} e^{-\lambda_{i} x}\right] &,x>0 \\
&0 &,x \leq 0
\end{aligned}
\right.
\]
\(\beta\) 分布
取相互独立的随机变量\(X,Y\),\(X \sim \operatorname{Gamma}(\alpha, 1)\),\(Y \sim \operatorname{Gamma}(\beta, 1)\),\(\frac{X}{X+Y}\) 服从\(\beta(\alpha,\beta)\)分布。
下面求概率密度函数:令
\[U=\frac{X}{X+Y},V=X+Y \Rightarrow\left\{\begin{array}{l}X=UV\\ Y=V(1-U)\end{array}\right.
\]
Jacobi多项式:
\[J=\left|\begin{array}{cc}v & u \\ -v & 1-u\end{array}\right|=v
\]
进而:
\[f_{UV}(u, v)=f_{X Y}(u v,v(u-u)) \cdot v =\frac{\left.e^{-v} v^{\alpha+\beta-1} u^{\alpha-1} u-u\right)^{\beta-1}}{\tau(\alpha) \tau(\beta)} (\text{Note.}0<u<1, v>0)
\]
计算 \(U\) 的边缘分布:
\[f_{U}(u)=\int_{0}^{+\infty} f_{UV}(u, v) d v = \begin{cases}\frac{\tau(\alpha+\beta) u^{\alpha-1}(1-u)^{\beta-1}}{\tau(\alpha) \tau(\beta)} & , 0<u<1\\
0 & , otherwise.\end{cases}
\]
.期望值和方差分别是:
\[\begin{gathered}
\mu=\mathrm{E}(X)=\frac{\alpha}{\alpha+\beta}, \\
\operatorname{Var}(X)=\mathrm{E}(X-\mu)^2=\frac{\alpha \beta}{(\alpha+\beta)^2(\alpha+\beta+1)} .
\end{gathered}
\]
正态分布
\[\begin{aligned}
&X \sim N(0,1) \Rightarrow f_{x}(x)=\frac{1}{\sqrt{2 \pi}} e^{-\frac{x^{2}}{2}} \\
& Y=\mu+\sigma X \Rightarrow Y \sim N\left(\mu, \sigma^{2}\right),f_{Y}(x)=\frac{1}{\sqrt{2 \pi} \sigma} e^{-\frac{(x-\mu)^{2}}{2 \sigma^{2}}}, x \in R \text {. } \\
& M_{X}(t)=e^{\frac{t^{2}}{2}}, M_{Y(t)}=E\left[e^{tY}\right]=e^{\mu t+\frac{(\sigma t)^{2}}{2}}
\end{aligned}
\]
对数正态分布:若 \(Y \sim N\left(\mu, \sigma^{2}\right)\),令 \(Z=e^{Y}\) ,称 \(Z \sim \operatorname{lognormal}\left(\mu, \sigma^{2}\right)\)。
\[E(Z)=e^{\mu+\sigma^2/2}
\]
多元正态分布、Cholesky分解
多元正态分布
- 均值向量:\(\mu=\left(\mu_{1}, \cdots, \mu_{n}\right)^{\top}\)
- 协方差矩阵:\(\Sigma \in \mathbb{R}^{n \times n}\) 为对称正定矩阵(正定矩阵的定义: \(\forall u \neq X \in \mathbb{R}^{n} , X^{\top} \Sigma X>0\))
多元正态分布记作:
\[X=\left(X_{1}, \cdots, X_{n}\right)^{\top}, X \sim N(\mu, \Sigma)
\]
概率密度函数为:
\[f_{X}(x)=\frac{1}{(\sqrt{2 \pi})^{n} \sqrt{\operatorname{det} \Sigma}} \cdot e^{-\frac{1}{2}(x-\mu)^{\top} \Sigma^{-1}(x-\mu)}
\]
上面这个形式显然太复杂了,可以绕开。考虑标准的多元正态分布\(\mu=(0,0, \ldots 0)^{\top},\Sigma=I,X \sim N(0, I)\),则
概率密度函数为:
\[f_{X}(x)=\left(\frac{1}{\sqrt{2 \pi}}\right)^{n} e^{-\frac{1}{2} x^{\top} x}=\prod_{i=1}^{n}\left(\frac{1}{\sqrt{2 \pi}} e^{-\frac{x_{i}^{2}}{2}}\right)
\]
矩母函数为:
\[M_{X}(t)=\prod_{i=1}^{n} M_{X_{i}}(t)=e^{\frac{1}{2}\left(t_{1}^{2}+\cdots+t_{n}^{2}\right)} =e^{\frac{1}{2} t^{\top} \cdot t}
\]
如何把标准多元正态分布转换为一般的多元正态分布呢?
Cholesky 分解
Cholesky分解的定义
定理:设 \(A \in \mathbb{R}^{n \times n}\) 为对称正定阵,则存在唯一的对角元为正的下三角阵\(L\), 使\(A=L \cdot L^{\top}\)。
注意\(A\)一定要是对称的,而协方差矩阵很好地满足了这个性质。
证明:若\(A\)为对称正定矩阵,\(S\)为非奇异方阵,则 \(S^{\top} A S\) 对称正定。进行合同变换(对 \(X \neq 0 ,S X \neq 0\) ):
\[X^{\top}\left(S^{\top} A S\right) X=(S X)^{\top} A(S X)>0
\]
上面给出的是正定矩阵的定义。
使用数学归纳法:当 \(n=1\) 时, 成立。设当 \(n=k\) 时,结论成立。则当 \(n=k+1\) 时,结论也成立。
如何进行Cholesky分解
- 分块:左上常数,左下列向量,右上行向量,右下降1阶矩阵;
- 计算:左上常数开根(值记为\(\alpha\)),左下列向量、右上行向量每个元素除以\(\alpha\)(左下、右上向量记为\(\mathbf{a},\mathbf{a}^\top\)),右下矩阵减去\(\mathbf{a}\mathbf{a}^\top\);
- 对右下矩阵重复上述过程,注意最后剩一个常数的时候还是要开根的。
例子:以如下 \(A\) 矩阵为例进行Cholesky分解:
\[A=\left[\begin{array}{rrr}
4 & 12 & -16 \\
12 & 37 & -43 \\
-16 & -43 & 98
\end{array}\right]
\]
从3到2:
分块:
\[\begin{gathered}
{\left[\begin{array}{r|rr}
4 & 12 & -16 \\
\hline 12 & 37 & -43 \\
-16 & -43 & 98
\end{array}\right]=\left[\begin{array}{ll}
l_{11} & \\
L_{21} & L_{22}
\end{array}\right]\left[\begin{array}{ll}
l_{11} & L_{21}^{\mathrm{T}} \\
& L_{22}^{\mathrm{T}}
\end{array}\right]} \\
=\left[\begin{array}{cc}
l_{11}^2 & l_{11} L_{21}^{\mathrm{T}} \\
l_{11} L_{21} & L_{21} L_{21}^{\mathrm{T}}+L_{22} L_{22}^{\mathrm{T}}
\end{array}\right]
\end{gathered}
\]
计算:
\[\begin{gathered}
l_{11}=\sqrt{a_{11}}=\sqrt{4}=2, \\
L_{21}=\frac{1}{l_{11}} A_{21}=\frac{1}{2}\left[\begin{array}{c}
12 \\
-16
\end{array}\right]=\left[\begin{array}{c}
6 \\
-8
\end{array}\right]
\end{gathered}
\]
右下矩阵计算:
\[\begin{gathered}
L_{22} L_{22}^{\mathrm{T}}=A_{22}-L_{21} L_{21}^{\mathrm{T}}=
{\left[\begin{array}{cc}
37 & -43 \\
-43 & 98
\end{array}\right]-\left[\begin{array}{c}
6 \\
-8
\end{array}\right]\cdot\left[\begin{array}{ll}
6 & -8
\end{array}\right]=\left[\begin{array}{cc}
1 & 5 \\
5 & 34
\end{array}\right]}
\end{gathered}
\]
从2到1:处理 \(A_{n e w}\)
\[A_{\text {new }}=L_{22} L_{22}^{\mathrm{T}}=\left[\begin{array}{cc}
1 & 5 \\
5 & 34
\end{array}\right]
\]
分块:
\[\left[\begin{array}{c|c}
1 & 5 \\
\hline 5 & 34
\end{array}\right]=\left[\begin{array}{ll}
l_{11} & \\
L_{21} & L_{22}
\end{array}\right]\left[\begin{array}{cc}
l_{11} & L_{21}^{\mathrm{T}} \\
& L_{22}^{\mathrm{T}}
\end{array}\right]=\left[\begin{array}{cc}
l_{11}^2 & l_{11} L_{21}^{\mathrm{T}} \\
l_{11} L_{21} & L_{21} L_{21}^{\mathrm{T}}+L_{22} L_{22}^{\mathrm{T}}
\end{array}\right]
\]
计算:
\[\begin{aligned}
l_{11} & =\sqrt{a_{11}}=\sqrt{1}=1, \\
L_{21} & =\frac{1}{l_{11}} A_{21}=\frac{1}{1}[5]=[5]
\end{aligned}
\]
右下矩阵计算:
\[\begin{gathered}
L_{22} L_{22}^{\mathrm{T}}=A_{22}-L_{21} L_{21}^{\mathrm{T}}={[34]-[5] \cdot[5]=[9]}
\end{gathered}
\]
从1到完成:处理 \(A_{n e w}\)
\[A_{\text {new }}=L_{22} L_{22}^{\mathrm{T}}=[9]
\]
此时 \(A_{n e w}\) 为 \(1 \times 1\) 的平凡情况,直接求平方根作为三角阵最右下角的元素即可。至此,Cholesky分解完成,结果为:
\[\left[\begin{array}{rrr}
4 & 12 & -16 \\
12 & 37 & -43 \\
-16 & -43 & 98
\end{array}\right]=\left[\begin{array}{rcr}
2 & 0 & 0 \\
6 & 1 & 0 \\
-8 & 5 & 3
\end{array}\right]\left[\begin{array}{rrr}
2 & 6 & -8 \\
0 & 1 & 5 \\
0 & 0 & 3
\end{array}\right]
\]
如何对多元正态分布使用Cholesky分解
对一般的多元正态分布,取 \(X \sim N(0,I),\Sigma=L L^{\top},Y=\mu+L X\) ,则\(Y \sim N (\mu, \Sigma)\)。
注意:\(L L^{\top}=\Sigma, \operatorname{det}\left(L L^{\top}\right)=\operatorname{det} \Sigma=\operatorname{det} L \cdot \operatorname{det} L^{\top}=\left(\operatorname{det} L\right)^{2}\)。因此 \(\operatorname{det} L=(\operatorname{det} \Sigma)^{\frac{1}{2}}\) 。
\[\begin{aligned}
Y \sim N(\mu, \Sigma)\Rightarrow M_{Y}(t)&=E\left(e^{t^{\top} Y}\right)=E\left(e^{t^{T} \cdot(L X+\mu)}\right) \\
& =E\left[e^{(t^{\top} L) X}\right] e^{t^{\top} \mu} \\
& =e^{\frac{1}{2} t^{\top} LL^{\top} t} \cdot e^{t^{\top} \mu}=e^{t^\top \mu+\frac{1}{2} t^{\top} \Sigma t}
\end{aligned}
\]
性质:如果对一般的多元正态分布做线性变换,得到的仍然是多元正态分布。
\[Z=\eta+C Y,\eta \in \mathbb{R}^{m},C \in \mathbb{R}^{m \times n} \Rightarrow Z \sim N\left(\eta+C \mu, C \Sigma C^{\top}\right)
\]
计算条件密度
若$X \sim N(\mu, \Sigma), X=\left(\begin{array}{l}X^{(1)} \ X^{(2)}\end{array}\right), \mu=\left(\begin{array}{l}\mu^{(1)} \ \mu^{(2)}\end{array}\right),\Sigma=\left(\begin{array}{ll}\Sigma_{11} & \Sigma_{12} \ \Sigma_{21} & \Sigma_{22}\end{array}\right) $ ,假设\(\Sigma_{11}\)对称正定,给定\(X^{(1)}=x^{(1)}\),求 \(X^{(2)}\) 的条件密度函数。解决这类问题可以构造辅助分布\(Y\),先待定系数矩阵\(T\),分离出\(X^{(1)},X^{(2)}\)彼此无关的部分。
\[\begin{aligned}
& Y =\left(\begin{array}{l}
Y^{(1)} \\
Y^{(2)}
\end{array}\right)=\left(\begin{array}{ll}
I & \\
T & I
\end{array}\right)\left(\begin{array}{l}
X^{(1)} \\
X^{(2)}
\end{array}\right)=\left(\begin{array}{ll}
I \\
T & I
\end{array}\right) X \Rightarrow
Y \sim N\left[\left(\begin{array}{ll}
I \\
T & I
\end{array}\right) \mu,\left(\begin{array}{ll}
I\\
T & I
\end{array}\right) \Sigma\left(\begin{array}{ll}
I&T^{\top} \\
& I
\end{array}\right)\right]
\end{aligned}
\]
对于:
\[\begin{aligned}
\left(\begin{array}{ll}
I & \\
T & I
\end{array}\right) \Sigma\left(\begin{array}{ll}
I & T^{\top} \\
& I
\end{array}\right)=\left(\begin{array}{c:c}
\cdots& (T\Sigma_{11}+\Sigma_{21})^\top \\
\hdashline
T\Sigma_{11}+\Sigma_{21} & \cdots
\end{array}\right)
\end{aligned}
\]
选择合适的\(T\),使非对角元素为0:
\[T\Sigma_{11}+\Sigma_{21}=0\Rightarrow T=-\Sigma_{21}\Sigma_{11}^{-1}
\]
此时:
\[Y=\left(\begin{array}{l}
X^{(1)} \\
X^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} X^{(1)}
\end{array}\right)
\sim N\left(\left(\begin{array}{l}
\mu^{(1)} \\
\mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} \mu^{(1)}
\end{array}\right),\left(\begin{array}{ll}
\Sigma_{11} &\\
&\Sigma_{22}-\Sigma_{21}\Sigma_{11}^{-1} \Sigma_{12}
\end{array}\right)\right) \\
\]
这个时候我们就实现了\(Y^{(1)} ,Y^{(2)}\)独立:
\[Y^{(2)} \sim N\left(\mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} \mu^{(1)}, \Sigma_{22}-\Sigma_{21} \Sigma_{11}^{-1} \Sigma_{12}\right)
\]
进而有条件期望:
\[\begin{aligned}
& X^{(2)}=Y^{(2)}-T Y^{(1)}\quad(\text{Note. }Y^{(1)}=X^{(1)})\\
& \Rightarrow X^{(2)} \sim N\left(\mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1}\left(\mu^{(1)}-X^{(1)}\right), \Sigma_{22}-\Sigma_{21} \Sigma_{11}^{-1} \Sigma_{12}\right)
\end{aligned}
\]
条件概率与条件期望
条件概率:\(A,B\) 事件 \(P(A \mid B)=\frac{P(A \cap B)}{P(B)}\)
对离散随机变量:
\[P\left(X=x_{i} \mid Y=y_{j}\right)=\frac{P\left(X=x_{i}, Y=y_{j}\right)}{P\left(Y=y_{j}\right)}
\]
对连续随机变量:
\[f_{X \mid Y}(x \mid y=y)=\frac{f_{X Y}(x, y)}{f_{Y}(y)}
\]
有性质:
\[\begin{aligned}
& E(X \mid Y=y)=\int_{R} x f_{X \mid Y}(X \mid y) d x=g(y) \\
& E(h(X) \mid Y=y)=\int_{R} h(x) f_{X \mid Y}(x \mid y) d x =g(y) . \\
& E(h(X,Y) \mid Y=y)=\int_{R} h(x, y) f_{X \mid Y}(x \mid y) d x=g(y) .
\end{aligned}
\]
若X与Y独立: \(E(X \mid Y)=E(X)\) 。
重要公式
- 迭代期望公式:\(E(X)=E(E(X \mid Y))\)
- 条件方差公式:\(\operatorname{Var}(X \mid Y)=E\left[\left(X-E[X \mid Y])^{2} \mid Y\right]\right.=E\left[X^{2} \mid Y\right]-(E[X \mid Y])^{2}\)
- 迭代方差公式:\(\operatorname{Var}(X)=\operatorname{Var}(E[X \mid Y])+E[\operatorname{Var}(X \mid Y)]\),由此不难发现不等关系:\(\operatorname{Var}(X) \geqslant \operatorname{Var}(E[X \mid Y])\)