Loading

随机过程(零):概统工具

特殊的分布

矩母函数(MGF)

不一定存在,不像特征函数。

对随机变量\(X\),定义矩母函数:

\[M_{X}(t)=E\left[e^{t X}\right]\quad(\text{Note. }M_{X}(0)=1) \]

\(M_{X}(t)\) 在包含原点的某邻域内存在,即存在 \(\delta>0\),使 \(M_{X}(t)\)\((-\delta,+\delta)\) 上存在,则 \(M_{X}(t)\) 对应唯一分布函数 \(F_X(x)\)

\[\left.\frac{d M_X(t)}{d t}\right|_{t=0}=E\left[X e^{t X}\right]=E(X)\\ \left.\frac{d M_X^k(t)}{d t^k}\right|_{t=0}=E\left[X^k e^{t X}\right]=E(X^k) \]

若随机变量 \(\eta\) 的矩母函数为 \(M_\eta(t)\) ,且 \(\xi\)\(\eta\) 相互独立。则 \(\xi+\eta\) 的矩母函数:

\[M_{\xi+\eta}(t)=M_{\xi}(t) \cdot M_\eta(t) \]

矩母函数的意义:唯一地确定分布,且将分布的卷积化为乘积。

离散分布

Bernoulli 伯努利分布

参数为 \(p~~(0<p<1)\)

\[\begin{aligned} & P(x=1)=p, P(x=0)=1-p\\ & E(x)=p\\ & \operatorname{Var}(x)=p(1-p) \end{aligned} \]

Binomial 二项分布

参数为 \(n,p\) 相当于多个独立同分布的Bernoulli分布。

\[\begin{aligned} & P(x=k)=C_{n}^{k} p^{k}(1-p)^{n-k} \quad k=0,1, \cdots n \\ & E(x)=\sum_{i=1}^{n} E\left[x_{i}\right]=n p\\ & \operatorname{Var}(x)=\sum_{i=1}^{n} \operatorname{Var}\left(x_{i}\right)=n p(1-p) . \end{aligned} \]

Geometric 几何分布

要几次才能成功

\[\begin{aligned} &P(x=k)=(1-p)^{k-1} p \quad k=1,2 \ldots\\ &E(x)=\frac{1}{p}\\ &Var(x)=\frac{1-p}{p^2} \end{aligned} \]

几何分布还有无记忆性:若 \(k_{2}>k_{1}>0\). 则 \(P\left(x>k_{2} \mid x>k_{1}\right)=P\left(x>k_{2}-k_{1}\right)\)

Poisson 泊松分布

参数为\(\lambda\)

\[P(x=k)=\frac{e^{-\lambda} \cdot \lambda^{k}}{k !} \]

期望为 \(\lambda\) ,方差也为 \(\lambda\)

连续分布

Uniform 均匀分布

参数为 \(a, b \quad(a<b)\)

\[f_X(x)=\left\{ \begin{aligned} &\frac{1}{b-a}&,x \in (a,b)\\ &0&,x \notin (a,b) \end{aligned}\right. \]

均匀分布具有以下性质:

  • 若连续严格单调递增的函数\(F:(-\infty,+\infty) \rightarrow(0,1)\) 具有反函数 \(F^{-1}:(0,1) \rightarrow(-\infty,+\infty)\) ,则\(X=F^{-1}(U)\) 的分布函数为\(F\),其中 \(U \sim \text{Uniform} [0,1]\)

  • 对一般的分布函数 \(F\) ,若\(F^{-1}(u)=\inf \{x \mid F(x) \geqslant u\} , \forall u(-0,1)\),则$ x=F^{-1}(u)\(具有分布函数\)F$。

  • 如果有机制产生 \((0,1)\) 的均匀分布随机变量,可以通过算法生成 \(P\left(X=x_{i}\right)=p_i,i=1,2, \cdots\) ,且 \(x_{1}<x_{2}<\cdots\)

Gamma分布

首先定义Gamma函数如下:

\[\tau(\alpha)=\int_{0}^{+\infty} t^{\alpha-1}e^{-t} d t \quad (d>0) \]

Gamma函数具有以下性质:

  • \(\tau(\alpha+1)=\alpha\tau(\alpha)\)

  • 对正整数 \(n\)

\[\begin{aligned} &\tau(n)=(n-1)!\\ &\tau\left(\frac{n}{2}\right)=\left(\frac{n}{2}-1\right)\left(\frac{n}{2}-2\right) \cdots \frac{3}{2} \cdot \frac{1}{2} \cdot \sqrt{\pi}\\ \end{aligned} \]

定义Gamma分布如下:

  • \(X \sim \operatorname{Gamma}(\alpha, 1)\)

\[f_X(x)= \left\{ \begin{aligned}&\frac{x^{\alpha-1} e^{-x}}{\tau(\alpha)}\\ &0 \end{aligned}\right. \]

  • \(Y \sim \operatorname{Gamma}(\alpha, \beta)\)

\[f_{Y}(y)=\left\{\begin{aligned} &\frac{y^{\alpha-1} e^{-\frac{y}{\beta}}}{\tau(\alpha) \beta^{\alpha}}, & x>0 . \\ &0 & , x \leq 0 . \end{aligned}\right. \]

性质:

  • 矩母函数:\(Y \sim \operatorname{Gamma}(\alpha, \beta) \Rightarrow M_{Y}(t)=\left(\frac{1}{1-\beta t}\right)^{\alpha} \quad,t<\frac{1}{\beta}\)
  • \(E[Y]=\alpha \beta,Var(Y)=\alpha \beta^2\)

特殊的Gamma分布:Exponential 指数分布

\(x \sim \text{Exponential}(\lambda) ,\lambda>0\)

\[f_{X}(x)=\left\{\begin{aligned}&\lambda e^{-\lambda x}&, x>0 \\& 0&, x \leq 0\end{aligned}\right.\\F_{X}(x)=1-e^{-\lambda x} \]

性质:

  1. 无记忆性:对 \(t>s>0 ,P(X>t \mid X>s)=P(X>t-s)\)

  2. \(X_{1}, \cdots X_{n}\stackrel{iid}{\sim}\text{Exponential}(\lambda)\),则 \(X_{1}+\cdots+X_{n} \sim \operatorname{Gamma}\left(n, \frac{1}{\lambda}\right)\)

  3. 期望为 \(\frac{1}{\lambda}\) ,方差为 \(\frac{1}{\lambda^2}\)

指数分布卷积:

\(X_{1}, \ldots, X_{n}\) 独立, \(X_{i} \sim \operatorname{Exp}\left(\lambda_{i}\right)\)

\(\lambda_1=\cdots=\lambda_n=\lambda\) ,则 \(Y=X_{1}+\cdots+X_{n}\sim \operatorname{Gamma}(n)\)

若对\(i\neq j,\lambda_i \neq \lambda_j\),则:

\[f_{Y}(x)=\left\{\begin{aligned} &\sum_{i=1}^{n}\left[ \prod_{i \neq j}\left(\frac{\lambda_{j}}{\lambda_{j}-\lambda_{i}}\right) \lambda_{i} e^{-\lambda_{i} x}\right] &,x>0 \\ &0 &,x \leq 0 \end{aligned} \right. \]

\(\beta\) 分布

取相互独立的随机变量\(X,Y\)\(X \sim \operatorname{Gamma}(\alpha, 1)\)\(Y \sim \operatorname{Gamma}(\beta, 1)\)\(\frac{X}{X+Y}\) 服从\(\beta(\alpha,\beta)\)分布。

下面求概率密度函数:令

\[U=\frac{X}{X+Y},V=X+Y \Rightarrow\left\{\begin{array}{l}X=UV\\ Y=V(1-U)\end{array}\right. \]

Jacobi多项式:

\[J=\left|\begin{array}{cc}v & u \\ -v & 1-u\end{array}\right|=v \]

进而:

\[f_{UV}(u, v)=f_{X Y}(u v,v(u-u)) \cdot v =\frac{\left.e^{-v} v^{\alpha+\beta-1} u^{\alpha-1} u-u\right)^{\beta-1}}{\tau(\alpha) \tau(\beta)} (\text{Note.}0<u<1, v>0) \]

计算 \(U\) 的边缘分布:

\[f_{U}(u)=\int_{0}^{+\infty} f_{UV}(u, v) d v = \begin{cases}\frac{\tau(\alpha+\beta) u^{\alpha-1}(1-u)^{\beta-1}}{\tau(\alpha) \tau(\beta)} & , 0<u<1\\ 0 & , otherwise.\end{cases} \]

.期望值和方差分别是:

\[\begin{gathered} \mu=\mathrm{E}(X)=\frac{\alpha}{\alpha+\beta}, \\ \operatorname{Var}(X)=\mathrm{E}(X-\mu)^2=\frac{\alpha \beta}{(\alpha+\beta)^2(\alpha+\beta+1)} . \end{gathered} \]

正态分布

\[\begin{aligned} &X \sim N(0,1) \Rightarrow f_{x}(x)=\frac{1}{\sqrt{2 \pi}} e^{-\frac{x^{2}}{2}} \\ & Y=\mu+\sigma X \Rightarrow Y \sim N\left(\mu, \sigma^{2}\right),f_{Y}(x)=\frac{1}{\sqrt{2 \pi} \sigma} e^{-\frac{(x-\mu)^{2}}{2 \sigma^{2}}}, x \in R \text {. } \\ & M_{X}(t)=e^{\frac{t^{2}}{2}}, M_{Y(t)}=E\left[e^{tY}\right]=e^{\mu t+\frac{(\sigma t)^{2}}{2}} \end{aligned} \]

对数正态分布:若 \(Y \sim N\left(\mu, \sigma^{2}\right)\),令 \(Z=e^{Y}\) ,称 \(Z \sim \operatorname{lognormal}\left(\mu, \sigma^{2}\right)\)

\[E(Z)=e^{\mu+\sigma^2/2} \]

多元正态分布、Cholesky分解

多元正态分布

  • 均值向量:\(\mu=\left(\mu_{1}, \cdots, \mu_{n}\right)^{\top}\)
  • 协方差矩阵:\(\Sigma \in \mathbb{R}^{n \times n}\) 为对称正定矩阵(正定矩阵的定义: \(\forall u \neq X \in \mathbb{R}^{n} , X^{\top} \Sigma X>0\)

多元正态分布记作:

\[X=\left(X_{1}, \cdots, X_{n}\right)^{\top}, X \sim N(\mu, \Sigma) \]

概率密度函数为:

\[f_{X}(x)=\frac{1}{(\sqrt{2 \pi})^{n} \sqrt{\operatorname{det} \Sigma}} \cdot e^{-\frac{1}{2}(x-\mu)^{\top} \Sigma^{-1}(x-\mu)} \]

上面这个形式显然太复杂了,可以绕开。考虑标准的多元正态分布\(\mu=(0,0, \ldots 0)^{\top},\Sigma=I,X \sim N(0, I)\),则

概率密度函数为:

\[f_{X}(x)=\left(\frac{1}{\sqrt{2 \pi}}\right)^{n} e^{-\frac{1}{2} x^{\top} x}=\prod_{i=1}^{n}\left(\frac{1}{\sqrt{2 \pi}} e^{-\frac{x_{i}^{2}}{2}}\right) \]

矩母函数为:

\[M_{X}(t)=\prod_{i=1}^{n} M_{X_{i}}(t)=e^{\frac{1}{2}\left(t_{1}^{2}+\cdots+t_{n}^{2}\right)} =e^{\frac{1}{2} t^{\top} \cdot t} \]

如何把标准多元正态分布转换为一般的多元正态分布呢?

Cholesky 分解

Cholesky分解的定义

定理:设 \(A \in \mathbb{R}^{n \times n}\) 为对称正定阵,则存在唯一的对角元为正的下三角阵\(L\), 使\(A=L \cdot L^{\top}\)

注意\(A\)一定要是对称的,而协方差矩阵很好地满足了这个性质。

证明:若\(A\)为对称正定矩阵,\(S\)为非奇异方阵,则 \(S^{\top} A S\) 对称正定。进行合同变换(对 \(X \neq 0 ,S X \neq 0\) ):

\[X^{\top}\left(S^{\top} A S\right) X=(S X)^{\top} A(S X)>0 \]

上面给出的是正定矩阵的定义。

使用数学归纳法:当 \(n=1\) 时, 成立。设当 \(n=k\) 时,结论成立。则当 \(n=k+1\) 时,结论也成立。

如何进行Cholesky分解

  • 分块:左上常数,左下列向量,右上行向量,右下降1阶矩阵;
  • 计算:左上常数开根(值记为\(\alpha\)),左下列向量、右上行向量每个元素除以\(\alpha\)(左下、右上向量记为\(\mathbf{a},\mathbf{a}^\top\)),右下矩阵减去\(\mathbf{a}\mathbf{a}^\top\)
  • 对右下矩阵重复上述过程,注意最后剩一个常数的时候还是要开根的。

例子:以如下 \(A\) 矩阵为例进行Cholesky分解:

\[A=\left[\begin{array}{rrr} 4 & 12 & -16 \\ 12 & 37 & -43 \\ -16 & -43 & 98 \end{array}\right] \]

从3到2:

分块:

\[\begin{gathered} {\left[\begin{array}{r|rr} 4 & 12 & -16 \\ \hline 12 & 37 & -43 \\ -16 & -43 & 98 \end{array}\right]=\left[\begin{array}{ll} l_{11} & \\ L_{21} & L_{22} \end{array}\right]\left[\begin{array}{ll} l_{11} & L_{21}^{\mathrm{T}} \\ & L_{22}^{\mathrm{T}} \end{array}\right]} \\ =\left[\begin{array}{cc} l_{11}^2 & l_{11} L_{21}^{\mathrm{T}} \\ l_{11} L_{21} & L_{21} L_{21}^{\mathrm{T}}+L_{22} L_{22}^{\mathrm{T}} \end{array}\right] \end{gathered} \]

计算:

\[\begin{gathered} l_{11}=\sqrt{a_{11}}=\sqrt{4}=2, \\ L_{21}=\frac{1}{l_{11}} A_{21}=\frac{1}{2}\left[\begin{array}{c} 12 \\ -16 \end{array}\right]=\left[\begin{array}{c} 6 \\ -8 \end{array}\right] \end{gathered} \]

右下矩阵计算:

\[\begin{gathered} L_{22} L_{22}^{\mathrm{T}}=A_{22}-L_{21} L_{21}^{\mathrm{T}}= {\left[\begin{array}{cc} 37 & -43 \\ -43 & 98 \end{array}\right]-\left[\begin{array}{c} 6 \\ -8 \end{array}\right]\cdot\left[\begin{array}{ll} 6 & -8 \end{array}\right]=\left[\begin{array}{cc} 1 & 5 \\ 5 & 34 \end{array}\right]} \end{gathered} \]

从2到1:处理 \(A_{n e w}\)

\[A_{\text {new }}=L_{22} L_{22}^{\mathrm{T}}=\left[\begin{array}{cc} 1 & 5 \\ 5 & 34 \end{array}\right] \]

分块:

\[\left[\begin{array}{c|c} 1 & 5 \\ \hline 5 & 34 \end{array}\right]=\left[\begin{array}{ll} l_{11} & \\ L_{21} & L_{22} \end{array}\right]\left[\begin{array}{cc} l_{11} & L_{21}^{\mathrm{T}} \\ & L_{22}^{\mathrm{T}} \end{array}\right]=\left[\begin{array}{cc} l_{11}^2 & l_{11} L_{21}^{\mathrm{T}} \\ l_{11} L_{21} & L_{21} L_{21}^{\mathrm{T}}+L_{22} L_{22}^{\mathrm{T}} \end{array}\right] \]

计算:

\[\begin{aligned} l_{11} & =\sqrt{a_{11}}=\sqrt{1}=1, \\ L_{21} & =\frac{1}{l_{11}} A_{21}=\frac{1}{1}[5]=[5] \end{aligned} \]

右下矩阵计算:

\[\begin{gathered} L_{22} L_{22}^{\mathrm{T}}=A_{22}-L_{21} L_{21}^{\mathrm{T}}={[34]-[5] \cdot[5]=[9]} \end{gathered} \]

从1到完成:处理 \(A_{n e w}\)

\[A_{\text {new }}=L_{22} L_{22}^{\mathrm{T}}=[9] \]

此时 \(A_{n e w}\)\(1 \times 1\) 的平凡情况,直接求平方根作为三角阵最右下角的元素即可。至此,Cholesky分解完成,结果为:

\[\left[\begin{array}{rrr} 4 & 12 & -16 \\ 12 & 37 & -43 \\ -16 & -43 & 98 \end{array}\right]=\left[\begin{array}{rcr} 2 & 0 & 0 \\ 6 & 1 & 0 \\ -8 & 5 & 3 \end{array}\right]\left[\begin{array}{rrr} 2 & 6 & -8 \\ 0 & 1 & 5 \\ 0 & 0 & 3 \end{array}\right] \]

如何对多元正态分布使用Cholesky分解

对一般的多元正态分布,取 \(X \sim N(0,I),\Sigma=L L^{\top},Y=\mu+L X\) ,则\(Y \sim N (\mu, \Sigma)\)

注意:\(L L^{\top}=\Sigma, \operatorname{det}\left(L L^{\top}\right)=\operatorname{det} \Sigma=\operatorname{det} L \cdot \operatorname{det} L^{\top}=\left(\operatorname{det} L\right)^{2}\)。因此 \(\operatorname{det} L=(\operatorname{det} \Sigma)^{\frac{1}{2}}\)

\[\begin{aligned} Y \sim N(\mu, \Sigma)\Rightarrow M_{Y}(t)&=E\left(e^{t^{\top} Y}\right)=E\left(e^{t^{T} \cdot(L X+\mu)}\right) \\ & =E\left[e^{(t^{\top} L) X}\right] e^{t^{\top} \mu} \\ & =e^{\frac{1}{2} t^{\top} LL^{\top} t} \cdot e^{t^{\top} \mu}=e^{t^\top \mu+\frac{1}{2} t^{\top} \Sigma t} \end{aligned} \]

性质:如果对一般的多元正态分布做线性变换,得到的仍然是多元正态分布。

\[Z=\eta+C Y,\eta \in \mathbb{R}^{m},C \in \mathbb{R}^{m \times n} \Rightarrow Z \sim N\left(\eta+C \mu, C \Sigma C^{\top}\right) \]

计算条件密度

若$X \sim N(\mu, \Sigma), X=\left(\begin{array}{l}X^{(1)} \ X^{(2)}\end{array}\right), \mu=\left(\begin{array}{l}\mu^{(1)} \ \mu^{(2)}\end{array}\right),\Sigma=\left(\begin{array}{ll}\Sigma_{11} & \Sigma_{12} \ \Sigma_{21} & \Sigma_{22}\end{array}\right) $ ,假设\(\Sigma_{11}\)对称正定,给定\(X^{(1)}=x^{(1)}\),求 \(X^{(2)}\) 的条件密度函数。解决这类问题可以构造辅助分布\(Y\),先待定系数矩阵\(T\)分离出\(X^{(1)},X^{(2)}\)彼此无关的部分。

\[\begin{aligned} & Y =\left(\begin{array}{l} Y^{(1)} \\ Y^{(2)} \end{array}\right)=\left(\begin{array}{ll} I & \\ T & I \end{array}\right)\left(\begin{array}{l} X^{(1)} \\ X^{(2)} \end{array}\right)=\left(\begin{array}{ll} I \\ T & I \end{array}\right) X \Rightarrow Y \sim N\left[\left(\begin{array}{ll} I \\ T & I \end{array}\right) \mu,\left(\begin{array}{ll} I\\ T & I \end{array}\right) \Sigma\left(\begin{array}{ll} I&T^{\top} \\ & I \end{array}\right)\right] \end{aligned} \]

对于:

\[\begin{aligned} \left(\begin{array}{ll} I & \\ T & I \end{array}\right) \Sigma\left(\begin{array}{ll} I & T^{\top} \\ & I \end{array}\right)=\left(\begin{array}{c:c} \cdots& (T\Sigma_{11}+\Sigma_{21})^\top \\ \hdashline T\Sigma_{11}+\Sigma_{21} & \cdots \end{array}\right) \end{aligned} \]

选择合适的\(T\),使非对角元素为0:

\[T\Sigma_{11}+\Sigma_{21}=0\Rightarrow T=-\Sigma_{21}\Sigma_{11}^{-1} \]

此时:

\[Y=\left(\begin{array}{l} X^{(1)} \\ X^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} X^{(1)} \end{array}\right) \sim N\left(\left(\begin{array}{l} \mu^{(1)} \\ \mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} \mu^{(1)} \end{array}\right),\left(\begin{array}{ll} \Sigma_{11} &\\ &\Sigma_{22}-\Sigma_{21}\Sigma_{11}^{-1} \Sigma_{12} \end{array}\right)\right) \\ \]

这个时候我们就实现了\(Y^{(1)} ,Y^{(2)}\)独立:

\[Y^{(2)} \sim N\left(\mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1} \mu^{(1)}, \Sigma_{22}-\Sigma_{21} \Sigma_{11}^{-1} \Sigma_{12}\right) \]

进而有条件期望:

\[\begin{aligned} & X^{(2)}=Y^{(2)}-T Y^{(1)}\quad(\text{Note. }Y^{(1)}=X^{(1)})\\ & \Rightarrow X^{(2)} \sim N\left(\mu^{(2)}-\Sigma_{21} \Sigma_{11}^{-1}\left(\mu^{(1)}-X^{(1)}\right), \Sigma_{22}-\Sigma_{21} \Sigma_{11}^{-1} \Sigma_{12}\right) \end{aligned} \]

条件概率与条件期望

条件概率:\(A,B\) 事件 \(P(A \mid B)=\frac{P(A \cap B)}{P(B)}\)

对离散随机变量:

\[P\left(X=x_{i} \mid Y=y_{j}\right)=\frac{P\left(X=x_{i}, Y=y_{j}\right)}{P\left(Y=y_{j}\right)} \]

对连续随机变量:

\[f_{X \mid Y}(x \mid y=y)=\frac{f_{X Y}(x, y)}{f_{Y}(y)} \]

有性质:

\[\begin{aligned} & E(X \mid Y=y)=\int_{R} x f_{X \mid Y}(X \mid y) d x=g(y) \\ & E(h(X) \mid Y=y)=\int_{R} h(x) f_{X \mid Y}(x \mid y) d x =g(y) . \\ & E(h(X,Y) \mid Y=y)=\int_{R} h(x, y) f_{X \mid Y}(x \mid y) d x=g(y) . \end{aligned} \]

若X与Y独立: \(E(X \mid Y)=E(X)\)

重要公式

  • 迭代期望公式:\(E(X)=E(E(X \mid Y))\)
  • 条件方差公式:\(\operatorname{Var}(X \mid Y)=E\left[\left(X-E[X \mid Y])^{2} \mid Y\right]\right.=E\left[X^{2} \mid Y\right]-(E[X \mid Y])^{2}\)
  • 迭代方差公式:\(\operatorname{Var}(X)=\operatorname{Var}(E[X \mid Y])+E[\operatorname{Var}(X \mid Y)]\),由此不难发现不等关系:\(\operatorname{Var}(X) \geqslant \operatorname{Var}(E[X \mid Y])\)
posted @ 2023-12-19 00:56  长歌不采薇  阅读(113)  评论(0)    收藏  举报