概率论

《概率论》全课程精讲

概率论是什么?一句话:把"不确定性"定量化的数学。掷硬币你无法预知结果,但掷 10000 次正面比例会稳定在 \(\frac{1}{2}\) 附近;保险无法预知谁出事,但能精确算出该收多少保费;搜索引擎不知道你下一个词是什么,但能算出概率最大的那个词。这一门课就是给你一套语言和工具,把"感觉""可能""差不多"翻译成精确的数字与方程。

学概率论最大的坑是只背公式、不建立图像。公式背得再熟,不知道它"在问什么、在答什么",考完就忘。这套笔记站在学长的视角,按"它要解决什么问题 → 它怎么解决 → 常考的题长什么样 → 它以后有什么用"的逻辑把全书过一遍。考前看完,脑子里应该有一张完整的知识地图。

复习建议:第 1、2 章是地基(占 30% 考分),第 3、4 章是主体(占 40%),第 5 章是灵魂(必有 1 个大题),第 6 章是应用(单独作为"数理统计"的一部分考察,约 20%)。


一、课程大纲

模块 章节 核心内容
基础概念 第 1 章:概率论的基本概念 随机试验、样本空间、事件、概率公理、古典/几何概型、条件概率、全概率公式、贝叶斯公式、独立性
分布理论 第 2 章:一维随机变量及其分布 随机变量、分布函数、离散型分布(0-1、二项、泊松、几何)、连续型分布(均匀、指数、正态)、随机变量函数的分布
分布理论 第 3 章:多维随机变量及其分布 联合分布、边缘分布、条件分布、独立性、二维随机变量函数的分布(和、max、min)
数字特征 第 4 章:随机变量的数字特征 数学期望、方差、协方差与相关系数、原点矩与中心矩
极限理论 第 5 章:大数定律与中心极限定理 切比雪夫不等式、依概率收敛、切比雪夫/辛钦/伯努利大数定律、中心极限定理
统计应用 第 6 章:数理统计基础 总体与样本、抽样分布(\(\chi^2\)\(t\)\(F\))、矩估计与极大似然估计、区间估计、假设检验初步

二、一条主线

全课程可以压缩成一句话:

把"不确定性"定量化。随机变量是核心对象,分布完整描述它,数字特征压缩它,大数定律和中心极限定理把理论和现实连接起来(为什么大量独立随机叠加的结果趋于正态)。

把这四层拆开看,就是整本书的骨架:

  1. 随机试验的长期频率是概率的源头。概率论回答的问题本质是:"如果一个随机试验重复做很多很多次,某件事发生的长期频率会稳定在哪个数上?" 这个"稳定的数"就叫概率。频率具有稳定性,这是整个理论的经验基础。
  2. 随机变量把试验结果翻译成数字。样本空间里的样本点可能是一堆乱七八糟的东西("正""反"、红球白球),用函数 \(X:\Omega\to\mathbb{R}\) 把它们映射成数,我们就能用微积分研究随机性了。这是概率论从"文字题"变成"数学题"的关键一跃。
  3. 分布完整描述随机变量。一个随机变量内部的所有随机性信息,全都被它的分布函数 \(F(x)=P\{X\le x\}\) 锁死了。你知道 \(F\),就能算出关于它的任何概率问题。多维时则是联合分布,外加边缘、条件、独立性这三个"切片角度"。
  4. 数字特征压缩分布。分布太全、太"胖",拿着不方便。期望告诉你"平均在哪",方差告诉你"波动多大",协方差/相关系数告诉你"两个变量有没有线性牵连"。数字特征丢了细节,但抓住了要害,而且它们在相加时运算规则极好(期望线性、独立时方差可加)。
  5. 极限定理把理论接回现实。前四章都在"给定分布算概率",但真实问题里分布往往是未知的、来自大量微小随机因素叠加的。大数定律说:平均会"收敛"到期望,频率会"收敛"到概率——这解释了为什么现实世界是可预测的、统计是有意义的。中心极限定理更惊人:只要叠加的独立随机因素够多,总和不管原来是什么分布,都近似服从正态分布——这解释了为什么正态分布在自然界和统计学里到处都是,也直接支撑了第 6 章"用样本推断总体"。

一句话记忆:频率→概率(第 1 章),概率→随机变量(第 2 章),一个变量→多个变量(第 3 章),随机变量→数字(第 4 章),数字→定律(第 5 章),理论→现实(第 6 章)。


三、逐章精讲

第 1 章 概率论的基本概念

这一章在干什么

给"概率"一个严谨的定义,并学会算它。这一章是全书的地基:它定义了什么是随机试验、什么是事件、概率必须满足哪些公理,还给出了两大"计算武器"——全概率公式和贝叶斯公式。后面所有章节的公式,本质上都是在这一章定义的框架上长出来的。

核心内容

1. 随机试验与样本空间

随机试验的三个特征:可重复进行、结果不唯一但可列举、事先无法预知结果。比如"掷一枚骰子"。

  • 样本空间 \(\Omega\):所有可能结果(样本点)的集合。掷骰子 \(\Omega=\{1,2,3,4,5,6\}\)
  • 事件:样本空间的子集。例如"点数为偶数" \(=\{2,4,6\}\)

关键观念:事件就是集合。所以概率论里集合论的所有运算(并、交、补、包含)都能直接用:\(A\)\(B\) 至少一个发生是 \(A\cup B\),同时发生是 \(A\cap B\)\(A\) 不发生是 \(\bar{A}\)。把文字翻译成集合符号,是这一章最重要的基本功。

2. 概率的公理化定义(柯尔莫哥洛夫公理)

概率是定义在事件上的一个函数 \(P\),满足三条公理:

  1. 非负性\(P(A)\ge 0\)
  2. 规范性\(P(\Omega)=1\)
  3. 可列可加性:互不相容的事件列 \(A_1,A_2,\dots\) 满足 \(P(\bigcup_{i=1}^{\infty}A_i)=\sum_{i=1}^{\infty}P(A_i)\)

由公理可推出常用性质:\(P(\varnothing)=0\)\(P(\bar{A})=1-P(A)\)\(P(A\cup B)=P(A)+P(B)-P(A\cap B)\)(减法公式)。

为什么"可列可加"这么重要?它是概率能算的根本保证:把事件拆成互不相容的小块,概率可以放心相加。后面全概率公式、无穷级数求和都用它。

3. 古典概型与几何概型

  • 古典概型\(\Omega\) 有限且每个样本点等可能,则

    \[P(A)=\frac{A\text{ 中包含的样本点数}}{\Omega\text{ 中样本点总数}} \]

    核心是数数:排列 \(A_n^k\)、组合 \(C_n^k\)、分球入盒、分配问题。"至少""至多""不放回""有放回"是高频陷阱,先想清楚样本空间怎么建,再数有利事件。
  • 几何概型:样本空间是某个可度量的区域(长度/面积/体积),等可能体现为"均匀落入",则 \(P(A)=\frac{A\text{ 的测度}}{\Omega\text{ 的测度}}\)。核心是画图求面积之比。"会面问题""蒲丰投针"都是经典模型。

4. 条件概率与乘法公式

在"已知 \(B\) 发生"的前提下,\(A\) 发生的概率为

\[P(A\mid B)=\frac{P(AB)}{P(B)}\qquad(P(B)>0) \]

它把概率空间"收缩"到 \(B\) 上再重新归一化——条件概率就是在缩小样本空间,这是最直观的理解。由它推出乘法公式

\[P(AB)=P(B)P(A\mid B)=P(A)P(B\mid A) \]

多个事件的乘法公式 \(P(A_1A_2\cdots A_n)=P(A_1)P(A_2\mid A_1)P(A_3\mid A_1A_2)\cdots\) 在"不放回摸球"这类题里几乎必用。

5. 全概率公式(先分情况,再汇总)

\(B_1,B_2,\dots,B_n\)\(\Omega\) 的一个划分(互不相容且并起来是 \(\Omega\),也称"完备事件组"),则

\[P(A)=\sum_{i=1}^{n}P(B_i)P(A\mid B_i) \]

直觉:\(A\) 发生太麻烦,我就问"\(A\) 是在哪种情况 \(B_i\) 下发生的"。每种情况 \(B_i\) 的概率 \(\times\) 该情况下 \(A\) 的条件概率,求和。"原因 → 结果"的正向推理

6. 贝叶斯公式(由果溯因)

在全概率公式的条件下,还反过来问"\(A\) 已经发生了,它是由 \(B_k\) 引起的概率是多少":

\[P(B_k\mid A)=\frac{P(B_k)P(A\mid B_k)}{\sum_{i=1}^{n}P(B_i)P(A\mid B_i)} \]

这里 \(P(B_i)\)先验概率\(P(B_i\mid A)\)后验概率。贝叶斯公式就是"用观测到的事实 \(A\),更新我们对原因的信念"。

直觉与记忆:贝叶斯的分子是乘法公式 \(P(B_kA)\),分母是全概率公式 \(P(A)\),所以它其实就是条件概率的定义\(P(B_k\mid A)=P(B_kA)/P(A)\)。两者一组合就有了。贝叶斯是机器学习中贝叶斯分类器、垃圾邮件过滤的数学内核。

7. 独立性

事件 \(A,B\) 相互独立定义为 \(P(AB)=P(A)P(B)\)。直观含义:\(B\) 发生不改变 \(A\) 的概率,即 \(P(A\mid B)=P(A)\)(当 \(P(B)>0\))。

注意三件事:① 独立 ≠ 互不相容。互不相容是"不能同时发生",独立是"彼此不影响",两码事。② 相互独立要求任意子集都满足乘积公式,两两独立不够(经典反例需要记一下)。③ 独立的判断常用实际背景:掷两次骰子、两次抽取(有放回)、两台机器,通常默认独立;不放回抽取则有关联。

典型题型/考点

  • 古典概型数数(排列组合、分球入盒、"至少一个"用补事件);
  • 几何概型求面积/长度之比;
  • 条件概率直接计算;
  • 用全概率公式求"最终结果"的概率(如:混料中任取一件是次品的概率);
  • 用贝叶斯公式做"已知结果反推原因"(如:抽到次品,它来自甲厂的概率);
  • 判断独立性、用独立性算交事件概率。

为什么这一章重要

这一章是统计、机器学习、算法分析的共同地基:

  • 机器学习里所有模型都在假设数据的概率分布,贝叶斯公式直接催生了朴素贝叶斯分类器;
  • 算法分析里"随机化算法""哈希冲突的概率""生日悖论"全是古典概型;
  • 第 2~6 章每一个概念(条件分布、条件期望、贝叶斯估计)都是这一章概念的推广。第 1 章没啃透,后面全是空中楼阁。

第 2 章 一维随机变量及其分布

这一章在干什么

把样本空间里的随机结果翻译成数,然后用函数(分布函数、分布律、密度)来描述"一个数的随机性"。这一章是全书的核心工具间:学会了它,"随机"就变成了"已知分布,算概率"这种标准操作。

核心内容

1. 随机变量:把"随机试验"变成"随机数"

随机变量是定义在样本空间上的函数 \(X:\Omega\to\mathbb{R}\)。掷硬币用 \(X=1\) 记正面、\(X=0\) 记反面。"\(X\) 的取值带随机性"这句话,含义是"它的取值由随机试验的结果决定"。

为什么要引入它?因为数字可以比较、加减、积分。有了 \(X\),概率论就从组合计数升级成微积分分析。

2. 分布函数 \(F(x)\):描述随机变量的"总开关"

\[F(x)=P\{X\le x\},\qquad -\infty<x<+\infty \]

性质(要背熟,也常被拿来出小题):

  1. \(F\) 单调不减;
  2. \(F(-\infty)=0\)\(F(+\infty)=1\)
  3. \(F\) 右连续。

只要 \(F\) 给定了,这个随机变量的所有概率问题都能回答\(P\{a<X\le b\}=F(b)-F(a)\)\(P\{X>a\}=1-F(a)\)。这就是"分布完整描述随机变量"的精确含义。连续型时 \(F\) 可写为 \(F(x)=\int_{-\infty}^{x}f(t)\,dt\);离散型时 \(F\) 是阶梯函数。

3. 离散型:分布律

取值可列(\(x_1,x_2,\dots\)),用分布律 \(p_k=P\{X=x_k\}\) 描述,满足 \(p_k\ge 0,\ \sum_k p_k=1\)

常见离散分布:

分布 分布律 / 含义 期望 方差
0-1 分布 \(P\{X=1\}=p\)\(P\{X=0\}=1-p\);一次试验成功与否 \(p\) \(p(1-p)\)
二项分布 \(B(n,p)\) \(P\{X=k\}=C_n^k p^k(1-p)^{n-k}\)\(n\) 次独立试验成功次数 \(np\) \(np(1-p)\)
泊松分布 \(P(\lambda)\) \(P\{X=k\}=\frac{\lambda^k}{k!}e^{-\lambda}\);稀有事件计数 \(\lambda\) \(\lambda\)
几何分布 \(P\{X=k\}=(1-p)^{k-1}p\);首次成功所需次数 \(\frac{1}{p}\) \(\frac{1-p}{p^2}\)
超几何分布 不放回抽样中的成功次数 \(\frac{nM}{N}\)

泊松分布的直观:它是"二项分布在 \(n\) 大、\(p\) 小、\(np=\lambda\) 时"的极限(稀有事件定律)。电话呼叫、放射粒子、网页点击量这些"单位时间/空间内稀有事件次数"都近似服从泊松。

4. 连续型:概率密度

密度函数 \(f(x)\ge 0,\ \int_{-\infty}^{+\infty}f(x)\,dx=1\) 描述,对任意区间

\[P\{a\le X\le b\}=\int_a^b f(x)\,dx \]

三个必须建立的直觉:① 连续型随机变量取"单点"的概率是 0\(\int_a^a f=0\)),所以 \(\le\)\(<\) 没区别;② 概率是密度曲线下的面积,不是 \(f(x)\) 本身的值(\(f(x)\) 可以大于 1!);③ \(f(x)\) 表示"\(x\) 附近的概率密集程度"。

常见连续分布:

分布 密度 / 含义 期望 方差
均匀分布 \(U(a,b)\) \(f(x)=\frac{1}{b-a}\ (a<x<b)\);等可能落在区间内 \(\frac{a+b}{2}\) \(\frac{(b-a)^2}{12}\)
指数分布 \(E(\lambda)\) \(f(x)=\lambda e^{-\lambda x}\ (x>0)\);寿命、等待时间 \(\frac{1}{\lambda}\) \(\frac{1}{\lambda^2}\)
正态分布 \(N(\mu,\sigma^2)\) \(f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\) \(\mu\) \(\sigma^2\)

指数分布的无记忆性 \(P\{X>s+t\mid X>s\}=P\{X>t\}\) 是经典考点,它意味着"已用时间不影响剩余寿命"。

5. 正态分布:全场最重要的分布

  • 标准正态 \(N(0,1)\) 的密度关于 \(y\) 轴对称,分布函数记 \(\Phi(x)\),查表;\(3\sigma\) 原则:\(P\{|X-\mu|<3\sigma\}\approx 0.997\)
  • 标准化:若 \(X\sim N(\mu,\sigma^2)\),则 \(Z=\frac{X-\mu}{\sigma}\sim N(0,1)\)。于是所有概率问题统一化为

    \[P\{a<X<b\}=\Phi\Big(\frac{b-\mu}{\sigma}\Big)-\Phi\Big(\frac{a-\mu}{\sigma}\Big) \]

    这个"标准化换元"几乎是正态分布所有题的必经步骤,务必熟练。

6. 随机变量函数的分布

已知 \(X\) 的分布,求 \(Y=g(X)\) 的分布。方法:

  • 离散型:把 \(X\) 取值映射到 \(g(x)\),合并相同值、概率相加;
  • 连续型——分布函数法(万能):先求 \(F_Y(y)=P\{Y\le y\}=P\{g(X)\le y\}\),把它写成关于 \(X\) 的概率(解不等式),再对 \(y\) 求导得 \(f_Y(y)\)
  • 连续型——公式法:当 \(g\) 严格单调时 \(f_Y(y)=f_X(h(y))\,|h'(y)|\),其中 \(h=g^{-1}\)

建议:分布函数法是本、公式法是"速",考试先保证分布函数法会写,再记公式。这个技能第 3 章求二维函数分布时还要用,属于一级重要。

典型题型/考点

  • 已知 \(F(x)\)\(P\{X\in \text{某区间}\}\),或反求参数;
  • 已知密度 \(f(x)\) 求待定常数、分布函数、区间概率;
  • 二项/泊松/指数/均匀/正态的识别与应用题;
  • 正态标准化查表计算;
  • \(Y=g(X)\) 求分布(分布函数法最常考);
  • 泊松作为二项极限的近似计算。

为什么这一章重要

这是统计建模的语法。任何真实问题只要能把"关心的量"抽象成一个随机变量,并判断它属于哪种分布,后面的估计、检验、机器学习全都有了起点。正态分布更是全局主角:第 5 章会告诉你它为什么"无处不在",第 6 章的置信区间、假设检验全部建立在其上。


第 3 章 多维随机变量及其分布

这一章在干什么

现实问题往往不只一个随机变量:身高和体重、成绩和学习时间、发射角和射程。这一章研究多个随机变量放一起怎么描述(联合分布),以及如何从一个变量"切"出另一个(边缘、条件),还回答一个关键问题:它们到底是不是相互独立的? 最后把第 2 章"求函数分布"推广到二维。

核心内容

1. 联合分布函数

对二维随机变量 \((X,Y)\)

\[F(x,y)=P\{X\le x,\ Y\le y\} \]

表示点落在"左下角区域"的概率。性质类比一维:对每个变量单调不减、\(F(-\infty,-\infty)=0\)\(F(+\infty,+\infty)=1\)、对每个变量右连续,此外还要满足矩形概率非负。

2. 二维离散型:联合分布律

\(p_{ij}=P\{X=x_i,\ Y=y_j\}\),满足 \(\sum_i\sum_j p_{ij}=1\)。联合分布律是一张二维表格,这是离散型二维问题最常用的载体——几乎所有的概率都能从表格里"按行按列"加出来。

3. 二维连续型:联合密度

\(f(x,y)\ge 0\)\(\iint_{\mathbb{R}^2}f(x,y)\,dx\,dy=1\),概率是密度曲面下的体积

\[P\{(X,Y)\in D\}=\iint_D f(x,y)\,dx\,dy \]

常考的区域 \(D\):矩形(可分离变量)、三角形(要分情况积分)、圆域(用极坐标)。

4. 边缘分布:把另一个变量"积掉"

  • 离散型:\(p_{i\cdot}=\sum_j p_{ij}\),即按行/按列求和
  • 连续型:\(f_X(x)=\int_{-\infty}^{+\infty}f(x,y)\,dy\)\(y\) 积掉

直觉:边缘分布只关心 \(X\),不管 \(Y\) 取什么,所以把 \(Y\) "加总/积分"掉。注意积分区间要画图确定——先画联合密度的支撑区域,再定 \(x\)\(y\) 的上下限,是二维积分的头号易错点。

5. 条件分布:把另一个变量"固定住"

  • 离散型:\(P\{X=x_i\mid Y=y_j\}=\frac{p_{ij}}{p_{\cdot j}}\),即在 \(Y=y_j\) 那一里按比例归一化;
  • 连续型:\(f_{X\mid Y}(x\mid y)=\frac{f(x,y)}{f_Y(y)}\)

结构上和第 1 章的条件概率完全一致:分子是联合,分母是边缘

6. 独立性:分布能否"因式分解"

\((X,Y)\) 独立的充要条件:

  • 离散型:\(p_{ij}=p_{i\cdot}\cdot p_{\cdot j}\)(表格里每格等于行边缘乘列边缘);
  • 连续型:\(f(x,y)=f_X(x)\,f_Y(y)\)(几乎处处)。

直觉:联合分布"拆得开",说明两个变量互不提供对方的信息。独立性在二维题目里几乎总是考点:要么判断独立(检验因式分解),要么已知独立后用 \(f(x,y)=f_X(x)f_Y(y)\) 代回计算。

7. 二维随机变量函数的分布

最重要的三个:

  • \(Z=X+Y\):卷积公式。连续型 \(f_Z(z)=\int_{-\infty}^{+\infty}f(x,z-x)\,dx\)(另一变量替换后积分);离散型 \(P\{Z=k\}=\sum_i P\{X=i\}P\{Y=k-i\}\)(独立时)。两个独立正态之和仍正态:若 \(X\sim N(\mu_1,\sigma_1^2)\)\(Y\sim N(\mu_2,\sigma_2^2)\) 独立,则 \(X+Y\sim N(\mu_1+\mu_2,\ \sigma_1^2+\sigma_2^2)\)
  • \(M=\max(X,Y)\):利用"最大小于等于 \(z\)"\(\iff\)"两个都小于等于 \(z\)":\(F_M(z)=F_X(z)F_Y(z)\)(独立时)。
  • \(N=\min(X,Y)\):利用补事件"最小大于 \(z\)"\(\iff\)"两个都大于 \(z\)":\(F_N(z)=1-\big[1-F_X(z)\big]\big[1-F_Y(z)\big]\)

求二维函数的分布,正统套路永远是:先求分布函数(把事件写成关于 \(X,Y\) 的不等式 → 画区域 → 积分),再求导。max/min 的"夹逼"写法是本题型最大的套路,务必背下来。

典型题型/考点

  • 已知联合分布律表格,求边缘、条件、判断独立;
  • 已知联合密度求待定常数、求 \(P\{(X,Y)\in D\}\)、求两个边缘密度;
  • 求条件密度、条件概率;
  • 判断(或利用)独立性计算;
  • \(Z=X+Y\)\(\max(X,Y)\)\(\min(X,Y)\) 的分布;
  • 二维正态分布 \(N(\mu_1,\mu_2,\sigma_1^2,\sigma_2^2,\rho)\) 的性质(边缘仍正态、\(\rho=0\iff\) 独立)。

为什么这一章重要

统计和机器学习几乎都在处理多维数据

  • 回归分析本质上在刻画"\(Y\)\(X\) 的条件分布";
  • 朴素贝叶斯假设特征条件独立,直接依赖本章的独立性概念;
  • "两个变量是否相关、相关多强"正是第 4 章协方差/相关系数要回答的,而本章给出了计算它们所需的全部原材料(联合分布与边缘分布)。

第 4 章 随机变量的数字特征

这一章在干什么

分布是"全量信息",但常常太"沉"。这一章学的是给随机变量做"数据压缩":期望(中心位置)、方差(波动幅度)、协方差/相关系数(线性关联度)、矩(更高阶的形状信息)。压缩会丢细节,但换来了超强的运算便利——这正是指标存在的全部理由。

核心内容

1. 数学期望:随机变量的"加权平均"

\[E(X)=\begin{cases}\displaystyle\sum_i x_i p_i, & X\text{ 离散}\\[6pt] \displaystyle\int_{-\infty}^{+\infty}x\,f(x)\,dx, & X\text{ 连续}\end{cases} \]

直觉:期望是"做很多次试验,结果的平均值"——第 5 章的大数定律会严格证明这一点。它回答"平均而言是多少"。

期望的性质(考试直接用):

  • \(E(C)=C\)\(E(aX+b)=aE(X)+b\)
  • 线性\(E(X+Y)=E(X)+E(Y)\)无需任何条件
  • \(X,Y\) 独立,则 \(E(XY)=E(X)E(Y)\)(反之不成立)。

随机变量函数的期望(必须掌握):

\[E[g(X)]=\int_{-\infty}^{+\infty}g(x)f(x)\,dx \]

二维:\(E[g(X,Y)]=\iint g(x,y)f(x,y)\,dx\,dy\)好处:不需要先求 \(g(X)\) 的分布,直接用原分布的密度算。这是求期望最省事的捷径。

2. 方差:围绕期望的"平均偏离"

\[\text{Var}(X)=E\big[(X-E(X))^2\big]=E(X^2)-\big[E(X)\big]^2 \]

直觉:方差衡量波动。"与平均值的平均平方距离"。第二个等式是计算神器:先算 \(E(X^2)\) 再减 \([E(X)]^2\)

方差的性质:

  • \(\text{Var}(C)=0\)\(\text{Var}(aX+b)=a^2\text{Var}(X)\)
  • 独立时 \(\text{Var}(X\pm Y)=\text{Var}(X)+\text{Var}(Y)\)注意:独立才可加,且 \(X+Y\)\(X-Y\) 的方差都是相加);
  • 一般地 \(\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y)+2\text{Cov}(X,Y)\)

标准差 \(\sigma(X)=\sqrt{\text{Var}(X)}\)\(X\) 同量纲,更"直觉"。

3. 协方差与相关系数

\[\text{Cov}(X,Y)=E\big[(X-E(X))(Y-E(Y))\big]=E(XY)-E(X)E(Y) \]

\[\rho_{XY}=\frac{\text{Cov}(X,Y)}{\sqrt{\text{Var}(X)}\sqrt{\text{Var}(Y)}} \]

  • 协方差正负表示 \(X,Y\) 同向还是反向变动
  • 相关系数把协方差"标准化"到 \([-1,1]\),不随量纲/线性变换改变(不变性),所以用来度量线性相关程度
  • \(|\rho|=1 \iff Y\)\(X\) 以概率 1 线性相关\(Y=aX+b\));
  • \(X,Y\) 独立 \(\Rightarrow \rho=0\)(不相关),反过来不成立——\(\rho=0\) 只说明没有线性关系,还可能有二次等非线性关系。这是最经典的反例考点(如 \(X\sim N(0,1)\)\(Y=X^2\))。

运算规则:\(\text{Cov}(X,Y)=\text{Cov}(Y,X)\)\(\text{Cov}(aX,bY)=ab\,\text{Cov}(X,Y)\)\(\text{Cov}(X_1+X_2,Y)=\text{Cov}(X_1,Y)+\text{Cov}(X_2,Y)\)独立性 ⇒ 不相关,但反之不成立,这是本章最重要的一对逻辑关系。

4. 矩

  • \(k\) 阶原点矩:\(\mu_k=E(X^k)\)
  • \(k\) 阶中心矩:\(\nu_k=E\big[(X-E(X))^k\big]\)
  • 期望是一阶原点矩,方差是二阶中心矩,只是"改名重出"。

典型题型/考点

  • 由分布律/密度求 \(E(X)\)\(E(X^2)\)\(\text{Var}(X)\)
  • \(E[g(X)]=\int g(x)f(x)dx\) 求函数的期望;
  • 利用期望/方差的性质算 \(E(aX+bY)\)\(\text{Var}(aX+bY)\)
  • \(\text{Cov}(X,Y)\)\(\rho_{XY}\),判断相关/独立;
  • 常见分布的期望与方差查表速算(第 2 章的表要背牢);
  • 由联合密度算 \(E(XY)\)\(E(X)\)\(E(Y)\) 从而得协方差。

为什么这一章重要

数字特征是一切推断的"目标量"

  • 第 6 章估计的根本目标就是"用样本均值估计期望、用样本方差估计方差";
  • 机器学习里的损失函数(均方误差)本质上就是 \(E[(Y-\hat{Y})^2]\),最小化它正是"方差 + 偏差"权衡问题的原型;
  • 协方差矩阵是多维正态分布和 PCA 主成分分析的核心工具;
  • 期望的线性性 \(\operatorname{E}(X+Y)=\operatorname{E}(X)+\operatorname{E}(Y)\) 连独立性都不要,这一条性质在算法分析(随机算法的期望运行时间)里被用到烂。

第 5 章 大数定律与中心极限定理

这一章在干什么

前四章是"给定了分布,算概率",属于纯数学。这一章是全书最深刻也最贴近现实的一章:它回答两个终极问题——

  1. 为什么"重复试验的频率稳定在概率附近"?(大数定律
  2. 为什么这么多自然现象、测量误差、统计量都近似正态?(中心极限定理

它是连接"概率论的数学世界"和"现实世界的统计"的桥。

核心内容

1. 切比雪夫不等式:不依赖分布的大概率估计

\(E(X)=\mu\)\(\text{Var}(X)=\sigma^2\),则对任意 \(\varepsilon>0\)

\[P\{|X-\mu|\ge\varepsilon\}\le\frac{\sigma^2}{\varepsilon^2} \]

它说:一个随机变量偏离期望超过 \(\varepsilon\) 的概率,被方差控制住。只用期望和方差就能给出概率上界,不用知道分布——这是它"万能"的原因。用途:证明大数定律、估计概率下界(常考"用切比雪夫不等式估计 \(P\{|X-\mu|<3\}\)"这种题)。

2. 依概率收敛与三个大数定律

\(\bar{X}_n=\frac{1}{n}\sum_{i=1}^{n}X_i\) 为样本均值。

  • 依概率收敛\(X_n\xrightarrow{P}a\) 意思是 \(P\{|X_n-a|>\varepsilon\}\to 0\ (n\to\infty)\),即"几乎不可能差得远"。这是弱收敛(不必逐点收敛,只管概率上靠近)。
大数定律 条件 结论
切比雪夫大数定律 \(X_i\) 两两不相关、方差一致有界(\(\text{Var}(X_i)\le C\) \(\bar{X}_n\xrightarrow{P}\frac{1}{n}\sum_{i=1}^{n}E(X_i)\)
辛钦大数定律 \(X_i\) 独立同分布、\(E(X)=\mu\) \(\bar{X}_n\xrightarrow{P}\mu\)
伯努利大数定律 \(n\) 次独立重复试验,\(A\) 发生 \(n_A\) 次,\(P(A)=p\) \(\frac{n_A}{n}\xrightarrow{P}p\)

一句话总结三个定律的"意思":均值收敛到期望,频率收敛到概率。伯努利大数定律是统计学的哲学基石——因为频率最终会稳定在 \(p\) 附近,我们才敢用抽样频率估计未知概率

3. 中心极限定理(本章的灵魂,也是全书的高潮)

独立同分布中心极限定理(林德伯格-莱维):设 \(X_1,X_2,\dots\) 独立同分布,\(E(X_i)=\mu\)\(\text{Var}(X_i)=\sigma^2>0\),则和 \(S_n=\sum_{i=1}^{n}X_i\) 的标准化:

\[\frac{S_n-n\mu}{\sigma\sqrt{n}}\xrightarrow{\text{分布}}N(0,1) \]

实用写法(近似):

\[S_n\approx N(n\mu,\ n\sigma^2),\qquad \bar{X}_n\approx N\Big(\mu,\ \frac{\sigma^2}{n}\Big) \]

德莫佛-拉普拉斯定理:二项分布 \(B(n,p)\)\(n\) 大时近似正态 \(N(np,\ np(1-p))\)

直觉(为什么大量独立随机因素叠加趋于正态):每个因素 \(X_i\) 都"单薄无力"(与总和相比方差很小),它们的波动相互抵消,剩下的净效果由波动大的方向决定,而大量小波动的综合效应自然呈现"中间密、两头稀"的钟形。中心极限定理说:只要因素独立、每个贡献都不占主导,叠加结果就越来越像正态,与单个因素原来的分布完全无关。这就是正态分布"无处不在"的数学根源。

应用套路(每年必考的大题)

  1. 判断 \(S_n\) 是"大量独立同分布的和",用 \(S_n\approx N(n\mu,n\sigma^2)\)
  2. 用连续性修正(针对二项/离散)\(P\{S_n\le k\}\approx\Phi\Big(\frac{k+0.5-n\mu}{\sigma\sqrt{n}}\Big)\)
  3. 标准化查表。

典型题型/考点

  • 用切比雪夫不等式给概率估计上界;
  • 判断哪个大数定律适用并说明"平均/频率稳定";
  • 中心极限定理近似计算 \(P\{S_n>c\}\)(涉及独立同分布和或二项);
  • 应用题:保险公司赔付、产品合格率估计、"最少需要多少次试验才能以 95% 概率保证……";
  • 说明中心极限定理为什么让正态分布成为"万能分布"。

为什么这一章重要

这一章是统计理论成立的理由

  • 抽样分布、置信区间、假设检验全靠"样本均值近似正态"撑腰(第 6 章直接使用);
  • 机器学习中随机梯度下降、大数误差分析都依赖大数定律;
  • 中心极限定理解释了为什么自然界大量现象(测量误差、人体指标、智商分数)服从正态分布;
  • "均值收敛、方差以 \(1/n\) 收缩"这个结论,是算法与统计里"样本越多估计越准"的数学基础。这一章值得背得滚瓜烂熟,因为它是全书的"魂"。

第 6 章 数理统计基础

这一章在干什么

前五章都是"已知分布,算概率",是正问题。现实却是反的:分布未知,我们只有一堆数据,要用数据反推分布——这就是数理统计。这一章学它的入门三件套:抽样分布(样本统计量服从什么分布)、参数估计(猜未知参数)、假设检验(先提出主张,再用数据决定信不信)。顺带把第 5 章的"样本均值近似正态"变成可用的推断工具。

核心内容

1. 总体、样本与统计量

  • 总体:研究对象全部个体(其指标是一个随机变量 \(X\),分布未知);
  • 样本:从总体中抽取的 \(n\) 个个体 \(X_1,\dots,X_n\),要求独立、与总体同分布(简称 i.i.d.,简单随机样本)——"独立性 + 同分布"正是第 2、3 章老朋友的组合;
  • 统计量:样本的函数(不含未知参数),如样本均值 \(\bar{X}=\frac{1}{n}\sum X_i\)、样本方差 \(S^2=\frac{1}{n-1}\sum(X_i-\bar{X})^2\)。统计量是随机变量,服从的分布就叫抽样分布

几个必须背的抽样分布结论:\(E(\bar{X})=\mu\)\(\text{Var}(\bar{X})=\sigma^2/n\)(样本均值方差缩到 \(\frac{1}{n}\),样本越多越集中——这是大数定律的回声);\(E(S^2)=\sigma^2\)除以 \(n-1\) 是为了无偏,这是常考点)。

2. 三大抽样分布

分布 构造 用途
\(\chi^2\)(卡方)分布 \(\chi^2=\sum_{i=1}^{n}Z_i^2\)\(Z_i\sim N(0,1)\) 独立,自由度 \(n\) 推断总体方差
\(t\) 分布 \(t=\frac{Z}{\sqrt{\chi^2/n}}\)\(Z\sim N(0,1)\)\(\chi^2\) 独立 方差未知时推断均值(厚尾、对称)
\(F\) 分布 \(F=\frac{\chi_1^2/n_1}{\chi_2^2/n_2}\) 比较两个总体方差

核心定理(必须记)\(X_1,\dots,X_n\) i.i.d. \(\sim N(\mu,\sigma^2)\),则

\[\bar{X}\sim N\Big(\mu,\frac{\sigma^2}{n}\Big),\qquad \frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1),\qquad \frac{\bar{X}-\mu}{S/\sqrt{n}}\sim t(n-1) \]

第三条"方差未知用 \(t\) 分布"是区间估计和假设检验的总开关。

3. 参数估计:矩估计与极大似然估计

设总体分布含未知参数 \(\theta\)

  • 矩估计:用样本矩替代总体矩。解方程

    \[E(X)=\bar{X}\quad(\text{一阶矩});\qquad E(X^2)=\frac{1}{n}\sum X_i^2\quad(\text{二阶矩}) \]

直觉:总体矩是 \(\theta\) 的函数(比如 \(E(X)=\lambda\)),样本矩是数据算出来的数,让"理论 = 实际",解出 \(\theta\)。简单但有时不唯一。

  • 极大似然估计(MLE):写出似然函数

    \[L(\theta)=\prod_{i=1}^{n}f(x_i;\theta)\quad(\text{连续型用密度,离散型用分布律}) \]

    然后对 \(\theta\) 求最大化,常用工具:取对数 → 求导 → 令导数为 0

直觉:找最"可能"产生这批观测数据的那个 \(\theta\)。"既然数据长这样,那它由哪个参数生成的概率最大?"这是统计里最有思想、也最常考的方法,必须会完整走一遍流程:写 \(L\) → 取 \(\ln L\) → 求导 → 解 \(\hat{\theta}\) → (常要求)验证二阶导为负。

  • 无偏性、有效性、一致性\(\hat{\theta}\) 的均值等于 \(\theta\)(无偏)、方差尽量小(有效)、\(n\to\infty\) 时收敛到 \(\theta\)(一致)。常考:验证某个估计量是否无偏(算 \(E(\hat\theta)=\theta\)?)。

4. 区间估计(置信区间)

求一个区间 \((\hat{\theta}_1,\hat{\theta}_2)\) 使 \(P\{\hat{\theta}_1<\theta<\hat{\theta}_2\}=1-\alpha\)\(1-\alpha\)置信水平

直觉:这个区间像"渔网"——\(1-\alpha\) 的意思是"如果反复抽样构造区间,有 \(1-\alpha\) 比例的区间会罩住真值 \(\theta\)"。真值是固定的,随机的是区间,这是理解置信区间最关键的一句话。

模板(背熟):

场景 枢轴量 置信区间
\(\sigma\) 已知,估 \(\mu\) \(\frac{\bar{X}-\mu}{\sigma/\sqrt{n}}\sim N(0,1)\) \(\bar{X}\pm z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\)
\(\sigma\) 未知,估 \(\mu\) \(\frac{\bar{X}-\mu}{S/\sqrt{n}}\sim t(n-1)\) \(\bar{X}\pm t_{\alpha/2}(n-1)\frac{S}{\sqrt{n}}\)
\(\sigma^2\) \(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\) \(\Big(\frac{(n-1)S^2}{\chi^2_{\alpha/2}},\ \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}}\Big)\)

\(n\) 大时 \(\sigma\) 未知可用 \(\frac{S}{\sqrt{n}}\)\(z\) 近似,即第 5 章的中心极限定理。)

5. 假设检验初步

流程(选择题/填空题高频):

  1. 提出原假设 \(H_0\) 与备择假设 \(H_1\)(如 \(H_0:\mu=\mu_0\)\(H_1:\mu\ne\mu_0\));
  2. 选检验统计量(和区间估计用同一个枢轴量);
  3. \(H_0\) 成立下求临界值/拒绝域(双侧或单侧);
  4. 根据样本值落入拒绝域与否,作出判断。
  • 两类错误:第一类错误(弃真,概率 \(\alpha\))——\(H_0\) 本来对却拒绝;第二类错误(取伪,概率 \(\beta\))——\(H_0\) 本来错却不拒绝。\(\alpha\) 由检验者设定,样本量固定时二者此消彼长(加大样本可同时减小)。
  • \(p\):能拒绝 \(H_0\) 的最小显著性水平,\(p<\alpha\) 则拒绝 \(H_0\)
  • 与区间估计的对应:\(\mu\) 的置信水平 \(1-\alpha\) 区间若包含 \(\mu_0\),则不拒绝 \(H_0\)——区间估计和假设检验是同一枚硬币的两面

典型题型/考点

  • 判断统计量是否无偏、计算 \(E(\bar{X})\)\(E(S^2)\)
  • 矩估计、极大似然估计的完整求解(指数、正态、均匀、泊松是常客);
  • 已知 \(\sigma\) 或未知 \(\sigma\) 时求均值 \(\mu\) 的置信区间;
  • 对方差求置信区间;
  • 均值检验(\(z\) 检验/双侧或单侧 \(t\) 检验)全流程 + 判断两类错误;
  • 卡方/正态/独立同分布性质的综合题。

为什么这一章重要

这一章是概率论通往"用数据做决策"的入口,也是机器学习模型评估的雏形:

  • "用样本估计总体"是数据科学最核心的信条,极大似然估计更是深度学习损失函数(交叉熵 = 负对数似然)的理论源头;
  • 假设检验对应 A/B 测试、医学试验中的显著性判断,\(p\) 值至今是科研论文的通用语言;
  • \(t\) 检验/置信区间在回归、对比实验里无处不在。学完这一章,概率论才真正"落地"。

四、全书收尾

把全书浓缩成一张关系图:

              随机试验(可重复、结果不确定)
                          │
                          ▼
              样本空间 Ω + 概率公理 P           ← 第 1 章:把"随机"摆上数学台面
                          │
                          ▼
             随机变量 X:Ω → ℝ                     ← 第 2 章:把结果翻译成数
                          │
        ┌─────────────────┼─────────────────┐
        ▼                 ▼                 ▼
   一维分布            多维分布            数字特征
  F(x)/f(x)/pₖ      联合·边缘·条件·独立      E·Var·Cov·ρ
  常见分布表           Z=X+Y、max、min       矩与性质
   (完整描述)         (变量之间的关系)     (压缩信息)
        │                 │                 │
        └─────────────────┼─────────────────┘
                          ▼
              大数定律:均值→期望,频率→概率
              中心极限定理:大量独立随机和→正态  ← 第 5 章:理论接回现实
                          │
                          ▼
              数理统计:用样本推断总体            ← 第 6 章:概率论落地
              抽样分布 · 参数估计 · 区间估计 · 假设检验

几句话总结全书逻辑

概率论始于一个朴素观察——重复试验的结果虽然不能预测,但长期频率是稳定的。第 1 章把这份直觉公理化(概率的三条公理),第 2、3 章把随机性翻译成随机变量,用分布完整地刻画它,从单变量推广到多变量,并学会切片(边缘、条件)和拼装(独立、卷积);第 4 章用期望、方差、相关系数给分布"压缩摘要";第 5 章证明前四章积累的一切都能在大样本下稳定实现——频率收敛于概率、均值收敛于期望、和近似正态;第 6 章顺势把这套理论倒过来用:既然样本足够多时统计量会稳定,那我们就能用样本数据反推总体的未知参数,并给推断附上可信度

复习权重

章节 权重 复习策略
第 1 章 ★★★★ 概念必考(选择/填空),全概率+贝叶斯是必做的大题之一
第 2 章 ★★★★★ 分布与密度计算是基本功,正态标准化天天用
第 3 章 ★★★★★ 联合密度积分、max/min、卷积是大题主力
第 4 章 ★★★★ 期望方差计算与性质,常混在 2、3 章大题中
第 5 章 ★★★★★ 中心极限定理大题几乎必考,切比雪夫不等式小题常考
第 6 章 ★★★☆ 矩估计/极大似然/置信区间/检验各一题,套路化,背模板即可

祝复习顺利——记住那句话:分布是主语,期望方差是定语,大数定律是承诺,中心极限定理是答案。概率论不过是一套把"没准"说清楚的语言。

posted @ 2026-09-04 16:52  IcarusLee  阅读(15)  评论(0)    收藏  举报