概率论
《概率论》全课程精讲
概率论是什么?一句话:把"不确定性"定量化的数学。掷硬币你无法预知结果,但掷 10000 次正面比例会稳定在 \(\frac{1}{2}\) 附近;保险无法预知谁出事,但能精确算出该收多少保费;搜索引擎不知道你下一个词是什么,但能算出概率最大的那个词。这一门课就是给你一套语言和工具,把"感觉""可能""差不多"翻译成精确的数字与方程。
学概率论最大的坑是只背公式、不建立图像。公式背得再熟,不知道它"在问什么、在答什么",考完就忘。这套笔记站在学长的视角,按"它要解决什么问题 → 它怎么解决 → 常考的题长什么样 → 它以后有什么用"的逻辑把全书过一遍。考前看完,脑子里应该有一张完整的知识地图。
复习建议:第 1、2 章是地基(占 30% 考分),第 3、4 章是主体(占 40%),第 5 章是灵魂(必有 1 个大题),第 6 章是应用(单独作为"数理统计"的一部分考察,约 20%)。
一、课程大纲
| 模块 | 章节 | 核心内容 |
|---|---|---|
| 基础概念 | 第 1 章:概率论的基本概念 | 随机试验、样本空间、事件、概率公理、古典/几何概型、条件概率、全概率公式、贝叶斯公式、独立性 |
| 分布理论 | 第 2 章:一维随机变量及其分布 | 随机变量、分布函数、离散型分布(0-1、二项、泊松、几何)、连续型分布(均匀、指数、正态)、随机变量函数的分布 |
| 分布理论 | 第 3 章:多维随机变量及其分布 | 联合分布、边缘分布、条件分布、独立性、二维随机变量函数的分布(和、max、min) |
| 数字特征 | 第 4 章:随机变量的数字特征 | 数学期望、方差、协方差与相关系数、原点矩与中心矩 |
| 极限理论 | 第 5 章:大数定律与中心极限定理 | 切比雪夫不等式、依概率收敛、切比雪夫/辛钦/伯努利大数定律、中心极限定理 |
| 统计应用 | 第 6 章:数理统计基础 | 总体与样本、抽样分布(\(\chi^2\)、\(t\)、\(F\))、矩估计与极大似然估计、区间估计、假设检验初步 |
二、一条主线
全课程可以压缩成一句话:
把"不确定性"定量化。随机变量是核心对象,分布完整描述它,数字特征压缩它,大数定律和中心极限定理把理论和现实连接起来(为什么大量独立随机叠加的结果趋于正态)。
把这四层拆开看,就是整本书的骨架:
- 随机试验的长期频率是概率的源头。概率论回答的问题本质是:"如果一个随机试验重复做很多很多次,某件事发生的长期频率会稳定在哪个数上?" 这个"稳定的数"就叫概率。频率具有稳定性,这是整个理论的经验基础。
- 随机变量把试验结果翻译成数字。样本空间里的样本点可能是一堆乱七八糟的东西("正""反"、红球白球),用函数 \(X:\Omega\to\mathbb{R}\) 把它们映射成数,我们就能用微积分研究随机性了。这是概率论从"文字题"变成"数学题"的关键一跃。
- 分布完整描述随机变量。一个随机变量内部的所有随机性信息,全都被它的分布函数 \(F(x)=P\{X\le x\}\) 锁死了。你知道 \(F\),就能算出关于它的任何概率问题。多维时则是联合分布,外加边缘、条件、独立性这三个"切片角度"。
- 数字特征压缩分布。分布太全、太"胖",拿着不方便。期望告诉你"平均在哪",方差告诉你"波动多大",协方差/相关系数告诉你"两个变量有没有线性牵连"。数字特征丢了细节,但抓住了要害,而且它们在相加时运算规则极好(期望线性、独立时方差可加)。
- 极限定理把理论接回现实。前四章都在"给定分布算概率",但真实问题里分布往往是未知的、来自大量微小随机因素叠加的。大数定律说:平均会"收敛"到期望,频率会"收敛"到概率——这解释了为什么现实世界是可预测的、统计是有意义的。中心极限定理更惊人:只要叠加的独立随机因素够多,总和不管原来是什么分布,都近似服从正态分布——这解释了为什么正态分布在自然界和统计学里到处都是,也直接支撑了第 6 章"用样本推断总体"。
一句话记忆:频率→概率(第 1 章),概率→随机变量(第 2 章),一个变量→多个变量(第 3 章),随机变量→数字(第 4 章),数字→定律(第 5 章),理论→现实(第 6 章)。
三、逐章精讲
第 1 章 概率论的基本概念
这一章在干什么
给"概率"一个严谨的定义,并学会算它。这一章是全书的地基:它定义了什么是随机试验、什么是事件、概率必须满足哪些公理,还给出了两大"计算武器"——全概率公式和贝叶斯公式。后面所有章节的公式,本质上都是在这一章定义的框架上长出来的。
核心内容
1. 随机试验与样本空间
随机试验的三个特征:可重复进行、结果不唯一但可列举、事先无法预知结果。比如"掷一枚骰子"。
- 样本空间 \(\Omega\):所有可能结果(样本点)的集合。掷骰子 \(\Omega=\{1,2,3,4,5,6\}\)。
- 事件:样本空间的子集。例如"点数为偶数" \(=\{2,4,6\}\)。
关键观念:事件就是集合。所以概率论里集合论的所有运算(并、交、补、包含)都能直接用:\(A\) 与 \(B\) 至少一个发生是 \(A\cup B\),同时发生是 \(A\cap B\),\(A\) 不发生是 \(\bar{A}\)。把文字翻译成集合符号,是这一章最重要的基本功。
2. 概率的公理化定义(柯尔莫哥洛夫公理)
概率是定义在事件上的一个函数 \(P\),满足三条公理:
- 非负性:\(P(A)\ge 0\);
- 规范性:\(P(\Omega)=1\);
- 可列可加性:互不相容的事件列 \(A_1,A_2,\dots\) 满足 \(P(\bigcup_{i=1}^{\infty}A_i)=\sum_{i=1}^{\infty}P(A_i)\)。
由公理可推出常用性质:\(P(\varnothing)=0\),\(P(\bar{A})=1-P(A)\),\(P(A\cup B)=P(A)+P(B)-P(A\cap B)\)(减法公式)。
为什么"可列可加"这么重要?它是概率能算的根本保证:把事件拆成互不相容的小块,概率可以放心相加。后面全概率公式、无穷级数求和都用它。
3. 古典概型与几何概型
- 古典概型:\(\Omega\) 有限且每个样本点等可能,则\[P(A)=\frac{A\text{ 中包含的样本点数}}{\Omega\text{ 中样本点总数}} \]核心是数数:排列 \(A_n^k\)、组合 \(C_n^k\)、分球入盒、分配问题。"至少""至多""不放回""有放回"是高频陷阱,先想清楚样本空间怎么建,再数有利事件。
- 几何概型:样本空间是某个可度量的区域(长度/面积/体积),等可能体现为"均匀落入",则 \(P(A)=\frac{A\text{ 的测度}}{\Omega\text{ 的测度}}\)。核心是画图求面积之比。"会面问题""蒲丰投针"都是经典模型。
4. 条件概率与乘法公式
在"已知 \(B\) 发生"的前提下,\(A\) 发生的概率为
它把概率空间"收缩"到 \(B\) 上再重新归一化——条件概率就是在缩小样本空间,这是最直观的理解。由它推出乘法公式:
多个事件的乘法公式 \(P(A_1A_2\cdots A_n)=P(A_1)P(A_2\mid A_1)P(A_3\mid A_1A_2)\cdots\) 在"不放回摸球"这类题里几乎必用。
5. 全概率公式(先分情况,再汇总)
设 \(B_1,B_2,\dots,B_n\) 是 \(\Omega\) 的一个划分(互不相容且并起来是 \(\Omega\),也称"完备事件组"),则
直觉:\(A\) 发生太麻烦,我就问"\(A\) 是在哪种情况 \(B_i\) 下发生的"。每种情况 \(B_i\) 的概率 \(\times\) 该情况下 \(A\) 的条件概率,求和。"原因 → 结果"的正向推理。
6. 贝叶斯公式(由果溯因)
在全概率公式的条件下,还反过来问"\(A\) 已经发生了,它是由 \(B_k\) 引起的概率是多少":
这里 \(P(B_i)\) 叫先验概率,\(P(B_i\mid A)\) 叫后验概率。贝叶斯公式就是"用观测到的事实 \(A\),更新我们对原因的信念"。
直觉与记忆:贝叶斯的分子是乘法公式 \(P(B_kA)\),分母是全概率公式 \(P(A)\),所以它其实就是条件概率的定义:\(P(B_k\mid A)=P(B_kA)/P(A)\)。两者一组合就有了。贝叶斯是机器学习中贝叶斯分类器、垃圾邮件过滤的数学内核。
7. 独立性
事件 \(A,B\) 相互独立定义为 \(P(AB)=P(A)P(B)\)。直观含义:\(B\) 发生不改变 \(A\) 的概率,即 \(P(A\mid B)=P(A)\)(当 \(P(B)>0\))。
注意三件事:① 独立 ≠ 互不相容。互不相容是"不能同时发生",独立是"彼此不影响",两码事。② 相互独立要求任意子集都满足乘积公式,两两独立不够(经典反例需要记一下)。③ 独立的判断常用实际背景:掷两次骰子、两次抽取(有放回)、两台机器,通常默认独立;不放回抽取则有关联。
典型题型/考点
- 古典概型数数(排列组合、分球入盒、"至少一个"用补事件);
- 几何概型求面积/长度之比;
- 条件概率直接计算;
- 用全概率公式求"最终结果"的概率(如:混料中任取一件是次品的概率);
- 用贝叶斯公式做"已知结果反推原因"(如:抽到次品,它来自甲厂的概率);
- 判断独立性、用独立性算交事件概率。
为什么这一章重要
这一章是统计、机器学习、算法分析的共同地基:
- 机器学习里所有模型都在假设数据的概率分布,贝叶斯公式直接催生了朴素贝叶斯分类器;
- 算法分析里"随机化算法""哈希冲突的概率""生日悖论"全是古典概型;
- 第 2~6 章每一个概念(条件分布、条件期望、贝叶斯估计)都是这一章概念的推广。第 1 章没啃透,后面全是空中楼阁。
第 2 章 一维随机变量及其分布
这一章在干什么
把样本空间里的随机结果翻译成数,然后用函数(分布函数、分布律、密度)来描述"一个数的随机性"。这一章是全书的核心工具间:学会了它,"随机"就变成了"已知分布,算概率"这种标准操作。
核心内容
1. 随机变量:把"随机试验"变成"随机数"
随机变量是定义在样本空间上的函数 \(X:\Omega\to\mathbb{R}\)。掷硬币用 \(X=1\) 记正面、\(X=0\) 记反面。"\(X\) 的取值带随机性"这句话,含义是"它的取值由随机试验的结果决定"。
为什么要引入它?因为数字可以比较、加减、积分。有了 \(X\),概率论就从组合计数升级成微积分分析。
2. 分布函数 \(F(x)\):描述随机变量的"总开关"
性质(要背熟,也常被拿来出小题):
- \(F\) 单调不减;
- \(F(-\infty)=0\),\(F(+\infty)=1\);
- \(F\) 右连续。
只要 \(F\) 给定了,这个随机变量的所有概率问题都能回答:\(P\{a<X\le b\}=F(b)-F(a)\),\(P\{X>a\}=1-F(a)\)。这就是"分布完整描述随机变量"的精确含义。连续型时 \(F\) 可写为 \(F(x)=\int_{-\infty}^{x}f(t)\,dt\);离散型时 \(F\) 是阶梯函数。
3. 离散型:分布律
取值可列(\(x_1,x_2,\dots\)),用分布律 \(p_k=P\{X=x_k\}\) 描述,满足 \(p_k\ge 0,\ \sum_k p_k=1\)。
常见离散分布:
| 分布 | 分布律 / 含义 | 期望 | 方差 |
|---|---|---|---|
| 0-1 分布 | \(P\{X=1\}=p\),\(P\{X=0\}=1-p\);一次试验成功与否 | \(p\) | \(p(1-p)\) |
| 二项分布 \(B(n,p)\) | \(P\{X=k\}=C_n^k p^k(1-p)^{n-k}\);\(n\) 次独立试验成功次数 | \(np\) | \(np(1-p)\) |
| 泊松分布 \(P(\lambda)\) | \(P\{X=k\}=\frac{\lambda^k}{k!}e^{-\lambda}\);稀有事件计数 | \(\lambda\) | \(\lambda\) |
| 几何分布 | \(P\{X=k\}=(1-p)^{k-1}p\);首次成功所需次数 | \(\frac{1}{p}\) | \(\frac{1-p}{p^2}\) |
| 超几何分布 | 不放回抽样中的成功次数 | \(\frac{nM}{N}\) | — |
泊松分布的直观:它是"二项分布在 \(n\) 大、\(p\) 小、\(np=\lambda\) 时"的极限(稀有事件定律)。电话呼叫、放射粒子、网页点击量这些"单位时间/空间内稀有事件次数"都近似服从泊松。
4. 连续型:概率密度
用密度函数 \(f(x)\ge 0,\ \int_{-\infty}^{+\infty}f(x)\,dx=1\) 描述,对任意区间
三个必须建立的直觉:① 连续型随机变量取"单点"的概率是 0(\(\int_a^a f=0\)),所以 \(\le\) 和 \(<\) 没区别;② 概率是密度曲线下的面积,不是 \(f(x)\) 本身的值(\(f(x)\) 可以大于 1!);③ \(f(x)\) 表示"\(x\) 附近的概率密集程度"。
常见连续分布:
| 分布 | 密度 / 含义 | 期望 | 方差 |
|---|---|---|---|
| 均匀分布 \(U(a,b)\) | \(f(x)=\frac{1}{b-a}\ (a<x<b)\);等可能落在区间内 | \(\frac{a+b}{2}\) | \(\frac{(b-a)^2}{12}\) |
| 指数分布 \(E(\lambda)\) | \(f(x)=\lambda e^{-\lambda x}\ (x>0)\);寿命、等待时间 | \(\frac{1}{\lambda}\) | \(\frac{1}{\lambda^2}\) |
| 正态分布 \(N(\mu,\sigma^2)\) | \(f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\) | \(\mu\) | \(\sigma^2\) |
指数分布的无记忆性 \(P\{X>s+t\mid X>s\}=P\{X>t\}\) 是经典考点,它意味着"已用时间不影响剩余寿命"。
5. 正态分布:全场最重要的分布
- 标准正态 \(N(0,1)\) 的密度关于 \(y\) 轴对称,分布函数记 \(\Phi(x)\),查表;\(3\sigma\) 原则:\(P\{|X-\mu|<3\sigma\}\approx 0.997\)。
- 标准化:若 \(X\sim N(\mu,\sigma^2)\),则 \(Z=\frac{X-\mu}{\sigma}\sim N(0,1)\)。于是所有概率问题统一化为\[P\{a<X<b\}=\Phi\Big(\frac{b-\mu}{\sigma}\Big)-\Phi\Big(\frac{a-\mu}{\sigma}\Big) \]这个"标准化换元"几乎是正态分布所有题的必经步骤,务必熟练。
6. 随机变量函数的分布
已知 \(X\) 的分布,求 \(Y=g(X)\) 的分布。方法:
- 离散型:把 \(X\) 取值映射到 \(g(x)\),合并相同值、概率相加;
- 连续型——分布函数法(万能):先求 \(F_Y(y)=P\{Y\le y\}=P\{g(X)\le y\}\),把它写成关于 \(X\) 的概率(解不等式),再对 \(y\) 求导得 \(f_Y(y)\);
- 连续型——公式法:当 \(g\) 严格单调时 \(f_Y(y)=f_X(h(y))\,|h'(y)|\),其中 \(h=g^{-1}\)。
建议:分布函数法是本、公式法是"速",考试先保证分布函数法会写,再记公式。这个技能第 3 章求二维函数分布时还要用,属于一级重要。
典型题型/考点
- 已知 \(F(x)\) 求 \(P\{X\in \text{某区间}\}\),或反求参数;
- 已知密度 \(f(x)\) 求待定常数、分布函数、区间概率;
- 二项/泊松/指数/均匀/正态的识别与应用题;
- 正态标准化查表计算;
- \(Y=g(X)\) 求分布(分布函数法最常考);
- 泊松作为二项极限的近似计算。
为什么这一章重要
这是统计建模的语法。任何真实问题只要能把"关心的量"抽象成一个随机变量,并判断它属于哪种分布,后面的估计、检验、机器学习全都有了起点。正态分布更是全局主角:第 5 章会告诉你它为什么"无处不在",第 6 章的置信区间、假设检验全部建立在其上。
第 3 章 多维随机变量及其分布
这一章在干什么
现实问题往往不只一个随机变量:身高和体重、成绩和学习时间、发射角和射程。这一章研究多个随机变量放一起怎么描述(联合分布),以及如何从一个变量"切"出另一个(边缘、条件),还回答一个关键问题:它们到底是不是相互独立的? 最后把第 2 章"求函数分布"推广到二维。
核心内容
1. 联合分布函数
对二维随机变量 \((X,Y)\),
表示点落在"左下角区域"的概率。性质类比一维:对每个变量单调不减、\(F(-\infty,-\infty)=0\)、\(F(+\infty,+\infty)=1\)、对每个变量右连续,此外还要满足矩形概率非负。
2. 二维离散型:联合分布律
\(p_{ij}=P\{X=x_i,\ Y=y_j\}\),满足 \(\sum_i\sum_j p_{ij}=1\)。联合分布律是一张二维表格,这是离散型二维问题最常用的载体——几乎所有的概率都能从表格里"按行按列"加出来。
3. 二维连续型:联合密度
\(f(x,y)\ge 0\),\(\iint_{\mathbb{R}^2}f(x,y)\,dx\,dy=1\),概率是密度曲面下的体积:
常考的区域 \(D\):矩形(可分离变量)、三角形(要分情况积分)、圆域(用极坐标)。
4. 边缘分布:把另一个变量"积掉"
- 离散型:\(p_{i\cdot}=\sum_j p_{ij}\),即按行/按列求和;
- 连续型:\(f_X(x)=\int_{-\infty}^{+\infty}f(x,y)\,dy\),把 \(y\) 积掉。
直觉:边缘分布只关心 \(X\),不管 \(Y\) 取什么,所以把 \(Y\) "加总/积分"掉。注意积分区间要画图确定——先画联合密度的支撑区域,再定 \(x\) 与 \(y\) 的上下限,是二维积分的头号易错点。
5. 条件分布:把另一个变量"固定住"
- 离散型:\(P\{X=x_i\mid Y=y_j\}=\frac{p_{ij}}{p_{\cdot j}}\),即在 \(Y=y_j\) 那一列里按比例归一化;
- 连续型:\(f_{X\mid Y}(x\mid y)=\frac{f(x,y)}{f_Y(y)}\)。
结构上和第 1 章的条件概率完全一致:分子是联合,分母是边缘。
6. 独立性:分布能否"因式分解"
\((X,Y)\) 独立的充要条件:
- 离散型:\(p_{ij}=p_{i\cdot}\cdot p_{\cdot j}\)(表格里每格等于行边缘乘列边缘);
- 连续型:\(f(x,y)=f_X(x)\,f_Y(y)\)(几乎处处)。
直觉:联合分布"拆得开",说明两个变量互不提供对方的信息。独立性在二维题目里几乎总是考点:要么判断独立(检验因式分解),要么已知独立后用 \(f(x,y)=f_X(x)f_Y(y)\) 代回计算。
7. 二维随机变量函数的分布
最重要的三个:
- \(Z=X+Y\):卷积公式。连续型 \(f_Z(z)=\int_{-\infty}^{+\infty}f(x,z-x)\,dx\)(另一变量替换后积分);离散型 \(P\{Z=k\}=\sum_i P\{X=i\}P\{Y=k-i\}\)(独立时)。两个独立正态之和仍正态:若 \(X\sim N(\mu_1,\sigma_1^2)\),\(Y\sim N(\mu_2,\sigma_2^2)\) 独立,则 \(X+Y\sim N(\mu_1+\mu_2,\ \sigma_1^2+\sigma_2^2)\)。
- \(M=\max(X,Y)\):利用"最大小于等于 \(z\)"\(\iff\)"两个都小于等于 \(z\)":\(F_M(z)=F_X(z)F_Y(z)\)(独立时)。
- \(N=\min(X,Y)\):利用补事件"最小大于 \(z\)"\(\iff\)"两个都大于 \(z\)":\(F_N(z)=1-\big[1-F_X(z)\big]\big[1-F_Y(z)\big]\)。
求二维函数的分布,正统套路永远是:先求分布函数(把事件写成关于 \(X,Y\) 的不等式 → 画区域 → 积分),再求导。max/min 的"夹逼"写法是本题型最大的套路,务必背下来。
典型题型/考点
- 已知联合分布律表格,求边缘、条件、判断独立;
- 已知联合密度求待定常数、求 \(P\{(X,Y)\in D\}\)、求两个边缘密度;
- 求条件密度、条件概率;
- 判断(或利用)独立性计算;
- 求 \(Z=X+Y\)、\(\max(X,Y)\)、\(\min(X,Y)\) 的分布;
- 二维正态分布 \(N(\mu_1,\mu_2,\sigma_1^2,\sigma_2^2,\rho)\) 的性质(边缘仍正态、\(\rho=0\iff\) 独立)。
为什么这一章重要
统计和机器学习几乎都在处理多维数据:
- 回归分析本质上在刻画"\(Y\) 对 \(X\) 的条件分布";
- 朴素贝叶斯假设特征条件独立,直接依赖本章的独立性概念;
- "两个变量是否相关、相关多强"正是第 4 章协方差/相关系数要回答的,而本章给出了计算它们所需的全部原材料(联合分布与边缘分布)。
第 4 章 随机变量的数字特征
这一章在干什么
分布是"全量信息",但常常太"沉"。这一章学的是给随机变量做"数据压缩":期望(中心位置)、方差(波动幅度)、协方差/相关系数(线性关联度)、矩(更高阶的形状信息)。压缩会丢细节,但换来了超强的运算便利——这正是指标存在的全部理由。
核心内容
1. 数学期望:随机变量的"加权平均"
直觉:期望是"做很多次试验,结果的平均值"——第 5 章的大数定律会严格证明这一点。它回答"平均而言是多少"。
期望的性质(考试直接用):
- \(E(C)=C\),\(E(aX+b)=aE(X)+b\);
- 线性:\(E(X+Y)=E(X)+E(Y)\),无需任何条件;
- 若 \(X,Y\) 独立,则 \(E(XY)=E(X)E(Y)\)(反之不成立)。
随机变量函数的期望(必须掌握):
二维:\(E[g(X,Y)]=\iint g(x,y)f(x,y)\,dx\,dy\)。好处:不需要先求 \(g(X)\) 的分布,直接用原分布的密度算。这是求期望最省事的捷径。
2. 方差:围绕期望的"平均偏离"
直觉:方差衡量波动。"与平均值的平均平方距离"。第二个等式是计算神器:先算 \(E(X^2)\) 再减 \([E(X)]^2\)。
方差的性质:
- \(\text{Var}(C)=0\),\(\text{Var}(aX+b)=a^2\text{Var}(X)\);
- 独立时 \(\text{Var}(X\pm Y)=\text{Var}(X)+\text{Var}(Y)\)(注意:独立才可加,且 \(X+Y\) 和 \(X-Y\) 的方差都是相加);
- 一般地 \(\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y)+2\text{Cov}(X,Y)\)。
标准差 \(\sigma(X)=\sqrt{\text{Var}(X)}\) 与 \(X\) 同量纲,更"直觉"。
3. 协方差与相关系数
- 协方差正负表示 \(X,Y\) 同向还是反向变动;
- 相关系数把协方差"标准化"到 \([-1,1]\),不随量纲/线性变换改变(不变性),所以用来度量线性相关程度;
- \(|\rho|=1 \iff Y\) 与 \(X\) 以概率 1 线性相关(\(Y=aX+b\));
- \(X,Y\) 独立 \(\Rightarrow \rho=0\)(不相关),反过来不成立——\(\rho=0\) 只说明没有线性关系,还可能有二次等非线性关系。这是最经典的反例考点(如 \(X\sim N(0,1)\),\(Y=X^2\))。
运算规则:\(\text{Cov}(X,Y)=\text{Cov}(Y,X)\);\(\text{Cov}(aX,bY)=ab\,\text{Cov}(X,Y)\);\(\text{Cov}(X_1+X_2,Y)=\text{Cov}(X_1,Y)+\text{Cov}(X_2,Y)\)。独立性 ⇒ 不相关,但反之不成立,这是本章最重要的一对逻辑关系。
4. 矩
- \(k\) 阶原点矩:\(\mu_k=E(X^k)\);
- \(k\) 阶中心矩:\(\nu_k=E\big[(X-E(X))^k\big]\);
- 期望是一阶原点矩,方差是二阶中心矩,只是"改名重出"。
典型题型/考点
- 由分布律/密度求 \(E(X)\)、\(E(X^2)\)、\(\text{Var}(X)\);
- 用 \(E[g(X)]=\int g(x)f(x)dx\) 求函数的期望;
- 利用期望/方差的性质算 \(E(aX+bY)\)、\(\text{Var}(aX+bY)\);
- 求 \(\text{Cov}(X,Y)\)、\(\rho_{XY}\),判断相关/独立;
- 常见分布的期望与方差查表速算(第 2 章的表要背牢);
- 由联合密度算 \(E(XY)\)、\(E(X)\)、\(E(Y)\) 从而得协方差。
为什么这一章重要
数字特征是一切推断的"目标量":
- 第 6 章估计的根本目标就是"用样本均值估计期望、用样本方差估计方差";
- 机器学习里的损失函数(均方误差)本质上就是 \(E[(Y-\hat{Y})^2]\),最小化它正是"方差 + 偏差"权衡问题的原型;
- 协方差矩阵是多维正态分布和 PCA 主成分分析的核心工具;
- 期望的线性性 \(\operatorname{E}(X+Y)=\operatorname{E}(X)+\operatorname{E}(Y)\) 连独立性都不要,这一条性质在算法分析(随机算法的期望运行时间)里被用到烂。
第 5 章 大数定律与中心极限定理
这一章在干什么
前四章是"给定了分布,算概率",属于纯数学。这一章是全书最深刻也最贴近现实的一章:它回答两个终极问题——
- 为什么"重复试验的频率稳定在概率附近"?(大数定律)
- 为什么这么多自然现象、测量误差、统计量都近似正态?(中心极限定理)
它是连接"概率论的数学世界"和"现实世界的统计"的桥。
核心内容
1. 切比雪夫不等式:不依赖分布的大概率估计
若 \(E(X)=\mu\),\(\text{Var}(X)=\sigma^2\),则对任意 \(\varepsilon>0\):
它说:一个随机变量偏离期望超过 \(\varepsilon\) 的概率,被方差控制住。只用期望和方差就能给出概率上界,不用知道分布——这是它"万能"的原因。用途:证明大数定律、估计概率下界(常考"用切比雪夫不等式估计 \(P\{|X-\mu|<3\}\)"这种题)。
2. 依概率收敛与三个大数定律
设 \(\bar{X}_n=\frac{1}{n}\sum_{i=1}^{n}X_i\) 为样本均值。
- 依概率收敛:\(X_n\xrightarrow{P}a\) 意思是 \(P\{|X_n-a|>\varepsilon\}\to 0\ (n\to\infty)\),即"几乎不可能差得远"。这是弱收敛(不必逐点收敛,只管概率上靠近)。
| 大数定律 | 条件 | 结论 |
|---|---|---|
| 切比雪夫大数定律 | \(X_i\) 两两不相关、方差一致有界(\(\text{Var}(X_i)\le C\)) | \(\bar{X}_n\xrightarrow{P}\frac{1}{n}\sum_{i=1}^{n}E(X_i)\) |
| 辛钦大数定律 | \(X_i\) 独立同分布、\(E(X)=\mu\) | \(\bar{X}_n\xrightarrow{P}\mu\) |
| 伯努利大数定律 | \(n\) 次独立重复试验,\(A\) 发生 \(n_A\) 次,\(P(A)=p\) | \(\frac{n_A}{n}\xrightarrow{P}p\) |
一句话总结三个定律的"意思":均值收敛到期望,频率收敛到概率。伯努利大数定律是统计学的哲学基石——因为频率最终会稳定在 \(p\) 附近,我们才敢用抽样频率估计未知概率。
3. 中心极限定理(本章的灵魂,也是全书的高潮)
独立同分布中心极限定理(林德伯格-莱维):设 \(X_1,X_2,\dots\) 独立同分布,\(E(X_i)=\mu\),\(\text{Var}(X_i)=\sigma^2>0\),则和 \(S_n=\sum_{i=1}^{n}X_i\) 的标准化:
实用写法(近似):
德莫佛-拉普拉斯定理:二项分布 \(B(n,p)\) 当 \(n\) 大时近似正态 \(N(np,\ np(1-p))\)。
直觉(为什么大量独立随机因素叠加趋于正态):每个因素 \(X_i\) 都"单薄无力"(与总和相比方差很小),它们的波动相互抵消,剩下的净效果由波动大的方向决定,而大量小波动的综合效应自然呈现"中间密、两头稀"的钟形。中心极限定理说:只要因素独立、每个贡献都不占主导,叠加结果就越来越像正态,与单个因素原来的分布完全无关。这就是正态分布"无处不在"的数学根源。
应用套路(每年必考的大题):
- 判断 \(S_n\) 是"大量独立同分布的和",用 \(S_n\approx N(n\mu,n\sigma^2)\);
- 用连续性修正(针对二项/离散)\(P\{S_n\le k\}\approx\Phi\Big(\frac{k+0.5-n\mu}{\sigma\sqrt{n}}\Big)\);
- 标准化查表。
典型题型/考点
- 用切比雪夫不等式给概率估计上界;
- 判断哪个大数定律适用并说明"平均/频率稳定";
- 中心极限定理近似计算 \(P\{S_n>c\}\)(涉及独立同分布和或二项);
- 应用题:保险公司赔付、产品合格率估计、"最少需要多少次试验才能以 95% 概率保证……";
- 说明中心极限定理为什么让正态分布成为"万能分布"。
为什么这一章重要
这一章是统计理论成立的理由:
- 抽样分布、置信区间、假设检验全靠"样本均值近似正态"撑腰(第 6 章直接使用);
- 机器学习中随机梯度下降、大数误差分析都依赖大数定律;
- 中心极限定理解释了为什么自然界大量现象(测量误差、人体指标、智商分数)服从正态分布;
- "均值收敛、方差以 \(1/n\) 收缩"这个结论,是算法与统计里"样本越多估计越准"的数学基础。这一章值得背得滚瓜烂熟,因为它是全书的"魂"。
第 6 章 数理统计基础
这一章在干什么
前五章都是"已知分布,算概率",是正问题。现实却是反的:分布未知,我们只有一堆数据,要用数据反推分布——这就是数理统计。这一章学它的入门三件套:抽样分布(样本统计量服从什么分布)、参数估计(猜未知参数)、假设检验(先提出主张,再用数据决定信不信)。顺带把第 5 章的"样本均值近似正态"变成可用的推断工具。
核心内容
1. 总体、样本与统计量
- 总体:研究对象全部个体(其指标是一个随机变量 \(X\),分布未知);
- 样本:从总体中抽取的 \(n\) 个个体 \(X_1,\dots,X_n\),要求独立、与总体同分布(简称 i.i.d.,简单随机样本)——"独立性 + 同分布"正是第 2、3 章老朋友的组合;
- 统计量:样本的函数(不含未知参数),如样本均值 \(\bar{X}=\frac{1}{n}\sum X_i\)、样本方差 \(S^2=\frac{1}{n-1}\sum(X_i-\bar{X})^2\)。统计量是随机变量,服从的分布就叫抽样分布。
几个必须背的抽样分布结论:\(E(\bar{X})=\mu\),\(\text{Var}(\bar{X})=\sigma^2/n\)(样本均值方差缩到 \(\frac{1}{n}\),样本越多越集中——这是大数定律的回声);\(E(S^2)=\sigma^2\)(除以 \(n-1\) 是为了无偏,这是常考点)。
2. 三大抽样分布
| 分布 | 构造 | 用途 |
|---|---|---|
| \(\chi^2\)(卡方)分布 | \(\chi^2=\sum_{i=1}^{n}Z_i^2\),\(Z_i\sim N(0,1)\) 独立,自由度 \(n\) | 推断总体方差 |
| \(t\) 分布 | \(t=\frac{Z}{\sqrt{\chi^2/n}}\),\(Z\sim N(0,1)\) 与 \(\chi^2\) 独立 | 方差未知时推断均值(厚尾、对称) |
| \(F\) 分布 | \(F=\frac{\chi_1^2/n_1}{\chi_2^2/n_2}\) | 比较两个总体方差 |
核心定理(必须记):\(X_1,\dots,X_n\) i.i.d. \(\sim N(\mu,\sigma^2)\),则
第三条"方差未知用 \(t\) 分布"是区间估计和假设检验的总开关。
3. 参数估计:矩估计与极大似然估计
设总体分布含未知参数 \(\theta\)。
- 矩估计:用样本矩替代总体矩。解方程\[E(X)=\bar{X}\quad(\text{一阶矩});\qquad E(X^2)=\frac{1}{n}\sum X_i^2\quad(\text{二阶矩}) \]
直觉:总体矩是 \(\theta\) 的函数(比如 \(E(X)=\lambda\)),样本矩是数据算出来的数,让"理论 = 实际",解出 \(\theta\)。简单但有时不唯一。
- 极大似然估计(MLE):写出似然函数\[L(\theta)=\prod_{i=1}^{n}f(x_i;\theta)\quad(\text{连续型用密度,离散型用分布律}) \]然后对 \(\theta\) 求最大化,常用工具:取对数 → 求导 → 令导数为 0。
直觉:找最"可能"产生这批观测数据的那个 \(\theta\)。"既然数据长这样,那它由哪个参数生成的概率最大?"这是统计里最有思想、也最常考的方法,必须会完整走一遍流程:写 \(L\) → 取 \(\ln L\) → 求导 → 解 \(\hat{\theta}\) → (常要求)验证二阶导为负。
- 无偏性、有效性、一致性:\(\hat{\theta}\) 的均值等于 \(\theta\)(无偏)、方差尽量小(有效)、\(n\to\infty\) 时收敛到 \(\theta\)(一致)。常考:验证某个估计量是否无偏(算 \(E(\hat\theta)=\theta\)?)。
4. 区间估计(置信区间)
求一个区间 \((\hat{\theta}_1,\hat{\theta}_2)\) 使 \(P\{\hat{\theta}_1<\theta<\hat{\theta}_2\}=1-\alpha\),\(1-\alpha\) 叫置信水平。
直觉:这个区间像"渔网"——\(1-\alpha\) 的意思是"如果反复抽样构造区间,有 \(1-\alpha\) 比例的区间会罩住真值 \(\theta\)"。真值是固定的,随机的是区间,这是理解置信区间最关键的一句话。
模板(背熟):
| 场景 | 枢轴量 | 置信区间 |
|---|---|---|
| \(\sigma\) 已知,估 \(\mu\) | \(\frac{\bar{X}-\mu}{\sigma/\sqrt{n}}\sim N(0,1)\) | \(\bar{X}\pm z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\) |
| \(\sigma\) 未知,估 \(\mu\) | \(\frac{\bar{X}-\mu}{S/\sqrt{n}}\sim t(n-1)\) | \(\bar{X}\pm t_{\alpha/2}(n-1)\frac{S}{\sqrt{n}}\) |
| 估 \(\sigma^2\) | \(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\) | \(\Big(\frac{(n-1)S^2}{\chi^2_{\alpha/2}},\ \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}}\Big)\) |
(\(n\) 大时 \(\sigma\) 未知可用 \(\frac{S}{\sqrt{n}}\) 借 \(z\) 近似,即第 5 章的中心极限定理。)
5. 假设检验初步
流程(选择题/填空题高频):
- 提出原假设 \(H_0\) 与备择假设 \(H_1\)(如 \(H_0:\mu=\mu_0\),\(H_1:\mu\ne\mu_0\));
- 选检验统计量(和区间估计用同一个枢轴量);
- 在 \(H_0\) 成立下求临界值/拒绝域(双侧或单侧);
- 根据样本值落入拒绝域与否,作出判断。
- 两类错误:第一类错误(弃真,概率 \(\alpha\))——\(H_0\) 本来对却拒绝;第二类错误(取伪,概率 \(\beta\))——\(H_0\) 本来错却不拒绝。\(\alpha\) 由检验者设定,样本量固定时二者此消彼长(加大样本可同时减小)。
- \(p\) 值:能拒绝 \(H_0\) 的最小显著性水平,\(p<\alpha\) 则拒绝 \(H_0\)。
- 与区间估计的对应:\(\mu\) 的置信水平 \(1-\alpha\) 区间若包含 \(\mu_0\),则不拒绝 \(H_0\)——区间估计和假设检验是同一枚硬币的两面。
典型题型/考点
- 判断统计量是否无偏、计算 \(E(\bar{X})\)、\(E(S^2)\);
- 矩估计、极大似然估计的完整求解(指数、正态、均匀、泊松是常客);
- 已知 \(\sigma\) 或未知 \(\sigma\) 时求均值 \(\mu\) 的置信区间;
- 对方差求置信区间;
- 均值检验(\(z\) 检验/双侧或单侧 \(t\) 检验)全流程 + 判断两类错误;
- 卡方/正态/独立同分布性质的综合题。
为什么这一章重要
这一章是概率论通往"用数据做决策"的入口,也是机器学习模型评估的雏形:
- "用样本估计总体"是数据科学最核心的信条,极大似然估计更是深度学习损失函数(交叉熵 = 负对数似然)的理论源头;
- 假设检验对应 A/B 测试、医学试验中的显著性判断,\(p\) 值至今是科研论文的通用语言;
- \(t\) 检验/置信区间在回归、对比实验里无处不在。学完这一章,概率论才真正"落地"。
四、全书收尾
把全书浓缩成一张关系图:
随机试验(可重复、结果不确定)
│
▼
样本空间 Ω + 概率公理 P ← 第 1 章:把"随机"摆上数学台面
│
▼
随机变量 X:Ω → ℝ ← 第 2 章:把结果翻译成数
│
┌─────────────────┼─────────────────┐
▼ ▼ ▼
一维分布 多维分布 数字特征
F(x)/f(x)/pₖ 联合·边缘·条件·独立 E·Var·Cov·ρ
常见分布表 Z=X+Y、max、min 矩与性质
(完整描述) (变量之间的关系) (压缩信息)
│ │ │
└─────────────────┼─────────────────┘
▼
大数定律:均值→期望,频率→概率
中心极限定理:大量独立随机和→正态 ← 第 5 章:理论接回现实
│
▼
数理统计:用样本推断总体 ← 第 6 章:概率论落地
抽样分布 · 参数估计 · 区间估计 · 假设检验
几句话总结全书逻辑:
概率论始于一个朴素观察——重复试验的结果虽然不能预测,但长期频率是稳定的。第 1 章把这份直觉公理化(概率的三条公理),第 2、3 章把随机性翻译成随机变量,用分布完整地刻画它,从单变量推广到多变量,并学会切片(边缘、条件)和拼装(独立、卷积);第 4 章用期望、方差、相关系数给分布"压缩摘要";第 5 章证明前四章积累的一切都能在大样本下稳定实现——频率收敛于概率、均值收敛于期望、和近似正态;第 6 章顺势把这套理论倒过来用:既然样本足够多时统计量会稳定,那我们就能用样本数据反推总体的未知参数,并给推断附上可信度。
复习权重:
| 章节 | 权重 | 复习策略 |
|---|---|---|
| 第 1 章 | ★★★★ | 概念必考(选择/填空),全概率+贝叶斯是必做的大题之一 |
| 第 2 章 | ★★★★★ | 分布与密度计算是基本功,正态标准化天天用 |
| 第 3 章 | ★★★★★ | 联合密度积分、max/min、卷积是大题主力 |
| 第 4 章 | ★★★★ | 期望方差计算与性质,常混在 2、3 章大题中 |
| 第 5 章 | ★★★★★ | 中心极限定理大题几乎必考,切比雪夫不等式小题常考 |
| 第 6 章 | ★★★☆ | 矩估计/极大似然/置信区间/检验各一题,套路化,背模板即可 |
祝复习顺利——记住那句话:分布是主语,期望方差是定语,大数定律是承诺,中心极限定理是答案。概率论不过是一套把"没准"说清楚的语言。

浙公网安备 33010602011771号