大三上 机器学习课程复习总结 20260101

机器学习各章节详细复习要点(AI辅助生成,剔除12、14、15章)

说明:本复习要点覆盖考试核心章节(1-11、13、16章),按章节梳理核心概念、算法原理、关键步骤、公式应用及易错点,兼顾理解与应试,可结合公式速记表配套使用。

第一章 机器学习概述

一、核心概念

  • 机器学习定义:通过数据训练使系统自动学习规律,无需显式编程即可完成特定任务的过程。

  • 关键术语:数据(样本/特征/标签)、假设空间(所有可能的模型集合)、版本空间(与训练数据一致的假设子集)。

  • 学习任务分类:

    • 监督学习:有标签,含分类(二分类/多分类)、回归(连续值预测);典型场景:垃圾邮件识别、房价预测。

    • 无监督学习:无标签,含聚类(样本分组)、降维(特征压缩);典型场景:用户分群、图像去冗余。

    • 半监督学习:少量标签+大量无标签数据;核心假设:聚类假设、流形假设。

    • 强化学习:智能体与环境交互,通过试错获取奖励学习最优策略;核心要素:状态、动作、奖励、策略。

二、学习过程与目标

  • 目标:找到泛化能力强的模型(在新数据上表现好),而非仅拟合训练数据。

  • 泛化误差:模型在新数据上的误差(核心评估指标);训练误差:模型在训练数据上的误差(需结合泛化误差分析)。

三、易错点

  • 混淆“监督/无监督/半监督”任务的核心区别:是否有标签、标签数量。

  • 泛化误差≠训练误差:训练误差小不代表泛化能力强(可能过拟合)。

第二章 模型评估与选择

一、泛化误差相关

  • 过拟合与欠拟合:

    • 过拟合:模型复杂度过高,拟合训练数据中的噪声,泛化误差大;成因:模型复杂、数据量小、噪声多;解决方法:正则化、数据增强、早停、剪枝。

    • 欠拟合:模型复杂度过低,未捕捉数据核心规律,训练误差和泛化误差均大;成因:模型简单、特征不足;解决方法:增加模型复杂度、补充有效特征。

  • 泛化误差分解:$E = bias^2 + var + \epsilon^2$;偏差(模型拟合能力,欠拟合对应高偏差)、方差(模型稳定性,过拟合对应高方差)、噪声(数据本身不可避免的误差)。

二、评估方法

  • 留出法:

    • 步骤:将数据划分为训练集(70%-80%)和测试集(20%-30%),训练集训练模型,测试集评估泛化误差。

    • 关键:分层抽样(保证训练集和测试集的类别分布与原数据一致),避免随机划分导致的偏差。

  • k折交叉验证:

    • 步骤:将数据均匀划分为k个互斥子集,每次用k-1个子集训练,1个子集测试,重复k次,取k次测试误差的均值作为最终评估结果。

    • 常用k值:10折(最常用)、5折;特殊形式:5×2折交叉验证(避免单次划分的随机性)。

  • 自助法:

    • 步骤:基于bootstrap抽样(有放回抽样),从m个样本中抽取m个样本组成训练集,未被抽取的样本(包外样本)作为测试集。

    • 适用场景:数据量少的情况;优势:不浪费数据,可进行包外估计。

三、性能度量

  • 分类任务度量:

    • 混淆矩阵:明确TP(真阳性)、FP(假阳性)、TN(真阴性)、FN(假阴性)的定义,是后续指标计算的基础。

    • 核心指标:准确率(Acc)、查准率(P)、查全率(R)、F1度量;公式应用:需熟练掌握计算方法,明确适用场景(如样本不均衡时不用准确率,用P/R/F1)。

    • ROC与AUC:ROC曲线以FPR为横轴、TPR为纵轴;AUC是ROC曲线下面积,衡量模型区分正负样本的能力,AUC越大性能越好。

  • 回归任务度量:

    • 均方误差(MSE):最常用,反映预测值与真实值的平均偏差;公式:$MSE = \frac{1}{m}\sum_{i=1}^m (f(x_i)-y_i)^2$。

    • R²:衡量模型解释数据变异的能力,R²越接近1说明模型拟合效果越好。

  • 聚类任务度量:

    • 外部指标:Jaccard系数、FM指数(需真实标签,衡量聚类结果与真实类别分布的一致性)。

    • 内部指标:DB指数(越小越好)、Dunn指数(越大越好,无需真实标签,衡量聚类的紧致性和分离度)。

四、易错点

  • 样本不均衡时的指标选择:避免用准确率,优先用P/R/F1或AUC。

  • 交叉验证的核心目的:降低评估结果的随机性,更准确反映模型泛化能力。

第三章 线性模型

一、线性回归

  • 模型形式:单一属性$y = wx + b$;多元属性$\boldsymbol{y} = \boldsymbol{Xw} + b$(简化为单一属性学习,无矩阵计算)。

  • 核心思想:最小化均方误差(最小二乘法),找到最优的w和b。

  • 闭式解计算:

    • 权重$w = \frac{\sum_{i=1}^m (x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^m (x_i-\bar{x})^2}$;偏置$b = \bar{y} - w\bar{x}$。

    • 理解:$\bar{x}$和$\bar{y}$分别为x和y的均值,闭式解是通过对MSE求导并令导数为0得到的解析解。

  • 正则化改进:

    • 岭回归(L2正则化):目标函数添加L2正则项$\frac{\lambda}{2}w^2$,防止过拟合,权重趋于较小值,不具备特征选择能力。

    • LASSO(L1正则化):目标函数添加L1正则项$\lambda|w|$,可使部分权重变为0,具备特征选择能力,适用于冗余特征多的场景。

二、逻辑回归

  • 适用场景:二分类任务(输出样本属于正类的概率)。

  • 模型形式:通过Sigmoid函数将线性输出映射到[0,1]区间,$y = \sigma(z) = \frac{1}{1+e^{-z}}$,其中$z = wx + b$。

  • 损失函数:交叉熵损失(避免平方损失在Sigmoid饱和区的梯度消失问题);单样本损失$L = -[y\log\sigma(z) + (1-y)\log(1-\sigma(z))]$。

  • 决策规则:当$\sigma(z) ≥ 0.5$时,预测为正类;否则为负类。

三、线性判别分析(LDA)

  • 核心思想:找到一条投影直线,将样本投影到直线上后,同类样本尽可能近,异类样本尽可能远。

  • 二分类核心步骤:

    • 计算各类别样本的均值$\mu_c = \frac{1}{m_c}\sum_{x\in D_c}x$。

    • 计算类内散度$S_w = \sum_{x\in D_1}(x-\mu_1)^2 + \sum_{x\in D_2}(x-\mu_2)^2$(衡量同类样本的分散程度)。

    • 计算类间散度$S_b = (\mu_1 - \mu_2)^2$(衡量异类样本的分离程度)。

    • 最优投影系数$w \propto \frac{\mu_1 - \mu_2}{S_w}$(最大化$\frac{S_b}{S_w}$)。

  • 与逻辑回归的区别:LDA是生成式模型(建模$P(x|c)$),逻辑回归是判别式模型(直接建模$P(c|x)$)。

四、易错点

  • 线性回归与逻辑回归的本质区别:线性回归预测连续值,逻辑回归通过Sigmoid映射预测概率(二分类)。

  • L1与L2正则化的差异:L1可特征选择,L2防过拟合但不具备特征选择能力。

第四章 决策树

一、核心思想与结构

  • 结构:根节点(初始特征)、内部节点(特征划分)、叶节点(类别/回归值)、分支(特征取值)。

  • 学习目标:通过特征划分,使叶节点的样本尽可能属于同一类别(分类树)或取值相近(回归树)。

二、特征划分准则

  • ID3算法(信息增益):

    • 信息熵:衡量样本集纯度,$Ent(S) = -\sum_{i=1}^k p_i\log_2 p_i$,熵越小纯度越高。

    • 条件熵:划分后样本集的平均熵,$Ent(S|A) = \sum_{v}\frac{|S_v|}{|S|}Ent(S_v)$。

    • 信息增益:$Gain(S,A) = Ent(S) - Ent(S|A)$,选择增益最大的特征划分;缺点:偏好取值多的特征。

  • C4.5算法(增益率):

    • 分裂信息:$SplitInfo(S,A) = -\sum_{v}\frac{|S_v|}{|S|}\log_2\frac{|S_v|}{|S|}$(衡量特征取值的分散程度)。

    • 增益率:$GainRatio(S,A) = \frac{Gain(S,A)}{SplitInfo(S,A)}$,解决ID3偏好取值多的特征问题;缺点:偏好取值少的特征(实际中先选增益高于平均的特征,再计算增益率)。

  • CART算法(基尼指数):

    • 基尼指数:衡量样本集的不确定性,$Gini(S) = 1 - \sum_{i=1}^k p_i^2$,基尼指数越小纯度越高。

    • 划分后基尼指数:$Gini(S|A) = \sum_{v}\frac{|S_v|}{|S|}Gini(S_v)$,选择基尼指数最小的特征划分。

    • 适用场景:分类树和回归树(回归树用均方误差作为划分准则)。

三、决策树剪枝(防过拟合)

  • 预剪枝:在树构建过程中停止生长(如限制树的最大深度、最小样本数);优点:计算简单、效率高;缺点:可能欠拟合。

  • 后剪枝:先构建完整的决策树,再从叶节点向上剪枝(移除子树,用叶节点替代),通过交叉验证判断剪枝是否提升泛化能力;优点:泛化能力强;缺点:计算复杂、效率低。

四、连续值与缺失值处理

  • 连续值处理:采用二分法离散化(将连续特征的取值排序,选择最优划分点,将特征分为两部分)。

  • 缺失值处理:

    • 特征划分时:用无缺失值的样本计算划分准则(如信息增益)。

    • 样本分类时:将缺失值样本分配到所有子节点,按子节点的样本数量加权投票。

五、易错点

  • 三种划分准则的适用算法与优缺点:ID3(信息增益,偏好多取值)、C4.5(增益率,改进ID3)、CART(基尼指数,分类+回归)。

  • 剪枝的目的:解决过拟合,提升决策树的泛化能力。

第五章 神经网络

一、神经网络基础

  • 神经元结构:输入(特征)→加权求和→激活函数→输出;核心:激活函数引入非线性,使网络能拟合复杂函数。

  • 常用激活函数:

    • Sigmoid:$\sigma(z) = \frac{1}{1+e^{-z}}$,输出[0,1],适用于二分类输出层;缺点:饱和区梯度消失、输出非零均值。

    • ReLU:$\phi(z) = \max(0,z)$,解决梯度消失问题,计算简单;缺点:死亡ReLU(部分神经元永久不激活)。

    • Softmax:$\phi(z_i) = \frac{e{z_i}}{\sum_{j=1}k e^{z_j}}$,输出[0,1]且和为1,适用于多分类输出层。

  • 网络结构:单隐藏层网络(感知机)、多隐藏层网络(深度学习);层数越多,拟合能力越强,但易过拟合。

二、BP算法(核心,反向传播误差)

  • 核心思想:通过梯度下降最小化损失函数,误差从输出层反向传播到输入层,更新各层权重。

  • 关键步骤:

    • 前向传播:计算各层神经元的加权和(z)和激活输出(a),直到输出层得到预测值。

    • 计算损失:如交叉熵损失(分类)、MSE(回归)。

    • 反向传播误差:

      • 输出层误差项:$\Delta^o = \phi'(z^o)(y - ao)$(y为真实标签,ao为输出层激活值)。

      • 隐藏层误差项:$\Delta^h = \phi'(zh)(\Deltao \cdot w_{h→o})$(权重w为隐藏层到输出层的权重)。

    • 更新权重:$w = w - \alpha \cdot \Delta \cdot 前层激活值$(α为学习率,控制步长)。

  • 学习率的影响:α过大→权重震荡不收敛;α过小→收敛速度慢。

三、防止过拟合的方法

  • Dropout:训练时随机丢弃部分神经元,测试时恢复所有神经元并对权重加权;模拟集成学习,减少过拟合。

  • 早停:监控验证集误差,当验证集误差不再下降时停止训练,避免过度拟合训练数据。

  • 正则化:在损失函数中添加L1/L2正则项,限制权重大小。

四、易错点

  • BP算法的核心是链式法则:通过反向传播计算各层权重的梯度,实现权重更新。

  • 激活函数的作用:引入非线性,否则多层网络等价于单层线性模型。

第六章 支持向量机(SVM)

一、核心思想

  • 找到最优超平面:使正负样本到超平面的几何间隔最大(几何间隔越大,泛化能力越强)。

  • 支持向量:距离最优超平面最近的样本点,决定超平面的位置;SVM的决策边界仅由支持向量决定。

二、硬间隔SVM(样本线性可分)

  • 超平面方程:$w_1x_1 + w_2x_2 + b = 0$(二维简化)。

  • 几何间隔:样本到超平面的距离,$\gamma_i = \frac{y_i(w_1x_1 + w_2x_2 + b)}{\sqrt{w_1^2 + w_2^2}}$;硬间隔要求所有样本的几何间隔≥1。

  • 目标函数:$\min_{w,b} \frac{1}{2}(w_1^2 + w_2^2)$(最大化间隔等价于最小化权重的L2范数),约束条件:$y_i(w_1x_1 + w_2x_2 + b) ≥ 1$。

三、软间隔SVM(样本线性不可分)

  • 引入松弛变量$\xi_i ≥ 0$:允许部分样本不满足硬间隔约束,$\xi_i$表示样本偏离正确一侧的程度。

  • 目标函数:$\min_{w,b,\xi} \frac{1}{2}(w_1^2 + w_2^2) + C\sum_{i=1}^m \xi_i$(C为惩罚系数)。

  • 惩罚系数C的影响:C越大→对误分类样本的惩罚越重→模型越复杂(易过拟合);C越小→对误分类样本的惩罚越轻→模型越简单(易欠拟合)。

四、核函数(处理非线性问题)

  • 核心思想:将线性不可分的样本映射到高维特征空间,使样本在高维空间线性可分;核函数避免直接计算高维映射,降低计算复杂度。

  • 常用核函数:

    • 线性核:$\kappa(x_i,x_j) = x_{i1}x_{j1} + x_{i2}x_{j2}$,适用于线性可分数据。

    • 高斯核(RBF):$\kappa(x_i,x_j) = \exp(-\gamma[(x_{i1}-x_{j1})^2 + (x_{i2}-x_{j2})^2])$,适用于非线性数据;γ越大→核函数越窄→模型越复杂(易过拟合)。

    • 多项式核:$\kappa(x_i,x_j) = (\gamma(x_{i1}x_{j1} + x_{i2}x_{j2}) + r)^d$,适用于样本具有多项式分布的场景。

五、易错点

  • 支持向量的定义与作用:仅支持向量决定超平面,删除非支持向量不影响模型。

  • 核函数的选择:线性数据用线性核,非线性数据优先用高斯核(通用性强)。

  • C和γ的影响:均为超参数,需通过交叉验证调优,过大易过拟合,过小易欠拟合。

第七章 贝叶斯分类器

一、贝叶斯定理(核心)

  • 公式:$P(c|x) = \frac{P(x|c)P(c)}{P(x)}$;$P(c)$为先验概率(类别c的概率),$P(x|c)$为似然(样本x在类别c下的概率),$P(c|x)$为后验概率(样本x属于类别c的概率)。

  • 分类规则:选择后验概率最大的类别作为预测结果。

二、朴素贝叶斯分类器

  • 核心假设:特征条件独立(简化计算,忽略特征间的依赖关系)。

  • 似然计算:$P(x|c) = \prod_{i=1}^d P(x_i|c)$(d为特征数)。

  • 拉普拉斯修正(解决零概率问题):

    • 先验概率修正:$P(c) = \frac{|D_c| + 1}{|D| + K}$(K为类别数)。

    • 条件概率修正:$P(x_i|c) = \frac{|D_{c,x_i}| + 1}{|D_c| + N_i}$(N_i为特征i的取值数)。

  • 优点:计算简单、效率高、对小数据友好;缺点:特征独立假设可能不成立(实际中仍常用,泛化能力强)。

三、半朴素贝叶斯分类器

  • 核心思想:放松特征独立假设,允许每个特征依赖一个或少数几个父特征(降低假设的严苛性)。

  • 常用策略:TAN(树增强朴素贝叶斯),通过互信息选择父特征,构建特征间的依赖树。

四、易错点

  • 朴素贝叶斯的核心假设:特征条件独立,是其计算简单的关键,也是主要局限性。

  • 拉普拉斯修正的目的:避免因某些特征取值未在训练集中出现导致的零概率问题,提升模型稳定性。

第八章 集成学习

一、核心思想

  • 将多个基学习器的预测结果组合,得到泛化能力更强的集成学习器;核心:基学习器需“多样性”(误差相互独立)且“有一定性能”(好于随机猜测)。

  • 集成优势:降低方差(减少过拟合)、提高鲁棒性、提升预测精度。

二、Boosting(提升方法,串行训练)

  • 核心思想:通过改变样本权重,聚焦于之前基学习器分类错误的样本,串行训练一系列基学习器,最终加权组合。

  • 代表算法:AdaBoost:

    • 步骤:

      • 初始化样本权重(均匀分布)。

      • 训练基学习器,计算其误差率$\epsilon_t = \sum_{i=1}^m w_{ti}I(h_t(x_i)\neq y_i)$。

      • 计算基学习器权重$\alpha_t = \frac{1}{2}\log\frac{1-\epsilon_t}{\epsilon_t}$(误差率越低,权重越大)。

      • 更新样本权重:正确分类样本权重减小,错误分类样本权重增大,$w_{(t+1)i} = \frac{w_{ti}\exp(-\alpha_t y_i h_t(x_i))}{Z_t}$(Z_t为归一化因子)。

      • 重复训练,组合所有基学习器的预测结果(加权投票)。

    • 优点:泛化能力强,无需调参;缺点:对噪声数据敏感。

三、Bagging(套袋方法,并行训练)

  • 核心思想:基于bootstrap抽样,生成多个不同的训练集(有放回抽样),并行训练多个基学习器,最终简单投票/平均组合。

  • 代表算法:随机森林:

    • 改进:在Bagging基础上,每个基学习器(决策树)训练时随机选择部分特征(特征扰动),进一步增强基学习器的多样性。

    • 优点:并行训练、效率高、抗过拟合能力强、可处理高维数据;缺点:对噪声数据敏感。

    • 重要参数:决策树数量、每棵树的最大深度、随机选择的特征数。

四、组合策略

  • 分类任务:

    • 硬投票:少数服从多数,直接统计各基学习器的预测类别。

    • 软投票:加权投票,根据基学习器的权重和预测概率计算最终类别(泛化能力更好)。

  • 回归任务:

    • 简单平均:所有基学习器预测值的均值。

    • 加权平均:根据基学习器的性能加权,性能好的权重更大。

  • 高级策略:Stacking(堆叠),用元学习器学习如何组合基学习器的预测结果(复杂度高,易过拟合)。

五、易错点

  • Boosting与Bagging的核心差异:Boosting串行训练(依赖前一个基学习器),聚焦错误样本;Bagging并行训练(独立),依赖样本扰动。

  • 随机森林的优势来源:样本扰动+特征扰动,增强基学习器多样性,提升泛化能力。

第九章 聚类

一、核心概念

  • 聚类定义:无监督学习任务,将相似的样本归为一类,不相似的样本归为不同类;核心是“相似度/距离”的定义。

  • 距离度量(核心):

    • 欧氏距离:$\text{dist}(x_i,x_j) = \sqrt{(x_{i1}-x_{j1})^2 + (x_{i2}-x_{j2})^2}$(最常用,衡量样本间的直线距离)。

    • 曼哈顿距离:$\text{dist}(x_i,x_j) = |x_{i1}-x_{j1}| + |x_{i2}-x_{j2}|$(适用于高维数据,对异常值不敏感)。

    • 闵可夫斯基距离:$\text{dist}(x_i,x_j) = (\sum |x_{ik}-x_{jk}|p){p}}$(欧氏距离p=2,曼哈顿距离p=1)。

二、常用聚类算法

  • k-Means(划分式聚类):

    • 核心思想:将样本划分为k个簇,使簇内样本的平方误差和最小(簇内紧凑,簇间分离)。

    • 关键步骤:

      • 初始化:随机选择k个样本作为初始簇中心。

      • 簇分配:计算每个样本到各簇中心的距离,将样本分配到距离最近的簇。

      • 更新中心:计算每个簇内样本的均值,作为新的簇中心。

      • 重复:直到簇中心不再变化或达到迭代次数上限。

    • 优点:计算简单、效率高、适用于大数据;缺点:需预先指定k值、对初始簇中心敏感、只能发现球形簇。

    • k值选择方法:肘部法则(绘制误差和-k曲线,选择曲线拐点对应的k值)、轮廓系数法。

  • DBSCAN(密度聚类):

    • 核心思想:基于样本的密度划分簇,无需指定k值,可发现任意形状的簇。

    • 关键概念:

      • ε邻域:以样本x为中心,半径为ε的区域。

      • 核心点:ε邻域内的样本数≥min_n(最小样本数)。

      • 边界点:ε邻域内的样本数<min_n,但在核心点的ε邻域内。

      • 噪声点:既不是核心点也不是边界点的样本。

    • 优点:无需指定k、可发现任意形状簇、对异常值不敏感;缺点:对ε和min_n敏感、高维数据效率低。

  • 层次聚类(AGNES,自底向上):

    • 核心思想:初始每个样本为一个簇,逐步合并相似度最高的簇,直到所有样本合并为一个簇(形成聚类树)。

    • 簇间距离度量:最小距离(合并最近的样本对)、最大距离(合并最远的样本对)、平均距离(合并平均距离最近的簇)。

    • 优点:无需指定k、可直观看到聚类层次;缺点:计算复杂度高、不适用于大数据。

三、聚类评估

  • 外部评估(有真实标签):Jaccard系数、FM指数(值越大,聚类结果与真实类别越一致)。

  • 内部评估(无真实标签):DB指数(越小越好,衡量簇的紧致性和分离度)、Dunn指数(越大越好)。

四、易错点

  • k-Means的局限性:对k值和初始簇中心敏感,只能处理球形簇。

  • DBSCAN的核心参数:ε和min_n需合理设置,否则影响聚类效果;优点是可发现任意形状簇和噪声点。

第十章 降维与度量学习

一、核心思想

  • 降维定义:将高维特征空间映射到低维特征空间,保留数据的核心信息(如方差、局部结构),去除冗余和噪声。

  • 目的:降低计算复杂度、避免维度灾难、便于数据可视化。

二、主成分分析(PCA,最常用)

  • 核心思想:找到低维投影方向(主成分),使样本在投影后的方差最大(保留最多信息)。

  • 关键步骤(无矩阵计算简化):

    • 数据中心化:$x_1' = x_1 - \bar{x_1}$,$x_2' = x_2 - \bar{x_2}$(消除量纲影响,使数据均值为0)。

    • 确定主成分:找到使投影后方差最大的方向(特征向量方向,对应协方差矩阵的最大特征值)。

    • 低维投影:将中心化后的样本投影到前d'个主成分方向,得到低维数据(二维→一维:$z = w_1x_1' + w_2x_2'$)。

  • 主成分选择:选择特征值大于1的主成分,或累计方差贡献率达到80%-90%的主成分(确保保留大部分信息)。

  • 优点:计算简单、无参数、降维效果好;缺点:线性降维,不适用于非线性数据。

三、核主成分分析(KPCA)

  • 核心思想:通过核函数将非线性数据映射到高维特征空间,在高维空间进行PCA降维(间接实现非线性降维)。

  • 适用场景:非线性数据(如螺旋状数据);常用核函数:高斯核、多项式核。

四、流形学习(Isomap、LLE,非线性降维)

  • 核心假设:高维数据位于低维流形上,降维需保留数据的局部结构(相邻样本在低维空间仍相邻)。

  • 代表算法:

    • Isomap:基于测地线距离(流形上的最短路径)替代欧氏距离,保留全局结构。

    • LLE(局部线性嵌入):假设每个样本可由其邻域样本线性表示,降维后保留这种线性关系,保留局部结构。

  • 优点:可处理非线性数据;缺点:计算复杂、对噪声敏感、不适用于大数据。

五、度量学习

  • 核心思想:学习一个合适的距离度量(如马氏距离),使同类样本的距离变小,异类样本的距离变大。

  • 简化马氏距离:$\text{dist}(x,y) = \sqrt{w_1(x_1-y_1)^2 + w_2(x_2-y_2)^2}$(w为特征权重,学习得到)。

  • 适用场景:改善KNN、聚类等依赖距离度量的算法性能。

六、易错点

  • PCA的第一步是数据中心化:必须进行,否则量纲差异会影响主成分的选择。

  • PCA与KPCA的区别:PCA是线性降维,KPCA通过核函数实现非线性降维。

第十一章 特征选择与稀疏学习

一、核心思想

  • 特征选择:从原始特征中选择出对任务有效的子集,去除冗余、噪声特征;目的:降低维度、提升模型效率、改善泛化能力。

  • 稀疏学习:通过正则化等方法使模型的权重向量稀疏(部分权重为0),等价于特征选择(权重为0的特征被舍弃)。

二、特征选择方法

  • 过滤式(先选特征,再训练模型):

    • 代表算法:Relief算法(二分类):通过计算特征对同类/异类样本的区分能力更新特征权重,权重越大特征越重要。

    • 权重更新公式(单一特征):$w = w - \frac{(x_i - H)^2}{m} + \frac{(x_i - M)^2}{m}$(H为同类近邻,M为异类近邻)。

    • 优点:计算简单、效率高;缺点:未考虑特征间的交互作用。

  • 包裹式(用模型评估特征子集,包裹模型):

    • 代表算法:LVW(拉斯维加斯 wrapper):通过随机选择特征子集,用模型性能评估子集好坏,选择最优子集。

    • 优点:考虑特征交互,性能好;缺点:计算复杂、效率低。

  • 嵌入式(特征选择与模型训练同步进行):

    • 代表:LASSO(L1正则化)、决策树(自带特征选择)、随机森林(特征重要性)。

    • 优点:效率高、考虑特征交互、泛化能力强;缺点:依赖模型选择。

三、稀疏学习

  • 核心:通过L1正则化使权重稀疏,如LASSO回归、稀疏表示($\min_{\alpha} |x - B\alpha|_2^2 + \lambda|\alpha|_1$,B为字典)。

  • L1正则化产生稀疏的原因:解空间为菱形,最优解易落在坐标轴上(权重为0)。

四、易错点

  • 三种特征选择方法的差异:过滤式快但不考虑交互,包裹式准但慢,嵌入式平衡效率和性能。

  • L1正则化的稀疏性:是嵌入式特征选择的核心,可自动舍弃冗余特征。

第十三章 半监督学习

一、核心概念与假设

  • 定义:利用少量标注数据和大量未标注数据训练模型,降低标注成本,提升泛化能力。

  • 核心假设(半监督学习的理论基础):

    • 聚类假设:同类样本形成紧凑的簇,相邻样本大概率属于同一类别。

    • 流形假设:高维数据位于低维流形上,流形上相邻的样本类别相同(局部一致性)。

二、半监督学习方法

  • 半监督SVM:

    • 核心思想:在监督SVM的基础上,利用未标注样本调整超平面,使超平面尽可能穿过未标注样本的低密度区域。

    • 目标函数(简化):$\min \frac{1}{2}w^2 + C_l\sum_{L}\xi_i + C_u\sum_{U}\xi_j$;约束:标注样本$y_i(wx_i + b) ≥ 1 - \xi_i$,未标注样本$|wx_j + b| ≥ 1 - \xi_j$。

    • 参数设置:初始$C_l \gg C_u$(未标注样本可信度低,惩罚轻),随训练迭代增大$C_u$。

  • 图半监督学习(标签传播):

    • 核心思想:将样本构建为图(节点为样本,边权重为相似度),标注样本的标签沿边传播到未标注样本。

    • 标签传播规则:$y_i = \sum_{j\in N(i)}W_{ij}y_j$(W为边权重,N(i)为i的邻居,权重越大传播影响越大)。

    • 优点:直观、易实现;缺点:对图的构建(相似度计算)敏感。

  • 生成式半监督学习:

    • 核心思想:假设标注和未标注样本服从同一生成模型(如高斯分布),用所有数据估计模型参数,再进行分类。

    • 优点:理论基础扎实;缺点:生成模型假设

(注:文档部分内容可能由 AI 生成)

机器学习各章节例题及解析(剔除12、14、15章)

说明:本例题文档覆盖考试核心章节(1-11、13、16章),题型分为选择题(侧重知识点细节辨析)和计算题(仅涉及简单公式应用,无矩阵计算),每题均附详细解析,可结合复习要点文档同步使用,强化知识点掌握。

第一章 机器学习概述

一、选择题

  1. 下列关于监督学习与无监督学习的核心区别,说法正确的是( )

A. 监督学习需大量数据,无监督学习需少量数据

B. 监督学习数据有标签,无监督学习数据无标签

C. 监督学习仅能做分类,无监督学习仅能做聚类

D. 监督学习泛化能力更强,无监督学习泛化能力更弱

解析:答案为B。监督学习与无监督学习的核心差异在于数据是否含标签:监督学习使用带标签数据训练,可完成分类、回归等任务;无监督学习使用无标签数据,核心任务为聚类、降维等。A选项错误,两者对数据量无固定“多少”要求;C选项错误,监督学习不止分类,还有回归,无监督学习不止聚类,还有降维等;D选项错误,泛化能力取决于模型设计、数据质量等,与监督/无监督类型无必然关联。

  1. 下列任务中,属于半监督学习范畴的是( )

A. 用1000个带类别标签的邮件训练模型,识别新邮件是否为垃圾邮件

B. 用100个带类别标签的邮件+900个无标签邮件训练模型,识别新邮件是否为垃圾邮件

C. 用1000个无标签邮件分组,找出内容相似的邮件集群

D. 智能体通过与邮件系统交互,根据用户是否点击邮件获得奖励,优化邮件推荐策略

解析:答案为B。半监督学习的核心是利用“少量标注数据+大量未标注数据”训练模型,B选项符合该定义。A选项仅用带标签数据,属于监督学习;C选项仅用无标签数据分组,属于无监督学习的聚类任务;D选项通过交互试错获取奖励,属于强化学习。

二、计算题(无,本章以概念辨析为主)

第二章 模型评估与选择

一、选择题

  1. 下列关于过拟合与欠拟合的说法,错误的是( )

A. 过拟合时模型复杂度过高,拟合了训练数据中的噪声

B. 欠拟合时训练误差和泛化误差均较大

C. 增加训练数据量可有效缓解欠拟合问题

D. 正则化可用于缓解过拟合问题

解析:答案为C。欠拟合的成因是模型复杂度过低或有效特征不足,无法捕捉数据核心规律,增加训练数据量对缓解欠拟合无明显作用,反而可能加重计算负担。A选项为过拟合的核心特征,正确;B选项欠拟合的典型表现是训练误差和泛化误差都大,正确;D选项正则化通过限制模型参数大小,可有效降低过拟合风险,正确。

  1. 在样本不均衡(正样本占比仅5%)的二分类任务中,最不适合作为评估指标的是( )

A. 查准率(P) B. 查全率(R) C. 准确率(Acc) D. AUC

解析:答案为C。样本不均衡时,准确率易受多数类样本主导,若模型全部预测为多数类,准确率可达95%,但无法反映模型对少数类的识别能力。查准率、查全率可聚焦少数类的预测效果,AUC衡量模型区分正负样本的整体能力,均适用于样本不均衡场景。

二、计算题

  1. 某二分类模型测试集预测结果如下:真阳性(TP)=18,假阳性(FP)=2,真阴性(TN)=78,假阴性(FN)=2。请计算该模型的准确率、查准率和查全率。

解析:

核心公式:

(1)准确率(Acc)=(TP + TN)/ 总样本数,总样本数=TP+FP+TN+FN

(2)查准率(P)= TP /(TP + FP)(预测为正类的样本中,真实为正类的比例)

(3)查全率(R)= TP /(TP + FN)(真实为正类的样本中,被正确预测的比例)

计算过程:

总样本数=18+2+78+2=100

准确率=(18+78)/100=96%

查准率=18/(18+2)=90%

查全率=18/(18+2)=90%

  1. 某回归模型对5个样本的预测值分别为[2.1, 3.5, 4.2, 5.0, 6.3],真实值分别为[2.0, 3.6, 4.0, 5.2, 6.5]。请计算该模型的均方误差(MSE)。

解析:

核心公式:均方误差(MSE)=(1/m)×Σ(f(x_i) - y_i)²,其中m为样本数,f(x_i)为预测值,y_i为真实值。

计算过程:

第一步,计算每个样本的预测误差平方:

(2.1-2.0)²=0.01;(3.5-3.6)²=0.01;(4.2-4.0)²=0.04;(5.0-5.2)²=0.04;(6.3-6.5)²=0.04

第二步,求和:0.01+0.01+0.04+0.04+0.04=0.14

第三步,计算MSE:0.14/5=0.028

第三章 线性模型

一、选择题

  1. 下列关于线性回归与逻辑回归的区别,说法正确的是( )

A. 线性回归的输出是连续值,逻辑回归的输出是离散类别

B. 线性回归用交叉熵损失,逻辑回归用均方误差损失

C. 线性回归仅适用于线性可分数据,逻辑回归可适用于非线性数据

D. 线性回归是生成式模型,逻辑回归是判别式模型

解析:答案为A。线性回归的核心任务是预测连续值(如房价),逻辑回归通过Sigmoid函数将线性输出映射为[0,1]的概率,最终输出离散类别(二分类),A正确。B选项错误,线性回归用均方误差损失,逻辑回归用交叉熵损失(避免Sigmoid饱和区梯度消失);C选项错误,两者均为线性模型,仅适用于线性可分数据,处理非线性数据需结合核方法;D选项错误,两者均为判别式模型(直接建模P(c|x)或预测值与特征的映射关系),LDA是生成式模型。

  1. 下列关于L1正则化(LASSO)与L2正则化(岭回归)的说法,正确的是( )

A. L1正则化可使部分权重变为0,具备特征选择能力

B. L2正则化可使部分权重变为0,具备特征选择能力

C. 相同正则化强度下,L1正则化对权重的惩罚力度大于L2正则化

D. L1正则化适用于特征冗余少的场景,L2正则化适用于特征冗余多的场景

解析:答案为A。L1正则化的解空间为菱形,最优解易落在坐标轴上,使部分权重为0,从而实现特征选择;L2正则化的解空间为圆形,最优解多为非零值,仅能使权重趋于较小值,不具备特征选择能力,A正确,B错误。C选项错误,惩罚力度与正则化强度和权重大小相关,无绝对“L1大于L2”的结论;D选项错误,L1正则化因具备特征选择能力,更适用于特征冗余多的场景,L2正则化适用于需防止过拟合但无需筛选特征的场景。

二、计算题

  1. 已知某单一属性线性回归问题的样本数据如下:x=[1,2,3,4,5],y=[2,4,5,7,8]。请计算最优权重w和偏置b(用最小二乘法闭式解)。

解析:

核心公式:

(1)均值:$\bar{x}$=(Σx_i)/m,$\bar{y}$=(Σy_i)/m

(2)权重w=Σ(x_i - $\bar{x}$)(y_i - $\bar{y}$) / Σ(x_i - $\bar{x}$)²

(3)偏置b= $\bar{y}$ - w×$\bar{x}$

计算过程:

第一步,计算均值:

$\bar{x}$=(1+2+3+4+5)/5=3;$\bar{y}$=(2+4+5+7+8)/5=5.2

第二步,计算分子和分母:

分子Σ(x_i - $\bar{x}$)(y_i - $\bar{y}$)=(1-3)(2-5.2)+(2-3)(4-5.2)+(3-3)(5-5.2)+(4-3)(7-5.2)+(5-3)(8-5.2)

=(-2)×(-3.2)+(-1)×(-1.2)+0×(-0.2)+1×1.8+2×2.8=6.4+1.2+0+1.8+5.6=15

分母Σ(x_i - $\bar{x}$)²=(1-3)²+(2-3)²+(3-3)²+(4-3)²+(5-3)²=4+1+0+1+4=10

第三步,计算w和b:

w=15/10=1.5;b=5.2 - 1.5×3=5.2-4.5=0.7

最终线性回归模型:y=1.5x + 0.7

  1. 已知逻辑回归模型的线性输出z=wx + b,其中w=2,b=-3,x=2。请计算该样本属于正类的概率(用Sigmoid函数)。

解析:

核心公式:Sigmoid函数σ(z)=1/(1+e^(-z)),其中z=wx + b,σ(z)即为样本属于正类的概率。

计算过程:

第一步,计算z:z=2×2 + (-3)=4-3=1

第二步,计算概率:σ(1)=1/(1+e^(-1))≈1/(1+0.3679)=0.7311(保留四位小数)

结论:该样本属于正类的概率约为73.11%。

第四章 决策树

一、选择题

  1. 下列关于决策树划分准则的说法,错误的是( )

A. ID3算法采用信息增益作为划分准则,偏好取值多的特征

B. C4.5算法采用增益率作为划分准则,解决了ID3偏好多取值特征的问题

C. CART算法采用基尼指数作为划分准则,仅适用于分类任务

D. 信息熵越小,样本集的纯度越高

解析:答案为C。CART算法是通用决策树算法,既可用于分类任务(划分准则为基尼指数),也可用于回归任务(划分准则为均方误差),C错误。A选项正确,ID3的信息增益准则对取值多的特征更友好,例如“身份证号”这类取值唯一的特征,信息增益会最大,但无实际意义;B选项正确,C4.5通过增益率=信息增益/分裂信息,平衡了多取值特征的影响;D选项正确,信息熵衡量样本集的不确定性,熵越小,样本越集中于少数类别,纯度越高。

  1. 下列关于决策树剪枝的说法,正确的是( )

A. 预剪枝是先构建完整决策树,再从叶节点向上剪枝

B. 后剪枝的泛化能力通常优于预剪枝

C. 预剪枝的计算复杂度高于后剪枝

D. 剪枝的目的是提升决策树的训练准确率

解析:答案为B。后剪枝先构建完整决策树,再通过交叉验证判断剪枝是否提升泛化能力,保留泛化能力强的简化树,其泛化能力通常优于预剪枝(预剪枝可能因过早停止生长导致欠拟合),B正确。A选项错误,预剪枝是在树构建过程中停止生长(如限制最大深度),后剪枝才是先构建完整树再剪枝;C选项错误,预剪枝无需构建完整树,计算复杂度低于后剪枝;D选项错误,剪枝的核心目的是缓解过拟合,提升泛化能力,而非训练准确率(剪枝后训练准确率可能下降)。

二、计算题

  1. 已知某样本集S包含10个样本,其中正类样本6个,负类样本4个。若用特征A划分样本集,得到两个子集S1(正类3个,负类1个)和S2(正类3个,负类3个)。请计算特征A的信息增益(对数以2为底)。

解析:

核心公式:

(1)信息熵Ent(S) = -Σp_i log₂p_i,其中p_i为类别i的占比

(2)条件熵Ent(S|A) = (|S1|/|S|)Ent(S1) + (|S2|/|S|)Ent(S2)

(3)信息增益Gain(S,A) = Ent(S) - Ent(S|A)

计算过程:

第一步,计算原始样本集S的信息熵:

正类占比p1=6/10=0.6,负类占比p2=4/10=0.4

Ent(S) = -0.6log₂0.6 - 0.4log₂0.4 ≈ -0.6×(-0.73696) - 0.4×(-1.32193) ≈ 0.4422 + 0.5288 = 0.9710

第二步,计算子集S1和S2的信息熵:

S1样本数=4,正类3个(占比0.75),负类1个(占比0.25)

Ent(S1) = -0.75log₂0.75 - 0.25log₂0.25 ≈ -0.75×(-0.4150) - 0.25×(-2) ≈ 0.3113 + 0.5 = 0.8113

S2样本数=6,正类3个(占比0.5),负类3个(占比0.5)

Ent(S2) = -0.5log₂0.5 - 0.5log₂0.5 ≈ -0.5×(-1) - 0.5×(-1) = 1.0

第三步,计算条件熵Ent(S|A):

Ent(S|A) = (4/10)×0.8113 + (6/10)×1.0 = 0.3245 + 0.6 = 0.9245

第四步,计算信息增益:

Gain(S,A) = 0.9710 - 0.9245 = 0.0465

  1. 已知某样本集S包含8个样本,其中类别1有5个,类别2有3个。请计算该样本集的基尼指数。

解析:

核心公式:基尼指数Gini(S) = 1 - Σp_i²,其中p_i为类别i的占比

计算过程:

类别1占比p1=5/8=0.625,类别2占比p2=3/8=0.375

Gini(S) = 1 - (0.625² + 0.375²) = 1 - (0.390625 + 0.140625) = 1 - 0.53125 = 0.46875

第五章 神经网络

一、选择题

  1. 下列关于激活函数的说法,错误的是( )

A. Sigmoid函数的输出范围是[0,1],适用于二分类输出层

B. ReLU函数可解决Sigmoid函数的梯度消失问题

C. Softmax函数的输出和为1,适用于多分类输出层

D. 激活函数的作用是引入线性变换,增强网络的拟合能力

解析:答案为D。激活函数的核心作用是引入非线性变换,若没有激活函数,多层神经网络等价于单层线性模型,无法拟合复杂的非线性关系,D错误。A、B、C选项均正确:Sigmoid输出[0,1],对应二分类概率;ReLU在z>0时梯度为1,可避免Sigmoid饱和区(z过大或过小)梯度趋近于0的问题;Softmax将多分类的线性输出映射为概率分布,输出和为1。

  1. 下列关于BP算法的说法,正确的是( )

A. BP算法是一种监督学习算法,仅适用于单隐藏层神经网络

B. BP算法的核心是通过前向传播计算梯度,反向传播更新权重

C. 学习率越大,BP算法的收敛速度越快,且越容易收敛到最优解

D. BP算法通过梯度下降最小化损失函数,误差从输出层反向传播到输入层

解析:答案为D。BP算法的核心逻辑是“前向传播计算预测值和损失,反向传播误差计算各层权重梯度,通过梯度下降更新权重”,误差传播方向是从输出层到输入层,D正确。A选项错误,BP算法适用于任意多层的神经网络;B选项错误,前向传播计算的是预测值和损失,梯度是通过反向传播计算的;C选项错误,学习率过大可能导致权重震荡不收敛,学习率过小则收敛速度过慢,需合理调优。

二、计算题

  1. 已知某单神经元模型的输入x=3,权重w=2,偏置b=-1,激活函数为ReLU。请计算该神经元的输出。

解析:

核心公式:神经元输出a=ReLU(z),其中z=wx + b,ReLU函数定义为ReLU(z)=max(0,z)。

计算过程:

第一步,计算加权和z:z=2×3 + (-1)=6-1=5

第二步,应用ReLU激活函数:ReLU(5)=max(0,5)=5

结论:该神经元的输出为5。

  1. 已知某多分类任务的神经网络输出层线性输出z=[2,1,0],请通过Softmax函数计算各类别对应的概率。

解析:

核心公式:Softmax函数σ(z_i)=e^z_i / Σ(e^z_j)(j从1到类别数),其中σ(z_i)为第i类的概率。

计算过程:

第一步,计算各z_i的指数:

e2≈7.389,e1≈2.718,e^0=1.0

第二步,计算指数和:7.389+2.718+1.0=11.107

第三步,计算各类别概率:

类别1概率=7.389/11.107≈0.665;类别2概率=2.718/11.107≈0.245;类别3概率=1.0/11.107≈0.090

验证:0.665+0.245+0.090=1.0,符合概率分布要求。

第六章 支持向量机(SVM)

一、选择题

  1. 下列关于支持向量机的说法,正确的是( )

A. 支持向量是距离超平面最远的样本点,决定超平面的位置

B. 硬间隔SVM适用于样本线性不可分的场景

C. 软间隔SVM通过引入松弛变量,允许部分样本不满足间隔约束

D. 核函数的作用是将高维数据映射到低维空间,降低计算复杂度

解析:答案为C。软间隔SVM针对线性不可分样本,引入松弛变量ξ_i≥0,允许部分样本偏离正确的间隔区域,ξ_i表示样本的偏离程度,C正确。A选项错误,支持向量是距离超平面最近的样本点,正是这些样本决定了超平面的位置;B选项错误,硬间隔SVM仅适用于线性可分样本,线性不可分需用软间隔或核函数;D选项错误,核函数的作用是将低维线性不可分数据映射到高维线性可分空间,且通过核技巧避免直接计算高维映射,降低计算复杂度。

  1. 下列关于SVM核函数的说法,错误的是( )

A. 线性核适用于线性可分的数据

B. 高斯核(RBF)的γ值越大,核函数的作用范围越窄,模型越容易过拟合

C. 多项式核的阶数d越大,模型的拟合能力越弱

D. 核函数需满足Mercer条件,才能保证映射后的内积可计算

解析:答案为C。多项式核的阶数d越大,模型的非线性拟合能力越强,越容易拟合复杂的数据分布,但同时也越容易过拟合,C错误。A选项正确,线性核对应的是线性SVM,适用于线性可分数据;B选项正确,γ是高斯核的带宽参数,γ越大,核函数仅对样本附近的区域敏感(作用范围窄),模型会过度拟合训练数据;D选项正确,Mercer条件是核函数对应的Gram矩阵半正定的充要条件,只有满足该条件,才能通过核技巧间接计算高维空间的内积。

二、计算题

  1. 已知二维平面上的线性可分样本:正类样本(1,2)、(2,3),负类样本(0,1)、(1,0)。若超平面方程为w1x1 + w2x2 + b = 0,且已知w1=1,w2=1,试判断样本(2,3)是否为支持向量(假设硬间隔要求几何间隔≥1)。

解析:

核心公式:

(1)几何间隔γ_i = y_i×(w1x1 + w2x2 + b)/√(w1² + w2²),其中y_i为样本标签(正类y=1,负类y=-1)

(2)支持向量的判断:几何间隔=1(硬间隔下,支持向量是距离超平面最近的样本,几何间隔等于最小间隔)

计算前提:需先确定b的值,使所有样本的几何间隔≥1,且至少有样本的几何间隔=1(超平面为最优间隔超平面)。此处简化计算,假设超平面满足正类样本的w1x1 + w2x2 + b ≥1,负类样本的w1x1 + w2x2 + b ≤-1(函数间隔=±1)。

计算过程:

第一步,确定b的值:

对于正类样本(1,2):1×1 + 1×2 + b ≥1 → 3 + b ≥1 → b ≥-2

对于负类样本(1,0):1×1 + 1×0 + b ≤-1 → 1 + b ≤-1 → b ≤-2

因此,b=-2,超平面方程为x1 + x2 - 2 = 0

第二步,计算样本(2,3)的几何间隔:

y_i=1,w1x1 + w2x2 + b=2+3-2=3,√(w1² + w2²)=√2

γ_i=1×3/√2≈2.121>1

第三步,判断:该样本的几何间隔大于1,不是支持向量(支持向量的几何间隔应为1)。

  1. 已知两个样本x1=(1,2),x2=(3,4),请计算它们通过高斯核(γ=0.5)的核函数值κ(x1,x2)。

解析:

核心公式:高斯核κ(x1,x2)=exp(-γ×||x1 - x2||²),其中||x1 - x2||²为两样本的欧氏距离平方。

计算过程:

第一步,计算欧氏距离平方:||x1 - x2||²=(1-3)² + (2-4)²=(-2)² + (-2)²=4+4=8

第二步,计算核函数值:κ(x1,x2)=exp(-0.5×8)=exp(-4)≈0.0183

第七章 贝叶斯分类器

一、选择题

  1. 下列关于贝叶斯定理的说法,正确的是( )

A. 后验概率P(c|x) = 先验概率P(c) × 似然P(x|c) / 证据P(x)

B. 先验概率P(c)是样本x属于类别c的概率

C. 似然P(x|c)是类别c出现的概率

D. 证据P(x)与类别无关,对分类决策无影响,可忽略不计

解析:答案为A。贝叶斯定理的核心公式为P(c|x)=P(x|c)P(c)/P(x),其中P(c)是先验概率(类别c的先验分布),P(x|c)是似然(给定类别c时样本x的分布),P(x)是证据(样本x的边际分布),A正确。B选项错误,先验概率P(c)是类别c出现的概率,而非样本x属于c的概率;C选项错误,似然P(x|c)是给定类别c时样本x出现的概率;D选项错误,证据P(x)对所有类别是相同的,在分类决策(比较不同c的P(c|x)大小)时可忽略,但并非对分类决策无影响(影响后验概率的绝对值)。

  1. 下列关于朴素贝叶斯分类器的说法,错误的是( )

A. 核心假设是特征条件独立,即各特征之间无依赖关系

B. 拉普拉斯修正的目的是解决样本量过小的问题

C. 朴素贝叶斯分类器计算简单,效率高,对小数据友好

D. 即使特征独立假设不成立,朴素贝叶斯仍可能有较好的泛化性能

解析:答案为B。拉普拉斯修正的核心目的是解决“某些特征取值未在训练集中出现导致的零概率问题”,例如某特征取值在训练集中未出现在类别c中,直接计算P(x_i|c)会为0,导致整个似然P(x|c)为0,拉普拉斯修正通过在分子分母加常数,避免零概率,B错误。A选项正确,特征条件独立假设是朴素贝叶斯“朴素”的原因,也是其计算简单的关键;C选项正确,朴素贝叶斯无需复杂迭代训练,仅需统计概率,效率高,适合小数据;D选项正确,实际应用中,即使特征存在一定依赖,朴素贝叶斯仍能保持较好的泛化性能,因此应用广泛。

二、计算题

  1. 已知某二分类任务的先验概率:P(正类)=0.6,P(负类)=0.4。现有一样本x,其似然P(x|正类)=0.3,P(x|负类)=0.5。请通过贝叶斯定理计算后验概率P(正类|x)和P(负类|x),并判断样本x的类别。

解析:

核心公式:后验概率P(c|x)=P(x|c)P(c)/P(x),其中P(x)=P(x|正类)P(正类)+P(x|负类)P(负类)(全概率公式)。

计算过程:

第一步,计算证据P(x):

P(x)=0.3×0.6 + 0.5×0.4=0.18 + 0.2=0.38

第二步,计算后验概率:

P(正类|x)=0.3×0.6 / 0.38=0.18/0.38≈0.4737

P(负类|x)=0.5×0.4 / 0.38=0.2/0.38≈0.5263

第三步,判断类别:因P(负类|x)>P(正类|x),故样本x属于负类。

  1. 已知某分类任务中,类别c的样本数|D_c|=5,其中特征A取值为a1的样本数|D_{c,a1}|=0。若类别总数K=2,特征A的取值数N_i=3,试用拉普拉斯修正计算P(a1|c)。

解析:

核心公式:拉普拉斯修正后的条件概率P(x_i|c)=(|D_{c,x_i}| + 1)/(|D_c| + N_i),其中|D_{c,x_i}|为类别c中特征i取x_i的样本数,N_i为特征i的取值数。

计算过程:

已知|D_{c,a1}|=0,|D_c|=5,N_i=3,代入公式:

P(a1|c)=(0 + 1)/(5 + 3)=1/8=0.125

说明:若不进行拉普拉斯修正,P(a1|c)=0/5=0,会导致后续似然计算为0,修正后避免了零概率问题。

第八章 集成学习

一、选择题

  1. 下列关于Boosting与Bagging的区别,说法正确的是( )

A. Boosting是并行训练基学习器,Bagging是串行训练基学习器

B. Boosting通过样本扰动增强基学习器多样性,Bagging通过改变样本权重增强多样性

C. Boosting聚焦于之前基学习器分类错误的样本,Bagging对所有样本一视同仁

D. Boosting的组合策略是简单投票,Bagging的组合策略是加权投票

解析:答案为C。Boosting的核心逻辑是串行训练,通过不断调整样本权重,使后续基学习器更关注之前分类错误的样本(难例样本),从而逐步提升模型性能;Bagging是并行训练,通过bootstrap抽样(样本扰动)生成不同训练集,各基学习器独立训练,对所有样本权重相同,C正确。A选项错误,Boosting是串行训练,Bagging是并行训练;B选项错误,Boosting通过样本权重调整增强多样性,Bagging通过样本扰动增强多样性;D选项错误,Boosting的组合策略是加权投票(误差率低的基学习器权重更大),Bagging的组合策略是简单投票/平均

  1. 下列关于随机森林的说法,错误的是( )

A. 随机森林是Bagging的一种改进,基学习器为决策树

B. 随机森林通过“样本扰动+特征扰动”增强基学习器多样性

C. 随机森林的泛化能力通常优于单一决策树,且不易过拟合

D. 随机森林中决策树的数量越多,模型的性能越好,计算复杂度越低

解析:答案为D。随机森林中决策树的数量越多,模型的稳定性和泛化能力通常会逐渐提升,但当数量达到一定阈值后,性能会趋于饱和,而计算复杂度会随决策树数量增加而线性上升,D错误。A选项正确,随机森林的本质是基于决策树的Bagging集成;B选项正确,样本扰动来自bootstrap抽样,特征扰动是指每个决策树训练时随机选择部分特征,两者共同增强基学习器多样性;C选项正确,集成学习通过组合多个弱学习器,可有效降低单一决策树的方差(过拟合风险),提升泛化能力。

二、计算题

  1. 已知AdaBoost算法训练某基学习器h_t时,样本权重分布为w_t=[0.1, 0.1, 0.2, 0.2, 0.4](共5个样本)。训练后发现,样本1、2、3被正确分类,样本4、5被错误分类。请计算该基学习器的误差率ε_t。

解析:

核心公式:AdaBoost基学习器误差率ε_t=Σ(w_ti × I(h_t(x_i)≠y_i)),其中I为指示函数(分类错误时I=1,正确时I=0),w_ti为第t轮样本i的权重。

计算过程:

错误分类的样本为4和5,对应的权重的w_t4=0.2,w_t5=0.4

ε_t=0.2×1 + 0.4×1=0.6(正确分类的样本指示函数为0,权重不贡献误差率)

  1. 已知3个基学习器对某测试样本的预测结果如下:基学习器1预测为正类(权重α1=0.8),基学习器2预测为正类(权重α2=0.6),基学习器3预测为负类(权重α3=0.4)。请通过AdaBoost的加权投票策略判断该样本的类别(正类标签为1,负类标签为-1)。

解析:

核心公式:加权投票得分=Σ(α_i × y_i),其中α_i为基学习器权重,y_i为基学习器预测标签(正类1,负类-1);得分>0则预测为正类,得分<0则预测为负类。

计算过程:

加权得分=0.8×1 + 0.6×1 + 0.4×(-1)=0.8+0.6-0.4=1.0>0

结论:该样本预测为正类。

第九章 聚类

一、选择题

  1. 下列关于k-Means聚类的说法,错误的是( )

A. k-Means的核心目标是最小化簇内样本的平方误差和

B. k-Means需要预先指定簇的数量k

C. k-Means对初始簇中心的选择不敏感,无论初始中心如何,最终都会收敛到同一最优解

D. k-Means更适合发现球形分布的簇,对非球形簇的聚类效果较差

解析:答案为C。k-Means对初始簇中心的选择非常敏感,不同的初始中心可能导致最终收敛到不同的局部最优解,而非同一最优解,因此实际应用中通常会多次随机初始化初始中心,选择平方误差和最小的结果作为最终聚类结果,C错误。A选项正确,k-Means通过迭代优化,使簇内样本尽可能紧凑,核心目标是最小化簇内平方误差和;B选项正确,k是k-Means的关键超参数,需预先指定;D选项正确,k-Means基于欧氏距离度量相似度,天然适合球形簇,对于不规则形状(如环形、螺旋形)的簇,聚类效果较差。

  1. 下列关于DBSCAN聚类的说法,正确的是( )

A. DBSCAN需要预先指定簇的数量k

B. DBSCAN中的核心点是指ε邻域内的样本数小于min_n的样本

C. DBSCAN可以发现任意形状的簇,且能识别噪声点

D. DBSCAN对高维数据的聚类效率高于k-Means

解析:答案为C。DBSCAN是密度聚类算法,核心是基于样本的密度连接性划分簇,无需指定k值,可发现任意形状的簇(如环形、螺旋形),同时能将密度极低的样本识别为噪声点,C正确。A选项错误,DBSCAN无需指定k值,核心参数是ε(邻域半径)和min_n(核心点的最小样本数);B选项错误,核心点是ε邻域内样本数≥min_n的样本,边界点是ε邻域内样本数<min_n但在核心点邻域内的样本,噪声点是既非核心点也非边界点的样本;D选项错误,DBSCAN需要计算样本间的距离,高维数据中距离度量的区分度低,且计算复杂度高,效率低于k-Means。

二、计算题

  1. 已知两个样本x1=(1,3),x2=(4,7),请分别计算它们的欧氏距离和曼哈顿距离。

解析:

核心公式:

(1)欧氏距离dist(x1,x2)=√[(x11-x21)² + (x12-x22)²]

(2)曼哈顿距离dist(x1,x2)=|x11-x21| + |x12-x22|

计算过程:

欧氏距离:√[(1-4)² + (3-7)²] = √[(-3)² + (-4)²] = √(9+16)=√25=5

曼哈顿距离:|1-4| + |3-7|=3 + 4=7

  1. 已知k-Means聚类中,簇1的样本为(1,2)、(2,3)、(3,4),簇2的样本为(5,6)、(6,7)、(7,8)。请计算两个簇的簇内平方误差和(SSE)。

解析:

核心公式:簇内平方误差和SSE=Σ(||x_i - μ||²),其中μ为簇中心(样本均值),x_i为簇内样本。

计算过程:

第一步,计算各簇中心:

簇1中心μ1=((1+2+3)/3,(2+3+4)/3)=(2,3)

簇2中心μ2=((5+6+7)/3,(6+7+8)/3)=(6,7)

第二步,计算簇1的SSE:

||(1,2)-(2,3)||² + ||(2,3)-(2,3)||² + ||(3,4)-(2,3)||² = (1²+1²) + (0²+0²) + (1²+1²) = 2 + 0 + 2 = 4

第三步,计算簇2的SSE:

||(5,6)-(6,7)||² + ||(6,7)-(6,7)||² + ||(7,8)-(6,7)||² = (1²+1²) + (0²+0²) + (1²+1²) = 2 + 0 + 2 = 4

第四步,总簇内平方误差和=簇1 SSE + 簇2 SSE = 4 + 4 = 8

第十章 降维与度量学习

一、选择题

  1. 下列关于主成分分析(PCA)的说法,正确的是( )

A. PCA的核心目标是保留数据集中方差最小的特征

B. PCA需要先对数据进行标准化处理,否则可能受量纲影响

C. 主成分的数量必须与原始特征数量相同

D. PCA是一种监督式降维方法

解析:答案为B。PCA的核心是通过线性变换将数据映射到低维空间,保留方差最大的主成分(即最具区分度的信息),A错误;由于PCA基于方差最大化,若数据量纲不同(如一个特征是身高cm,一个是体重kg),方差大的特征会主导主成分,因此需先标准化(均值为0、方差为1),B正确;主成分数量可根据需求选择(通常根据方差贡献率确定),小于原始特征数量,C错误;PCA无需利用标签信息,属于无监督降维方法,D错误。

  1. 下列关于降维方法的分类,错误的是( )

A. LDA(线性判别分析)是监督式降维方法

B. t-SNE是非线性降维方法,适用于高维数据可视化

C. PCA和LDA均属于线性降维方法

D. 度量学习的核心是将降维与分类任务结合,属于无监督学习

解析:答案为D。度量学习的核心是学习一个合适的距离度量,使同类样本距离更近、异类样本距离更远,通常需利用标签信息优化度量准则,属于监督式学习,D错误。A正确,LDA通过最大化类间距离、最小化类内距离降维,需利用类别标签;B正确,t-SNE通过构建高维与低维数据的概率分布映射,是非线性降维方法,常用于高维数据(如神经网络特征、图像)的可视化;C正确,PCA和LDA均通过线性变换实现降维,属于线性降维方法。

二、计算题

  1. 已知二维数据样本:x1=(1,2),x2=(2,4),x3=(3,6)。请计算该数据的协方差矩阵(无需标准化)。

解析:

核心公式:对于d维数据,协方差矩阵C为d×d矩阵,元素C_ij=Cov(X_i,X_j)=E[(X_i-μ_i)(X_j-μ_j)],其中μ_i为第i维特征的均值,E为期望(样本协方差中用1/(m-1)代替1/m,此处简化用1/m计算)。

计算过程:

第一步,计算各维特征均值:

第1维(X1)均值μ1=(1+2+3)/3=2;第2维(X2)均值μ2=(2+4+6)/3=4

第二步,计算协方差元素:

C_11=Cov(X1,X1)=[(1-2)² + (2-2)² + (3-2)²]/3 = (1+0+1)/3=2/3

C_12=Cov(X1,X2)=[(1-2)(2-4) + (2-2)(4-4) + (3-2)(6-4)]/3 = [(-1)(-2)+0+1×2]/3=(2+0+2)/3=4/3

C_21=Cov(X2,X1)=C_12=4/3(协方差矩阵对称)

C_22=Cov(X2,X2)=[(2-4)² + (4-4)² + (6-4)²]/3 = (4+0+4)/3=8/3

第三步,协方差矩阵:

C = [[2/3, 4/3], [4/3, 8/3]]

  1. 已知某数据经PCA降维后,第一主成分的方差贡献率为92%,第二主成分的方差贡献率为6%,其余主成分方差贡献率之和为2%。若要求保留95%以上的信息,需选择多少个主成分?

解析:

核心概念:方差贡献率=该主成分的方差/所有主成分方差之和,保留的信息比例为所选主成分方差贡献率之和。

计算过程:

第一步,计算累积方差贡献率:

选择1个主成分(第一主成分):累积贡献率=92%<95%

选择2个主成分:累积贡献率=92%+6%=98%≥95%

结论:需选择2个主成分。

第十一章 特征选择与稀疏学习

一、选择题

  1. 下列关于特征选择方法的说法,正确的是( )

A. 过滤式特征选择(如方差选择法)依赖后续学习器,选择效果更好

B. 包裹式特征选择(如拉斯维加斯方法)直接以学习器性能为准则,选择精度高但计算复杂度高

C. 嵌入式特征选择(如L1正则化)是在模型训练后进行特征筛选

D. 特征选择的核心目的是增加特征数量,提升模型拟合能力

解析:答案为B。包裹式特征选择将特征选择与学习器训练结合,直接以学习器的性能(如准确率)作为特征子集的评价准则,能选择出更适合特定学习器的特征子集,但需要遍历多个特征子集,计算复杂度高,B正确。A错误,过滤式特征选择不依赖后续学习器,通过特征自身的统计特性(如方差、相关性)筛选,计算简单但选择效果可能不如包裹式;C错误,嵌入式特征选择是在模型训练过程中同步完成特征筛选(如L1正则化使部分权重为0,自动实现特征选择),而非训练后;D错误,特征选择的核心目的是剔除冗余、无效特征,减少特征数量,降低计算复杂度,缓解过拟合。

  1. 下列关于稀疏学习的说法,错误的是( )

A. 稀疏学习的核心是使模型参数具有稀疏性(部分参数为0)

B. L1正则化是实现稀疏学习的常用方法

C. 稀疏学习可用于特征选择,因为参数为0的特征对模型无贡献

D. 稀疏学习的参数稀疏性会降低模型的可解释性

解析:答案为D。稀疏学习中,参数为0的特征可视为被模型舍弃,仅保留非零参数对应的特征,使模型仅依赖少数关键特征,反而提升了模型的可解释性(如“哪些特征对预测结果有影响”),D错误。A正确,稀疏性即参数向量中大部分元素为0;B正确,L1正则化的解空间特性使最优解易出现参数为0的情况,是稀疏学习的典型实现方式;C正确,参数为0表示该特征的权重为0,对模型预测结果无贡献,因此可通过稀疏学习筛选有效特征。

二、计算题

  1. 已知某数据集包含3个特征X1、X2、X3,其方差分别为0.1、2.5、0.3。若采用方差选择法(阈值设为0.5),应保留哪些特征?

解析:

核心逻辑:方差选择法的准则是保留方差大于阈值的特征,方差越大,说明该特征的取值差异越大,可能包含更多有效信息;方差过小(接近0)的特征取值几乎不变,对模型无贡献。

计算过程:

对比各特征方差与阈值(0.5):

X1方差=0.1<0.5,剔除;X2方差=2.5>0.5,保留;X3方差=0.3<0.5,剔除

结论:应保留特征X2。

  1. 已知某线性回归模型的损失函数为L(w,b)=Σ(y_i - (w1x1i + w2x2i + b))² + λ(|w1| + |w2|),其中λ=0.1。若训练后得到w1=0.8,w2=0.001,b=0.5,试判断该模型通过稀疏学习实现了特征选择吗?并说明理由。

解析:

核心逻辑:稀疏学习通过使参数稀疏(部分权重为0或接近0)实现特征选择,若某特征对应的权重接近0,说明该特征对模型预测的贡献极小,可视为被筛选掉。

分析过程:

模型中L1正则化项λ(|w1| + |w2|)用于实现稀疏学习,训练后w2=0.001,远小于w1=0.8,且接近0。这表明特征X2对模型的贡献极小,可认为被模型舍弃,仅保留了特征X1。

结论:该模型通过稀疏学习实现了特征选择,剔除了特征X2,保留了特征X1。

第十三章 概率图模型

一、选择题

  1. 下列关于概率图模型的说法,正确的是( )

A. 贝叶斯网络是无向概率图模型,马尔可夫随机场是有向概率图模型

B. 概率图模型的核心是用图结构表示随机变量之间的依赖关系,降低概率计算复杂度

C. 贝叶斯网络的联合概率分布可通过所有随机变量的边缘概率乘积得到

D. 马尔可夫随机场的最大后验推断无法通过Gibbs采样实现

解析:答案为B。概率图模型将随机变量作为节点,依赖关系作为边,通过图结构直观表示变量间的依赖/独立关系,可基于图结构分解联合概率分布,降低高维概率计算的复杂度,B正确。A错误,贝叶斯网络是有向图(边有方向,表示因果关系),马尔可夫随机场是无向图(边无方向,表示关联关系);C错误,贝叶斯网络的联合概率分布是各节点在其父节点条件下的条件概率乘积,而非边缘概率乘积;D错误,Gibbs采样是马尔可夫随机场中常用的近似推断方法,可用于最大后验推断和边缘概率计算。

  1. 下列关于贝叶斯网络的说法,错误的是( )

A. 贝叶斯网络需满足“局部马尔可夫性”:给定父节点,节点与非后代节点独立

B. 贝叶斯网络的结构学习是指在已知变量间依赖关系的情况下,估计条件概率表

C. 条件概率表(CPT)是贝叶斯网络的参数,用于存储节点在父节点不同取值下的条件概率

D. 朴素贝叶斯分类器是一种特殊的贝叶斯网络,其结构为“所有特征节点指向类别节点”

解析:答案为B。贝叶斯网络的学习分为结构学习和参数学习:结构学习是学习变量间的依赖关系(即图结构),参数学习是在已知图结构的情况下,估计各节点的条件概率表(CPT),B错误。A正确,局部马尔可夫性是贝叶斯网络的核心性质,可简化联合概率计算;C正确,条件概率表是贝叶斯网络的核心参数,例如节点A的父节点为B,则CPT存储P(A|B=0)、P(A|B=1)等概率;D正确,朴素贝叶斯的网络结构中,类别节点是根节点,所有特征节点是叶节点,且特征节点之间相互独立(条件独立于类别节点),符合贝叶斯网络的定义。

二、计算题

  1. 已知贝叶斯网络结构为:A→B→C,各节点的条件概率表如下:P(A=0)=0.3,P(A=1)=0.7;P(B=0|A=0)=0.6,P(B=1|A=0)=0.4;P(B=0|A=1)=0.2,P(B=1|A=1)=0.8;P(C=0|B=0)=0.5,P(C=1|B=0)=0.5;P(C=0|B=1)=0.1,P(C=1|B=1)=0.9。请计算联合概率P(A=1,B=1,C=1)。

解析:

核心公式:贝叶斯网络的联合概率分布可分解为各节点在其父节点条件下的条件概率乘积,即P(A,B,C)=P(A)×P(B|A)×P(C|B)(因A是根节点,无父节点,用边缘概率P(A);B的父节点是A,用P(B|A);C的父节点是B,用P(C|B))。

计算过程:

P(A=1,B=1,C=1)=P(A=1)×P(B=1|A=1)×P(C=1|B=1)=0.7×0.8×0.9=0.504

  1. 已知马尔可夫随机场包含三个节点A、B、C,且三节点构成完全图(两两之间有边连接),其势函数为:φ(A,B)=1.2(A=0,B=0)、2.3(A=0,B=1)、1.8(A=1,B=0)、3.1(A=1,B=1);φ(B,C)=0.9(B=0,C=0)、1.5(B=0,C=1)、2.0(B=1,C=0)、2.8(B=1,C=1);φ(A,C)=1.0(A=0,C=0)、1.6(A=0,C=1)、1.4(A=1,C=0)、2.2(A=1,C=1)。请计算联合概率P(A=1,B=1,C=1)(归一化因子Z可暂不计算具体值,用Z表示)。

解析:

核心公式:马尔可夫随机场的联合概率分布为P(X)=(1/Z)×Πφ_c(X_c),其中Z为归一化因子(所有可能取值的势函数乘积之和),φ_c(X_c)为团(完全子图)的势函数,完全图中所有节点构成一个团,其势函数可由两两节点的势函数乘积表示。

计算过程:

P(A=1,B=1,C=1)=(1/Z)×φ(A=1,B=1)×φ(B=1,C=1)×φ(A=1,C=1)=(1/Z)×3.1×2.8×2.2=(1/Z)×19.016

结论:P(A=1,B=1,C=1)=19.016/Z

第十六章 强化学习

一、选择题

  1. 下列关于强化学习的基本概念,说法正确的是( )

A. 智能体(Agent)通过与环境(Environment)交互,获取奖励(Reward),并优化策略(Policy)以最大化累积奖励

B. 价值函数(Value Function)用于直接给出智能体的最优动作,无需考虑状态

C. 策略(Policy)是指智能体在特定状态下的价值估计

D. 强化学习是监督学习的一种,其奖励信号等价于监督学习的标签

解析:答案为A。强化学习的核心框架是“智能体-环境”交互:智能体在环境中观察状态,执行动作,环境反馈奖励和新状态,智能体的目标是学习最优策略(状态到动作的映射),以最大化长期累积奖励,A正确。B错误,价值函数用于估计状态(或状态-动作对)的长期价值,而非直接给出最优动作;C错误,策略是状态到动作的映射(如“在状态s下执行动作a的概率”),而非价值估计;D错误,强化学习无监督学习的标签,奖励信号是延迟的、评价性的(而非指导性的),与监督学习的标签有本质区别,不属于监督学习。

  1. 下列关于Q学习(Q-Learning)的说法,错误的是( )

A. Q学习是一种异策略(Off-Policy)强化学习算法

B. Q学习的核心是学习状态-动作对的价值(Q值),即Q(s,a)表示在状态s执行动作a后的累积奖励期望

C. Q学习的更新公式为Q(s,a)=Q(s,a)+α[r+γ×max_a'Q(s',a')-Q(s,a)],其中α是学习率,γ是折扣因子

D. Q学习需要先构建环境的状态转移模型,才能进行Q值更新

解析:答案为D。Q学习是无模型(Model-Free)强化学习算法,无需预先知道环境的状态转移模型(即无需知道“执行动作a后从状态s转移到s'的概率”),而是通过与环境直接交互获取经验(s,a,r,s')来更新Q值,D错误。A正确,Q学习中用于更新Q值的是目标策略(贪婪策略,选择Q值最大的动作),而智能体实际探索环境的是行为策略(ε-贪婪策略,兼顾探索与利用),两者不同,属于异策略;B正确,Q值的核心含义是状态-动作对的长期价值;C正确,该公式是Q学习的核心更新公式,通过时序差分误差(TD误差)调整Q值,α控制更新步长,γ控制未来奖励的权重。

二、计算题

  1. 已知Q学习中,学习率α=0.1,折扣因子γ=0.9。智能体在状态s执行动作a后,获得奖励r=5,转移到新状态s'。若当前Q(s,a)=3.2,新状态s'下的最大Q值max_a'Q(s',a')=4.5。请计算更新后的Q(s,a)值。

解析:

核心公式:Q学习的时序差分更新公式为Q_new(s,a)=Q_old(s,a)+α×[r+γ×max_a'Q(s',a')-Q_old(s,a)],其中[r+γ×max_a'Q(s',a')]是目标Q值,与当前Q值的差值为TD误差,α控制误差对Q值的修正幅度。

计算过程:

第一步,计算TD误差:r+γ×max_a'Q(s',a')-Q_old(s,a)=5+0.9×4.5-3.2=5+4.05-3.2=5.85

第二步,计算更新后的Q值:Q_new(s,a)=3.2+0.1×5.85=3.2+0.585=3.785

  1. 已知某强化学习任务中,智能体的策略为:在状态s1时,执行动作a1的概率为0.6,执行动作a2的概率为0.4;执行a1后获得奖励r1=2,执行a2后获得奖励r2=3。若折扣因子γ=0.8,且状态s1的后续状态s2的价值V(s2)=4,试计算状态s1的价值V(s1)(基于策略的价值函数,仅考虑一步转移)。

解析:

核心公式:基于策略π的状态价值函数Vπ(s)=Σ_aπ(a|s)×[r(s,a)+γ×Vπ(s')],其中π(a|s)是策略π在状态s下执行动作a的概率,r(s,a)是执行动作a的即时奖励,s'是执行a后的转移状态,V^π(s')是s'的价值。

计算过程:

V(s1)=π(a1|s1)×[r1+γ×V(s2)]+π(a2|s1)×[r2+γ×V(s2)]=0.6×(2+0.8×4)+0.4×(3+0.8×4)=0.6×(2+3.2)+0.4×(3+3.2)=0.6×5.2+0.4×6.2=3.12+2.48=5.6

(注:文档部分内容可能由 AI 生成)

机器学习考前计算题型公式速记表

说明:剔除12、14、15章及矩阵计算,聚焦高频考点,标注“核心”为必背公式

一、分类任务评估计算(必考)

题型 核心公式 关键说明
准确率 $\text{Acc} = \frac{TP+TN}{TP+FP+TN+FN}$ 适用于样本均衡场景
查准率(P) $\text{P} = \frac{TP}{TP+FP}$ 【核心】 关注“预测为正的样本中真实为正”的比例
查全率(R) $\text{R} = \frac{TP}{TP+FN}$ 【核心】 关注“真实为正的样本中被预测到”的比例
F1度量 $\text{F1} = \frac{2PR}{P+R}$ 【核心】 平衡P和R,适用于样本不均衡
ROC核心指标 TPR=$\frac{TP}{TP+FN}$,FPR=$\frac{FP}{TN+FP}$ TPR纵轴、FPR横轴,AUC为曲线下面积
聚类外部评估(Jaccard) $\text{JC} = \frac{a}{a+b+c}$ a=同簇同类,b=同簇异类,c=异簇同类

二、回归任务评估计算

题型 核心公式 关键说明
均方误差(MSE) $\text{MSE} = \frac{1}{m}\sum_{i=1}^m (f(x_i)-y_i)^2$ 【核心】 回归任务最常用损失,反映预测值与真实值偏差
训练误差(回归) $E_{\text{train}} = \frac{1}{m}\sum_{i=1}^m (f(x_i)-y_i)^2$ 仅计算训练集样本误差

三、算法核心计算(重中之重)

(一)线性模型相关

题型 核心公式 关键说明
单一属性线性回归(w,b) w=$\frac{\sum_{i=1}^m (x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^m (x_i-\bar{x})^2}$;b=$\bar{y}-w\bar{x}$ 【核心】 $\bar{x}=\frac{1}{m}\sum x_i$,$\bar{y}=\frac{1}{m}\sum y_i$,最小二乘闭式解
逻辑回归(Sigmoid) $\sigma(z)=\frac{1}{1+e^{-z}}$(z=wx+b) 【核心】 将线性输出映射到[0,1],用于二分类概率预测
逻辑回归损失(单样本) L=$-[y\log\sigma(z)+(1-y)\log(1-\sigma(z))]$ 交叉熵损失,避免梯度消失
LDA二分类(简化) $\mu_c=\frac{1}{m_c}\sum_{x\in D_c}x$;$S_w=\sum_{x\in D_1}(x-\mu_1)^2+\sum_{x\in D_2}(x-\mu_2)^2$;w∝$\frac{\mu_1-\mu_2}{S_w}$ 最大化类间距离、最小化类内距离
L1/L2正则化(简化) LASSO:$\min \frac{1}{2}\sum (wx_i+b-y_i)^2+\lambda|w|$;岭回归:$\min \frac{1}{2}\sum (wx_i+b-y_i)2+\frac{\lambda}{2}w2$ L1可特征选择,L2防过拟合

(二)决策树相关

题型 核心公式 关键说明
信息熵(ID3) $\text{Ent}(S)=-\sum_{i=1}^k p_i\log_2 p_i$ 【核心】 $p_i=\frac{
信息增益(ID3) $\text{Gain}(S,A)=\text{Ent}(S)-\sum_{v}\frac{ S_v
增益率(C4.5) $\text{GainRatio}(S,A)=\frac{\text{Gain}(S,A)}{\text{SplitInfo}(S,A)}$;$\text{SplitInfo}=-\sum_{v}\frac{|S_v|}{|S|}\log_2\frac{|S_v|}{|S|}$ 解决ID3偏好取值多的特征问题
基尼指数(CART) $\text{Gini}(S)=1-\sum_{i=1}^k p_i^2$ 【核心】 与熵趋势一致,计算更简单

(三)神经网络(BP算法)

题型 核心公式 关键说明
Sigmoid导数 $\phi'(z)=\phi(z)(1-\phi(z))$ 【核心】 BP误差传播的关键推导依据
BP误差项 输出层:$\Deltao=\phi'(zo)(y-ao)$;隐藏层:$\Deltah=\phi'(zh)(\Deltao \cdot w_3)$ 【核心】 从输出层反向传播计算误差
权重更新 $w=w-\alpha \cdot \Delta \cdot 前层激活$ 【核心】 α为学习率,过大震荡、过小收敛慢

(四)集成学习(AdaBoost)

题型 核心公式 关键说明
基学习器误差率 $\epsilon_t=\sum_{i=1}^m w_{ti}I(h_t(x_i)\neq y_i)$ 基于样本权重计算,反映基学习器性能
基学习器权重 $\alpha_t=\frac{1}{2}\log\frac{1-\epsilon_t}{\epsilon_t}$($\epsilon_t<0.5$) 【核心】 误差率越低,权重越大
样本权重更新 $w_{(t+1)i}=\frac{w_{ti}\exp(-\alpha_t y_i h_t(x_i))}{Z_t}$ 【核心】 正确分类样本权重减小,错误分类增大,Z_t为归一化因子

(五)聚类与降维

题型 核心公式 关键说明
距离度量(二维) 欧氏:$\text{dist}=\sqrt{(x_{i1}-x_{j1})2+(x_{i2}-x_{j2})2}$;曼哈顿:$\text{dist}=|x_{i1}-x_{j1}|+|x_{i2}-x_{j2}|$ 【核心】 聚类和KNN的基础
k-Means簇中心更新 $\mu_c=(\frac{1}{|C_c|}\sum x_1,\frac{1}{|C_c|}\sum x_2)$ 【核心】 簇内样本均值作为新中心,迭代更新
PCA中心化 $x_1'=x_1-\bar{x_1}$,$x_2'=x_2-\bar{x_2}$ 【核心】 PCA的第一步,消除量纲影响
PCA投影(二维→一维) $z=w_1x_1'+w_2x_2'$ w1、w2为最大特征值对应的特征向量分量

(六)贝叶斯相关

题型 核心公式 关键说明
贝叶斯定理 $P(c|x)=\frac{P(x|c)P(c)}{P(x)}$ 【核心】 朴素贝叶斯的理论基础
拉普拉斯修正 $P(c)=\frac{|D_c|+1}{|D|+K}$;$P(x|c)=\frac{|D_{c,x}|+1}{|D_c|+N}$ 【核心】 解决零概率问题,K为类别数,N为特征取值数

四、强化学习计算(16章,必考)

题型 核心公式 关键说明
折扣回报 $G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2 r_{t+3}+...$ 【核心】 γ∈[0,1],未来奖励的折扣系数
Q-Learning更新 $Q(s,a)←Q(s,a)+\alpha[r+\gamma \max_{a'}Q(s',a')-Q(s,a)]$ 【核心】 时序差分学习,$\max_{a'}Q(s',a')$为下一状态最优动作价值
贝尔曼方程(动作价值) $Q\pi(s,a)=E\pi[r+\gamma \max_{a'}Q^\pi(s',a')|s,a]$ 价值函数的递归关系

五、半监督学习计算(13章)

题型 核心公式 关键说明
半监督SVM目标函数(简化) $\min \frac{1}{2}w^2+C_l\sum_{L}\xi_i+C_u\sum_{U}\xi_j$,s.t.$y_i(wx_i+b)≥1-\xi_i$,$|wx_j+b|≥1-\xi_j$ 初始$C_l\gg C_u$,避免未标注样本错误干扰
标签传播规则 $y_i=\sum_{j\in N(i)}W_{ij}y_j$ W为样本相似度权重,邻居标签加权更新当前标签

(注:文档部分内容可能由 AI 生成)

posted @ 2026-01-01 21:27  陆舟LandBoat  阅读(11)  评论(0)    收藏  举报