线性回归 完整逻辑梳理(用途 → 建模 → 求解 → 优化 → 评估 → 问题处理)
按照业务目标→实现流程→算法求解→调优评估→故障解决的完整链路整理,逻辑连贯,方便背诵和复盘。
一、核心用途
线性回归是回归类基础算法,用于预测连续型数值。
- 目标:找到自变量(特征 \(x\))与因变量(标签 \(y\))之间的线性关系,实现预测。
- 适用场景:房价预测、销量预测、气温预测等。
- 模型形式
一元线性回归:\(y = w_0 + w_1 x\)
多元线性回归:\(y = w_0 + w_1 x_1 + w_2 x_2 + \dots + w_n x_n\)
\(w_0\):偏置项;\(w_1\dots w_n\):特征权重(待求解参数)
二、整体执行流程(怎么干)
- 准备数据集:划分特征 \(x\)、真实标签 \(y\)
- 构建线性模型,定义损失函数(衡量预测值与真实值的差距)
- 求解最优参数 \(w\),让损失函数最小
- 模型训练完成后,用指标评估效果
- 针对欠拟合、过拟合等问题做优化、修正
三、损失函数(优化目标)
统一使用均方误差 MSE,衡量整体预测误差:
\[\text{MSE} = \frac{1}{m}\sum_{i=1}^m (\hat{y}_i - y_i)^2
\]
\(\hat{y}_i\):模型预测值;\(y_i\):真实值;\(m\):样本总数
训练目标:最小化 MSE
四、两大参数求解方法(核心解法)
目标:求出使损失最小的权重 \(w\),二选一使用
方法1:正规方程(解析解)
- 公式:\(\boldsymbol{w} = (\boldsymbol{X}^\top \boldsymbol{X})^{-1}\boldsymbol{X}^\top \boldsymbol{y}\)
- \(\boldsymbol{X}\):增广特征矩阵(首列全为1,对应偏置项)
- 一元、多元线性回归公式完全通用
- 特点
- 无迭代、一步算出结果,无需设置学习率
- 适合小样本、少特征场景
- 缺陷:特征数/样本数过大时,矩阵求逆计算量爆炸;特征多重共线性会导致矩阵不可逆
方法2:梯度下降(迭代解,主流)
- 核心思想
沿着损失函数负梯度方向,一步步迭代更新参数,逐步逼近最小值。 - 通用更新公式\[\boldsymbol{w} := \boldsymbol{w} - \alpha \cdot \nabla J(\boldsymbol{w}) \]\(\alpha\):学习率(步长);\(\nabla J(\boldsymbol{w})\):损失函数梯度
- 三类梯度下降(按每次使用样本划分)
- 批量梯度下降 BGD:用全部样本算梯度,收敛稳定,大数据速度慢
- 随机梯度下降 SGD:每次只用1个样本,速度快,震荡明显
- 小批量梯度下降 MBGD:每次取一小批样本,兼顾速度与稳定性,工业界首选
五、模型评估指标(训练完怎么判断好坏)
针对回归任务,常用3个误差指标,数值越小,模型效果越好:
- MAE 平均绝对误差\[\text{MAE} = \frac{1}{m}\sum_{i=1}^m |\hat{y}_i - y_i| \]单位和原数据一致,对异常值不敏感。
- MSE 均方误差
损失函数本身,处处可导适合优化,对大误差、异常值惩罚强,单位为原数据平方。 - RMSE 均方根误差\[\text{RMSE}=\sqrt{\text{MSE}} \]MSE开根号,单位还原为原数据,兼顾直观性与误差惩罚。
六、模型问题与优化方案(欠拟合 / 过拟合)
1. 欠拟合
- 现象:训练集、测试集误差都很大,模型没学到数据规律
- 原因:模型过于简单、特征太少、训练迭代不足、学习率过小
- 解决:增加特征/提升模型复杂度、增大学习率、增加迭代次数、减少正则化
2. 过拟合
- 现象:训练集误差极小,测试集误差很大;模型学到了数据噪音,泛化能力差
- 原因:模型太复杂、样本数据少、噪音多、未做正则化
- 通用解决:扩充数据集、降低模型复杂度、早停、数据增强
- 核心优化:正则化(给损失函数加惩罚项,限制权重大小)
L1 正则化(Lasso)
损失函数:\(\text{MSE} + \alpha\sum|w|\)
- 特点:可让部分权重压缩为0,自动筛选特征,生成稀疏模型
L2 正则化(Ridge)
损失函数:\(\text{MSE} + \alpha\sum w^2\)
- 特点:仅缩小权重、不会置0,求解稳定,最常用,主打防止过拟合
七、整体逻辑总览(精简串讲)
- 目的:用线性关系对连续值做预测;
- 建模:搭建线性方程,用 MSE 定义损失;
- 求解参数:小数据用正规方程,大数据/工程场景用梯度下降(三类梯度按需选择);
- 效果检验:用 MAE/MSE/RMSE 评估预测精度;
- 问题调优:出现欠拟合就提升模型复杂度;出现过拟合就加数据、降复杂度,或使用 L1/L2 正则化。

浙公网安备 33010602011771号