第3章 线性模型
3.1 基本形式
给定由d个属性描述的示例x=(x1;x2;...;xd),其中xi是x在第i个属性上的取值。
线性模型:试图学得一个通过属性的线性组合来进行预测的函数,即

一般用向量形式写成

其中w=(w1;w2;...;wd)。w和b学得之后,模型就得以确定。
线性模型形式简单、易于建模,许多功能更为强大的非线性模型可在线性模型的基础上通过引入层级结构或高维映射而得。此外,由于w直观表达了各属性在预测中的重要性,因此线性模型由很好的可解释性。
3.2 线性回归
线性回归:试图学得一个线性模型以尽可能准确地预测实值输出标记。
给定数据集D={(x1,y1),(x2,y2),...,(xm,ym),其中xi=(x{i1};x{i2};...;x{id}),yi∈{R}。
(1)当输入属性的数目只有一个。
忽略关于属性的下标,即D={(x{i},y{i})}^m{i=1},其中x{i}∈R。
对离散属性,若属性值间存在“序”关系,可通过连续化将其转化为连续值;若属性值间不存在序关系,假定有k个属性值,则通常转化为k维向量。
线性回归试图学得

使用均方误差来衡量f(x)与y之间的差别,因此均方误差应当最小,则有

均方误差的几何意义对应了常用的欧几里得距离或简称“欧氏距离”。
最小二乘法:基于均方误差最小化来进行模型的求解的方法。
在线性回归中,最小二乘法就是试图找到一条直线,使所有样本到直线上的欧氏距离之和最小。
求解w和b使得
最小化的过程,称为线性回归模型的最小二乘“参数估计”。
我们可以将E(w,b)分别对w和b求导,得到

然后令两式为0,即可得到w和b最优解的闭式解


其中
为x的均值。
(2)样本由d个属性描述。
此时我们试图学得

,这称为“多元线性回归”。
通常对于多元问题,常常使用矩阵的形式来表示数据。我们把w和b吸收入向量形式
,相应的,把数据集D表示为一个m×(d+1)大小的矩阵X,其中每行对应于一个示例,该行前d个元素对应于示例的d个属性值,最后一个元素恒置为1,即

再把标记也写成向量形式y=(y1;y2;...;ym),则有

令
对
求导得到

令得到的导数为零可得
最优解的闭式解。
在简单的情况下,X^{T}X为满秩矩阵或正定矩阵时,导数为零可得

其中
是矩阵X^{T}X的逆矩阵。
令
,则最终学得的多元线性回归模型为

然而,现实任务中X^{T}X往往不是满秩矩阵。此时可以解出多个
使得均方误差最小化,选择哪一个解作为输出将由学习算法的归纳偏好决定,常见的做法是引入正则化项。
(3)令模型预测值逼近y的衍生物,那么可将输出标记的对数作为线性模型逼近的目标,即

这就是“对数线性回归”,它实际上是在试图让
逼近y。这在形式上仍是线性回归,但实质上已是在求取输入空间到输出空间的非线性函数映射。

更一般的,考虑单调可微函数g(·),令

这样得到的模型称为“广义线性模型”,其中函数g(·)称为“联系函数”。显然,对数线性回归是广义线性模型在
时的特例。

为x的均值。
是矩阵X^{T}X的逆矩阵。
逼近y。这在形式上仍是线性回归,但实质上已是在求取输入空间到输出空间的非线性函数映射。
时的特例。
浙公网安备 33010602011771号