Statistical Learning with Sparsity - The Lasso and Generalizations的第2章导读
(1)不管是lasso还是岭回归,都是对线性回归问题进行参数估计的具体方法。
(2)在本书中,特征(feature)和预测子(predictor)是同一概念。在其它文献(尤其是统计分析)中,经常会用变量(varible)来表示相同的意思。一组特征(或预测子、变量)可用来刻画某个具本的对象。
(3)第5页倒数第2段中“替代最小二乘的原因”是指需要对传统最小二乘进行“改进”的原因。偏差(bias)小,而方差(variance)大就是通常的过拟和。
(4)第5页中最后一段提到的“收缩系数”主要是指缩小系数的取值范围。
(5)(2.5)式中的$\lambda$与(2.3)式中的t在什么时候是对应的?
首先,起作用约束是指$t=\|\beta\|_1$。
(6) 第8页中“不同大小的样本可以放在一起比较$\lambda$值”是什么意思?
样本数量的不一样,可能会得到不同的$\lambda$值。因此可以观测到随着数量的变化,其$\lambda$取值的变化情况。当然,每种数量的样本,其$\lambda$值是通过交叉验证得到的。
(7)由第8页最后段可知,图2.1的横坐标反应的是$t$的取值变化对系数的影响,当$t$取无穷大时,lasso得到的解与普通最小二乘(不加约束)的解一样,这时$\frac{\|\hat{\beta}\|_1}{\|\tilde{\beta}\|_1}=1$(这就是最大化界(maximal bound));同样,$t=0$时,有$\|\hat{\beta}\|_1=0$。图2.1的模轴并没有出现$t$的取值,而是巧妙地通过$\frac{\|\hat{\beta}\|_1}{\|\tilde{\beta}\|_1}来表示$t$从$0$变化到无穷大,这就是一种缩放。
(8)对2.5节中自由度的概念没有理解。
浙公网安备 33010602011771号