合集-机器学习
摘要:1.2 基本术语 数据集:收集数据的集合。 示例/样本:每条记录的数据是关于一个事件或对象的描述。 属性/特征:反映事件或对象在某方面的表现或性质的事项。 属性值:属性上的取值。 属性空间/样本空间/输入空间:属性张成的空间。 学习/训练:从数据中学得模型的过程,这个过程通过执行某个学习算法来完成。
阅读全文
摘要:2.1经验误差与过拟合 错误率:分类错误的样本数占样本总数的比例。即如果在m个样本中有α个样本分类错误,则错误率E=a/m。 精度:1- a/m,即“精度=1-错误率”。 误差学习器的实际预测输出与样本的真实输出之间的差异。 训练误差/经验误差:学习器在训练集上的误差。 泛化误差:新样本上的误差。
阅读全文
摘要:通常,我们可通过实验测试来对学习器的泛化误差进行评估并进而做出选择。为此,需使用一个“测试集”来测试学习器对新样本的判别能力,然后以测试集上的“测试误差”作为泛化误差的近似。通常我们假设测试样本也是从样本真实分布中独立同分布采样而得。但需注意的是,测试集应该尽可能与训练集互斥,即测试样本尽量不在训练
阅读全文
摘要:2.3 性能度量 性能度量 :对学习器的泛化性能进行评估,不仅需要有效可行的实验估计方法,还需要有衡量模型泛化能力的评价标准。它反映了任务需求,在对比不同模型的能力时,使用不同的性能度量往 往会导致不同的评判结果;这意味着模型的"好坏"是相对的,什么样的模型是好的?不仅取决于算法和数据,还决定于任务
阅读全文
摘要:3.1 基本形式 给定由d个属性描述的示例x=(x1;x2;...;xd),其中xi是x在第i个属性上的取值。 线性模型:试图学得一个通过属性的线性组合来进行预测的函数,即 一般用向量形式写成 其中w=(w1;w2;...;wd)。w和b学得之后,模型就得以确定。 线性模型形式简单、易于建模,许多功
阅读全文
摘要:3.3 对数几率回归 若要做分类任务,只需找一个单调可微函数将分类任务的真实标记y与线性回归模型的预测值联系起来。 单位阶跃函数: 即若预测值z大于0就判为正例,小于0则判为反例,预测值为临界值0则可任意判别。 对数几率函数:是一种“Sigmoid函数”,它将z值转化为一个接近0或1的y值,并且其输
阅读全文
摘要:4.1 基本流程 决策过程的最终结论对应了所希望的判定结果。 决策过程中提出的每个判定问题是对某个属性的测试。 一个决策树包含一个根节点,若干个内部节点和若干个叶节点。 叶节点对应决策结果。其他每个结点则对应于一个属性测试;每个结点包含的样本集合根据属性测试的结果被划分到子结点中;根结点包含样本全集
阅读全文

浙公网安备 33010602011771号