第一章 绪论

1.2 基本术语
数据集:收集数据的集合。
示例/样本:每条记录的数据是关于一个事件或对象的描述。
属性/特征:反映事件或对象在某方面的表现或性质的事项。
属性值:属性上的取值。
属性空间/样本空间/输入空间:属性张成的空间。
学习/训练:从数据中学得模型的过程,这个过程通过执行某个学习算法来完成。
训练数据:训练过程中使用的数据。
训练样本:训练数据中的每个样本。
训练集:训练样本组成的集合。
假设:学得模型对应了关于数据的某种潜在的规律。
真相/真实:这种潜在规律自身。
学习过程:找出或者逼近真相。
学习器/模型:学习算法在给定数据和参数空间上的实例化。
标记:关于示例结果的信息。
样例:拥有了标记信息的示例。
标记空间/输出空间:一般地,用(xi,yi)表示第i个样例,其中yi∈Y是示例xi的标记,Y是所有标记的集合。
分类:预测离散值的此类学习任务。
回归:预测连续值的此类学习任务。
二分类:只涉及两个类别的任务。通常称其中一个类为“正类”,另一个类为“反类”。
多分类:涉及多个类别的任务。
测试:学得模型后,使用其进行预测的过程。
测试样本:被预测的样本。
根据训练数据是否拥有标记信息,学习任务可大致划分为两大类:
监督学习:分类和叉归是其代表。
无监督学习:聚类是其代表。
泛化能力:学得模型适用于新样本的能力,具有强泛化能力的模型能很好地适用于整个样本空间。
独立同分布:通常假设样本空间中全体样本服从一个未知“分布”D,我们获得的每个样本都是独立地从这个分布上采样获得的。
1.3假设空间
科学推理的两大基本手段:
归纳:从特殊到一般的“泛化”过程,即从具体的事实归结出一般性规律;
演绎:从一般到特殊的“特化”过程,即从基础原理推演出具体状况。
版本空间:可能有多个假设与训练集一致,即存在着一个与训练集一致的“假设集合”。
1.4归纳偏好
在何一个有效的机器学习算法必有其归纳偏好,否则它将被假设空间中看似在训练集上“等效”的假设所迷惑,而无法产生确定的学习结果。归纳偏好可看作学习算法自身在一个可能很庞大的假设空间中对假设进行选择的启发式或“价值观”。
奥卡姆剃刀:若有多个假设与观察一致.则选最简单的那个。是一种常用的、自然科学研究中最基本的原则。

没有免费的午餐定了(NFL定理):无论算法a有多聪明,无论算法b有多笨拙,它们的期望值都是相同的。所以,NFL定理最重要的寓意,是让我们清楚地认识到,脱离具体问题,空泛地谈论“什么学习算法更好”毫无意义,因为若考虑所有潜在的问题,则所有学习算法都一样好.
1.5发展历程
归纳逻辑程序设计:可看作机器学习与逻辑程序设计的交叉,它使用一阶逻辑(即谓词逻辑)来进行知识表示,通过修改和扩充逻辑表达式(例如Prolog表达式)来完成对数据的归纳.

posted @ 2024-10-23 21:58  退堂鼓演奏大师  阅读(14)  评论(0)    收藏  举报